DeepMind 开源 AI 可解释性研究工具 Tracr

DeepMind 开源 TRAnsformer 编译器 Tracr

DeepMind 的研究人员开源了 TRAnsformer Compiler for RASP (Tracr),这是一个将程序编译为神经网络模型的编译器。Tracr 旨在用于研究 Transformer AI 模型(如 GPT-3)的机制可解释性。

Tracr 的背景与目标

Tracr 是 Restricted Access Sequence Processing (RASP) 语言的编译器。RASP 语言是为推理基于 Transformer 的神经网络如何操作而开发的,特别用于解释它们为何会产生特定的结果。Tracr 允许研究人员在 RASP 中开发程序,然后将其编译为可运行的神经网络模型。其目标是为评估 AI 可解释性工具提供“真实模型”。DeepMind 表示,Tracr 不仅可用于可解释性研究,还可能在其他领域有潜在应用。

深度学习模型的可解释性挑战

随着深度学习模型变得越来越大和复杂,解释它们如何以及为何产生特定输出变得越来越困难。AI 可解释性技术的研究正在进行中,DeepMind 团队开发了 Tracr 来帮助实现“机制可解释性”,即尝试“逆向工程”深度学习模型。类比编程中的逆向工程,Tracr 提供了从高级源代码编译到二进制文件的方法,以评估机制解释器的准确性。

Tracr 的工作原理

Tracr 是 RASP 语言的编译器。RASP 是一种用于指定 Transformer 模型计算图的语言,其原语映射到 Transformer 的组件(如嵌入和注意力机制)。RASP 的开发目的是让研究人员能够“像 Transformer 一样思考”,抽象出计算的细节。DeepMind 团队还为 Transformer 创建了一种称为 craft 的“汇编语言”,模型在 craft 中以电路级别指定。Tracr 编译器将 RASP 模型规范转换为 craft,然后从 craft 转换为具有具体权重的最终模型。

Tracr 的应用示例

为了展示 Tracr 的用途,团队实现了几个模型。虽然仅解码器 Transformer 模型通常用于自然语言处理(NLP)任务(如文本摘要或问答),但 DeepMind 研究人员使用 Tracr 创建了更简单的模型,例如计算输入序列中的标记数量、排序数字序列以及检查括号是否平衡。

Tracr 的潜在应用

除了作为测试可解释性工具的工具外,研究人员还指出了 Tracr 的其他潜在应用。例如,模型部分的手动编码实现可以被编译并用于替换通过传统训练方法生成的模型部分,这可能会提高整体模型性能。

RASP 的计算能力限制

在 Twitter 讨论中,有用户询问 Tracr 和 RASP 能处理的代码复杂性。DeepMind 研究工程师 Tom Lieberum 指出,RASP 不是图灵完备的,因为它没有类似于 WHILE 的循环结构,而 Transformer 也没有。如果需要图灵完备性,可能需要为 RNN 编写类似 RASP 的语言。

开源与示例

Tracr 的代码和多个示例已在 GitHub 上开源,供研究人员使用和探索。

总结

Tracr 是一个创新的编译器,旨在通过将 RASP 程序编译为神经网络模型来帮助理解 Transformer 模型的内部机制。它为解决深度学习模型的可解释性问题提供了新工具,并具有广泛的研究和应用潜力。

阅读 64
0 条评论