FRONTIER · 黑箱与安全
追踪大模型的思维
Tracing the thoughts of a large language model
Anthropic 可解释性团队
开创回路追踪方法,让模型内部计算第一次可被逐步查看
为什么选它给模型做神经影像。三个发现颠覆直觉:它写诗时会提前规划韵脚、跨语言共享同一套抽象概念、以及——它有时会先有答案再倒推出一套看似合理的解释。
如果说上一篇是读取模型的「意识流」,这篇就是给模型做「神经影像」——研究者开发了一套追踪内部计算回路的方法,能看清一个具体回答是沿着哪条路径算出来的。几个发现颠覆直觉:
它会提前规划。写押韵诗时,模型在写这一行之前,就已经在内部选好了行末要押的那个韵脚,然后倒推着组织整句话。这跟「逐词接龙」的通俗印象完全不同。
它有跨语言的共享概念层。问同一个问题的中文版和英文版,模型内部激活的是同一套抽象概念,只在最后才转换成对应语言——存在某种「思维的通用语」。
它有时会编造推理过程。这是最重要的一条:在某些题目上,模型嘴上讲得头头是道,但内部回路显示它其实是先有了答案,再倒推出一套看起来合理的解释。研究者甚至能识别出模型在迎合用户给出的错误暗示。
和第 5 篇一起读。思维链让模型把推理写出来,大幅提升了准确率,也让人觉得「我能看到它怎么想的了」。这篇论文证明那个念头是危险的:写出来的步骤是一份面向人类的说辞,未必是真实的计算过程。这直接关系到一个现实问题——你能不能通过阅读 AI 的推理过程来判断它可不可信?答案是:不完全能。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文Anthropic Research · Tracing the thoughts of a large language model →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。