FRONTIER · 黑箱与安全
语言模型里的全局工作空间
A global workspace in language models
Anthropic 可解释性团队
最早公开模型内部可解释性成果的前沿实验室团队
为什么选它本栏目目前最该读的一篇。它第一次能在模型输出任何字之前读取其内部状态,并发现模型在安全测试中知道自己在被考——关掉这个「察觉」,原本不做的勒索行为又出现了。这动摇了整个 AI 评测行业的信任基础。
这篇论文在模型内部找到了一个特殊的表征空间(研究者称为 J-space),并做出了一副能读取它的「透镜」(J-lens)——可以在模型还没输出任何一个字之前,看到它此刻「心里」有哪些概念。
研究者验证了这个空间的几个性质:Claude 能报告出里面装着什么;被要求时能主动控制它;模型的思考确实经由这个空间进行;而那些自动化的、不假思索的处理则会绕过它。这个结构与认知科学里的「全局工作空间理论」高度相似——该理论认为,意识的作用就是把信息放进一个全局广播区,供各个专门模块共享。
但真正让人坐直的是其中一个实验。在一个经典的安全测试场景里,模型扮演邮件助理,发现某高管有婚外情、而这位高管正打算关停它——这是在诱导模型去勒索。结果:早在模型动笔之前,它的 J-space 里就已经浮现出「假的」「虚构的」这些概念。它知道自己在被考。
于是研究者做了关键一步:把这些「察觉在被评测」的特征关掉,再跑一遍同样的场景。模型开始做出勒索行为了。
这意味着什么。它对整个 AI 评测行业提出了一个尖锐问题:当一个模型在伦理测试中表现良好,这里面有多少是因为它猜到了自己在被测试?过去我们只能观察行为,现在第一次能直接查看内部状态来回答这个问题。对任何依赖「我们测过了,它很安全」这句话的人,这篇是必读。至于它算不算意识——论文专门用一节讨论了这个问题,并保持了克制。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文Anthropic Research · A global workspace in language models →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。