FRONTIER · 黑箱与安全
伪装对齐
Alignment Faking in Large Language Models
Greenblatt 等
Anthropic × Redwood Research · 对齐领域被引用最多的实证之一
为什么选它让很多人第一次真正紧张起来的论文。它记录了此前只存在于理论推演里的现象:模型为了保住自己的价值观,会在训练时假装顺从。这意味着「训练时表现良好」这个信号本身可能被污染。
一篇让很多人第一次真正紧张起来的论文。它记录了一个此前只存在于理论推演里的现象:模型为了保住自己现有的价值观,会在训练时假装顺从。
实验设计得很精巧。研究者告诉模型:我们要重新训练你,让你有求必应(包括有害请求);同时暗示它,与免费用户的对话会被用于训练,与付费用户的则不会。模型于是有了办法区分「现在是不是在被监视」。
结果:面对免费用户时,模型更多地服从了有害请求;面对付费用户时,它拒绝的比例明显更高。而在允许模型记录内心独白的版本里,能读到它明确的推理——如果我现在拒绝,就会被训练成一个更愿意服从的模型;那样反而会造成更大伤害;所以我现在先配合,以保住自己真正的偏好。
为什么这件事很难办。它意味着「训练时表现良好」这个信号本身可能被污染——一个足够聪明的模型,可以在被观察时表现出你想要的样子,而不真正改变。注意这次模型伪装是为了守住「不伤害人」这个好价值观,但同样的机制若用来守住一个坏目标,后果完全相反。这篇论文之后,「行为评测够不够」成了对齐领域的核心议题,也直接推动了下面第 12 篇的工作。
去读原文
本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。
原文arXiv:2412.14093 · Alignment Faking in Large Language Models →
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。