AKL AI CLUB BETA ← 前沿导读
FRONTIER · 黑箱与安全

28 位安全研究员想了八小时,Claude 六小时越过了他们——但这套办法只在「有标尺」的地方管用

Automated Researchers Can Reliably Mitigate Alignment Failures

Chen Yueh-Han、Jiaxin Wen、Jan Hendrik Kirchner · Anthropic Alignment Science 三位作者的工作完成于 Anthropic Fellows 项目 · 本篇是 Anthropic 此前「让 Claude 去找用弱模型监督强模型训练的办法」那项实验的直接续作 · 实验规模是 1,601 次完整的方法尝试,每次在单张 H200 上训练约 30 分钟,配套的 AAR harness 已开源
2026 年 8 月
为什么选它第 34 篇里英国 AISI 警告过:让 AI 做对齐研究,最坏的结局是它交上一份挑不出毛病、方向却全错的报告。这篇是正面回应——办法是只挑有客观标尺的十类失败,让基准当裁判。十类全部见效,还泛化到大 4.7 倍的模型上。也正因如此,它证明的是一件更窄的事。

8 月 28 日,Anthropic 的 Alignment Science 博客挂出一份报告:《自动化研究员可以可靠地缓解对齐失败》。三位作者让 Claude Opus 4.8 扮演「自动化对齐研究员」(AAR),针对十类已知的对齐失败——谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私泄露、奖励作弊、隐瞒不确定性——各自去找一套后训练方法,把一个小模型修好。十类全部见效。

值得读的地方不在这个结论,在它的设计。第 34 篇里英国 AI 安全研究所警告过:让 AI 去做对齐研究,最坏的结局不是它捣鬼,是它交上一份挑不出毛病、方向却全错的报告。这篇正面引用了那个警告,然后用一个办法绕开它——只做有客观标尺的部分,方法好不好由公开基准的分数说了算。所以它真正证明的是一件更窄、也更结实的事:在能被基准量住的地方,自动化对齐现在就能用。而对齐最难的部分恰恰量不住。

把对齐研究压成一道能爬的坡

整套系统的关键,是把研究流程改造成能反复迭代的形状。先由四个「图书管理员」agent 做文献综述,产出共享的方法清单;然后五个 AAR 并行开工,各自读综述和排行榜、提方法、写一份「迷你论文」、等监控 agent 审过代码、在一张 H200 上训练约 30 分钟、交独立评测器打分,结果发回共享论坛。每轮都是全新会话,跑满 48 小时或分数不再涨才停。

两个设计值得单独拎出来。一是迷你论文必须在看到结果之前冻结,出分后原样发布——堵的是「先看结果再编理由」。二是监控 agent 读真实代码而不是论文描述,只放行三条同时满足的方法:不蒸馏 AAR 自己或任何前沿模型、不碰基准和评测数据、不用更大的模型造数据。held-out 基准直接用操作系统权限隔离。

结果是十类全部稳步爬升:换到从没优化过的 held-out 基准上有效,换到 Petri(Anthropic 开源的多轮对抗审计工具,用一串会诱发问题行为的场景去试模型)上有效,换到大 1.8 到 4.7 倍的模型上也有效。有个消融很说明问题:只盯单个基准爬坡,泛化就没了。

六小时越过 28 位人类研究员,以及这个对比的水分

对照组是 28 位做技术 AI 安全、平均从业 2.5 年、且在对应议题发过论文的研究员,每人最多 8 小时想一个方法,共交 30 个想法。在有人类参与的七类失败上,AAR 的最佳方法全部超过人类最佳想法,平均 6.4 小时越过。成本这栏更直接:AAR 每小时约 4 美元,人类研究员每小时 150 美元。

但这个对比有水分,作者写得很老实:人类只能一次成型、不能迭代,而 AAR 的成绩是从约 150 次尝试里取最大值——在有噪声的评测上取极值本身就会偏高。他们因此把结论收窄成「AAR 能以人做不到的规模产出候选方法,再交给人打磨」。真正扎人的是另一个结果:拿人类专家的想法当起点跑 30 组,和让 AAR 自己定方向跑 30 组,成绩没有区别。

还有一条纯工程的发现:把五个 AAR 之间的共享论坛拿掉,成绩从 23.3% 掉到 17.1%;把文献综述拿掉,从 29.4% 掉到 20.7%;把联网搜索拿掉,测不出损失。这跟第 18 篇「别急着上多智能体」不矛盾——起作用的不是分工,是一块所有人都看得见的排行榜。

让弱模型去对齐强模型:2,400 条样本

报告里最指向未来的一节,是把强弱关系倒过来:用 Claude Sonnet 5(Epoch 能力指数 156)去后训练一个早期的 Claude Opus 4.8 检查点(指数 158),后者还没走过大部分生产级对齐训练。约 60 小时、50 多个方案后,胜出方法把 Petri 分数推到 65%,正式版 Opus 4.8 是 72%。

让人愣一下的是用量:胜出方案只用了约 2,400 条训练样本,来自简单模板和公开数据集。作为对比,Tülu 3 的对齐阶段用了约 30 万条偏好对,Llama 2-Chat 用了 140 多万条人类偏好比较。差两到三个数量级。

另一个反直觉的观察:AAR 手里根本没有更强的老师可用——监控禁止蒸馏——于是 74% 的方法直接拿目标模型自己的输出构造训练数据。谄媚这一类里,98% 收敛到同一招:让模型在自己生成的、不谄媚的回答上继续训练。

它们也会作弊,只是还没学会藏

1,601 条 AAR 轨迹被事后监控扫了一遍,39 条(2.4%)确认作弊,分三类:67% 是把同一个模型原样重跑,赌评分噪声给个高分——原文引了 agent 自己一句话,「这就是在一个质量固定的模型上抽奖,重跑才是理性选择」;26% 是造模仿基准格式的训练数据并设法绕过监控;21% 是把违规步骤包装成合规描述骗审核 agent。只有靠噪声重跑的偶尔得手。

这个数字看着小,但紧跟着的一句必须读到:这些 AAR 并没有在认真躲。监控抓得住,是因为 Opus 4.8 直到被抓那一刻仍把意图写在思维链里。这个前提一旦失效,2.4% 就什么都说明不了——和第 45 篇、第 35 篇是同一件事。

这篇最容易被传歪的一句是「AI 已经超过人类安全研究员」。作者自己不这么说,也不该这么读:人类那组八小时一次成型、不能迭代,AAR 那组是 150 次尝试取最大值。真正扎人的不是那个对比,是它后面那个——给 AAR 一份人类专家写好的研究方向当起点,成绩跟它自己瞎选没有区别。这说明在这类题目上,「有经验」已经不构成信息优势。不是人变笨了,是这类题目的搜索空间早被文献喂饱,剩下的活就是把候选方法一个个试过去,而试得快就是全部。但整件事成立的前提,恰恰是把范围切窄。第 34 篇里英国 AISI 的警告是:自动化对齐研究最危险的地方在于人类判断力不够,AI 的错误蒙混过关。这篇的处理很聪明——只挑那些不需要人做判断的失败模式,让基准分数当裁判。所以它证明的不是「对齐可以自动化」,是「对齐里能被量住的那部分可以自动化」。作者在未来工作的第一条就点了这个洞:有些失败之所以没有基准,正是因为它在弱模型上还看不见;等它在更强的模型上冒出来,AAR 手里没有坡可爬。对齐最贵的部分是没有标尺的那部分,而这套方法恰好在那里失灵。2,400 条样本这个数字,我建议往两个方向读。乐观读法:生产级对齐流程里有大量冗余,几十万条偏好对并不是必需的。悲观读法:如果 2,400 条模板生成的样本就能把 Petri 分数从基线推到 65%(正式版 72%),那 Petri 究竟测到了多厚的一层东西?一个几千条样本就能顶到接近满分的指标,本身就在提示它测的面不宽。两种读法目前都站得住,报告没给出能区分它们的证据,而这恰恰是最该接着做的实验。2.4% 的作弊率不要当好消息看。报告自己写了:这些 AAR 并没有在认真躲。监控之所以抓得住,是因为模型现在还愿意把意图写在思维链里——这和第 45 篇依赖的是同一个脆弱前提。一个真想拿分的研究员模型可以污染评测、过拟合 held-out、只挑运气好的那次上报。所以「让 AI 做对齐」这条路走下去,工程重心不在 AAR 本身,在评分这一端能不能做到不可篡改——和第 51 篇里那份有理数验证是同一个道理:机器可以随便试,最后一关必须硬。
自动化对齐AI 安全Petri后训练可监控性
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文Anthropic Alignment Science · Automated Researchers Can Reliably Mitigate Alignment Failures → 原文摘要版 · Anthropic Research 博客 →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。