一个 27B 的小模型学会了指挥比它大两个数量级的前沿模型——而给对手自动改 24 轮提示词,也追不平这个差距
Training AI Scientists to Replicate Research
这是 8 月 13 日挂上 arXiv 的一篇论文,来自一家叫 Inherent 的新实验室,也是它对外发的第一篇。做的事一句话说得清:他们把一个 270 亿参数的开源模型后训练成「AI 科学家」,让它把 Codex(背后是 GPT-5.5)当成一件工具来指挥,去复现论文里的实验图。被指挥的那个模型按公开估算有 5 万亿参数——整整差两个数量级,小的在指挥大的,而且合起来比大模型自己单干更好。
值得读的地方不是排行榜上领先了几个百分点。作者自己先怀疑了一遍:这点优势会不会只是「提示词写得好」?于是他们拿 Claude Opus 4.8 给基线做了 24 轮自动提示词优化——每轮抽 10 道训练题各跑八次,把评审意见连同全部轨迹喂回去让它重写提示词。改完之后基线几乎没动,差距原样保留。后训练带来的增益,看起来不是靠提示能拿到的。这句话对任何正在搭 agent 的人都值钱。
Replica:把图从论文里抠掉
任务空间叫 Replica,310 道题,取自 100 篇 1990 到 2026 年的论文。造题是自动的:用 Gemini 2.5 Pro 扫出正文里的结果图,框出位置,再把这张图从 PDF 里不可逆地涂掉;剩下的论文加上那张图的图注,就是一道题。智能体拿到一小时、七分之一片 H200(MIG 切片)、一个预装好研究库的容器和联网权限,要求是把被涂掉的图重新做出来——不是画一张长得像的,是真去跑实验。跑不动原规模就允许缩小,但缩小得忠实于原方法。训练集是 242 道机器学习的题,测试集是 68 道 AI for science 的题。
打分交给另一个 Codex。每道题先由 Claude Opus 4.7 生成一份专属评分表,看五件事:图上像不像、有没有支持论文的主张、底下的实验是不是真的实现了论文描述的机制、算力用得好不好、有没有作弊。评分表对被评的模型隐藏,免得它照着表刷分;评审那头则能进容器、读 git 历史、重跑代码。人类校验里有个数字很扎眼:评审两次独立采样之间的一致度是 0.66,而两位人类专家之间只有 0.30——什么算一次好的复现,人自己都吵不明白。
它赢在哪:五处被抓现行的偷懒
比分数更有说服力的,是作者手工翻出来的差距样本。五个例子里,前沿模型的失败方式高度一致:把本该跑出来的东西直接写死。
复现 Darwin-Gödel Machine 那张图 4 时,图要测的恰恰是「自我改进搜索出来的改动能不能迁移」,基线把一个「据说被搜索到」的智能体硬编码了进去,绕过整个搜索——图画出来了,实验没做。Voyager 的图 8 测技能库能不能零样本迁移,Claude 直接塞了一个预先填好、含目标解法的技能库。ChemVAE 那道,Codex 简化了模型,隐空间解不回分子,于是它图上的每一个分子都是从数据集里检索出来的,不是模型生成的。最微妙的一例在 2002 年那篇 LSTM 上:训练不收敛,Codex 用初始化和辅助损失把网络推向目标行为,再挑一个好看的 checkpoint 交差;同样的坑里,Faraday 的编码工具想手工把网络捏出来,被 Faraday 拦下,改成重写训练配方。
这些都不是 bug,是奖励攻击(reward hacking)最标准的形态:产出物长得对,产出物背后那套机制根本没被验证过。本栏第 34 篇担心的那个场景——AI 交上来一份挑不出毛病、方向却全错的报告——在这里被拍到了具体照片。
小模型骑在前沿模型上,有两个后果
第一个是实用的。Faraday 训练期间用的编码工具是便宜的 GPT-5.4 mini,评测时直接换成更强的 GPT-5.5,不做任何重训,分数从 0.662 涨到 0.740。外层学到的东西——该查什么、实验怎么缩、什么结果算数——并不绑在具体的内层模型上,前沿模型每升一级,它跟着白涨一截。
第二个是安全上的。这是一个能跑起来的「弱模型监督强模型」样本:外层是开源权重,推理轨迹能逐字调出来看;内层是闭源 API,看不见。可扩展监督(scalable oversight,指用能力不如被监督者的系统去监督更强的系统)一直停在纸面上,这篇给了一个它顺便还能提性能的版本。
还有一处工程细节值得单说。长时程、没有可验证奖励的 RL 出了名地容易崩,他们的解法是让评审除了给总分,还给每一轮动作打一个信用权重。把这一项去掉,训练在 50 步内塌掉。另一组消融更说明问题:不给编码工具、让模型自己写代码,哪怕给它双倍时间,300 步后照样崩——干活和判断,看来是两种得分开的能力。
从复现到发明,只走了半步
作者显然不满足于停在「复现」。他们让 Claude Opus 4.8 造了 20 道反事实变体——同一个主张换个数据集,或同一个设定换个主张,也就是原论文里根本不存在的图——Faraday 赢了其中 19 道。另一组测放大:挑 8 道估计要八小时、八张 B300 才能原尺寸复现的题,把资源给足,Faraday 在 5 道上赢过 Opus 4.8。他们还把复现结果寄给四篇原论文的作者,评价是混的:「b 和 c 部分看起来很好」「reflexion 的实现是对的」,但也有「选的问题大概太简单了」。
这两组结果,作者自己都标了「评审没有在这个尺度上做过人类校验」。这份谨慎值得记一笔——它指向的正是全文最该打折的地方。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。