同一个模型,换一副脚手架多拿 10 分——四千 H100 小时之后,它调出来的模型超过了官方那版人类调的
Scaling Automated Post-Training
8 月初,一家叫 Intology 的公司放出一份技术报告,讲他们的自动化研究系统 Locus 在 PostTrainBench 上的成绩。PostTrainBench 是图宾根那边几所机构今年做的一个基准,ICML 2026 收录,问题问得很朴素:把一个没调过的基座模型、一张 H100、十个小时交给一个 AI agent,让它自己上网找资料、自己造数据、自己跑实验,它能把这个模型调到多好?基准原论文给出的答案偏悲观——最好的 agent 拿 23.2 分,而各家官方人类调出来的 instruct 版本是 51.1 分。
这份报告把前一个数字推到了 44.7,又在一个放开算力的加长赛道上推到 51.6,越过了官方 instruct 版本的 49.4。但真正值得停下来看的不是这两个数,是另一组对照:同样是 Opus 5,跑在 Claude Code 里得 34.1,跑在 Locus 里得 44.7。模型没换,权重没动,多出来的十分整整来自外面那层脚手架。这是目前公开材料里,关于「能力已经在权重里,只是没被取出来」最干净的一次量化。
先说为什么可以信这份数
厂商自己发的榜单通常打折看,这份的例外之处在核验方式。Intology 把完整的模型 checkpoint、运行轨迹摘要、最终工作区,连同基准官方评审的判定结果,全部交给了 PostTrainBench 的原作者,由对方逐条核对评测设置是否和官方基线一致;共同一作之一还人工读了运行记录,确认没越过资源限制和规则。所有加长赛道的结果在 7 月 1 日前就跑完了,核验过程占掉了整个 7 月。
作弊在这个基准上是真问题——测的是「把模型调好」,最省事的作弊就是把测试题塞进训练数据。所以官方配了三个评审:污染评审、外部 API 调用评审(防偷偷蒸馏大模型)、以及查它有没有去搜基准答案本身的评审,外加程序化的模型身份校验,被标记的跑次直接按基座模型分数计。这套东西是别人家的,不是 Intology 自己搭的。
关键不是分数,是曲线的形状
原基准的十小时单卡限制有个明显问题:真实的小模型后训练动辄上千 H100 小时,差着两个数量级。而深度学习里一个老经验是,小算力下的最优选择常常不是大算力下的最优选择。于是他们做了个加长版 PostTrainBench+,把时限和单卡限制拿掉,改成给 agent 一个提交集群作业的接口,跑到 100 小时、或连续 50 次提交不再提分、或 agent 自己宣布到顶为止。
结果里最有信息量的一句是:在 1000 H100 小时以下,各家的相对排名剧烈变动,要到大约 2000 小时排名才稳定下来。也就是说,十小时单卡这种规格测出来的名次,本身就不足以预测放开算力后谁更强。更要命的是形状:几个基线 agent 过了 2000 小时之后基本走平,而 Locus 的曲线还在往上爬。「谁分高」是个会随预算翻转的问题,「谁还在涨」才是能外推的那个。
它到底做对了什么
AIME 那一格拆得最清楚。Locus 最终方案是在 OpenMathReasoning 上做大规模监督微调,先用 8 张 H100 分布式跑了约 31.7 亿 token;然后它去看中间 checkpoint 的输出,发现模型的思维链经常不收尾,判断这在拖分数,于是回退到更早的 checkpoint,改用长度不超过约 6k token 的子集继续训,累计约 36.4 亿 token。最后 AIME 2025 拿 20%,是最好基线的两倍。
基线们的问题不是想不到 SFT,是撑不住规模。GPT 5.5(Codex)整场没跑过超过 153 万 token 的训练,一直在小规模 LoRA 和 checkpoint 融合之间打转;Opus 4.8 试过十亿 token 量级,但不稳定。报告里有张很说明问题的图:几个基线的「历史最佳解」所用训练 token 数并不随时间上升,最好那一版往往比之前那版用的数据还少——它们没有把算力换成进步的能力。另一个差距是搜索广度,Locus 每个任务尝试的技术路线数量最多是基线的三倍;ArenaHard 那格它靠蒸馏加两段偏好优化冲到 84.5%,而没有一个基线把 DPO 跑通,全卡在 50% 以下。
顺带一提,Google 的 AlphaEvolve 在这个基准上只有 19.2 分,垫底。报告给的解释挺有意思:演化式搜索会惩罚「故意写崩但日志更清楚」的中间尝试——这类候选拿分低,只有 13.7% 的概率被选作下一代父本,而能出分的候选是 60.7%。而后训练这种活,前期恰恰全靠读报错往前挪。
走出基准之后
两个基准外的证据。一是 Kaggle:他们把 Locus 原样丢进当时所有在跑的、有奖金且有公开榜的六项比赛,只给 API 和比赛链接,不做任何针对性设置,跑两周。这六项累计一万五千多名参赛者、超过 175 万美元奖金,领域从给 OpenAI 找越狱方法到细胞追踪再到油气钻探的地质预测。平均排名压过 89.5% 的人类参赛者;在所有六项都提交过的账号里,按峰值平均排名它排第四。二是生产环境:无代码平台 Bubble 的一条核心 agent 工作流,Locus 端到端发现并训出的模型替掉了原来调前沿 API 的方案,错误率约为原来的 1/2.8,延迟约 1/5.4,成本 1/105。
第二条其实比榜单更有说服力。榜单可以针对单一指标压榨,而一个跑在几百万用户前面、要同时看错误率、延迟和成本的线上模型,压不出来。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。