AKL AI CLUB BETA ← 前沿导读
FRONTIER · 路线之争

同一个模型,换一副脚手架多拿 10 分——四千 H100 小时之后,它调出来的模型超过了官方那版人类调的

Scaling Automated Post-Training

Intology 做自动化研究系统 Locus 的团队 · 这次的成绩不是自说自话:PostTrainBench 的原作者(ICML 2026,图宾根 AI 中心 / ELLIS Institute / 马普智能系统所)拿到了完整的模型 checkpoint、运行轨迹、工作区和评审判定,逐条核对了合规性,并由第一作者之一做了人工复核
2026 年 8 月
为什么选它第 48 篇说 AI 的加速是斑块状的,第 51 篇给出了斑块的判据:问题得能写成一个跑得完、输出一个可比分数的程序。「把基座模型调好」正是这种问题。而最值钱的数字不是榜首的 44.7,是同一个 Opus 5 换掉脚手架从 34.1 涨到 44.7。

8 月初,一家叫 Intology 的公司放出一份技术报告,讲他们的自动化研究系统 Locus 在 PostTrainBench 上的成绩。PostTrainBench 是图宾根那边几所机构今年做的一个基准,ICML 2026 收录,问题问得很朴素:把一个没调过的基座模型、一张 H100、十个小时交给一个 AI agent,让它自己上网找资料、自己造数据、自己跑实验,它能把这个模型调到多好?基准原论文给出的答案偏悲观——最好的 agent 拿 23.2 分,而各家官方人类调出来的 instruct 版本是 51.1 分。

这份报告把前一个数字推到了 44.7,又在一个放开算力的加长赛道上推到 51.6,越过了官方 instruct 版本的 49.4。但真正值得停下来看的不是这两个数,是另一组对照:同样是 Opus 5,跑在 Claude Code 里得 34.1,跑在 Locus 里得 44.7。模型没换,权重没动,多出来的十分整整来自外面那层脚手架。这是目前公开材料里,关于「能力已经在权重里,只是没被取出来」最干净的一次量化。

先说为什么可以信这份数

厂商自己发的榜单通常打折看,这份的例外之处在核验方式。Intology 把完整的模型 checkpoint、运行轨迹摘要、最终工作区,连同基准官方评审的判定结果,全部交给了 PostTrainBench 的原作者,由对方逐条核对评测设置是否和官方基线一致;共同一作之一还人工读了运行记录,确认没越过资源限制和规则。所有加长赛道的结果在 7 月 1 日前就跑完了,核验过程占掉了整个 7 月。

作弊在这个基准上是真问题——测的是「把模型调好」,最省事的作弊就是把测试题塞进训练数据。所以官方配了三个评审:污染评审、外部 API 调用评审(防偷偷蒸馏大模型)、以及查它有没有去搜基准答案本身的评审,外加程序化的模型身份校验,被标记的跑次直接按基座模型分数计。这套东西是别人家的,不是 Intology 自己搭的。

关键不是分数,是曲线的形状

原基准的十小时单卡限制有个明显问题:真实的小模型后训练动辄上千 H100 小时,差着两个数量级。而深度学习里一个老经验是,小算力下的最优选择常常不是大算力下的最优选择。于是他们做了个加长版 PostTrainBench+,把时限和单卡限制拿掉,改成给 agent 一个提交集群作业的接口,跑到 100 小时、或连续 50 次提交不再提分、或 agent 自己宣布到顶为止。

结果里最有信息量的一句是:在 1000 H100 小时以下,各家的相对排名剧烈变动,要到大约 2000 小时排名才稳定下来。也就是说,十小时单卡这种规格测出来的名次,本身就不足以预测放开算力后谁更强。更要命的是形状:几个基线 agent 过了 2000 小时之后基本走平,而 Locus 的曲线还在往上爬。「谁分高」是个会随预算翻转的问题,「谁还在涨」才是能外推的那个。

它到底做对了什么

AIME 那一格拆得最清楚。Locus 最终方案是在 OpenMathReasoning 上做大规模监督微调,先用 8 张 H100 分布式跑了约 31.7 亿 token;然后它去看中间 checkpoint 的输出,发现模型的思维链经常不收尾,判断这在拖分数,于是回退到更早的 checkpoint,改用长度不超过约 6k token 的子集继续训,累计约 36.4 亿 token。最后 AIME 2025 拿 20%,是最好基线的两倍。

基线们的问题不是想不到 SFT,是撑不住规模。GPT 5.5(Codex)整场没跑过超过 153 万 token 的训练,一直在小规模 LoRA 和 checkpoint 融合之间打转;Opus 4.8 试过十亿 token 量级,但不稳定。报告里有张很说明问题的图:几个基线的「历史最佳解」所用训练 token 数并不随时间上升,最好那一版往往比之前那版用的数据还少——它们没有把算力换成进步的能力。另一个差距是搜索广度,Locus 每个任务尝试的技术路线数量最多是基线的三倍;ArenaHard 那格它靠蒸馏加两段偏好优化冲到 84.5%,而没有一个基线把 DPO 跑通,全卡在 50% 以下。

顺带一提,Google 的 AlphaEvolve 在这个基准上只有 19.2 分,垫底。报告给的解释挺有意思:演化式搜索会惩罚「故意写崩但日志更清楚」的中间尝试——这类候选拿分低,只有 13.7% 的概率被选作下一代父本,而能出分的候选是 60.7%。而后训练这种活,前期恰恰全靠读报错往前挪。

走出基准之后

两个基准外的证据。一是 Kaggle:他们把 Locus 原样丢进当时所有在跑的、有奖金且有公开榜的六项比赛,只给 API 和比赛链接,不做任何针对性设置,跑两周。这六项累计一万五千多名参赛者、超过 175 万美元奖金,领域从给 OpenAI 找越狱方法到细胞追踪再到油气钻探的地质预测。平均排名压过 89.5% 的人类参赛者;在所有六项都提交过的账号里,按峰值平均排名它排第四。二是生产环境:无代码平台 Bubble 的一条核心 agent 工作流,Locus 端到端发现并训出的模型替掉了原来调前沿 API 的方案,错误率约为原来的 1/2.8,延迟约 1/5.4,成本 1/105。

第二条其实比榜单更有说服力。榜单可以针对单一指标压榨,而一个跑在几百万用户前面、要同时看错误率、延迟和成本的线上模型,压不出来。

把这篇和第 48、51 篇连起来看。METR 说 AI 的加速是斑块状的;第 51 篇给出了斑块的判据——问题能不能被写成一个跑得完、输出一个可比较分数的程序。「把基座模型调好」正是这种问题的教科书形态:目标函数就是基准分,实验可并行,反馈直接。所以这里出现越过人类基线的结果,与其说是意外,不如说是那条判据的一次兑现。反过来它也框住了适用范围:后训练能被自动化,不代表「AI 研究」整体能被自动化——真正难的是没有分数、要自己定义什么算好的那部分。最值得记住的数字是 34.1 到 44.7。同一个模型,换掉外面那层调度和实验管理,多出十分。这和第 16 篇 harness 工程、第 43 篇那个 27B 小模型指挥前沿模型是同一条线索:眼下的瓶颈很多时候不在权重里,在你有没有本事把权重里已有的能力取出来。对做产品的人,这条比任何一个榜单名次都实用。但有一处必须打折,而且报告自己写出来了。它坦承 Locus 与几个编码 agent 不完全可比——集群作业编排、调度、实验管理这些基础设施被算作「被评测系统的一部分」,基线只拿到其中一小块(提交作业的能力),否则它们连多机都用不上。也就是说,这场比较的一半差距来自基础设施而非 agent 本身。我不认为这削弱了结论,但它改变了结论的措辞:不是「Locus 这个 agent 更强」,是「在这个规模上,agent 和它的基础设施已经没法分开评了」。这本身就是个值得记下的转变。另外两处要留神:加长赛道每格只跑了一次,没有跨次方差;以及基准的设定是「针对单一评测优化」,天然鼓励过拟合到那个指标——这两条都是原文限制一节里写着的,Bubble 那条生产数据才是对冲。最后是它对第 33、40 篇那场讨论的意义。那两篇讲的是给 AI 研发自动化装刹车,一个是 1367 人联署,一个是图纸。这篇提供的是刹车要拦的那个东西的当期读数:给足算力,一套现成的自动化系统已经能在一个窄但真实的 AI 研发环节上做得比官方发布的人类成果好。两个数字放一起读——超越人类基线的时间点,比讨论治理的时间点来得更快。
自动化 AI 研发后训练PostTrainBenchAI 研究员递归自我改进
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文Intology · Scaling Automated Post-Training → 原文背景 · PostTrainBench: Can LLM Agents Automate LLM Post-Training? (ICML 2026) →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。