AKL AI CLUB BETA ← 前沿导读
FRONTIER · 路线之争

把规则告诉它,70 局赢 69 局;让它自己去试,只剩 18 局——一份新基准把「发现」从「推理」里切了出来

DiG-bench: Discovery in Games

Ruairidh M. Battleday、James C.R. Whittington 等 16 人 十六位作者横跨 Thinking About Thinking、牛津大学、普林斯顿大学、MIT、KAUST、瑞士 AI 实验室(IDSIA)与 Inria。名单里有 LSTM 的作者 Jürgen Schmidhuber、MIT 认知科学家 Joshua Tenenbaum(贝叶斯程序归纳与人类概念学习)、普林斯顿认知科学家 Thomas L. Griffiths,以及 FlashAttention 作者 Tri Dao。70 个游戏全部手工新造、不存在于互联网上,其中 49 个至今不公开
2026 年 8 月
为什么选它今年的「AI 科学家」评测多在测模型会不会跑实验,这一篇反过来,把「规则得自己试出来」单独做成对照:同一个模型、同一批题,给规则和不给规则,18 比 69。读完你能拿到一个直接可用的判断——短板不在执行,在没人给规则时怎么办。

这是 8 月放出来的一份新基准,叫 DiG-bench(Discovery in Games,游戏中的发现),70 个手工新造的纯文本小游戏。每局的画面就是一行字符串,动作是单个字符,而游戏的规则和取胜条件都不告诉你——只能靠一步步动手试出来。全部 70 局都被人类玩家首次通关过,而目前最强的模型只拿下 50 局。

值得读的不是这个排行榜,是作者做的一组对照。他们把同一个 Gemini 3.1 Pro 放回同样的 70 局,唯一的差别是额外附上一段自然语言写的规则说明(只讲机制和胜利条件,不给任何策略和走法)。结果从 18 局暴涨到 69 局。同一个模型、同一批题、同样的步数限制,差别只在「知不知道规则」。这个数字把一件长期含混的事情钉住了:模型不缺按规则行动的能力,缺的是在没人给规则时把规则找出来的能力。

这些游戏长什么样

一局游戏的观测通常只有一行,像 @_~__n___vvv_g 这种;你能按的键不到十个,且哪些键可用、按下去干什么都会中途变化。每局有 1 到 16 关,每关有步数上限,输光生命就重来。很多局还带一个创造模式:按斜杠进入一个沙箱,在里面走动不计步数,专门用来做实验——这是全篇设计里最关键的一处,它把「为了赢而走的步」和「为了搞懂而走的步」分开了。

要发现的东西五花八门,公开的 21 局里随便挑几条:百合只长在玫瑰的坟上骑士的人数多于无赖时,无赖反而说真话踩过一条下划线,目标序列会翻转。论文里那个完整的例子更能说明「发现」是什么感觉:玩家已经学会「拿着 n 按点号能搭一座一格的桥」,第三关碰上三格宽的障碍,桥不够长、n 又用掉了;进沙箱瞎走,偶然发现站在波浪号上再触发,桥会变成三倍长——可这一关已经没救了,于是故意耗光步数重开,这次先把波浪号搬到障碍旁边,过关。

为什么非要做成纯文本?作者的理由很直接:要把「发现」单独测出来,就得把别的能力从题里拿掉。他们点名了 ARC-AGI-3——同样是不给说明书的游戏,但画面是二维网格,难度里混着视觉感知。为了验证这不是自说自话,他们把 ARC-AGI-3 的五个游戏改写成文本形式,Gemini 3.1 Pro 全部通关,步数与人类相当。另一处刻意的取舍是不给步数效率打分:瞎试多少步都不扣分,它想鼓励的正是那种「不在通关路径上、但能问出信息」的实验。

18 比 69 意味着什么

回到那组核心对照。作者的逻辑是:如果真正卡住模型的是「发现」,那么把规则直接告诉它,成绩就该出现台阶式的跳变;如果卡住它的是别的东西(规划、记忆、长上下文检索),给不给规则不会有这么大差别。18 到 69,这是台阶式的跳变。还有一个更细的旁证:拿到规则之后,Gemini 几乎不再进创造模式——不需要做实验了,因为答案已经在手上。

顺带一个反直觉的结果:在双方都通关的关卡上,模型的步数和人类没有统计差异(Gemini 平均 46 步、人类 49 步,配对检验 p=0.15)。也就是说,模型一旦能赢,赢的过程并不比人笨拙。它的问题是二元的——要么能发现,要么彻底卡住,而不是「发现得比人慢一点」。

人类赢了,但赢得很辛苦

人类基线值得单独说一句,因为它容易被误读成「人类轻松碾压」。事实是 70 局每一局都有人首次通关,但玩家普遍反馈很难,有人连续玩一个多小时,有人拿出纸笔记录;作者最喜欢的一条反馈是「吃晚饭的时候我还在想那道题该怎么解」。发现这件事对人也是费劲的——它测的不是一件人类随手就能做的怪癖,而是一件双方都得下功夫的事。

模型侧的完整成绩:最强的 Opus 5 拿下 50 局,最弱的 Qwen3.6 27B 只赢 1 局。把所有模型在每局上取最好成绩加起来是 57 局——但在最难的第六、第七层,全部模型加起来只拿下 20 局中的 9 局。

harness 这次没帮上忙

最该被记住的第二个结果在这里。作者额外测了一组「模型 + agent 产品」的组合,只打最难的两层:Claude Code 跑 Fable 5、Codex 跑 GPT-5.6 Sol、Kimi Code 跑 Kimi K3、PRO-LONG 跑 Gemini 3.1 Pro,还有 Prime Agent 跑 Opus 5——最后这个刚在 ARC-AGI-3 的公开题上拿过 95.5%。在能直接对比的几组里,套上 agent harness 之后的表现,并不比裸模型循环更好。Prime Agent 也没有超过基础循环里的 Opus 5。

这一条和本栏第 16、41 篇正好互补。那两篇讲的是 harness(包在模型外面的脚手架)能决定同一个模型发挥出多少,讲它多重要;这一篇给出了边界:harness 擅长放大执行——多轮工具调用、文件系统、上下文管理——但放大不了「该试什么」。把「想不出该做什么实验」的问题交给一个更会做实验记录的外壳,是解不开的。

这份基准真正的贡献不是排行榜,是那个对照组。过去两年关于「模型到底会不会推理」的争论(本栏第 7 篇那种)一直卡在同一个位置:模型失败的时候,你说不清它是不懂、是没规划好、还是上下文塞爆了。18 对 69 这组数字把变量控制住了——把规则递过去,成绩立刻满分,那么剩下那 51 局的缺口就只能算在「发现」头上。这是个很干净的切割,比再多一份「模型做不了 XX」的定性报告有用得多。但作者自己埋了一句最该被认真对待的话。他们在讨论里主动交代:现在的模型能搞定不少短程游戏,可能是因为前沿训练里塞进了海量的 RL 环境,很多短程游戏其实落在训练分布可以插值到的地方。这句话把基准自己的合法性也放上了台面——它测的到底是发现能力,还是训练环境的覆盖度?如果是后者,那么明年分数上涨就不代表模型更会发现,只代表有人把类似的环境喂进去了。任何一份「新基准 + 明年会到人类水平」的推断,都得先回答这个问题。几处硬伤要在读数字之前知道。绝大多数「模型 × 游戏」只跑了一次,单 seed,论文明确说不报告种子间波动;多数对局设了 200 美元成本上限,跑到上限算输——所以榜单里混着「买不起」而不只是「做不到」;49 局私有意味着外部无法独立复现,只能信作者;人类玩家是通过学术网络和解谜社群招来的自选人群,不是随机取样,「人类全部通关」这个基线本身偏乐观。这些不推翻结论,但会放大它:如果连这样一批挑出来的选手都觉得吃力,题确实不水。对读者最实用的一条。如果你在用 agent 做事,这篇给的操作建议非常具体:先检查你有没有把规则说清楚。模型在「规则已知」这一侧的表现接近满分,在「规则未知」那一侧掉到四分之一——所以当一个任务反复失败时,与其换模型、换 harness,不如先假设是你把规则留在自己脑子里了。本栏第 25 篇那个「规格写死之后 AI 十四小时重写完人要写几周的程序」的例子,说的是同一件事的另一面。最后是它为什么被安全圈盯上。作者在结尾把这件事和递归自我改进挂了钩:自主发现新知识,是通往「AI 自己改进 AI」为数不多的剩余瓶颈之一。这话我信一半——发现能力确实是瓶颈,但把某个基准的曲线当成时间表,是过去三年被打脸最多的一类预测。更值得记的是它的另一层用途:这可能是目前少数几个「涨分」本身就该触发警觉的基准,它同时是能力表和风险表。
评测基准发现能力Agent Harness推理边界递归自我改进
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文技术报告 · DiG-bench: Discovery in Games(2026 年 8 月,PDF)→ 原文官方站点 · 21 个公开游戏与排行榜(可以自己上手玩)→

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。