AKL AI CLUB BETA ← 前沿导读
FRONTIER · 落到现实

OpenSSL 一年从 6 个漏洞涨到 39 个,Stockfish 的棋力一分没多——AI 的加速是斑块状的,不是一片

Have We Seen an Acceleration in Discoveries?

Tom Cunningham 与 Nate Rush · METR METR 是专做前沿模型自主能力测量的独立非营利机构,多家实验室的发布前评估交由它执行;「AI 能独立完成的任务时长每 7 个月翻一番」那条被引用到烂的曲线就出自这里 · 本篇的全部数据序列由 agent 采集、作者人工复核,源表与代码公开在 GitHub 供人挑错
2026 年 8 月
为什么选它「AI 到底有没有在加速科学」过去一年全靠轶事和新闻稿在吵。这篇不接受任何一条轶事,只把公开可查的发现速率序列摊开看斜率,结论是分裂的:漏洞挖掘拐了,数学在动但量不准,算法优化——最该被点燃的那块——公开记录里纹丝未动。读完你能拿到一份分领域的证据清单,以及一个更清醒的问题。

8 月 14 日,METR 挂出一份很朴素的研究简报,标题就是一个问句:我们真的看到「发现」在加速吗?作者 Tom Cunningham 和 Nate Rush 没做新实验,也没跑新基准。他们做的事情是把公开可查的发现速率时间序列尽可能找齐——网络安全漏洞、数学未解问题、算法效率纪录——摊在同一张坐标纸上,然后只问一件事:2026 年这几条线的斜率有没有变。

值得读的有两条。一是它把「AI 正在加速科学」这句被说烂了的话第一次当成一个可证伪的命题来验,而结论是分裂的:网络安全出现了肉眼可见的拐点,数学确实在动但没有一把尺子接得住,而算法优化——最该被 AI 吃掉、也被吹得最响的那一块——公开记录里一点斜率变化都没有。二是这份东西的诚实程度不太常见。全部数据由 agent 采集、作者人工复核,源表挂在 GitHub 上任人挑错,正文里反复出现「这只是很弱的证据」「我们不敢下结论」。这跟第 29 篇那份 GDP 简报是同一个调子:能力上去了,能查到的数却跟不上。

方法:只看斜率,不看新闻稿

他们的取舍是全文的关键。AI 辅助的发现天天有人宣布,但单个发现的分量几乎没法评估——所以他们干脆不评估单个,只看总量拐点,并把 2026 年 1 月标成一个可能的断点。「发现」在这里定义得很宽:任何推进公共知识边界的进展都算,包括把一段算法改得更快。这个宽口径有个好处,它同时装得下自动化和增强两种情形——不管是 AI 自己做出来的,还是人用 AI 做得更快,都会落在同一条曲线上,省掉了「这算不算 AI 的功劳」这场永远吵不完的架。代价也写在明处:所有结论只基于公开的发现,实验室内部做出来又没说的,一个都不在里面。

网络安全:唯一一个不用统计检验也看得出来的拐点

这一块的数字是全篇最扎眼的。cURL 的 CVE 从 2025 年全年 9 个涨到 2026 年 6 月底的 36 个,其中 15 个标了 AI;OpenSSL 从全年 6 个涨到 8 月初的 39 个,其中 18 个被确证是 AI 发现;Firefox 从 210 涨到 342;连微软自己发的 CVE 都从 1243 涨到 1927,年化约为 2025 年的 2.5 倍。有意思的是后两个的 AI 标记率很低——微软那 1927 个里只有 26 个带 AI 标记,占 1.3%。也就是说,加速并不都写着 AI 的名字。

但真正该记住的是另一组对比。已知漏洞(CVE)在暴涨,而已知被利用漏洞(KEV,即有证据表明真的在野外被打的那一小撮)涨得慢得多。Vulncheck 的半年报说,2026 上半年 KEV 比前半年只增 10%,CVE 却增了 45%,KEV 对 CVE 的比值明显下滑。这条数据的含义值得掂量:发现速率的暴涨,目前还没有等比例地转化成被攻破的速率。它可能意味着防守方跑在前面(第 31 篇那只 AI 蠕虫描述的场景暂时还没在总量上兑现),也可能只意味着利用总是滞后于披露几个月到几年——报告自己也说了,现在下判断太早。

数学:确实在动,但没有一把尺子接得住

数学这块的尴尬在于,产出量的爆炸是确定的,价值却量不出来。arXiv 的组合数学(math.CO)投稿从 2026 年 1 月的 377 篇涨到 7 月的 743 篇,半年翻倍,而 2025 年的月均值是 368 篇。可投稿数显然不等于发现数——这正是第 24 篇里陶哲轩担心的那件事:证明要过剩了,消化不过来。

于是他们改用一个粗糙但硬的指标:预先存在的名单上,未解问题被解掉的速率。Hilbert 的、千禧年的、Smale 的、计算几何的 TOPP、Ben Green 的一百题。2026 年有三个是靠 AI 解掉的——Smale 名单上的 Jacobian 猜想(三维及以上的反例)、Green 的第 44 题(半筛法)、以及 Green 第 100 题里 sofic 群那一半。作者自己给这个证据打的分是「弱」。原因很实在:这些名单太短、太稀疏,Hilbert 的 23 题最后一次有定论的解决是 1998 年,千禧年七题至今只倒了一个。样本量到不了能看出斜率的地步。Erdős 问题库大得多,看着确实在加速,但解决日期是从引用论文的年份倒推的,维护者本人明确警告过不能这么用。

算法优化:喊得最响的那一块,公开记录里一动没动

这是全文最反直觉的一节,也是我认为最有价值的一节。他们收了七条算法效率的历史序列:CIFAR-10 极速训练、Hutter 压缩奖、Gurobi 混合整数规划、MIPLIB、nanoGPT 极速训练、Stockfish 棋力、矩阵乘法指数 ω。七条里只有两条(nanoGPT 和 CIFAR-10)出现过 AI 贡献的纪录,而没有任何一条的斜率变化,能和漏洞或数学那边相提并论。

细节比结论更说明问题。Stockfish 从 2013 到 2026 涨了约 675 Elo,年均 50 上下,十三年间恰好只有一次主干提交致谢了语言模型——一个 0.6% 的提速补丁,还不是 Elo 纪录。矩阵乘法指数 ω 从 1969 年的 2.8074 掉到 1990 年的 2.3755,而 2010 年之后的六次改进总共只挪了 0.0024,每一步都是人写的证明。Hutter 压缩奖的排行榜自 2023 年 10 月起没动过。Gurobi 最近四个年度版本的提速是 13%、8.6%、13.1%、0.6%。作者说这「有点出乎意料」——2026 年 1 月 Yuksekgonul 等人报告说,用很简单的方法加上微不足道的推理开销,就在五个优化问题上推进了前沿,「我们试的每一个都推进了」。那这些进展为什么没在总量上显形?

为什么是斑块状的

报告给了四个候选解释,没有排序:一是推理投入的差异——漏洞挖掘这块砸的钱可能远超别处(Anthropic 今年 4 月宣布捐出最高一亿美元的 Mythos Preview 额度专门用于挖漏洞和修漏洞,别家也有类似项目);二是任务难度的差异;三是披露的差异;四是数据质量的差异——越难追踪的领域,观察到的加速越会被抹平。

第三条是有实锤的。Anthropic 自家的 Fable 5 系统卡写着,他们「实施了新的干预措施,限制 Claude 在前沿 LLM 研发相关请求上的有效性,例如预训练流水线、分布式训练基础设施、ML 加速器设计」。同时各家都在宣布用自研 AI 找到了内部的算法效率提升——DeepMind 说 AlphaEvolve 把 Gemini 的一个核心 kernel 提速 23%,换来训练时间降 1%;OpenAI 说 GPT-5.6 把 token 生成效率提了 15% 以上。换句话说,公开的算法优化曲线之所以平,很可能不是因为没发生,而是因为这恰好是唯一一个各家都有强动机不说、并且主动限制公开模型去做的领域。

报告末尾还收了一组耐人寻味的引语,主题是「不需要专家提示」。Anthropic 那次黎曼 zeta 的结果(第 36 篇)里,提示词是一位非数学家的员工写的,内容大意是「认真试一把」;Hiverge 在宣布刷新 CIFAR-10 纪录时说「领域专长不再是突破的前提」。作者没有下判断,只补了一句:这类说法可能掩盖了藏在别处的专长——藏在选题里,藏在训练里,藏在验证结果的人手上。

七条算法曲线全平这件事,比另外两块的加速更值得盯。因为它正好落在最要命的位置上:如果 AI 真要递归自我改进,第一个该被点燃的就是「AI 优化 AI」这一块。报告给的四个解释里,我认为披露那一条被低估了——而它偏偏是最难证伪的那一条。你要证明「实验室内部在加速但没说」,唯一的证据来源是实验室自己说了什么,而它们的动机恰好指向少说。于是这里出现了一个结构性的盲区:对 RSI 时间表最有信息量的那个变量,正是公开数据最系统性看不见的那个。METR 这份简报最大的贡献,或许不是三个结论中的任何一个,而是把这个盲区的形状描清楚了。另一条我想补的是:那个流行的解释站不住。眼下最常听到的说法是「AI 在可廉价验证的领域进步最快」——漏洞崩了就是崩了,证明能过 Lean 就是过了。可这解释救不了这篇的数据:算法优化恰恰是验证成本最低的领域之一,跑一遍看秒表就行,而它一动没动。我更倾向于另一个区分:漏洞和 Erdős 问题是「很多个浅目标」,Stockfish 的 Elo 和 ω 是「一个深前沿」。AI 眼下最能提供的东西是廉价的并行劳动力,这种东西能把「数得清的东西」乘上去,却很难把一条已经被全世界最聪明的人磨了几十年的前沿再推一格——每一步都必须严格胜过历史最优,并行度在这里几乎没有用。如果这个区分成立,那么 CVE 数量翻倍和矩阵乘法指数纹丝不动,就不是矛盾,而是同一个能力在两种问题结构上的自然投影;而真正的相变信号也就不该去总量曲线上找,该去看那些「深前沿」什么时候开始出现非人贡献。最后要说的是这份简报的元层面。它的全部数据序列由 agent 采集、人工复核——一份测量 AI 有没有加速发现的研究,本身就是被 AI 加速出来的,和第 29 篇那份 GDP 简报末尾的自我披露如出一辙。同时它也顺手给一年前那句流传很广的话结了个账:2025 年 4 月 Dwarkesh Patel 说,这些模型「几乎背下了世界上所有已知事实,却据我所知没做出过一个新发现」。一年之后,这句话在网络安全领域已经明确不成立,在数学领域大概不成立,在算法领域仍然大致成立。三个领域给出三个不同答案,这本身就是这一年最重要的事实——「AI 会不会加速科学」从此不再是一个能整体回答的问题。
科学加速递归自我改进漏洞挖掘数学发现测量方法
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文METR 研究简报 · Have We Seen an Acceleration in Discoveries? → 原文配套数据仓库 · ai-discovery-data(全部时间序列与来源)→

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。