OpenSSL 一年从 6 个漏洞涨到 39 个,Stockfish 的棋力一分没多——AI 的加速是斑块状的,不是一片
Have We Seen an Acceleration in Discoveries?
8 月 14 日,METR 挂出一份很朴素的研究简报,标题就是一个问句:我们真的看到「发现」在加速吗?作者 Tom Cunningham 和 Nate Rush 没做新实验,也没跑新基准。他们做的事情是把公开可查的发现速率时间序列尽可能找齐——网络安全漏洞、数学未解问题、算法效率纪录——摊在同一张坐标纸上,然后只问一件事:2026 年这几条线的斜率有没有变。
值得读的有两条。一是它把「AI 正在加速科学」这句被说烂了的话第一次当成一个可证伪的命题来验,而结论是分裂的:网络安全出现了肉眼可见的拐点,数学确实在动但没有一把尺子接得住,而算法优化——最该被 AI 吃掉、也被吹得最响的那一块——公开记录里一点斜率变化都没有。二是这份东西的诚实程度不太常见。全部数据由 agent 采集、作者人工复核,源表挂在 GitHub 上任人挑错,正文里反复出现「这只是很弱的证据」「我们不敢下结论」。这跟第 29 篇那份 GDP 简报是同一个调子:能力上去了,能查到的数却跟不上。
方法:只看斜率,不看新闻稿
他们的取舍是全文的关键。AI 辅助的发现天天有人宣布,但单个发现的分量几乎没法评估——所以他们干脆不评估单个,只看总量拐点,并把 2026 年 1 月标成一个可能的断点。「发现」在这里定义得很宽:任何推进公共知识边界的进展都算,包括把一段算法改得更快。这个宽口径有个好处,它同时装得下自动化和增强两种情形——不管是 AI 自己做出来的,还是人用 AI 做得更快,都会落在同一条曲线上,省掉了「这算不算 AI 的功劳」这场永远吵不完的架。代价也写在明处:所有结论只基于公开的发现,实验室内部做出来又没说的,一个都不在里面。
网络安全:唯一一个不用统计检验也看得出来的拐点
这一块的数字是全篇最扎眼的。cURL 的 CVE 从 2025 年全年 9 个涨到 2026 年 6 月底的 36 个,其中 15 个标了 AI;OpenSSL 从全年 6 个涨到 8 月初的 39 个,其中 18 个被确证是 AI 发现;Firefox 从 210 涨到 342;连微软自己发的 CVE 都从 1243 涨到 1927,年化约为 2025 年的 2.5 倍。有意思的是后两个的 AI 标记率很低——微软那 1927 个里只有 26 个带 AI 标记,占 1.3%。也就是说,加速并不都写着 AI 的名字。
但真正该记住的是另一组对比。已知漏洞(CVE)在暴涨,而已知被利用漏洞(KEV,即有证据表明真的在野外被打的那一小撮)涨得慢得多。Vulncheck 的半年报说,2026 上半年 KEV 比前半年只增 10%,CVE 却增了 45%,KEV 对 CVE 的比值明显下滑。这条数据的含义值得掂量:发现速率的暴涨,目前还没有等比例地转化成被攻破的速率。它可能意味着防守方跑在前面(第 31 篇那只 AI 蠕虫描述的场景暂时还没在总量上兑现),也可能只意味着利用总是滞后于披露几个月到几年——报告自己也说了,现在下判断太早。
数学:确实在动,但没有一把尺子接得住
数学这块的尴尬在于,产出量的爆炸是确定的,价值却量不出来。arXiv 的组合数学(math.CO)投稿从 2026 年 1 月的 377 篇涨到 7 月的 743 篇,半年翻倍,而 2025 年的月均值是 368 篇。可投稿数显然不等于发现数——这正是第 24 篇里陶哲轩担心的那件事:证明要过剩了,消化不过来。
于是他们改用一个粗糙但硬的指标:预先存在的名单上,未解问题被解掉的速率。Hilbert 的、千禧年的、Smale 的、计算几何的 TOPP、Ben Green 的一百题。2026 年有三个是靠 AI 解掉的——Smale 名单上的 Jacobian 猜想(三维及以上的反例)、Green 的第 44 题(半筛法)、以及 Green 第 100 题里 sofic 群那一半。作者自己给这个证据打的分是「弱」。原因很实在:这些名单太短、太稀疏,Hilbert 的 23 题最后一次有定论的解决是 1998 年,千禧年七题至今只倒了一个。样本量到不了能看出斜率的地步。Erdős 问题库大得多,看着确实在加速,但解决日期是从引用论文的年份倒推的,维护者本人明确警告过不能这么用。
算法优化:喊得最响的那一块,公开记录里一动没动
这是全文最反直觉的一节,也是我认为最有价值的一节。他们收了七条算法效率的历史序列:CIFAR-10 极速训练、Hutter 压缩奖、Gurobi 混合整数规划、MIPLIB、nanoGPT 极速训练、Stockfish 棋力、矩阵乘法指数 ω。七条里只有两条(nanoGPT 和 CIFAR-10)出现过 AI 贡献的纪录,而没有任何一条的斜率变化,能和漏洞或数学那边相提并论。
细节比结论更说明问题。Stockfish 从 2013 到 2026 涨了约 675 Elo,年均 50 上下,十三年间恰好只有一次主干提交致谢了语言模型——一个 0.6% 的提速补丁,还不是 Elo 纪录。矩阵乘法指数 ω 从 1969 年的 2.8074 掉到 1990 年的 2.3755,而 2010 年之后的六次改进总共只挪了 0.0024,每一步都是人写的证明。Hutter 压缩奖的排行榜自 2023 年 10 月起没动过。Gurobi 最近四个年度版本的提速是 13%、8.6%、13.1%、0.6%。作者说这「有点出乎意料」——2026 年 1 月 Yuksekgonul 等人报告说,用很简单的方法加上微不足道的推理开销,就在五个优化问题上推进了前沿,「我们试的每一个都推进了」。那这些进展为什么没在总量上显形?
为什么是斑块状的
报告给了四个候选解释,没有排序:一是推理投入的差异——漏洞挖掘这块砸的钱可能远超别处(Anthropic 今年 4 月宣布捐出最高一亿美元的 Mythos Preview 额度专门用于挖漏洞和修漏洞,别家也有类似项目);二是任务难度的差异;三是披露的差异;四是数据质量的差异——越难追踪的领域,观察到的加速越会被抹平。
第三条是有实锤的。Anthropic 自家的 Fable 5 系统卡写着,他们「实施了新的干预措施,限制 Claude 在前沿 LLM 研发相关请求上的有效性,例如预训练流水线、分布式训练基础设施、ML 加速器设计」。同时各家都在宣布用自研 AI 找到了内部的算法效率提升——DeepMind 说 AlphaEvolve 把 Gemini 的一个核心 kernel 提速 23%,换来训练时间降 1%;OpenAI 说 GPT-5.6 把 token 生成效率提了 15% 以上。换句话说,公开的算法优化曲线之所以平,很可能不是因为没发生,而是因为这恰好是唯一一个各家都有强动机不说、并且主动限制公开模型去做的领域。
报告末尾还收了一组耐人寻味的引语,主题是「不需要专家提示」。Anthropic 那次黎曼 zeta 的结果(第 36 篇)里,提示词是一位非数学家的员工写的,内容大意是「认真试一把」;Hiverge 在宣布刷新 CIFAR-10 纪录时说「领域专长不再是突破的前提」。作者没有下判断,只补了一句:这类说法可能掩盖了藏在别处的专长——藏在选题里,藏在训练里,藏在验证结果的人手上。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。