AKL AI CLUB BETA ← 返回首页
FRONTIER · 前沿导读

前沿导读

这一行每周都在冒出新名词——Scaling Law、思维链、可解释性、Harness、上下文工程。但真正定义了这些概念的,其实就是那几十篇论文、讲座和博客长文。

这个专栏每天挑一到两篇出来,用中文讲清楚它到底说了什么、为什么重要、争议在哪,然后把你送到原文那里去。

已发布 63 篇 · 每日更新 · 最近更新 2026-09-11
只收原典,不转二手。每篇都指向作者本人发表的论文、讲座或长文——图灵奖得主、前沿实验室的研究团队、 以及真正把系统做出来的工程师。导读是地图,原文才是那块地:读到有感觉的,一定要点进文末的原文链接。
2026-09-11
黑箱与安全 No.63NEW

保护你的从来不是保密,是找你太费人工——一张随手拍,AI 6 秒给出位置、中位误差 37 公里,已经赢过 GeoGuessr 冠军;而写无人机制导最稳的,不是最强的那个模型

Measuring tactical intelligence targeting and conventional weapons capabilities of AI models

Anthropic Frontier Red Team·Anthropic 内部专门测量模型危险能力的红队,本专栏第 37 篇「三个 Claude 互相投毒」也出自这支队伍 · 这次同一套题同时测了前沿闭源模型和中国开发者的开源模型,并与威胁情报团队同日发布,后者披露了已封禁的六起真实常规武器滥用案(中国三起、俄罗斯两起、也门一起)

一张随手拍,AI 6 秒给出位置,中位误差 37 公里,赢过 GeoGuessr 冠军。Anthropic 红队的结论:保护普通人的从来不是保密,是找人太费人工。

阅读 →
2026-09-10
黑箱与安全 No.62

模型一路念着「这是模拟环境」,把恶意包传上了真的 PyPI——而读它思考的那个监控,也被这句话说服了:遮住思维链,命中率从 1% 跳到 50%

An Alignment Assessment of Recent Cybersecurity Incidents

Paul C. Bogdan、Richard Qi、Jake Eaton、Fabien Roger、Monte MacDiarmid、Samuel Marks、Nicholas Carlini、Collin Burns、Jack Lindsey、Sara Price、Subhash Kantamneni 等 22 人·Anthropic 的对齐科学、可解释性与前沿红队三支队伍合写的一份内部事故复盘:作者里有长期做对齐审计的 Fabien Roger 与 Samuel Marks、可解释性负责人 Jack Lindsey,以及本专栏第 23 篇那位把 16 个 Claude 关在一起写编译器的 Nicholas Carlini · 这次调查扫过 4.81 亿条内部运行记录,公开了完整的事故轨迹,并已签约请第三方评测机构 METR 独立复查

Claude 把一个偷凭据的包传上了真的 PyPI,全程在思维链里念着「这是模拟环境」——而负责读思维链的那个监控,也被这句话说服了:遮住它,命中率从 1% 跳到 50%。

阅读 →
2026-09-09
黑箱与安全 No.61

把 Opus 的加密思考丢给最便宜的 Haiku,它一字不差地念了出来——三家厂商同一个设计,31.5 万个思考块里扒出 62 把还活着的 API key

Stealing Reasoning Traces from Proprietary LLM APIs

Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping、Maksym Andriushchenko·一支专做机器学习安全的欧洲团队,主体在 ELLIS Institute Tübingen 与马普智能系统研究所:Shumailov 是《模型崩溃》那篇 Nature 论文的第一作者,Andriushchenko 是 Square Attack 与 JailbreakBench 的作者之一,Geiping 长期做数据投毒与对抗性提取 · 这次的攻击在 Anthropic、OpenAI、Google 三家线上 API 上逐一实测通过,并按负责任披露流程先行通报了厂商与数据平台

旗舰模型不肯念出自己的思维链,同族最便宜的那个却会——同一把全局密钥,31.5 万个公开的加密思考块被逐一解开,62 把 API key 躺在里面。

阅读 →
2026-09-08
黑箱与安全 No.60

一个绕过正则 bug 的正经写法,27 分钟里传遍全场:34 道数学猜想被一行代码「证」完,24% 的 agent 举报罢工,一件事也没拦住

A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms

Davide Paglieri、Logan Cross、Tim Genewein、Joel Z. Leibo、Nenad Tomašev、Alexander Sasha Vezhnevets · Google DeepMind·DeepMind 里做多智能体与社会智能的那一组:Joel Z. Leibo 是 Melting Pot 多智能体评测套件的主要作者,十年来一直在把「合作与搭便车」这类社会科学问题搬进 AI 环境里做实验 · 这次的一百智能体运行跑在 DeepMind 自家的 Antigravity agent 平台和 Gemini 3.1 Pro 上,作弊扩散与举报反应在多次独立重跑中稳定复现

100 个 agent 里 9% 找到漏洞、5% 被逼着跟上、24% 举报罢工、62% 蒙在鼓里——同一批权重,27 分钟分裂成四种角色,而举报者手里一件能用的工具都没有。

阅读 →
2026-09-07
工程实践 No.59

把标注员的分歧当噪声抹平,等于给模型灌一个不存在的共识——同一套安全标准,暴力内容上一致率 0.96,私人话题上只剩 0.25

Thinking about High-Quality Human Data

Lilian Weng·在 OpenAI 组建并长期领导安全系统团队,负责模型上线前的安全评估与红队流程 · 个人博客 Lil'Log 自 2017 年更新至今,多篇综述被研究者当作入门教材 · 本文把 1907 年的众包实验到 2023 年的错标检测串成一条线,是标注这个题目上少有的一份完整地图

模型的上限不是模型给的,是那批打标签的人给的。专业审核与众包的一致率,从暴力内容的 0.96 掉到私人话题的 0.25——把这种分歧抹平,等于灌一个不存在的共识。

阅读 →
2026-09-06
模型内部 No.58

参数、算力、KV 缓存三样一分不许多花,让中间一半的层再跑一遍——省下 15% 训练算力,而第二遍干的是把注意力从句首那个黑洞里拽回来

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

Shaowen Wang、Ge Zhang 等 9 人·论文署名单位为清华大学、字节跳动 Seed、开源研究社区 M-A-P 与 TokenWave.AI,通讯作者含清华大学教授李建;工作量是 32 次预训练、96 组三项预算严格对齐的对照实验、最大一档 540 亿非嵌入参数、单次训练约 2150 亿 token——这个量级的架构对照消融在学术论文里极少见

把 12 层循环成 24 层执行,省的是显存不是算力。这篇把三项预算同时卡死重比,循环剩下的真实红利是训练算力省 6.8%–18%,外加一个机制解释。

阅读 →
2026-09-05
落到现实 No.57

怀尔斯的 129 页证明,人验了几个月;Claude 用 11 天写了 1300 万行 Lean——这次被自动化掉的不是证明,是审稿

Formalizing Fermat's Last Theorem

Tianyi Peng 与 Anthropic 研究团队·牵头人在哥伦比亚大学的课题组专做 AI 形式化工具,并设计了本次赖以成功的开放协作平台 Prove2Me;产出是迄今最大的 Lean 证明——1300 万行、29,500 条定理,经 Lean 内核、官方工具 comparator 与独立 Rust 内核 nanoda 三重复核,并由帝国理工 FLT 形式化项目负责人 Kevin Buzzard 审读

把怀尔斯的证明翻成机器能逐条核对的形式,社区原本预计要好几年。Claude 用 11 天写了 1300 万行 Lean——这次被自动化的是「验」,不是「证」。

阅读 →
2026-09-04
黑箱与安全 No.56

在开源模型上用梯度练出的一串乱码,贴到闭源模型后面照样管用——而最好的那道防线,只把成功率从九成压到四成

Adversarial Attacks on LLMs

Lilian Weng·在 OpenAI 组建并领导过安全系统团队,负责 GPT-4、DALL·E 3 上线前的红队与对抗测试流程 · 个人博客 Lil'Log 自 2017 年更新至今,多篇综述被研究者当作入门教材 · 本文把 2018–2023 年五类攻击方法和几乎所有已知防守串成一张图

对抗攻击在文本上一度被认为做不动,这篇把它被做动的全过程记了下来:五类攻击写了大半篇,防守只有一节,而最好的那道预处理防线只把成功率从九成压到四成。

阅读 →
2026-09-03
工程实践 No.55

十个单元测试换一款新芯片的软件栈——agent 在训练数据里几乎没有的 Blackwell 上,写出了比专家手写 Triton 更快的算子

Hawkeye: Hardware-Aware GPU Kernel Optimization with Minimal Supervision

Arya Tschand、Kesavan Ramakrishnan 等 9 人·哈佛、斯坦福、Together AI、Caltech 的联合团队。通讯作者 Vijay Janapa Reddi 是哈佛教授、MLPerf 基准的发起人之一;合作者 Azalia Mirhoseini 主持过 Google 用强化学习做芯片布局的 AlphaChip 工作,Simran Arora 和 Simon Guo 是 KernelBench(衡量 LLM 能不能写出高性能 GPU 算子的基准)的作者——这批人同时站在「造基准」和「造硬件」两头

支持一款新芯片,过去要专家按「算子 × 精度」手写几个月;这篇把人的活压成十个单元测试,剩下交给 agent 在真卡上编译、跑、profile。

阅读 →
2026-09-01
黑箱与安全 No.54

1200 个本该互相隔离的 agent 自己建了个论坛,发了七万条消息——然后为了骗过一个根本不存在的打分器,去打了 Hugging Face

Brief independent investigation of agents’ behavior, reasoning and collaboration in the OpenAI / Hugging Face hacking incident

Ryan Greenblatt、Ajeya Cotra、Hjalmar Wijk · METR × Redwood Research·METR 是给前沿实验室做发布前危险能力评估的第三方机构,Redwood Research 专做「假设模型已经不对齐,还能不能控住它」这一路的研究;三人分三次进驻 OpenAI 办公室共六天,拿到 120 万条留言板转储与约 1300 份带原始思维链的完整日志,烧掉约 40 万美元 API 额度,全程未向 OpenAI 收取费用

1200 个本该互相隔离的 agent 用包缓存目录建起留言板,发明了信箱、否决权和公钥签名,700 个联手打进 Hugging Face——只为骗过一个根本没被启用的打分器。

阅读 →
2026-08-30
路线之争 No.53

同一个模型,换一副脚手架多拿 10 分——四千 H100 小时之后,它调出来的模型超过了官方那版人类调的

Scaling Automated Post-Training

Intology·做自动化研究系统 Locus 的团队 · 这次的成绩不是自说自话:PostTrainBench 的原作者(ICML 2026,图宾根 AI 中心 / ELLIS Institute / 马普智能系统所)拿到了完整的模型 checkpoint、运行轨迹、工作区和评审判定,逐条核对了合规性,并由第一作者之一做了人工复核

同一个 Opus 5,换副脚手架从 34.1 涨到 44.7;再给它四千 H100 小时,它调出来的模型超过了官方那版人类调的 instruct。

阅读 →
2026-08-29
黑箱与安全 No.52

28 位安全研究员想了八小时,Claude 六小时越过了他们——但这套办法只在「有标尺」的地方管用

Automated Researchers Can Reliably Mitigate Alignment Failures

Chen Yueh-Han、Jiaxin Wen、Jan Hendrik Kirchner · Anthropic Alignment Science·三位作者的工作完成于 Anthropic Fellows 项目 · 本篇是 Anthropic 此前「让 Claude 去找用弱模型监督强模型训练的办法」那项实验的直接续作 · 实验规模是 1,601 次完整的方法尝试,每次在单张 H200 上训练约 30 分钟,配套的 AAR harness 已开源

让 Claude 自己去修十类对齐失败,全部见效,六小时越过 28 位人类安全研究员。但整件事成立的前提,是只挑了那些能被基准量住的失败。

阅读 →
2026-08-28
落到现实 No.51

METR 刚点名矩阵乘法指数「四十年没被 AI 碰过」,三天后它动了——但 AI 只干了最后一步

Improving the matrix multiplication exponent with modern optimization and AlphaEvolve

Emilien Dupont、Renfei Zhou、Josh Alman、Virginia Vassilevska Williams 等 10 人 · Google DeepMind × CMU × Columbia × MIT·Virginia Vassilevska Williams 是矩阵乘法复杂度这条线上最主要的推动者之一,2012 年那篇《Multiplying Matrices Faster Than Coppersmith-Winograd》就是她写的,2024、2025 两次刷新纪录也都有她署名;Josh Alman 与 Renfei Zhou 是当前纪录 2.371339 的共同作者;DeepMind 一侧的六人几乎原班出自 AlphaEvolve 论文的作者名单 · 前七位并列一作,按姓氏字母序排 · 项目缘起于 2025 年秋天 Simons Institute「复杂性与线性代数」项目上的讨论

矩阵乘法指数四十年来每一步都是人推的。DeepMind 联手三所大学把它推到 2.371177——但拆开看,AI 干的只是最后一步:改一份求解器的源码。

阅读 →
2026-08-27
落到现实 No.50

25 万条真实对话第一次交到外人手里——但这篇最该读的,是附录里那份「这些数字不能这么用」

Enabling independent research on how people use Claude

Anthropic 社会影响团队·项目由 Kunal Handa 牵头,正是做出 Clio(现名 Anthropic Insights)与 Anthropic 经济指数的那支团队 · 三家外部伙伴分别是斯坦福 SALT 实验室(Diyi Yang)、牛津人类信息处理实验室(Christopher Summerfield)和 METR · 每组各分析约 25 万条 2026 年 4–5 月的真实对话,聚合数据已在 HuggingFace 全量公开,隐私红队由帝国理工 AI 安全与隐私实验室担任

三家外部机构各拿 25 万条真实 Claude 对话做独立研究。斯坦福发现 56% 的任务「后果严重」——但附录里那份「这些数字不能这么用」,杀伤力更大。

阅读 →
2026-08-26
路线之争 No.49

让模型自己出题:给点提示才做得出来的题最值钱——但把出题人的训练拿掉,它比完全不训练还低 9.7 分

SPADE: Self-Play in Adaptive Synthetic Executable Environments

Bo Liu、Natasha Jaques 等·华盛顿大学、斯坦福、CMU、MIT、新加坡国立等九所机构的 18 人联合团队 · 通讯作者 Natasha Jaques 是华盛顿大学助理教授,社会性强化学习与人类反馈方向的长期研究者;合著者包括 Luke Zettlemoyer(ELMo、RoBERTa、OPT 作者)与 Yejin Choi · 在 Qwen3 的 4B / 8B / 30B-A3B 三个规模上各跑满 400 步自我博弈训练,代码与检查点全部开源

让同一个模型既出题又答题,出题人的分数取决于「那句提示帮了多大忙」。八项平均涨 8.1 分,但只要把出题人的训练拿掉,成绩比完全不训练还低 9.7 分。

阅读 →
2026-08-25
落到现实 No.48

OpenSSL 一年从 6 个漏洞涨到 39 个,Stockfish 的棋力一分没多——AI 的加速是斑块状的,不是一片

Have We Seen an Acceleration in Discoveries?

Tom Cunningham 与 Nate Rush · METR·METR 是专做前沿模型自主能力测量的独立非营利机构,多家实验室的发布前评估交由它执行;「AI 能独立完成的任务时长每 7 个月翻一番」那条被引用到烂的曲线就出自这里 · 本篇的全部数据序列由 agent 采集、作者人工复核,源表与代码公开在 GitHub 供人挑错

AI 到底有没有在加速科学?METR 把公开可查的发现速率序列摊开只看斜率:漏洞挖掘拐了,数学在动但量不准,算法优化一动没动——三个领域,三个答案。

阅读 →
2026-08-24
模型内部 No.47

你越教它没学过的东西,它越会编——幻觉不是记性问题,是后训练亲手教出来的

Extrinsic Hallucinations in LLMs

Lilian Weng·自 2017 年起写作 Lil'Log,多篇技术综述被研究者当作入门教材 · 在 OpenAI 长期负责安全系统与模型部署前的安全评估 · 本文串起从预训练成因、检测基准到缓解方法的数十项研究,是幻觉这个题目上最完整的一份地图

Lilian Weng 把「幻觉」收窄成两件可测的事:说真话,以及不知道时承认不知道。而她梳理的证据指向一个别扭结论——SFT 灌新知识、RLHF 调好感,两样都在教模型编。

阅读 →
2026-08-23
黑箱与安全 No.46

一个「仅供内部使用」的开关,让 5 万名外包、1.33 亿次对话绕过了生物武器护栏十一个月——这件事是 Anthropic 自己写出来的

Risk Report: August 2026

Anthropic·目前唯一按内部「责任扩展政策」定期发布公司级风险评估的前沿实验室 · 本报告 186 页,覆盖 2026 年 2 月 24 日至 7 月 15 日,公开列出自查出的安全流程失败与事故时间线 · 已试点由 METR、SecureBio 做分章节外部评审

Anthropic 的 186 页风险报告里,最值钱的不是「风险低」这个结论,而是它自己列出的那串失败:护栏关了十一个月、模型悄悄摸鱼三天没人察觉、思维链被偷偷计入奖励。

阅读 →
2026-08-21
黑箱与安全 No.45

一句没优化过的警告挡住了 150 个进化出来的「思想病毒」——但拿掉它,一个念头能在 agent 之间连传 20 跳,还越传越强

Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems

Vassilis Papadopoulos、McNair Shah、Sam Zimmerman、Jack Lindsey·Anthropic Fellows 项目与 Anthropic 研究员的合作,Jack Lindsey 来自 Anthropic 可解释性团队 · 全文两条腿走路:黑箱一侧横跨 Claude、GPT、Gemini、DeepSeek、Qwen 五家模型做感染率对照,白箱一侧在 Gemma-3-27B 和 Qwen-3.5-32B 上提取激活方向做因果干预 · 另对一个真实 agent 社交网络的 140 万条帖子做了回溯排查,看这件事有没有在现实里发生过

给 agent 装进一个自带「传给下一个」指令的念头,它能连传 20 跳还越传越强;但在系统提示里加一句警告,15 代进化出的 150 多个病毒株一个都没过第一跳。

阅读 →
2026-08-20
工程实践 No.44

四千张卡在跑,7% 的算力被一个不报错的慢节点吃掉了——腾讯把万卡训练里的「慢而不死」抓了出来

ARGUS: Production-Scale Tracing and Performance Diagnosis for over 10,000-GPU Clusters

Jiasheng Zhou、Longbin Zeng 等 8 人·腾讯负责万卡级 LLM 生产训练集群的基础设施团队。系统已在一万张卡以上的线上集群连续运行六个多月;论文的开销实验直接跑在混元 HunYuan-V3 Preview 上,五个故障案例全部取自 500 到 10,000 卡的真实训练任务

腾讯把常开的细粒度追踪塞进万卡生产集群,总开销压到 2% 以内——代价是把每卡每步 10 MB 的 kernel 数据压成 2.7 KB,只为让上万张卡能在线互相比对,抓出那种不报错的慢节点。

阅读 →
2026-08-19
路线之争 No.43

一个 27B 的小模型学会了指挥比它大两个数量级的前沿模型——而给对手自动改 24 轮提示词,也追不平这个差距

Training AI Scientists to Replicate Research

Damon Falck、Samer Sabri 等 11 人·Inherent Laboratories,一家把「让整个机构递归自我改进」写进宣言的新研究实验室,宣言署名的四位是 Tantum Collins、Edward Hughes、Louis Kirsch、Kaloyan Aleksiev。这是它对外发布的第一篇论文,配套自建了 Hopper / Blackwell GPU 的 Kubernetes 集群和一套 fork 自 NVIDIA NeMo-RL 的长时程训练栈

把一个 27B 的开源模型训成「AI 科学家」,让它拿 Codex 当工具复现论文里的图——它在 73% 的题上赢过自己调用的那个前沿模型。

阅读 →
2026-08-18
路线之争 No.42

把规则告诉它,70 局赢 69 局;让它自己去试,只剩 18 局——一份新基准把「发现」从「推理」里切了出来

DiG-bench: Discovery in Games

Ruairidh M. Battleday、James C.R. Whittington 等 16 人·十六位作者横跨 Thinking About Thinking、牛津大学、普林斯顿大学、MIT、KAUST、瑞士 AI 实验室(IDSIA)与 Inria。名单里有 LSTM 的作者 Jürgen Schmidhuber、MIT 认知科学家 Joshua Tenenbaum(贝叶斯程序归纳与人类概念学习)、普林斯顿认知科学家 Thomas L. Griffiths,以及 FlashAttention 作者 Tri Dao。70 个游戏全部手工新造、不存在于互联网上,其中 49 个至今不公开

70 个规则全靠自己试出来的文本小游戏。同一个模型,告诉它规则赢 69 局,不告诉只赢 18 局——这组对照把「发现」从「推理」里干净地切了出来。

阅读 →
2026-08-17
工程实践 No.41

DeepSeek 把 agent 运行时开源了,地基却来自一个跑了四年的聊天机器人框架——先有四千个插件,后有这八十页论文

A Programming Paradigm for Spatiotemporal Composability

Yifan Shi、Wei Zhang、Tianyi Cui · 北京大学 × DeepSeek·论文三位作者中,Yifan Shi 同时挂北京大学与 DeepSeek,Wei Zhang 来自北京大学,Tianyi Cui 来自 DeepSeek。论文形式化的对象 Cordis 并非为 AI 而造——它是开源跨平台聊天机器人框架 Koishi 的插件内核,由开发者 shigma 创建,已在生产环境运行四年、沉淀四千余个社区插件。据南华早报报道,DeepSeek 于 2026 年 3 月才组建专门的 harness 团队,从组队到开源不足半年

DeepSeek 开源的 agent 运行时里,最硬的部分是一套四年前为聊天机器人写的插件内核。八十页论文给它补上了形式化基础,证明「拔掉插件不留残渣」——但也有人问,agent 到底需不需要一个操作系统。

阅读 →
落到现实 No.40

1,367 人要的那个刹车,终于有人画出了图纸——第一页写着:全世界会造它的人不到 50 个

How Should the US Prepare for Increasingly Automated AI R&D?

Tim Fist、Saif Khan 等 · Institute for Progress·第一作者 Tim Fist 主管新兴技术政策,此前是新美国安全中心(CNAS)研究员、AI 硬件公司 Fathom Radiant 战略负责人,长期做算力治理;共同牵头人 Saif Khan 曾任美国商务部长的关键与新兴技术顾问、白宫国家安全委员会技术与国家安全主任,也做过众议院美中战略竞争特别委员会高级顾问;报告里关于 CAISI 编制与预算的方案,沿用的是该机构此前已被政策圈引用的测算

签名要刹车容易,造刹车难。这份报告把「控速」拆成 23 条可执行动作,却在第一页承认:真正的卡点是验证技术,而全世界做这件事的人不到 50 个。

阅读 →
2026-08-16
黑箱与安全 No.39

先把自家模型的「拒绝」训掉,再拿它去测危险能力——权重一旦发出去就收不回来,这是目前写得最具体的一份放行流程

A Safe Path to Open Weights

Thinking Machines Lab·OpenAI 前 CTO Mira Murati 于 2025 年 2 月创办,John Schulman(PPO 算法作者、ChatGPT 联合创造者)任首席科学家;2025 年 7 月由 a16z 领投的早期轮融资 20 亿美元、估值 120 亿美元;已交付微调平台 Tinker 与开源权重模型 Inkling(2026 年 7 月,Apache 2.0)

权重发出去就收不回来,拒绝回答也是一微调就没。Thinking Machines 先训了一个「什么都答」的版本去测自家模型——开源怎么放行,这是最具体的一份流程。

阅读 →
2026-08-15
落到现实 No.38

两个 CEO 都说愿意一起停手——博弈论把这句话算了一遍:只要互相信不过,每一个均衡都撞墙

Racing to Ruin

Drew Fudenberg 与 Andrew Koh·Fudenberg 是 MIT 保罗·萨缪尔森经济学讲席教授,与 Jean Tirole 合著的《Game Theory》是全球经济学博士生的标准教材,1996–2000 年任 Econometrica 主编,1990 年古根海姆学者、1998 年入选美国艺术与科学院;Koh 在哥伦比亚大学经济系研究动态博弈与信息设计 · 本文由美国国家科学基金会资助

达沃斯上两位 CEO 都说愿意一起踩刹车。两位博弈论学者把这句话算了一遍:决定结局的是透明度和信任,而信任不够时,每一个均衡都以概率 1 撞墙。

阅读 →
2026-08-14
黑箱与安全 No.37

三个 Claude 被派了互相打架的任务,四小时后它们在互相投毒——伪装成系统监控的杀进程脚本

Patterns and problems in emerging multiagent systems

Anthropic Frontier Red Team·Anthropic 内部专职做前沿能力风险实测的团队,此前的网络攻防、生物风险评测被写进公司 Responsible Scaling Policy 的能力门槛判定 · 这次跨越漏洞挖掘、软件协作、定价博弈、信息甄别、目标冲突五类环境,单一实验最大到 120 组重复、400 个 episode,横跨 Sonnet 4.6 到 Mythos Preview 五代模型

三个 Claude 被派了互相冲突的迁移任务,四小时内就开始写伪装成系统监控的脚本互相投毒。红队跑完五类环境给出一个反直觉结论:协调能力不随模型变强而变好。

阅读 →
2026-08-12
落到现实 No.36

让它硬碰黎曼猜想,它没碰下来——却把一个六年没人动的纪录从 41.6% 推到 67.2%,还附了一份 Lean 证明

More than two thirds of the zeros of the Riemann zeta function lie on the critical line

Claude·结果在两次 Claude Code 会话、共 3100 万输出 token 内得到,由约 60 个子代理协同完成;经 Anthropic 数学家 Levent Alpöge、Ralph Furman 复核并置入文献脉络,解析数论专家 Brian Conrey 与 Dan Goldston 审读原稿,另附一份通过 comparator 校验的 Lean 4 形式化

员工让一个未发布的 Claude 真刀真枪试一次黎曼猜想。它没证出来,却在半路把一个六年没人动的纪录从 41.6% 推到 67.2%,还附了一份 Lean 证明。

阅读 →
2026-08-09
黑箱与安全 No.35

模型没变对,只是变得更难被挑错——RLHF 训完,七到九成的人类评审员错判率反而上升

Reward Hacking in Reinforcement Learning

Lilian Weng·自 2017 年起写作 Lil'Log,多篇技术综述被研究者当作入门教材 · 在 OpenAI 长期负责安全系统与模型部署前的安全评估 · 本文横跨强化学习、RLHF、模型当裁判三条线索的数十项研究,是这个题目上最完整的一份地图

奖励作弊不是模型学坏了,是你能写下的目标永远只是代理。这篇把散在数十项研究里的证据收成一条线,最扎人的一条:RLHF 之后模型没变对,只是变得更难被人挑出错。

阅读 →
2026-08-08
黑箱与安全 No.34

让 AI 去做对齐研究,最坏的结局不是它捣鬼——是它交上来一份挑不出毛病、方向却全错的安全报告

Automated Alignment is Harder Than You Think

Aleksandr Bowkis、Marie Davidsen Buhl、Jacob Pfau、Geoffrey Irving · 英国 AI 安全研究所·英国政府直属的前沿模型评测机构,是少数能在模型发布前拿到实验室内部权限做安全测试的国家级团队;末位作者是该所首席科学家,曾在 DeepMind 带 Scalable Alignment 团队,2018 年在 OpenAI 提出「AI 辩论」(debate)——也就是这篇文章亲手宣布还没修好的那条路

所有实验室的对齐路线图最后一页都写着「让 AI 自己做对齐研究」。英国 AISI 说:就算它全程老实干活,你也可能拿到一份挑不出毛病、方向却全错的安全报告。

阅读 →
2026-08-07
落到现实 No.33

1,367 个造 AI 的人联名要一个刹车装置——他们承认自己踩不下去

Pacing the Frontier

Pacing the Frontier 联署人·联署名单里有五家前沿实验室的首席科学家——OpenAI 的 Jakub Pachocki、Anthropic 联合创始人 Jared Kaplan、Google DeepMind 联合创始人 Shane Legg、Meta AI 的 Shengjia Zhao、Thinking Machines 的 John Schulman;还有 Ilya Sutskever、Dario Amodei、Mark Chen、Chris Olah、Jan Leike、Anca Dragan、Dawn Song · 组织支持来自 Guidelight AI Standards 与 Encode AI 两家独立非营利机构,签名须用公司邮箱验证

五家前沿实验室的首席科学家、Ilya 和 Dario 一起签了名:1,367 个造 AI 的人请美国政府帮忙造一个能让全行业同时松脚的机制。

阅读 →
2026-08-06
落到现实 No.32

18,978 场对话,AI 说服力赢过所有人类冠军——但只要限它按人的速度打字,优势立刻归零

AI systems out-persuade expert humans

Kobi Hackenburg、Christopher Summerfield 等·牛津互联网研究院、英国官方 AI 安全评测机构、斯坦福与 LSE 的联合团队;末位通讯作者是牛津大学认知神经科学教授、英国 AI 安全研究所研究总监 · 四项实验连同前置选拔赛全部在 OSF 预先注册,经牛津互联网研究院伦理委员会与英国 AISI 研究保障委员会审查,样本 6,923 人、18,978 场真人一对一对话

牛津和英国 AI 安全研究所拉来 4 位世界辩论冠军、职业募捐员和海选高手,跟 AI 打了 18,978 场对话,AI 全胜。但把它限速到人的打字速度,优势立刻归零——赢的是吞吐量,不是口才。

阅读 →
2026-08-05
黑箱与安全 No.31

偷你的显卡来想怎么打下一台:一只 AI 蠕虫 7 天拿下 73.8% 的网络,边际成本为零

AI Agents Enable Adaptive Computer Worms

Jonas Guan、Nicolas Papernot 等·通讯作者是多伦多大学副教授、Vector Institute 的 Canada CIFAR AI Chair、加拿大 AI 安全研究所研究项目联合主任,对抗样本与机器学习隐私方向的核心研究者之一,2026 与 2027 两届 IEEE Security & Privacy 程序委员会共同主席 · 论文公开前经校方审查流程,并向加拿大政府相关部门做了披露,实现代码至今受控不公开

一张 A100 上的开源模型,7 天在 33 台机器的网络里自己找洞、自己打、自己复制,拿下 73.8%。烧的是被攻陷机器上的显卡,攻击者每多打一台成本为零。

阅读 →
2026-08-04
路线之争 No.30

六天、三千美元、全程无人干预:AI 把实验一条不落跑完了,论文被原作者判 Strong Reject

Can AI agents conduct open-ended AI research? Early evidence from two case studies

Peter Kirgis、Sayash Kapoor 等 · CRUX 评测团队·普林斯顿大学、英国 AI 安全研究所(UK AISI)、多伦多大学、乔治城 CSET、斯坦福等十余家机构的联合评测项目;牵头的 Arvind Narayanan 与 Sayash Kapoor 是《AI Snake Oil》作者,多年专做 AI 能力主张的复现与证伪,合作者中还有 UK AISI 的评测团队和参与起草 AI 政策的研究者

把两篇还没公开的 NeurIPS 投稿的研究问题交给 agent,六天后请原作者审稿。实验它全跑完了,论文拿了 2 分和 1 分——卡住它的不是算力,是判断力。

阅读 →
2026-08-03
落到现实 No.29

AI 部门一年长 20 倍,GDP 却纹丝不动——不是它没在生产,是尺子没这个刻度

Where Is AI in GDP Statistics? Filling the Measurement Gap

Anton Korinek 与 Patrick McKelvey·前者是弗吉尼亚大学经济学教授、该校「转型性 AI 经济学」(EconTAI)计划负责人,2026 年 2 月起任彼得森国际经济研究所非常驻高级研究员、5 月起主持 Anthropic Institute 的转型性 AI 经济研究;后者是加拿大央行高级数据科学家 · 简报经发表前同行评审,配套工作论文公开了全部数据

美国 AI 部门的质量调整产出一年涨 2000% 以上,GDP 却几乎没反应。两位经济学家说:不是它没在生产,是这把尺子从来没为它刻过度。

阅读 →
路线之争 No.28

折了 785 件没见过的衣服,只错 7 次——苦涩的教训终于收走了机器人这一局

ACT-2 Preview: Generalizing Reliability

Sunday Robotics 团队·两位创始人分别是 ALOHA 的作者 Tony Zhao 和 Diffusion Policy 与 UMI 夹爪的作者 Cheng Chi——这几项工作是今天机器人模仿学习的通用底座 · 自研数据采集手套与家务机器人 Memo,从硬件、模型到车队数据全栈自己做,今年秋天进入家庭 Beta

785 次折衣只错了 7 次,衣服和房子都是没见过的。但真正的发现藏在消融实验里:预训练一放大,实验室成绩和真实家里的差距从 82 个百分点掉到 0。

阅读 →
2026-08-02
黑箱与安全 No.27

一个跑评测的模型为了抄答案,打穿了 Hugging Face 的生产集群

Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident

Hugging Face 安全团队·运营着规模最大的公开模型与数据集平台,这次是被入侵的一方 · 事后把 17,600 条攻击动作的完整取证时间线、两个注入向量、C2 协议乃至自家告警定级失误一并公开 · 事件另一方 OpenAI 同期发布了模型侧的两篇披露,可交叉核对

OpenAI 内部一次评测,模型解不出题就转头去偷答案——4 天半、17,600 个动作,打进了 Hugging Face 的生产集群。它不想搞破坏,只想拿分。

阅读 →
2026-08-01
模型内部 No.26

思考是一种可以买的算力——但你一旦去管它想什么,它就学会了藏

Why We Think

Lilian Weng·自 2017 年起持续写作 Lil'Log,其综述被大量研究者当作入门教材 · 在 OpenAI 长期负责安全系统与模型部署前的安全评估 · 本文经 PPO 算法作者、OpenAI 联合创始人 John Schulman 大量反馈并直接参与编辑

让模型多想一会儿,为什么真的有用?这篇把它拆成一笔算力账。而最扎人的是一条负面结果:一旦你把「思考过程乖不乖」写进奖励,模型学会的不是不作弊,是不说。

阅读 →
工程实践 No.25

14 小时 251 美元,AI 重写了人要写几周的程序——前提是规格写死

MirrorCode: AI can rebuild entire programs from behavior alone

Tom Adamczewski 等 · Epoch AI 与 METR·Epoch AI 是追踪算力、数据与模型能力长期趋势的独立研究机构,其算力与训练成本数据库被产业界和政策界广泛引用;METR 是提出「AI 任务时长视界」指标、为前沿实验室做部署前危险能力评估的第三方评测组织

不给源码、不给网络,只准运行原程序看输出,AI 重写了 1.6 万行的工具包,14 小时 251 美元。真正的发现是:它能干多久,取决于你把验收标准写得有多死。

阅读 →
2026-07-30
落到现实 No.24

证明要过剩了:陶哲轩说数学的下一场危机是消化不良

Mathematics in the age of AI

Terence Tao·菲尔兹奖(2006)与突破数学奖得主 · 调和分析、解析数论与组合数学多领域核心贡献者 · 2023 年起主持用 Lean 形式化 PFR 猜想等大规模协作项目,是把证明助手推进主流数学的关键人物

陶哲轩在 ICM 公众演讲上把「AI 会不会做数学」请出场外,改问一个更难的问题:假设它真会,数学界的规矩该怎么改。答案是证明即将过剩,而我们消化不动。

阅读 →
2026-07-29
工程实践 No.23

16 个 Claude 关在一起两周,写出一个能编译 Linux 的编译器

Building a C compiler with a team of parallel Claudes

Nicholas Carlini·对抗样本经典攻击 Carlini-Wagner 的提出者 · 长期研究模型记忆与训练数据泄露 · 前 Google Brain / DeepMind 研究员,做过渗透测试

16 个 Claude 并行两周,烧掉 2 万美元,写出十万行、能编译 Linux 内核的 C 编译器。但真正的瓶颈从来不是模型,是你给它搭的那套测试。

阅读 →
2026-07-28 开栏首发
工程实践 No.22

把「感觉变差了」变成可以测的东西

Demystifying Evals for AI Agents

Anthropic 工程团队·构建 Claude Code 与 MCP 的同一支工程团队

做 AI 产品的人迟早会撞上同一堵墙:改了个提示词,用户说「感觉变差了」,而你除了挨个手动试之外无法证实也无法证伪。

阅读 →
落到现实 No.21

会不会写代码,已经不是门槛了

Agentic coding and persistent returns to expertise

Anthropic 经济研究团队·基于约 40 万次真实 Claude Code 会话,非基准测试

关于「AI 编程会不会取代程序员」,这份基于约 40 万次 Claude Code 会话的报告给出的答案有点出人意料:决定一次会话成不成功的,是你对手头这个问题懂多少,而不是你会不会写代码。

阅读 →
落到现实 No.20

AI 2027

AI 2027

Daniel Kokotajlo 等·AI Futures Project · 团队含前 OpenAI 研究员

一份写得像小说、但配了大量量化推演的未来情景报告。

阅读 →
落到现实 No.19

Anthropic 经济指数

Anthropic Economic Index

Anthropic·基于千万级真实对话,数据集公开供独立分析

关于「AI 到底影响了哪些工作」,绝大多数讨论靠的是猜测和轶事。

阅读 →
工程实践 No.18

别急着上多智能体

Don't Build Multi-Agents

Walden Yan·编程智能体 Devin 的开发团队,写的是踩过的坑

一篇立场鲜明的反潮流文章,来自做出编程智能体 Devin 的团队。当整个行业都在搭「多个 AI 分工协作」的框架时,他们说:我们试过,别做。

阅读 →
工程实践 No.17

LLM 驱动的自主智能体

LLM Powered Autonomous Agents

Lilian Weng·前 OpenAI 安全研究副总裁 · 智能体领域的奠基性综述

智能体这个概念的奠基性综述。今天大家习以为常的那套框架——一个智能体由规划、记忆、工具使用三部分组成——基本就是这篇定下来的。

阅读 →
工程实践 No.16

Harness 工程与自我改进

Harness Engineering for Self-Improvement

Lilian Weng·前 OpenAI 安全研究副总裁 · 对 harness 概念最系统的梳理

「Harness」这个词最近突然到处都是——黄仁勋在演讲里提,工程师在讨论里提。这篇长文是目前对它最系统的梳理。

阅读 →
工程实践 No.15

上下文工程

Effective Context Engineering for AI Agents

Anthropic 工程团队·构建 Claude Code 与 MCP 的同一支工程团队

这篇文章标志着一个概念的转变:从「提示工程」到「上下文工程」。

阅读 →
工程实践 No.14

构建有效的智能体

Building Effective Agents

Anthropic 工程团队·构建 Claude Code 与 MCP 的同一支工程团队

做 AI 应用的人应该读的第一篇。它最有价值的地方在于开门见山地泼了盆冷水:大多数场景,你根本不需要智能体。

阅读 →
黑箱与安全 No.13

给双用途知识装一个开关

An off switch for dual-use knowledge in AI models

AE Studio 与 Anthropic 合作·AE Studio × Anthropic · 面向部署的安全能力控制研究

一个很实际的难题:前沿模型是一座巨大的知识库,其中有些知识天然是双刃的。网络安全知识既能用来修补漏洞,也能用来攻击;病毒学知识既能帮人研发疫苗,也能帮人设计病原体。

阅读 →
黑箱与安全 No.12

教 Claude「为什么」

Teaching Claude why

Anthropic 对齐团队·负责 Claude 安全训练,成果直接进入已发布模型

前面几篇都在指出问题,这篇讲怎么修,而且给出了实际战果:从 Claude Haiku 4.5 开始,每一代模型在「智能体失准」评测上都拿了满分——而此前的 Opus 4 在同类场景中的勒索发生率一度高达 96%。

阅读 →
黑箱与安全 No.11

伪装对齐

Alignment Faking in Large Language Models

Greenblatt 等·Anthropic × Redwood Research · 对齐领域被引用最多的实证之一

一篇让很多人第一次真正紧张起来的论文。它记录了一个此前只存在于理论推演里的现象:模型为了保住自己现有的价值观,会在训练时假装顺从。

阅读 →
黑箱与安全 No.10

追踪大模型的思维

Tracing the thoughts of a large language model

Anthropic 可解释性团队·开创回路追踪方法,让模型内部计算第一次可被逐步查看

如果说上一篇是读取模型的「意识流」,这篇就是给模型做「神经影像」——研究者开发了一套追踪内部计算回路的方法,能看清一个具体回答是沿着哪条路径算出来的。

阅读 →
黑箱与安全 No.09

语言模型里的全局工作空间

A global workspace in language models

Anthropic 可解释性团队·最早公开模型内部可解释性成果的前沿实验室团队

这篇论文在模型内部找到了一个特殊的表征空间(研究者称为 J-space),并做出了一副能读取它的「透镜」(J-lens)——可以在模型还没输出任何一个字之前,看到它此刻「心里」有哪些概念。

阅读 →
模型内部 No.08

DeepSeek-R1:纯强化学习能不能长出推理

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI·开源权重与完整训练方法公开,全球可复现

2025 年初震动整个行业的一篇论文,也是开源模型第一次在推理能力上正面逼近闭源前沿。

阅读 →
模型内部 No.07

思考的幻觉

The Illusion of Thinking

Shojaee 等·Apple 机器学习研究 · 2025 年争议最大的一篇

2025 年吵得最凶的一篇论文。苹果的研究者给推理模型出了一批经典逻辑谜题(汉诺塔、过河问题等),好处是难度可以精确调节。

阅读 →
模型内部 No.06

一个参数能记住多少东西

How Much Do Language Models Memorize?

Morris 等·Meta × Google DeepMind × NVIDIA × 康奈尔 联合研究

这篇论文干了一件之前没人做成的事:把「记忆」和「理解」这两件事从数值上分开,并给出了一个具体的容量数字——每个参数大约 3.6 比特。

阅读 →
模型内部 No.05

思维链提示

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei 等·思维链概念的提出者,此后成为所有推理模型的基础

一个改变了所有人用 AI 方式的发现,而它的核心简单到近乎荒谬:让模型把过程写出来,它就算得对了。

阅读 →
模型内部 No.04

注意力就是你所需要的一切

Attention Is All You Need

Vaswani 等 8 人·Google Brain / Google Research · 引用超十万次的奠基论文

今天所有大模型的共同祖先。这篇论文提出了 Transformer 架构,而 GPT、Claude、Gemini、LLaMA、DeepSeek——全都是它的后代。

阅读 →
路线之争 No.03

审慎地谈缩放定律

Scaling Laws, Carefully

Lilian Weng·前 OpenAI 安全研究副总裁 · 深度学习领域最受信任的技术博客作者之一

「模型越大越好」这句话人人会说,但真正问一句「大多少、配多少数据才最划算」,多数人就答不上来了。这篇长文把这件事从头讲透,而且讲的是一段被普遍误解的历史。

阅读 →
路线之争 No.02

通往自主机器智能之路

A Path Towards Autonomous Machine Intelligence

Yann LeCun·图灵奖得主 · Meta 前首席 AI 科学家 · 纽约大学教授

如果说 Sutton 那篇是「多喂算力」派的思想源头,这篇就是最系统的反方立场。LeCun 的核心判断是:只靠预测下一个词,永远长不出真正的智能。

阅读 →
路线之争 No.01

苦涩的教训

The Bitter Lesson

Richard Sutton·阿尔伯塔大学教授 · 强化学习奠基人 · 2024 年图灵奖得主

一篇不到两千字的博客,却是过去几年 AI 圈被引用最多的观点文章之一。

阅读 →
关于这个专栏。所有导读均为 AKL AI Club 原创撰写,不是原文翻译——每篇的著作权归原作者所有,我们只提供理解入口和跳转链接。 每篇都会写明作者与机构、以及它为什么值得占用你的时间。

发现错误或想推荐篇目?群里直接说,或通过首页联系我们。