AKL AI CLUB BETA ← 前沿导读
FRONTIER · 黑箱与安全

给双用途知识装一个开关

An off switch for dual-use knowledge in AI models

AE Studio 与 Anthropic 合作 AE Studio × Anthropic · 面向部署的安全能力控制研究
2026 年 7 月
为什么选它代表了 AI 安全思路的一次转向:从「教模型别说」转向「控制模型能取用什么」。对企业部署有直接意义——同一个模型面向内部安全团队和面向公众,本就该开放不同的能力面。

一个很实际的难题:前沿模型是一座巨大的知识库,其中有些知识天然是双刃的。网络安全知识既能用来修补漏洞,也能用来攻击;病毒学知识既能帮人研发疫苗,也能帮人设计病原体。

目前的防护手段有个根本缺陷:它们只拦输出,不动知识本身。训练模型拒绝有害请求、用分类器筛查输入输出——这些都是在门口设卡,而危险知识仍完整地存在模型内部。只要有人找到足够刁钻的越狱方式,就可能绕过去。

这项研究提出的方法(GRAM)想同时满足三个目标:尽可能外科手术式地限制双用途能力、允许可信用户在正当场景下调用同样的能力、并且不损害模型在其它任务上的表现。第三点是关键难点——粗暴地删除某类知识往往会连带伤及模型的通用能力,因为知识在神经网络里是纠缠在一起的。

为什么值得关注。它代表了 AI 安全思路的一次转向:从「教模型别说」转向「控制模型能取用什么」。这对企业部署有直接意义——同一个模型,面向内部安全团队和面向公众,本就应该开放不同的能力面。如果这类方法成熟,「按用户权限分配模型能力」会成为标准做法,而不是像现在这样只能靠提示词和外挂过滤器勉强凑合。
AI 安全双用途知识越狱防护能力控制
去读原文 本文是原创导读,不是原文翻译——真正的细节、证据和微妙之处都在原文里。 原文Anthropic Research · An off switch for dual-use knowledge →

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。