AKL AI CLUB BETA ← 前沿导读
FRONTIER · 工程实践

DeepSeek 把 agent 运行时开源了,地基却来自一个跑了四年的聊天机器人框架——先有四千个插件,后有这八十页论文

A Programming Paradigm for Spatiotemporal Composability

Yifan Shi、Wei Zhang、Tianyi Cui · 北京大学 × DeepSeek 论文三位作者中,Yifan Shi 同时挂北京大学与 DeepSeek,Wei Zhang 来自北京大学,Tianyi Cui 来自 DeepSeek。论文形式化的对象 Cordis 并非为 AI 而造——它是开源跨平台聊天机器人框架 Koishi 的插件内核,由开发者 shigma 创建,已在生产环境运行四年、沉淀四千余个社区插件。据南华早报报道,DeepSeek 于 2026 年 3 月才组建专门的 harness 团队,从组队到开源不足半年
2026 年 8 月
为什么选它8 月中旬 DeepSeek 开源 agent harness 这件事,本栏按惯例不收——产品发布不在选题范围内。收的是同期这篇八十多页的编程语言理论论文:它给那套运行时补上了形式化基础,而且顺序是反的,工程先跑了四年,理论后补。本栏第 16 篇讲过 harness 是什么、为什么重要;这一篇讲的是有人真的把它当成一个需要形式化的系统来造,以及这么造值不值。

8 月 13 至 14 日,DeepSeek 开源了自己的 agent harness(命令行叫 dsh,MIT 许可),口号是「一切皆插件」——模型、工具、沙箱、文件系统、用户界面全是插件,连 agent 主循环本身都可以整个换掉,官方称之为「无特权内核」。仓库两天内涨到九万星量级(各家统计口径略有出入,数量级一致)。按本栏标准,产品发布本身不构成选题。真正值得读的是同一时间放出来的那篇论文,以及它揭示的一段反直觉的来历。

本栏第 16 篇写过 harness 这个概念:包在模型外面的那层脚手架,决定同一个模型能发挥出多少。那篇讲的是「应该重视它」。这篇讲的是,当你真的把它当成一个需要形式化的系统来造,会造出什么——以及为此付出什么代价。

地基不是为 AI 造的

dsh 最值得说的部分不在 dsh 里,而在它的底座 Cordis。Cordis 不是新东西,也不是为 AI 写的:它是 Koishi 的插件内核——一个跨平台的开源聊天机器人框架,名字取自东方 Project 的角色,由开发者 shigma 创建,在中文开源社区里跑了四年,沉淀了四千多个社区插件

也就是说,DeepSeek 没有从零造一套 agent 运行时,而是拿了一套已经被四千个插件、四年生产环境反复捶打过的动态插件系统,把它抬进了 AI 领域。论文是后补的。在「先发论文再补实现」几乎成为默认路径的 AI 圈,这个顺序本身就值得注意:它形式化的不是一个设想,而是一套已经证明自己能活下来的工程实践。

论文在证明什么:拔掉插件不留残渣

论文要解决的问题一句话能说清:怎么让一个正在运行的系统,安全地装上和拔掉零件,既不用重启,也不留下垃圾?它把这件事拆成两个正交的维度,这是全文的核心。

时间维度——可逆效应(revertible effects)。组件对系统做的每一个改动,都必须同时提供它的逆操作。运行时把这些逆操作记录下来并按序组合,卸载组件时倒着执行一遍,系统精确回到装它之前的状态。大白话:拔插件像拔 U 盘,不留残留文件、不留幽灵监听器、不用重启。

空间维度——反应式协效应(reactive coeffects)。普通的「效应(effect)」问的是「我改了什么」;「协效应(coeffect)」问的是「我需要什么」。组件声明自己的依赖规格,运行时持续监视:依赖齐了就自动激活它,依赖没了就自动停用它。大白话:插件之间的依赖不用手工排顺序,谁该醒谁该睡,运行时自己算。

论文把两者统一进单一的上下文类型,给出一套动态组合的演算,并证明其元理论能把这种「时空可组合性」从单个组件传递到整个交错组合的系统。落到实现上,Cordis 提供效应追踪、协效应解析、声明式组件加载与配置调和,以及热模块替换;一个「惯性状态机」保证重载与卸载一旦开始就会跑完,避免竞态。

为什么这对 agent 是个真问题

把这套机制放回 agent 语境,它想解决的事就清楚了:一个能在运行中增删自身能力的 agent,需要一个不会因此腐烂的运行时。今天的 agent 要装工具、卸工具、换模型、切沙箱,每一次都可能留下没清理干净的状态;跑几个小时之后,问题往往不是模型笨了,而是运行时脏了。这也是为什么有报道把 dsh 描述成「自我演化 agent 的运行时」。

dsh 在这个地基上还做了几个有性格的设计:它能把 Claude Code、Codex CLI 当作自己的子代理调用,官方支持约 40 家模型供应商,明确不做模型锁定;「模型看得见的,就一定被记录」是写进架构的保证而非最佳实践建议,会话日志只追加不修改,全程可审计可重放;仓库里带着 1,386 份架构决策记录和约 17 万行文档,并在 CI 里校验文档与代码是否一致。

冷静的一面

热度归热度,几件事必须同时说。它自己标注 developer preview,README 里大写警告会有破坏兼容性的变更,版本号还在 v0.1.0-rc 阶段。有第三方实测称 dsh 单次未命中缓存的输入约 4.7 万 token,而极简派 harness 只要约 4500,相差近十倍,并发现了工具间同步文件时重复注入指令集的 bug——这是单一来源的实测,未经广泛复现,但方向值得警惕。「一切皆插件」的价值取决于有多少插件,而有评测者实际尝试的 5 个第三方插件全部失败,数十项兼容性声明大多待验证。

同期发布的 DeepSeek V4-Pro,不同来源引用的基准分数彼此矛盾,独立评测与厂商自评差距悬殊,目前缺乏可靠的第三方复现。这件事恰好是个注脚:今年那篇《Stop Comparing LLM Agents Without Disclosing the Harness》指出,几乎没有一份基准报告会完整披露评测时用的 harness,而不同 harness 造成的分数波动常常大过新模型宣称的提升幅度。不公开 harness 的分数,参考价值有限。

这篇论文最该被记住的,是它的顺序。四年生产环境、四千个插件在前,八十页形式化在后——理论是从活下来的工程里长出来的,不是反过来。在 AI 圈普遍「先发布再说」的节奏里,这种做法稀少到本身就构成一条信息:有人认为 agent 运行时已经复杂到值得用编程语言理论去约束了。而这正是它最大的争议点。批评者的说法很直接:可逆效应加协效应这套运行时,解决的是绝大多数开发者一辈子碰不到的问题——热插拔、运行时自我重构听起来很美,但复杂度的代价是所有人一起付的,收益却只有做基础设施和多智能体研究的人拿得到。有个流传的评价是「为了蘸一口醋,包了一整盘饺子」。更要命的是,它可能在跟趋势对着干。Cursor 复盘自己 2024 到 2026 的演进时提到,早期他们往上下文里塞大量静态信息和护栏,到 2026 年大部分都删掉了,只保留操作系统、git 状态、当前文件这类便宜又高价值的元信息——模型越强,harness 应该越薄。dsh 赌的恰恰相反:harness 会越来越厚、越来越像一个操作系统。所以真正的问题不是「dsh 能不能用」,而是:agent 需要的是一个操作系统,还是一把小而锋利的刀?这个问题现在没有答案,只有下注。撇开产品,还有一层战略值得看。过去两年 AI 公司主要比两件事:模型有多聪明、token 有多便宜。harness 是第三个维度,而且正在悄悄变成护城河——Claude Code 这类产品的粘性很大程度来自 harness 与模型的联合调优,而非模型单独的分数。面对这条护城河有两种打法:向下整合(把 harness 和自家模型绑死,闭源,体验好但锁定用户),或者向外铺开(开源、模型中立、甚至把对手的工具当子代理)。DeepSeek 选了后者,主张是「agent 的能力不在某个神秘的内核里,而在一组可组合、可替换的工程组件里」。这是一次主动祛魅:如果 harness 成为公共标准而非商业秘密,护城河就重新回到模型本身——那正是 DeepSeek 想比的地方。对大多数读者最实用的一条,反而与 dsh 无关。当你觉得手上的 AI 工具变笨了,先别急着换模型:查上下文里是不是塞了大量无关内容、工具描述是不是模糊、失败时有没有清晰的报错回到模型。这几项的改善空间,通常远大于换一个模型。至于 dsh 本身——做 agent 基础设施或多智能体编排的,现在就值得去读它的架构文档,那 1,386 份决策记录是罕见的公开教材;只想要一个稳定顺手的编程助手的,观察三到六个月,等生态和 API 稳下来再说。
Agent Harness插件架构编程语言理论DeepSeek开源生态

本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。