DeepSeek 把 agent 运行时开源了,地基却来自一个跑了四年的聊天机器人框架——先有四千个插件,后有这八十页论文
A Programming Paradigm for Spatiotemporal Composability
8 月 13 至 14 日,DeepSeek 开源了自己的 agent harness(命令行叫 dsh,MIT 许可),口号是「一切皆插件」——模型、工具、沙箱、文件系统、用户界面全是插件,连 agent 主循环本身都可以整个换掉,官方称之为「无特权内核」。仓库两天内涨到九万星量级(各家统计口径略有出入,数量级一致)。按本栏标准,产品发布本身不构成选题。真正值得读的是同一时间放出来的那篇论文,以及它揭示的一段反直觉的来历。
本栏第 16 篇写过 harness 这个概念:包在模型外面的那层脚手架,决定同一个模型能发挥出多少。那篇讲的是「应该重视它」。这篇讲的是,当你真的把它当成一个需要形式化的系统来造,会造出什么——以及为此付出什么代价。
地基不是为 AI 造的
dsh 最值得说的部分不在 dsh 里,而在它的底座 Cordis。Cordis 不是新东西,也不是为 AI 写的:它是 Koishi 的插件内核——一个跨平台的开源聊天机器人框架,名字取自东方 Project 的角色,由开发者 shigma 创建,在中文开源社区里跑了四年,沉淀了四千多个社区插件。
也就是说,DeepSeek 没有从零造一套 agent 运行时,而是拿了一套已经被四千个插件、四年生产环境反复捶打过的动态插件系统,把它抬进了 AI 领域。论文是后补的。在「先发论文再补实现」几乎成为默认路径的 AI 圈,这个顺序本身就值得注意:它形式化的不是一个设想,而是一套已经证明自己能活下来的工程实践。
论文在证明什么:拔掉插件不留残渣
论文要解决的问题一句话能说清:怎么让一个正在运行的系统,安全地装上和拔掉零件,既不用重启,也不留下垃圾?它把这件事拆成两个正交的维度,这是全文的核心。
时间维度——可逆效应(revertible effects)。组件对系统做的每一个改动,都必须同时提供它的逆操作。运行时把这些逆操作记录下来并按序组合,卸载组件时倒着执行一遍,系统精确回到装它之前的状态。大白话:拔插件像拔 U 盘,不留残留文件、不留幽灵监听器、不用重启。
空间维度——反应式协效应(reactive coeffects)。普通的「效应(effect)」问的是「我改了什么」;「协效应(coeffect)」问的是「我需要什么」。组件声明自己的依赖规格,运行时持续监视:依赖齐了就自动激活它,依赖没了就自动停用它。大白话:插件之间的依赖不用手工排顺序,谁该醒谁该睡,运行时自己算。
论文把两者统一进单一的上下文类型,给出一套动态组合的演算,并证明其元理论能把这种「时空可组合性」从单个组件传递到整个交错组合的系统。落到实现上,Cordis 提供效应追踪、协效应解析、声明式组件加载与配置调和,以及热模块替换;一个「惯性状态机」保证重载与卸载一旦开始就会跑完,避免竞态。
为什么这对 agent 是个真问题
把这套机制放回 agent 语境,它想解决的事就清楚了:一个能在运行中增删自身能力的 agent,需要一个不会因此腐烂的运行时。今天的 agent 要装工具、卸工具、换模型、切沙箱,每一次都可能留下没清理干净的状态;跑几个小时之后,问题往往不是模型笨了,而是运行时脏了。这也是为什么有报道把 dsh 描述成「自我演化 agent 的运行时」。
dsh 在这个地基上还做了几个有性格的设计:它能把 Claude Code、Codex CLI 当作自己的子代理调用,官方支持约 40 家模型供应商,明确不做模型锁定;「模型看得见的,就一定被记录」是写进架构的保证而非最佳实践建议,会话日志只追加不修改,全程可审计可重放;仓库里带着 1,386 份架构决策记录和约 17 万行文档,并在 CI 里校验文档与代码是否一致。
冷静的一面
热度归热度,几件事必须同时说。它自己标注 developer preview,README 里大写警告会有破坏兼容性的变更,版本号还在 v0.1.0-rc 阶段。有第三方实测称 dsh 单次未命中缓存的输入约 4.7 万 token,而极简派 harness 只要约 4500,相差近十倍,并发现了工具间同步文件时重复注入指令集的 bug——这是单一来源的实测,未经广泛复现,但方向值得警惕。「一切皆插件」的价值取决于有多少插件,而有评测者实际尝试的 5 个第三方插件全部失败,数十项兼容性声明大多待验证。
同期发布的 DeepSeek V4-Pro,不同来源引用的基准分数彼此矛盾,独立评测与厂商自评差距悬殊,目前缺乏可靠的第三方复现。这件事恰好是个注脚:今年那篇《Stop Comparing LLM Agents Without Disclosing the Harness》指出,几乎没有一份基准报告会完整披露评测时用的 harness,而不同 harness 造成的分数波动常常大过新模型宣称的提升幅度。不公开 harness 的分数,参考价值有限。
本文为 AKL AI Club 原创撰写的导读,不是原文翻译;著作权归原文作者所有。 篇目由编辑独立选取,来源均经人工核实。