
DeepSeek Harness:当一切真正成为插件
Ai Security Network目录
谈到 AI 智能体时,我们几乎总是先谈模型。哪个模型写代码更好?哪个能理解更长的上下文?哪个能在基准测试中完成更多任务?这很容易理解,但如今只看模型已经不够了。智能体并不只是一个语言模型。它还需要工具、存储、会话、权限、运行环境、规划、日志,以及一个让人能够介入的界面。
这正是我觉得 DeepSeek Harness Developer Preview 如此令人兴奋的原因。DeepSeek 用一句非常清晰的话概括了这个想法:Everything is a plugin. 可以替换的不只是附加工具,模型、skills、会话、sandbox、storage、智能体循环、scheduling,甚至用户界面本身,也都被视为插件。
乍看之下,这只是面向开发者的一项技术设计决定。实际上,它对 AI 的下一个阶段提出了一个更大的判断:如果智能来自模型,而真正完成工作的能力来自 harness,那么后面这一半就不应该成为某一家供应商手中的不透明黑箱。
模型提供智能,而只有可替换的 harness 才能决定这种智能为谁服务,以及它可以按照什么规则行动。
智能体不只是它所使用的模型
DeepSeek 自己给出的公式非常简洁:智能体等于模型加 harness。模型处理语言并作出决策,harness 则把它连接到现实环境。它提供文件、注册工具、管理状态、启动子智能体、执行命令,并决定哪些信息会在下一次调用模型时重新进入上下文。
因此,harness 并不只是模型外面的一层包装。它决定了模型的回答最终能够变成什么。智能体只能输出文字,还是也能修改文件?它能看到整个代码仓库,还是只能看到一个工作目录?命令直接在主机上运行,还是在容器或远程 sandbox 中运行?某项操作是否必须由人批准?状态能否跨会话保留?这些都不是模型的属性,而是围绕模型的 runtime 所作出的决定。
从回答问题到执行行动
在简单聊天中,这种区别几乎看不出来。问题进去,答案出来。但一旦智能体开始处理代码仓库、工单或内部系统,或者接管持续时间较长的任务,harness 至少会变得和模型同样重要。它把用自然语言表达的意图转换成一系列真实步骤,再把执行结果作为新的上下文送回模型。
令人印象深刻的演示技术能否成为可靠工具,正是在这里见分晓。即使模型非常出色,如果上下文很差、权限过宽、会话管理不可靠,它仍然会是一个糟糕的智能体。它可以进行精彩的推理,却依然可能编辑错误的文件、使用过期状态,或者在出错后无法妥善继续。反过来,一个稍弱的模型在设计良好的 runtime 中也可能非常有用,因为它能看到正确的工具,受到明确限制,而且其工作过程可以追溯。
架构本身成为结果的一部分
DeepSeek Harness 让这一层变得可见。Cordis 内核负责挂载插件、解析依赖,并能再次移除组件。各种能力以 services 的形式提供。例如,一个插件可以实现 shell,另一个插件把这套 shell 作为模型工具提供,第三个插件则在 workflow 中使用该工具。具体实现可以通过配置更换,无须重建整个 harness。
DeepSeek 在这方面比许多只允许通过扩展添加少量工具的平台走得更远。模型连接、tool registry、session log 和智能体循环本身也都是插件。按照它的架构,并不存在一个为了每项扩展都必须打补丁的特权核心。新的行为被挂载在现有组件旁边,移除时也可以干净地撤销自身的注册。
这并不是一个全新的想法。几十年来,操作系统、浏览器、编辑器和各类平台一直依靠模块化组件发展。新颖之处在于,DeepSeek 如此彻底地把这项原则应用到一个完整的 AI 智能体上。智能体架构不再被当作固定产品接受,而是成为一组可以由运营者改变的决定。
为什么“一切皆插件”如此吸引人
插件理念把权力从一个成品转移到可组合的 runtime。无需彻底重建工作方式,我就能更换模型供应商。我可以把本地 shell 换成隔离更强的版本,也可以使用另一套存储、会话逻辑或自有界面。除了自家的模型接入方式,DeepSeek 还提供了其他供应商和自定义 OpenAI 兼容 endpoint 的文档。
更换模型,无需从头再来
这样一来,智能体更像一套可以根据自身环境组装的基础设施。小型开发团队也许只需要文件访问、Git 和测试。Security 团队则可能还需要网络查询、隔离的 sandbox、更严格的审批以及不可更改的日志。企业可以使用自己的 model gateway,而私人实验室可以连接本地 open-weight 模型。
这在战略上非常重要,因为模型目前变化得极快。今天某家供应商擅长 coding,明天另一家可能在长上下文或工具使用方面领先。在封闭产品中,更换模型往往也意味着更换平台,会话、规则、权限、集成方式和工作流程都得重新建立。在模块化 runtime 中,模型仍然只是一个组件,可以换成另一家 provider,或换成自行运营的 endpoint。
当然,这个过程不会完全没有摩擦。不同模型在角色格式、reasoning、工具调用、图像支持和错误行为上各不相同,因此各自的 adapter 必须妥善处理这些差异。但清晰接口的价值也恰恰体现在这里:单个供应商的特殊性不会不受控制地渗透到整个产品中。
可替换的基础设施,而不只是可替换的按钮
尤其有意思的是,某项能力的定义、提供者和使用者被彼此分开。Bash 接口描述这项能力可以做什么,provider 决定命令实际在哪里、以什么方式运行,然后再由另一个插件把它变成模型可以调用的工具。这类接口十分重要,因为控制可以在一个明确位置实现。时间限制、隔离、审批和日志都可以在那里加入,而无须重新编写每一套智能体循环。
当多种能力共享同一个执行环境时,这种潜力就变得很清楚。如果文件系统与进程从本地环境迁移到远程 sandbox,shell、终端和代码导航也能一起迁移。对用户而言,能力看起来依然相似,但底层的安全与运营边界却发生了根本变化。这种可替换性远比界面上多一个开关更有价值。
不同的 runtime 模式也展示了 DeepSeek 的目标。标准模式提供完整的 coding 智能体。Code Mode 允许模型通过生成的 TypeScript 代码编排多次工具调用。Minimal Mode 为基准测试把环境缩减到 shell 和编辑器。Creator Mode 则用于研究插件和自定义 presets。因此,并非每一种使用场景都必须加载同一个庞大工具箱。
Profiles 与 bundles 让它不再只是松散的扩展集合。一个 profile 可以为特定用途定义一套智能体 runtime。我们可以设想用于本地开发的轻量 profile、用于生产系统且限制更严格的 profile,以及记录更多信息的取证 profile。它们仍由相同的模块组成,但组件的组合方式与边界会匹配各自的风险。

潜力在现实中如何产生
这套架构很有吸引力,但只有在具体场景中才会显示价值。插件系统不是目的本身。它必须让智能体能够更快适应真实需求,而不必为每一种用途都重新打造一个平台。
从个人工具到企业平台
一名开发者可以从本地 shell、文件编辑器和一个模型开始。但它一旦成为团队工具,其他需求就会随之出现:统一身份、隔离的 workspaces、关键操作审批、model gateway、成本控制、持久会话以及可导出的 audit trail。在单体应用中,这些功能是否出现、何时出现,都由制造商决定。
在模块化 runtime 中,企业可以自行补充缺失部分或替换现有 provider,而无须重新发明智能体。同一套界面和智能体逻辑可以在企业 gateway 后方使用其他模型,在内部 sandbox 执行命令,并把会话存入自有 storage。这就是实用工具与可控平台之间的区别。
用相同模块构建不同信任区域
并非所有任务都应该拥有同样的权限。负责总结文档的智能体不需要生产环境访问权。用于 incident response 的智能体也许需要日志数据和网络查询,却不应修改配置。用于 deployment 的智能体可以执行变更,但应采用更严格的审批、更短时效的 token,以及特别清晰的日志。
通过清晰分离的 services 与 profiles,可以在 runtime 中直接表达这种差异。模型无须理解每个安全细节,并靠自觉遵守规则。环境会从技术上决定哪些能力真正存在。对于 security 而言,这是一个关键点:没有挂载的能力根本不会作为直接工具提供给模型。
面向专业提供者的生态系统
没有任何一家供应商能够同时构建最好的 sandbox、最好的 session store、所有企业系统和全部模型 adapter。开放的插件模式允许专业团队集中把其中一个层面做好。Security 厂商可以提供强化的执行环境,storage 项目可以提供可审计的会话,企业内部平台团队则可以把审批和身份接入自家组织。
如果这些组件能通过稳定接口配合,产生的将是生态系统,而不是一个不断膨胀的单体应用。这可能正是 DeepSeek Harness 最大的潜力。DeepSeek 不必赢得所有使用场景,只要这套架构成为其他人提供和组合能力的场所就够了。
可追溯性绝非次要细节
除了插件,第二个强有力的想法是 append-only session log。DeepSeek 表示,模型看到的一切都会被记录为事件,包括系统指令、工具调用及结果、上下文注入,以及对子智能体的规划。继续、分支、搜索和重复都建立在同一条事件流上。
这对开发者很实用,因为一次出错的执行可以被重建。对于 security 与运维而言,它甚至更加重要。当智能体修改文件、启动命令或向某项服务发送数据时,我需要了解的不只是最后一条聊天消息。我必须能够追溯当时有哪些上下文、涉及了什么工具,以及决策在哪一个环节转化成了行动。
在传统应用中,错误往往可以追溯到输入和一条确定的代码路径。智能体则更难分析。同一项粗略任务可能让模型推导出不同的中间步骤,以不同顺序使用工具,并对意外结果作出不同反应。没有完整历史,最后只剩下“智能体作出了某项决定”这一说法。无论用于 debugging 还是调查安全事件,这都远远不够。
把事件流作为 source of truth 的决定还创造了第二种可能:让实验更容易比较。一场会话可以在特定节点分支,然后使用另一个模型、修改后的 prompt 或不同能力继续。这样比较的就不只是哪个模型写出了更漂亮的答案,还可以研究一项具体变化如何影响同一个真实工作状态。
从长期看,对企业而言,这可能发展成智能体的变更和事件记录。谁下达了任务?当时启用了哪项策略?模型获得了什么数据?哪项操作得到批准?返回了什么结果?一旦智能体不再只是提供建议,而是会对真实系统触发变更,这些问题就会变得十分重要。
不过,仅有 log 还不等于完整的 audit trail。保留策略、访问保护、完整性、敏感内容和导出功能仍然需要妥善解决。如果完整日志包含 prompts、源代码、工具结果或凭据,它本身也可能成为风险。尽管如此,我依然喜欢这个基本决定:模型可见的信息不应来自某个隐藏的侧门,而应来自可以重建的事件流。

Open source 正在成为战略武器
这个项目来自中国,让事情变得更有意思。DeepSeek 不只发布模型权重,现在也明显在构建整个 stack 中的多个层面。DeepSeek V4 的权重和代码已经以 MIT 许可证发布,如今同样采用 MIT 许可证的 Harness 又带来了一套面向智能体工作的开放 runtime。再往下,Cordis 甚至提供了自己的插件与组合模型。
这与我此前在关于 AI、安全以及完整 stack 竞争的文章中描述的发展相符。中国不希望只消费 AI 应用。中国企业正在构建模型、推理软件、硬件路径,现在还在构建其上的智能体基础设施。DeepSeek 展现出的速度,已经无法再用西方过去那种“只是复制产业”的形象来解释。
在这场竞赛中,open source 不只是理想主义。它意味着分发、通过可检查性建立信任,以及加速生态系统。开放权重、代码和接口,就是邀请全球开发者发现错误、构建集成,并让自己的设计成为事实标准。对 DeepSeek 来说,开放的 harness 可能比另一个封闭聊天界面更具战略价值,因为即使其中运行的是其他供应商的模型,它仍然保持相关性。
这是一个值得注意的地方。DeepSeek 正在打造一个连 DeepSeek 自己都可以被替换的平台。短期看,这似乎自相矛盾。为什么一家模型供应商要让用户更容易切换到竞争对手?但长期看,这恰恰可能形成更强的位置。如果开发者在这套 runtime 上构建智能体、插件、安全规则和会话,Harness 就会成为共同基础设施。DeepSeek 也许会失去一部分模型调用,却能获得对整个生态架构的影响力。
开放也会加速学习。在封闭产品中,核心架构的发展基本由制造商掌握。开放项目会被用于原始团队从未完全预料到的各种环境,并由此产生错误报告、新 adapter、替代 backend 和运维知识。尤其在智能体软件这样年轻的领域,这种反馈可能比一个完美的首个版本更重要。
插件方案的聪明之处就在这里。DeepSeek 无须亲自构建每一种存储、每一套 sandbox 和每一个企业系统。它提供一个架构,让其他人把这些能力插入其中。生态系统增长时,核心会从每一次新集成中受益。
中国构建的不只是模型,还有模型周围的完整路径
因此,它的地缘政治意义并不只在基准测试分数上。一个国家或经济区域不会因为某处训练出了强大模型,就自动拥有技术主权。它还需要硬件、推理软件、开发工具、接口、运维经验,以及在其上构建产品的开发者。DeepSeek Harness 正是这条链中的又一个模块。
西方关于中国技术的叙事经常落后于这一发展。仍然主要把中国视为廉价模仿者的人,会忽略当地发布自主架构、吸引全球开发者的速度。DeepSeek 不必在所有类别中长期领先。只要保持很小的差距、快速迭代,并用开放方式让其他人继续在其成果上构建,就已经足够。
与顶尖封闭模型的差距正在缩小
过去很长时间里,open-weight 模型被视为适合实验室和特殊场景的有趣替代品,而真正强大的能力掌握在少数封闭供应商手里。这种看法越来越难以成立。差距并未在所有领域消失,但其缩小速度比许多人预想的更快。
在自己的评测中,DeepSeek 直接把 V4 模型与当前的顶尖封闭模型并列比较。根据不同基准,V4 Pro 可能接近它们、达到相当的分数,或者仍然明显落后。在 software engineering、工具使用、事实知识和极难的 reasoning 任务上,没有统一答案。正因为如此,我们不应根据一张表格就确定“赢家”。
更重要的是时间距离。不久前还被视为美国最大实验室独有优势的能力,如今只过几个月就出现在可以下载权重、自行运行和研究的模型中。“只落后顶尖模型几个月”并不是一项能够科学测量的常量,但它相当准确地描述了封闭系统的领先如今可能有多么短暂。
领先的经济意义也因此改变。如果封闭模型在某项任务上强百分之十,这可能至关重要。但如果开放模型已经足够好,可以运行于自有基础设施,并能纳入自己的安全区域,那么整体计算仍然可能有利于开放模型。控制权、数据位置、可预测成本以及自行调整的能力都是性能的一部分,即使它们不会出现在基准测试中。
同时也不能忘记硬件。权重开放并不意味着一个拥有 1.6 万亿参数的模型能轻松放进服务器机柜运行。DeepSeek V4 Pro 是一个巨大的 Mixture-of-Experts 模型。即使每个 token 只激活一部分参数,内存、推理成本和运维要求仍然很高。开放消除了代码与权重的访问壁垒,却无法消除大模型的物理现实。
尽管如此,这些权重仅仅是存在,就已经改变了市场。研究人员可以检查模型,供应商可以在自有基础设施上提供它,社区可以开发量化方案与 runtime 优化。企业至少获得了一种选择,不必完全依赖单一 API。
竞争因此发生转移。模型本身的知识仍然重要,但持久价值越来越多地来自 data pipeline、评估、runtime、安全、分发,以及与真实流程的结合。开放 harness 恰好符合这种变化。当模型更快地变得可以替换,能够可靠提供上下文、工具和边界的平台就会获胜。
开放并不自动等于可信
无论多么令人兴奋,如果自动把“来自中国的 open source”等同于自主权,仍然是天真的。使用 DeepSeek 托管服务的人依然会把数据发送给外部供应商。只有自行运营模型 endpoint,并使用受控 harness,才能真正改变对数据的控制。即便如此,来源、build 流程、依赖和更新仍然属于 supply chain 的一部分。
插件会进一步放大这项责任。插件不是无害的主题,它可以注册工具、访问 services,并在系统上执行代码。对于来自 Git 仓库的安装,DeepSeek 文档明确警告:获得允许的 build script 可能在智能体 sandbox 之外的主机上运行。文档建议只允许可信来源,并把依赖固定到具体 commit。
这正是正确的警告。开放插件平台带来可替换性,但也带来新的 supply chain。每增加一个提供方,就可能增加一个可以访问 prompts、文件、凭据或可执行工具的主体。若一个被攻陷的插件本来就是 runtime 的合法组成部分,它甚至不需要一次引人注目的模型 jailbreak。
能够查看源代码是一项优势,但还不能算安全审查。必须有人真正检查代码、追踪 builds、固定版本并控制更新。在不断增长的插件生态中,来源几乎会变得与功能同等重要。来自未知来源的实用插件,可能比缺少一项功能构成更大的风险。
因此,如果用于严肃环境,我只会部署少量经过检查的插件。版本必须固定、权限必须分离、secrets 必须在配置之外管理,出站连接也必须受控。Sandbox 应当真正实现隔离,而不只是叫这个名字。Session log 应受到保护,并检查其中是否有敏感数据。最重要的是,“一切皆插件”绝不能变成“每个插件什么都能做”。
所以,长期潜力也取决于 governance。优秀的平台需要清晰易懂的来源证明、经过签名的构件、可复现的 builds、明确依赖关系,以及按 profile 限制能力的方法。如果 DeepSeek 与社区认真对待这些枯燥的基础工作,开放可以带来真正的控制。否则,插件承诺只会变成一个非常巨大的攻击面。
我希望从 DeepSeek Harness 看到什么
DeepSeek 特意把项目称为 Developer Preview,并预告了不兼容变更。现在适合阅读、实验,并使用非关键数据进行测试,但还不足以让核心生产流程依赖它。
接下来值得观察的是,这套清晰架构能否发展成可靠的生态系统。这需要签名发布、可追溯的插件来源、明确的权限模型、可复现的 builds,以及不会在每次更换时都要求重新信任的更新流程。同样重要的是,在项目快速发展时,不同供应商的插件究竟能否真正良好组合。
我也想知道,承诺的可替换性在日常使用中是否成立。纸面上更换模型 adapter 很容易,实际中模型在工具调用、reasoning、上下文格式、图像支持和故障模式上都各不相同。开放接口能减少这些差异,却无法让它们消失。
尽管存在这些保留意见,DeepSeek Harness 仍是我认为今年最有意思的 AI 项目之一。这并不是因为它现在就必须成为最好的 coding 智能体。真正令人兴奋的是,一家中国 AI 企业正在开放模型之上的层,并把它变成一套模块化系统。当其他供应商把智能体越来越深地整合进封闭平台时,DeepSeek 选择了一套连自家模型也只是可替换插件的架构。
我的印象,以及难以置信的速度
仅仅是 Developer Preview 就已经让我看到了很大潜力。界面让插件原则变得直观,而 trajectory 视图也表明,可追溯性并不是准备事后补上的功能。项目仍然年轻,许多方面还在变化,但恰恰是这种开放架构,看起来像一块能够让重大成果迅速生长的基础。
如今 AI 世界里发生的事情太多了,就连几周的差距也可能显得过时。如果仅 Alphabet 就预计在 2026 年投入 1750 亿至 1850 亿美元资本支出,Meta 还会再投入 1150 亿至 1350 亿美元,而且两者都在很大程度上受到 AI 基础设施推动,那么谁还会感到意外?数千亿美元突然涌向了同一个理念、同一场竞争和同一个未来。
这些资本并不能保证产生优秀产品,但它解释了为什么模型、数据中心和智能体平台正以几年前看来不可能的速度前进。模型越来越可以替换,开放权重正在迅速追赶,决定性的差异化则转移到了 harness。DeepSeek 在这三个方面都明显加速。建设 AI 基础设施的人不应只把这理解为中国竞争者的故事,还应把它视为一项邀请,重新评估自身对封闭 stack 的依赖。
下次再见,
Joe


