trueNetLab logo
ZH
DeepSeek Harness:当一切真正成为插件

DeepSeek Harness:当一切真正成为插件

谈到 AI 智能体时,我们几乎总是先谈模型。哪个模型写代码更好?哪个能理解更长的上下文?哪个能在基准测试中完成更多任务?这很容易理解,但如今只看模型已经不够了。智能体并不只是一个语言模型。它还需要工具、存储、会话、权限、运行环境、规划、日志,以及一个让人能够介入的界面。

这正是我觉得 DeepSeek Harness Developer Preview 如此令人兴奋的原因。DeepSeek 用一句非常清晰的话概括了这个想法:Everything is a plugin. 可以替换的不只是附加工具,模型、skills、会话、sandbox、storage、智能体循环、scheduling,甚至用户界面本身,也都被视为插件。

乍看之下,这只是面向开发者的一项技术设计决定。实际上,它对 AI 的下一个阶段提出了一个更大的判断:如果智能来自模型,而真正完成工作的能力来自 harness,那么后面这一半就不应该成为某一家供应商手中的不透明黑箱。

模型提供智能,而只有可替换的 harness 才能决定这种智能为谁服务,以及它可以按照什么规则行动。

智能体不只是它所使用的模型

DeepSeek 自己给出的公式非常简洁:智能体等于模型加 harness。模型处理语言并作出决策,harness 则把它连接到现实环境。它提供文件、注册工具、管理状态、启动子智能体、执行命令,并决定哪些信息会在下一次调用模型时重新进入上下文。

因此,harness 并不只是模型外面的一层包装。它决定了模型的回答最终能够变成什么。智能体只能输出文字,还是也能修改文件?它能看到整个代码仓库,还是只能看到一个工作目录?命令直接在主机上运行,还是在容器或远程 sandbox 中运行?某项操作是否必须由人批准?状态能否跨会话保留?这些都不是模型的属性,而是围绕模型的 runtime 所作出的决定。

从回答问题到执行行动

在简单聊天中,这种区别几乎看不出来。问题进去,答案出来。但一旦智能体开始处理代码仓库、工单或内部系统,或者接管持续时间较长的任务,harness 至少会变得和模型同样重要。它把用自然语言表达的意图转换成一系列真实步骤,再把执行结果作为新的上下文送回模型。

令人印象深刻的演示技术能否成为可靠工具,正是在这里见分晓。即使模型非常出色,如果上下文很差、权限过宽、会话管理不可靠,它仍然会是一个糟糕的智能体。它可以进行精彩的推理,却依然可能编辑错误的文件、使用过期状态,或者在出错后无法妥善继续。反过来,一个稍弱的模型在设计良好的 runtime 中也可能非常有用,因为它能看到正确的工具,受到明确限制,而且其工作过程可以追溯。

架构本身成为结果的一部分

DeepSeek Harness 让这一层变得可见。Cordis 内核负责挂载插件、解析依赖,并能再次移除组件。各种能力以 services 的形式提供。例如,一个插件可以实现 shell,另一个插件把这套 shell 作为模型工具提供,第三个插件则在 workflow 中使用该工具。具体实现可以通过配置更换,无须重建整个 harness。

DeepSeek 在这方面比许多只允许通过扩展添加少量工具的平台走得更远。模型连接、tool registry、session log 和智能体循环本身也都是插件。按照它的架构,并不存在一个为了每项扩展都必须打补丁的特权核心。新的行为被挂载在现有组件旁边,移除时也可以干净地撤销自身的注册。

这并不是一个全新的想法。几十年来,操作系统、浏览器、编辑器和各类平台一直依靠模块化组件发展。新颖之处在于,DeepSeek 如此彻底地把这项原则应用到一个完整的 AI 智能体上。智能体架构不再被当作固定产品接受,而是成为一组可以由运营者改变的决定。

为什么“一切皆插件”如此吸引人

插件理念把权力从一个成品转移到可组合的 runtime。无需彻底重建工作方式,我就能更换模型供应商。我可以把本地 shell 换成隔离更强的版本,也可以使用另一套存储、会话逻辑或自有界面。除了自家的模型接入方式,DeepSeek 还提供了其他供应商和自定义 OpenAI 兼容 endpoint 的文档。

更换模型,无需从头再来

这样一来,智能体更像一套可以根据自身环境组装的基础设施。小型开发团队也许只需要文件访问、Git 和测试。Security 团队则可能还需要网络查询、隔离的 sandbox、更严格的审批以及不可更改的日志。企业可以使用自己的 model gateway,而私人实验室可以连接本地 open-weight 模型。

这在战略上非常重要,因为模型目前变化得极快。今天某家供应商擅长 coding,明天另一家可能在长上下文或工具使用方面领先。在封闭产品中,更换模型往往也意味着更换平台,会话、规则、权限、集成方式和工作流程都得重新建立。在模块化 runtime 中,模型仍然只是一个组件,可以换成另一家 provider,或换成自行运营的 endpoint。

当然,这个过程不会完全没有摩擦。不同模型在角色格式、reasoning、工具调用、图像支持和错误行为上各不相同,因此各自的 adapter 必须妥善处理这些差异。但清晰接口的价值也恰恰体现在这里:单个供应商的特殊性不会不受控制地渗透到整个产品中。

可替换的基础设施,而不只是可替换的按钮

尤其有意思的是,某项能力的定义、提供者和使用者被彼此分开。Bash 接口描述这项能力可以做什么,provider 决定命令实际在哪里、以什么方式运行,然后再由另一个插件把它变成模型可以调用的工具。这类接口十分重要,因为控制可以在一个明确位置实现。时间限制、隔离、审批和日志都可以在那里加入,而无须重新编写每一套智能体循环。

当多种能力共享同一个执行环境时,这种潜力就变得很清楚。如果文件系统与进程从本地环境迁移到远程 sandbox,shell、终端和代码导航也能一起迁移。对用户而言,能力看起来依然相似,但底层的安全与运营边界却发生了根本变化。这种可替换性远比界面上多一个开关更有价值。

不同的 runtime 模式也展示了 DeepSeek 的目标。标准模式提供完整的 coding 智能体。Code Mode 允许模型通过生成的 TypeScript 代码编排多次工具调用。Minimal Mode 为基准测试把环境缩减到 shell 和编辑器。Creator Mode 则用于研究插件和自定义 presets。因此,并非每一种使用场景都必须加载同一个庞大工具箱。

Profiles 与 bundles 让它不再只是松散的扩展集合。一个 profile 可以为特定用途定义一套智能体 runtime。我们可以设想用于本地开发的轻量 profile、用于生产系统且限制更严格的 profile,以及记录更多信息的取证 profile。它们仍由相同的模块组成,但组件的组合方式与边界会匹配各自的风险。

DeepSeek Harness 的插件管理界面,显示已安装模块及其状态

潜力在现实中如何产生

这套架构很有吸引力,但只有在具体场景中才会显示价值。插件系统不是目的本身。它必须让智能体能够更快适应真实需求,而不必为每一种用途都重新打造一个平台。

从个人工具到企业平台

一名开发者可以从本地 shell、文件编辑器和一个模型开始。但它一旦成为团队工具,其他需求就会随之出现:统一身份、隔离的 workspaces、关键操作审批、model gateway、成本控制、持久会话以及可导出的 audit trail。在单体应用中,这些功能是否出现、何时出现,都由制造商决定。

在模块化 runtime 中,企业可以自行补充缺失部分或替换现有 provider,而无须重新发明智能体。同一套界面和智能体逻辑可以在企业 gateway 后方使用其他模型,在内部 sandbox 执行命令,并把会话存入自有 storage。这就是实用工具与可控平台之间的区别。

用相同模块构建不同信任区域

并非所有任务都应该拥有同样的权限。负责总结文档的智能体不需要生产环境访问权。用于 incident response 的智能体也许需要日志数据和网络查询,却不应修改配置。用于 deployment 的智能体可以执行变更,但应采用更严格的审批、更短时效的 token,以及特别清晰的日志。

通过清晰分离的 services 与 profiles,可以在 runtime 中直接表达这种差异。模型无须理解每个安全细节,并靠自觉遵守规则。环境会从技术上决定哪些能力真正存在。对于 security 而言,这是一个关键点:没有挂载的能力根本不会作为直接工具提供给模型。

面向专业提供者的生态系统

没有任何一家供应商能够同时构建最好的 sandbox、最好的 session store、所有企业系统和全部模型 adapter。开放的插件模式允许专业团队集中把其中一个层面做好。Security 厂商可以提供强化的执行环境,storage 项目可以提供可审计的会话,企业内部平台团队则可以把审批和身份接入自家组织。

如果这些组件能通过稳定接口配合,产生的将是生态系统,而不是一个不断膨胀的单体应用。这可能正是 DeepSeek Harness 最大的潜力。DeepSeek 不必赢得所有使用场景,只要这套架构成为其他人提供和组合能力的场所就够了。

可追溯性绝非次要细节

除了插件,第二个强有力的想法是 append-only session log。DeepSeek 表示,模型看到的一切都会被记录为事件,包括系统指令、工具调用及结果、上下文注入,以及对子智能体的规划。继续、分支、搜索和重复都建立在同一条事件流上。

这对开发者很实用,因为一次出错的执行可以被重建。对于 security 与运维而言,它甚至更加重要。当智能体修改文件、启动命令或向某项服务发送数据时,我需要了解的不只是最后一条聊天消息。我必须能够追溯当时有哪些上下文、涉及了什么工具,以及决策在哪一个环节转化成了行动。

在传统应用中,错误往往可以追溯到输入和一条确定的代码路径。智能体则更难分析。同一项粗略任务可能让模型推导出不同的中间步骤,以不同顺序使用工具,并对意外结果作出不同反应。没有完整历史,最后只剩下“智能体作出了某项决定”这一说法。无论用于 debugging 还是调查安全事件,这都远远不够。

把事件流作为 source of truth 的决定还创造了第二种可能:让实验更容易比较。一场会话可以在特定节点分支,然后使用另一个模型、修改后的 prompt 或不同能力继续。这样比较的就不只是哪个模型写出了更漂亮的答案,还可以研究一项具体变化如何影响同一个真实工作状态。

从长期看,对企业而言,这可能发展成智能体的变更和事件记录。谁下达了任务?当时启用了哪项策略?模型获得了什么数据?哪项操作得到批准?返回了什么结果?一旦智能体不再只是提供建议,而是会对真实系统触发变更,这些问题就会变得十分重要。

不过,仅有 log 还不等于完整的 audit trail。保留策略、访问保护、完整性、敏感内容和导出功能仍然需要妥善解决。如果完整日志包含 prompts、源代码、工具结果或凭据,它本身也可能成为风险。尽管如此,我依然喜欢这个基本决定:模型可见的信息不应来自某个隐藏的侧门,而应来自可以重建的事件流。

DeepSeek Harness 中一次完整智能体执行的 trajectory 视图

Open source 正在成为战略武器

这个项目来自中国,让事情变得更有意思。DeepSeek 不只发布模型权重,现在也明显在构建整个 stack 中的多个层面。DeepSeek V4 的权重和代码已经以 MIT 许可证发布,如今同样采用 MIT 许可证的 Harness 又带来了一套面向智能体工作的开放 runtime。再往下,Cordis 甚至提供了自己的插件与组合模型。

这与我此前在关于 AI、安全以及完整 stack 竞争的文章中描述的发展相符。中国不希望只消费 AI 应用。中国企业正在构建模型、推理软件、硬件路径,现在还在构建其上的智能体基础设施。DeepSeek 展现出的速度,已经无法再用西方过去那种“只是复制产业”的形象来解释。

在这场竞赛中,open source 不只是理想主义。它意味着分发、通过可检查性建立信任,以及加速生态系统。开放权重、代码和接口,就是邀请全球开发者发现错误、构建集成,并让自己的设计成为事实标准。对 DeepSeek 来说,开放的 harness 可能比另一个封闭聊天界面更具战略价值,因为即使其中运行的是其他供应商的模型,它仍然保持相关性。

这是一个值得注意的地方。DeepSeek 正在打造一个连 DeepSeek 自己都可以被替换的平台。短期看,这似乎自相矛盾。为什么一家模型供应商要让用户更容易切换到竞争对手?但长期看,这恰恰可能形成更强的位置。如果开发者在这套 runtime 上构建智能体、插件、安全规则和会话,Harness 就会成为共同基础设施。DeepSeek 也许会失去一部分模型调用,却能获得对整个生态架构的影响力。

开放也会加速学习。在封闭产品中,核心架构的发展基本由制造商掌握。开放项目会被用于原始团队从未完全预料到的各种环境,并由此产生错误报告、新 adapter、替代 backend 和运维知识。尤其在智能体软件这样年轻的领域,这种反馈可能比一个完美的首个版本更重要。

插件方案的聪明之处就在这里。DeepSeek 无须亲自构建每一种存储、每一套 sandbox 和每一个企业系统。它提供一个架构,让其他人把这些能力插入其中。生态系统增长时,核心会从每一次新集成中受益。

中国构建的不只是模型,还有模型周围的完整路径

因此,它的地缘政治意义并不只在基准测试分数上。一个国家或经济区域不会因为某处训练出了强大模型,就自动拥有技术主权。它还需要硬件、推理软件、开发工具、接口、运维经验,以及在其上构建产品的开发者。DeepSeek Harness 正是这条链中的又一个模块。

西方关于中国技术的叙事经常落后于这一发展。仍然主要把中国视为廉价模仿者的人,会忽略当地发布自主架构、吸引全球开发者的速度。DeepSeek 不必在所有类别中长期领先。只要保持很小的差距、快速迭代,并用开放方式让其他人继续在其成果上构建,就已经足够。

与顶尖封闭模型的差距正在缩小

过去很长时间里,open-weight 模型被视为适合实验室和特殊场景的有趣替代品,而真正强大的能力掌握在少数封闭供应商手里。这种看法越来越难以成立。差距并未在所有领域消失,但其缩小速度比许多人预想的更快。

在自己的评测中,DeepSeek 直接把 V4 模型与当前的顶尖封闭模型并列比较。根据不同基准,V4 Pro 可能接近它们、达到相当的分数,或者仍然明显落后。在 software engineering、工具使用、事实知识和极难的 reasoning 任务上,没有统一答案。正因为如此,我们不应根据一张表格就确定“赢家”。

更重要的是时间距离。不久前还被视为美国最大实验室独有优势的能力,如今只过几个月就出现在可以下载权重、自行运行和研究的模型中。“只落后顶尖模型几个月”并不是一项能够科学测量的常量,但它相当准确地描述了封闭系统的领先如今可能有多么短暂。

领先的经济意义也因此改变。如果封闭模型在某项任务上强百分之十,这可能至关重要。但如果开放模型已经足够好,可以运行于自有基础设施,并能纳入自己的安全区域,那么整体计算仍然可能有利于开放模型。控制权、数据位置、可预测成本以及自行调整的能力都是性能的一部分,即使它们不会出现在基准测试中。

同时也不能忘记硬件。权重开放并不意味着一个拥有 1.6 万亿参数的模型能轻松放进服务器机柜运行。DeepSeek V4 Pro 是一个巨大的 Mixture-of-Experts 模型。即使每个 token 只激活一部分参数,内存、推理成本和运维要求仍然很高。开放消除了代码与权重的访问壁垒,却无法消除大模型的物理现实。

尽管如此,这些权重仅仅是存在,就已经改变了市场。研究人员可以检查模型,供应商可以在自有基础设施上提供它,社区可以开发量化方案与 runtime 优化。企业至少获得了一种选择,不必完全依赖单一 API。

竞争因此发生转移。模型本身的知识仍然重要,但持久价值越来越多地来自 data pipeline、评估、runtime、安全、分发,以及与真实流程的结合。开放 harness 恰好符合这种变化。当模型更快地变得可以替换,能够可靠提供上下文、工具和边界的平台就会获胜。

开放并不自动等于可信

无论多么令人兴奋,如果自动把“来自中国的 open source”等同于自主权,仍然是天真的。使用 DeepSeek 托管服务的人依然会把数据发送给外部供应商。只有自行运营模型 endpoint,并使用受控 harness,才能真正改变对数据的控制。即便如此,来源、build 流程、依赖和更新仍然属于 supply chain 的一部分。

插件会进一步放大这项责任。插件不是无害的主题,它可以注册工具、访问 services,并在系统上执行代码。对于来自 Git 仓库的安装,DeepSeek 文档明确警告:获得允许的 build script 可能在智能体 sandbox 之外的主机上运行。文档建议只允许可信来源,并把依赖固定到具体 commit。

这正是正确的警告。开放插件平台带来可替换性,但也带来新的 supply chain。每增加一个提供方,就可能增加一个可以访问 prompts、文件、凭据或可执行工具的主体。若一个被攻陷的插件本来就是 runtime 的合法组成部分,它甚至不需要一次引人注目的模型 jailbreak。

能够查看源代码是一项优势,但还不能算安全审查。必须有人真正检查代码、追踪 builds、固定版本并控制更新。在不断增长的插件生态中,来源几乎会变得与功能同等重要。来自未知来源的实用插件,可能比缺少一项功能构成更大的风险。

因此,如果用于严肃环境,我只会部署少量经过检查的插件。版本必须固定、权限必须分离、secrets 必须在配置之外管理,出站连接也必须受控。Sandbox 应当真正实现隔离,而不只是叫这个名字。Session log 应受到保护,并检查其中是否有敏感数据。最重要的是,“一切皆插件”绝不能变成“每个插件什么都能做”。

所以,长期潜力也取决于 governance。优秀的平台需要清晰易懂的来源证明、经过签名的构件、可复现的 builds、明确依赖关系,以及按 profile 限制能力的方法。如果 DeepSeek 与社区认真对待这些枯燥的基础工作,开放可以带来真正的控制。否则,插件承诺只会变成一个非常巨大的攻击面。

我希望从 DeepSeek Harness 看到什么

DeepSeek 特意把项目称为 Developer Preview,并预告了不兼容变更。现在适合阅读、实验,并使用非关键数据进行测试,但还不足以让核心生产流程依赖它。

接下来值得观察的是,这套清晰架构能否发展成可靠的生态系统。这需要签名发布、可追溯的插件来源、明确的权限模型、可复现的 builds,以及不会在每次更换时都要求重新信任的更新流程。同样重要的是,在项目快速发展时,不同供应商的插件究竟能否真正良好组合。

我也想知道,承诺的可替换性在日常使用中是否成立。纸面上更换模型 adapter 很容易,实际中模型在工具调用、reasoning、上下文格式、图像支持和故障模式上都各不相同。开放接口能减少这些差异,却无法让它们消失。

尽管存在这些保留意见,DeepSeek Harness 仍是我认为今年最有意思的 AI 项目之一。这并不是因为它现在就必须成为最好的 coding 智能体。真正令人兴奋的是,一家中国 AI 企业正在开放模型之上的层,并把它变成一套模块化系统。当其他供应商把智能体越来越深地整合进封闭平台时,DeepSeek 选择了一套连自家模型也只是可替换插件的架构。

我的印象,以及难以置信的速度

仅仅是 Developer Preview 就已经让我看到了很大潜力。界面让插件原则变得直观,而 trajectory 视图也表明,可追溯性并不是准备事后补上的功能。项目仍然年轻,许多方面还在变化,但恰恰是这种开放架构,看起来像一块能够让重大成果迅速生长的基础。

如今 AI 世界里发生的事情太多了,就连几周的差距也可能显得过时。如果仅 Alphabet 就预计在 2026 年投入 1750 亿至 1850 亿美元资本支出,Meta 还会再投入 1150 亿至 1350 亿美元,而且两者都在很大程度上受到 AI 基础设施推动,那么谁还会感到意外?数千亿美元突然涌向了同一个理念、同一场竞争和同一个未来。

这些资本并不能保证产生优秀产品,但它解释了为什么模型、数据中心和智能体平台正以几年前看来不可能的速度前进。模型越来越可以替换,开放权重正在迅速追赶,决定性的差异化则转移到了 harness。DeepSeek 在这三个方面都明显加速。建设 AI 基础设施的人不应只把这理解为中国竞争者的故事,还应把它视为一项邀请,重新评估自身对封闭 stack 的依赖。

下次再见,
Joe

来源