如果你还在搜索引擎里输入"DeepSeek Harness 模型评测",那得先停下来搞明白一件事:这东西根本不是大模型。2026年8月13日晚间,DeepSeek把一个叫 Harness 的开源项目扔到了 GitHub 上,MIT 协议,开发者预览版,npm 包版本号还挂在 0.1.0-rc.6。结果不到两小时,仓库 Star 数破万;十二小时后,五万颗星星已经点亮。到8月16日,GitHub API 返回的数字是 125,959 Stars、12,526 次 Fork。

这速度是什么概念?业内有人拿它跟之前增长最快的 OpenClaw 比,说 DeepSeek Harness 的增速大约是前者的八十倍。但比数字更值得琢磨的是,为什么一个"不是模型"的东西,能让开发者如此疯狂。

怎么看DeepSeek Harness 正式开源,采用一切皆插件的架构? - 知乎

先纠正一个最常见的误解

很多人第一次看到"DeepSeek Harness"这个名字,下意识以为它是 DeepSeek V4 的某个变体或者升级版。实际上官方给出的公式很直白:Model + Harness = Agent。模型负责想,Harness 负责让模型能动手干活——读文件、跑终端、调工具、记状态、渲染界面。Anthropic 之前推 Claude Code 的时候用过 harness 这个词,DeepSeek 这次把它彻底开源了,而且整件事跑在你自己的电脑上。

说白了,Harness 是智能体的运行时。你在里面跑的模型是 DeepSeek V4 Flash 或者 DeepSeek V4 Pro,但框架本身不绑定任何模型。它甚至不绑定 DeepSeek 自家的产品。因为在这个架构里模型本身就是一个可替换的插件。

"万物皆插件"到底意味着什么

这句话不是营销口号,而是技术事实。DeepSeek Harness 底层基于 Cordis,一个从 Koishi 机器人生态里抽出来的插件元框架。Cordis 本身极其克制,只管三件事:加载插件、卸载插件、解析插件之间的依赖关系除此之外什么都不管。

真正有意思的部分全在 Cordis 之上。模型适配器是插件,终端工具是插件,文件编辑器是插件,网络搜索是插件,会话记忆是插件,Web 界面是插件,连驱动整个智能体运转的主循环都是插件。它们之间通过 Cordis 的服务和事件互相协作,你可以在配置层随便换掉任何一个能力,完全不需要碰框架源码。

DeepSeek Harness(dsh)与dsh-TUI 震撼开源:安装介绍及使用体验,以及它的终端界面更多AI工具- 掘金

这直接带来了四个官方预设模式,而每个预设本质上就是一组插件包:

标准模式是最完整的编码智能体,文件编辑、Shell、网页检索、技能编排、子智能体调度全都有。PTC 模式在标准版基础上塞进了 Code Mode SDK,让模型直接写 TypeScript 程序来串联多步工具调用,而不是一步一步地发请求。极简模式只保留持久化 Bash 和字符串替换编辑器两个工具,DeepSeek 内部跑 V4 Flash 智能体基准测试时用的就是这个配置。创造模式则是给插件开发者准备的,带运行时检查和内存中插件实验功能。

你看,连"运行方式"都是插件化的。这不是在框架上挂几个扩展那么简单,而是整个智能体的每一层都被拆解成了可插拔的零件。

社区在三天内干了什么

公开发布前,DeepSeek 内部测试阶段就已经攒了大约三百个插件,甚至有人做了 Windows XP 复古皮肤和纯玩梗的插件。8月13日仓库公开后,生态膨胀的速度比 Star 数还夸张。

36Kr 在发布当晚统计到了 288 个插件仓库。几天之内,GitHub 上带 dsh-plugin 主题标签的公开仓库超过一千个。社区维护的 Oh-My-DSH 目录在8月15日收录了 1,117 个精选插件来自 1,521 个受监控的仓库,总共攒下 30 多万颗 GitHub Star。自动更新的 awesome-dsh 目录则扫到了 2,600 多个仓库,横跨 18 个类别的 368 条人工精选条目被收进了另一份 awesome-deepseek-harness 列表。

这些插件覆盖的面相当广。搜索层面有基于 Exa 的 dsh-web-search-exa,也有横跨 DeepSeek、DuckDuckGo、Bing、GitHub、Bilibili、YouTube 的多引擎路由 dsh-web-search-pro。办公场景有 dsh-office,能让模型直接改 Office 文档并在 Web 端预览 docx 和 pdf。聊天历史迁移也不成问题,dsh-chat-import 支持从 Claude Code、OpenAI Codex、ChatGPT、Cursor、Gemini 等 13 个编码智能体里恢复完整对话,变成可继续的 DSH 会话。

移动端适配、飞书机器人、企业微信网关、Telegram 桥接、语音朗读语音转文字、记忆增强、IDE 风格侧边栏、视觉能力补全,甚至 Tauri 桌面封装——这些东西不是官方 roadmap 上的规划,而是社区在七十二小时内自发长出来的。

上手比想象中简单,但有个坑要注意

装 DeepSeek Harness 只需要 Node.js(建议 22.19 或更新版本),然后一条命令:

plain

npx @deepseek-ai/dsh web

本地浏览器打开 127.0.0.1:3080,一分钟内你就能看到一个完整的 Web UI。你的会话、日志、数据全留在本地,不会上传到哪朵云上去。

加插件的规范命令是:

plain

dsh plugin --profile web add <包名>

这里 --profile web 不能省,因为 DSH 靠 profile 决定会话跑哪个插件包,而 web profile 就是 Web UI 背后用的那个。你也可以直接从 GitHub 仓库装,格式是 dsh plugin --profile web add "github:owner/repo#ref",甚至用 link 指向本地路径做开发调试。

不过新手很容易踩一个坑:只有声明了 dsh.bundle.patch 字段的包才会变成激活的配置层。普通依赖装上去只是静静地躺在那里,不会生效。bundle 声明才是告诉 DSH"我是 harness 插件、该在哪里打补丁"的关键。装完之后记得重启 dsh web 并刷新页面用 dsh plugin --profile web list 或者在 Web 端的"设置 → 插件"里确认状态。

不想全局安装 dsh 也行,用 npx -p @deepseek-ai/dsh dsh plugin --profile web add <包名> 一样能跑。

自己写插件也没那么高门槛

既然一切都是插件,写插件本质上就是写一个声明了 DSH bundle 的 Cordis 插件。社区已经铺好了脚手架,plugin-registry、dsh-plugin-starter、create-dsh-plugin 这些工具都能用。

本地开发的循环很直接:克隆并构建你的插件,用 dsh plugin --profile web add "link:$(pwd)" 挂上,然后迭代。客户端改动刷新页面,宿主端改动重启服务。生态里最早那一千多个插件,基本都是这么-link出来的。

但有个现实得提前说:预览版迭代速度极快,针对某个 rc 版本写的插件,下个 rc 可能就挂了。社区里的 ModLens 视觉插件甚至专门在文档里写明要锁定版本才能稳定运行。如果你打算现在入场写插件固定版本号不是可选项,是必选项。

两个被很多人忽略的核心能力

市面上大多数"DSH 插件清单"类的文章不会告诉你,这个框架里有两个设计是真正差异化的。

第一个是轨迹(trajectory)。每一次运行,模型的完整经历——系统提示、思维链、每次工具调用和返回结果、子代理调度、上下文注入——全部写入一条只能追加的会话日志。恢复会话、分叉对话、检索历史、重放执行,都基于同一条事件流。Hacker News 上有开发者把这称为杀手级功能,理由是封闭式智能体产品恰恰把这部分数据藏了起来,让你既看不到模型是怎么想的,也追不了它错在哪。

第二个是 MCP。DSH 自带官方 MCP 客户端,有 /mcp 命令,设置页里也有专门的服务器选项卡。社区已经在上面盖楼了:dsh-chatgpt-bridge 能把 DSH 会话作为 MCP 服务器暴露给 ChatGPT,dsh-mcp-panel 则是给这个客户端做的可观测性面板。如果你现有的代理栈已经接了一堆 MCP 服务器,DSH 可以直接把它们挂成插件用,不需要推翻重来。

OpenCode Tutorial: Complete Guide to the Open-Source Coding Agent

模型从哪来?DeepSeek 自家的两兄弟最合拍

DSH 是框架,不是模型提供商,所以你至少要提供一个兼容 OpenAI 格式的模型端点。而 DeepSeek 自家的 V4 Flash 和 V4 Pro 在这个场景下确实最对味。

V4 Flash 走的是性价比路线,284B 总参数、13B 激活参数的 MoE 架构,支持 1M 上下文和 384K 最大输出。官方定价在空闲时段输入缓存命中低至 0.05 元/百万 token,缓存未命中 1.5 元/百万 token,输出 4.5 元/百万 token高峰时段翻倍。对日常编码、批量生成、高频调用来说,这个成本几乎没压力。

V4 Pro 则是旗舰定位,1.6T 总参数、49B 激活参数,同样 1M 上下文和 384K 输出上限。空闲时段输入缓存命中 0.15 元/百万 token,缓存未命中 4.5 元/百万 token,输出 13.5 元/百万 token。复杂架构设计、深度调试、高难度推理任务上Pro 的明显优势才会显现出来。

DeepSeek V4 Architecture: MoE & Latent Attention Explained - Macaron

两款模型都托管在 OrcaRouter 上,按 DeepSeek 官方定价、零加价,一个兼容 OpenAI 格式的密钥就能访问。DSH 的模型插件正好对接这种端点,你可以在同一套框架里让 Flash 和 Pro 互相切换,甚至配置自动故障转移。需要强调的是,OrcaRouter 只提供模型层,DSH 本身完全跑在你的本地机器上,数据不会流经任何第三方 harness 服务。

诚实地说,预览版有哪些粗糙的地方

三天 12.5 万颗 Star 的能量,另一面就是粗糙边缘。在决定投入之前,这几点最好提前知道。

开发者预览版的身份是写在 README 里的,官方自己警告"会有破坏兼容性的变更"。npm 包是 rc 版本,核心插件和基础 API 仍在迭代,启动界面甚至弹着给 Harness 开发者的通知。把生产环境押在这个版本号上,风险自担。

Token 消耗也是个硬成本。有中文媒体援引第三方对比,同样的 DeepSeek V4 Flash 任务,另一个开源测试框架消耗的 token 大约只有 DSH 的 30%。Composio 的受控测试更直观:同一个 V4 Flash 在八个测试框架上跑 30 个任务,完成次数从 14 到 20 不等——模型完全一样,结果差了三分之一。这说明 harness 不是中性的包装纸,它直接决定了模型的工作效率。

UI 对非开发者并不友好,评价者的原话是"粗糙之处比比皆是"。没有官方 CLI 或 TUI,社区自己补了 dsh-TUI 和 dsh-tianshu-tui 来填这个坑。"万物皆插件"的自由,代价就是默认设置看起来像半成品。

它能干活但得有人盯着。那些亲测报告里描述的agent能完成多步骤任务——用不同设计语言重建网站、拉 GitHub API 数据并渲染图表——但过程中仍需要监督,输出里会有轻微的格式和交互错误。

最后,本地优先意味着算力你自己出,模型密钥你自己买。想要一个开箱即用的托管智能体?DSH 不是为这个场景设计的。

写在最后

DeepSeek Harness 成为 2026 年增速最快的开源项目,不是因为它是一个更好的模型——它压根就不是模型——而是因为它让智能体本身变成了平台。官方捆绑包里有一百多项能力,社区三天内长出一千多个插件,而验证这场押注最快的方式,就是运行 npx @deepseek-ai/dsh web然后装几个插件亲自试试。

对于想要本地、完全可审计、愿意在快速迭代的预览版上固定版本的开发者来说,DSH 今天值得安装。搭配 OrcaRouter 上的 DeepSeek V4 Flash 或 V4 Pro,你只需要付 token 的钱,就能跑完整套技术栈。但如果你需要生产级稳定性、不想盯预览版、或者想要托管服务,那它确实还没准备好——等接口稳定下来再说。

这个框架赌的是:价值积累发生在 harness 层,而不是模型层。这个命题到底成不成立,现在有一千多个开放插件让你自己验证。

Logo

openEuler 是由开放原子开源基金会孵化的全场景开源操作系统项目,面向数字基础设施四大核心场景(服务器、云计算、边缘计算、嵌入式),全面支持 ARM、x86、RISC-V、loongArch、PowerPC、SW-64 等多样性计算架构

更多推荐