DeepSeek Harness 开源两天,我装了这 8 个插件

DeepSeek Harness 开源两天,我装了这 8 个插件

DSH v0.1 开发者预览版发布两天,GitHub 上冒出七百多个社区插件。我从中筛选了八个覆盖核心场景的插件:Web UI 全家桶、视觉工具包、搜索引擎、多 Agent 协作、桌面操作、跨会话记忆、上下文体检和轨迹调试。

发布于 2026/08/15
更新于 2026/08/23
17 分钟阅读
51 次阅读

DeepSeek Harness 开源两天,我装了这 8 个插件

8 月 13 号晚上八点五十二分,DeepSeek 把 Harness 的源码丢上了 GitHub。MIT 协议,一行命令启动。
说实话,v0.1 的开发者预览版,体验粗糙的地方不少。让我收回那句话的,是它的插件生态。两天时间,GitHub 上冒出了七百多个社区插件。这个速度在 AI 工具圈里前所未有。

原因很简单。DeepSeek 做了一个激进的决定,"Everything is a plugin"。模型适配器是插件,工具注册表是插件,会话日志是插件,Agent 循环本身也是插件。它用了一个叫 Cordis 的框架,让所有能力都可以被替换、组合、堆叠。

这意味着社区不是在给一个产品做锦上添花的扩展。社区在参与定义这个产品是什么

我花了两天时间翻了那些仓库,装了大概三十多个插件,删掉了二十多个,最后留下了八个。它们覆盖了我日常用 DSH 的核心场景。分享给你。


1. dsh-web-ui —— 一个人的全家桶

GitHub: zhu1090093659/dsh-web-ui
Star: 2.3k

DSH 原生的 Web UI 能用,但只是"能用"。没有文件预览面板,没有 Git 变更视图,没有任务管理,移动端也没法远程。dsh-web-ui 把这些全补上了。

让我最意外的是任务看板。它不是一个花架子的 TODO 列表。你在卡片上点"执行",任务会由真实的 DSH Agent 会话去跑。跑完了状态自动回写。你甚至可以配 cron 表达式让任务定时启动。比如每天 23 点自动升级 DSH,每周一 9 点跑周报。这东西直接把 DSH 从"对话工具"变成了"工作台"。

Git 图谱也做得不错。分支泳道加提交历史可视化,切分支不用再开终端。右侧面板支持多标签预览 Markdown、HTML、代码、diff、CSV、PDF、Office 文件,还能分屏编辑。

然后是鲸鱼娘宠物。她会跟随 Agent 的状态切换动画。Agent 在思考,她在吐泡泡。Agent 在等你输入,她在打瞌睡。你可以摸她头。可以投喂小鱼干。亲密度从幼鲸一路成长到"深海羁绊"。

我知道这听起来很蠢。但你试试在深夜 debug 到第三个小时的时候,屏幕角落有一只鲸鱼在陪你工作。那个感受不一样。

另外,皮肤中心提供 10 款主题皮肤。有一款 Windows XP Luna 复古主题。有一款"鲸吟"深海女神主题。每一款都支持试穿再应用。

最实用的功能是移动端远程。侧边栏扫码配对后,手机变成 DSH 的远程控制器。可以在手机上收发消息、切换模型、调整权限。出门在外也能盯着 Agent 干活。


2. dsh-vision-toolkit —— 给纯文本模型装上眼睛

GitHub: Anionex/dsh-vision-toolkit
Star: 389

DeepSeek 的模型是纯文本的。这在大多数编码场景里不是问题。直到你需要它看一张截图、比对两个 UI、或者从一张手绘草图还原出界面。

dsh-vision-toolkit 做的事情是,把视觉当作一组可调用的工具,而不是模型本身的属性。它提供 10 个独立的视觉工具,每一个都有明确的输入输出契约。

我最常用的三个

vision_glance 是基础图片问答。你丢给它一张截图,问"这个报错是什么意思",它会通过配置的 VLM(默认 Gemini 3.6 Flash,也可以换成 GLM-4V、GPT-4o 或者本地 Ollama)给出回答。只有文本回答进入会话,图片本身不会占你上下文。

vision_pixel_diff 是像素级对比。你做前端还原的时候,把设计稿和实现截图丢进去,它会生成热力图告诉你哪些区域有差异,精确到百分比。仓库里有个 demo,初始差异 6.04%,迭代到 0%。这个工具让"像素级还原"这个词从 slogan 变成了可验证的标准。

vision_html_screenshot 是本地 HTML 渲染截图。它会启动一个无头 Chrome 来渲染你的 HTML 文件并截图。搭配 pixel_diff 用,就组成了一个完整的视觉验证循环——写代码、截图、比对、修改、再截图、再比对,直到差异归零。

整个插件的设计哲学值得学习。它不是一股脑把所有工具暴露给模型。初始状态下模型只能看到一个 vision_toolkit_activate 引导工具。只有当你确实需要视觉能力时,十个工具才会挂载到当前 Agent 的 schema 里。这叫"渐进式暴露"。不用的时候不占模型的注意力。


3. dsh-web-search-pro —— 搜索引擎的瑞士军刀

GitHub: anweat/dsh-web-search-pro

DSH 自带的搜索能力……怎么说呢,够用但不够好。dsh-web-search-pro 的做法是把多个搜索引擎做成可组合的后端,然后让你按需配置路由。

支持的引擎列表很长。通用搜索有 DDG、Bing、Exa、Jina、DeepSeek 自家的搜索 seam。垂直平台搜索有 GitHub、Bilibili、YouTube、V2EX、小红书、Twitter、Reddit、RSS。你还可以用 YAML 配置自定义任意平台,只要给出 URL 模板和 CSS 选择器,它就能搜。

更聪明的是缓存设计。SQLite + LRU 双层缓存,相同查询在 TTL 内不会重复请求。对于 API 有调用限制的引擎,这能省不少额度。

它还集成了 Playwright 做页面渲染。有些网站搜索结果是 JS 动态加载的,普通 HTTP 请求拿不到。这个插件会自动用浏览器去渲染再提取内容。

最让我惊喜的是自定义平台。我配了一个"我的 B 站"搜索,带 cookie 登录态的,从此 Agent 可以搜我的 B 站收藏夹里的视频了。想象空间很大。


4. dsh-agent-teams —— 让多个 Agent 协作干活

GitHub: NanmiCoder/dsh-agent-teams

单 Agent 有天花板。复杂项目里,你经常希望有一个 Agent 负责规划,一个负责写代码,一个负责 review,一个负责跑测试。但 DSH 原生的 subagent 机制太底层了,配置起来很麻烦。

dsh-agent-teams 把这件事做成了"组建团队"。

你在 Web UI 的管理面板里创建一个 team。给每个 member 配不同的模型、不同的工具权限、不同的人格设定。然后你可以用自然语言给团队发任务,它们会自己分工。

核心设计是这样的。team 里的每个 member 都是一个可持续的 DSH 子 Agent,可以被唤醒继续上次的对话。成员之间通过邮箱系统互发消息。任务有明确的状态流转和依赖关系,上游任务没完成,下游任务不能被 claim。

一个我实际在用的场景。我让一个 planner agent 先拆分需求,生成任务卡片。然后两个 coder agent 并行开发不同模块。开发完了,一个 reviewer agent 做 code review。最后一个 tester agent 跑集成测试。整个流程跑通之后,我只需要看最终的 review 意见和测试报告就行。

它把"一个人带一群 AI 干活"变成了可操作的现实。


5. dsh-computer-use —— 操作桌面,不抢鼠标

GitHub: Anionex/dsh-computer-use

Anthropic 搞的 Computer Use 有个问题,它要接管你的鼠标和键盘。你不能同时用电脑。这在演示里看着很酷,实际工作中很烦。

dsh-computer-use 换了一个思路。它走 macOS 的辅助功能(Accessibility)API,在后台操作应用窗口。你的鼠标不会被抢走。Agent 在后台打开 Chrome 查东西、在另一个窗口填表单、甚至在 Finder 里整理文件。你可以同时在前台继续写代码。

它还有一个"应用租约"机制。Agent 要操作某个应用之前,必须先获得租约。租约有时间限制,到期自动释放。这意味着 Agent 不会悄悄霸占你的某个应用。

安全设计也值得说一下。每个可能有副作用的操作都需要确认。它有"陈旧观察保护",如果 Agent 上次看到的窗口状态已经过时了(你手动操作过了),它会先重新截图确认当前状态,而不是基于过时的认知瞎点。

目前只支持 macOS。


6. dsh-mneme —— 跨会话记忆,掌控在自己手里

GitHub: dsh-mneme

AI 工具最让人抓狂的事情之一就是记忆。每次新开会话,之前聊过什么全忘了。很多工具的解法是把记忆存在云端,但那是它们的云端,不是你的。

dsh-mneme 的哲学是"记忆主权"。所有记忆存在本地。SQLite 是数据库,但同时它还维护了一份人类可编辑的 Markdown 镜像文件。你用任何文本编辑器都能直接看到、修改 Agent 记住的东西。

它有六个记忆工具。Agent 可以在对话中主动记住关键信息,也可以搜索过去的记忆。但最聪明的部分叫 autoDream,一个后台自动整理流程。它会在你不用的时候,把碎片化的记忆条目聚类、归纳、压缩,就像人在睡眠中整理白天的记忆一样。

语义搜索是完全离线的。本地 embedding、本地 reranking、本地 clustering。不需要调任何外部 API。这意味着你的记忆数据永远不会离开你的机器。

对我来说最重要的场景是项目记忆。我在项目 A 里做了一个架构决策,两周后在项目 B 里遇到类似问题,Agent 可以搜出来当时的上下文和决策理由。不用我再解释一遍。


7. dsh-context-doctor —— 给上下文做体检

GitHub: dsh-context-doctor(见 awesome 列表)

这是一个"你不知道你需要,直到你用过一次就再也回不去"的插件。

DSH 的 Agent 每次发请求给模型,会带上一堆东西。AGENTS.md 里的系统指令,所有已安装 Skill 的描述,所有已挂载工具的 schema,历史消息,注入的记忆……这些东西加起来有多少 token?哪些在浪费空间?有没有重复或冲突?

dsh-context-doctor 回答的就是这些问题。

它在 Web UI 里加了一个仪表盘。一个环形图展示当前上下文的 token 构成。一个面板详细列出每个组件的开销。比如你可能发现,你装的某个插件的工具描述就占了 2000 token,但你这个项目根本用不到它。

更有价值的是它的冲突检测。如果两个插件注册了名字相近的工具,或者两段 AGENTS.md 的指令互相矛盾,它会高亮告诉你。配合可操作的裁剪建议,"这个工具三天没被调用过了,考虑在这个项目里关掉它?"直接帮你优化 token 支出。

在模型按 token 计费的世界里,这个插件能帮你省钱。更重要的是,精简的上下文意味着更精准的 Agent 行为。模型不用在一堆无关的指令和工具里做选择了。

安装它之后我才意识到,我之前有多少 token 在"空转"。


8. dsh-trajectory-debug —— 回放、断点、分叉对比

GitHub: dsh-trajectory-debug(见 awesome 列表)

这可能是八个插件里最"开发者向"的一个。但如果你是重度 DSH 用户,它的价值不可替代。

Agent 执行任务的过程是一条轨迹。每一步思考、每一次工具调用、每一个决策分叉。DSH 原生的 Trajectory 视图只是把它们线性展示出来。dsh-trajectory-debug 在此基础上加了三个东西。

第一是瀑布图。它把 Agent 的执行过程可视化成一个时间线瀑布,每个工具调用的开始和结束时间、耗时、状态一目了然。你能立刻看出哪一步是瓶颈。

第二是确定性回放加断点。你可以选择轨迹中的任何一个节点,打断点,然后从那个节点重新开始执行。模型的输入和之前一模一样,但你可以改掉那个节点之后的指令或工具结果,看看 Agent 会不会走上不同的路径。

第三是分叉对比。从同一个断点出发,走两条不同的路,然后并排对比结果。这在调试复杂 Agent 行为的时候极其有用。"Agent 为什么选了 A 不选 B?"你可以强制让它走 B,看看结果有什么不同。

还有性能分析。每一步的 token 消耗、延迟、工具成功率都有统计。你可以量化地知道你的 Agent 工作流哪里效率高、哪里在浪费。


写在最后

两天时间,七百多个插件。

DeepSeek 做 Harness 的方式和其他人不一样。Claude Code 是一个产品。Cursor 是一个产品。它们可以扩展,但骨架是固定的。DSH 不是一个产品。DSH 是一套乐高积木的接口规范。产品是什么样子,社区来决定。

这当然有风险。插件质量参差不齐,兼容性问题一定会来,生态碎片化也可能发生。v0.1 的粗糙也意味着接口随时可能 breaking change。

但如果你回想一下 VS Code 刚出来的时候,那时候也有人说它太简陋了,Sublime 和 WebStorm 才是正经编辑器····

插件生态的护城河不是技术深度。是网络效应。一旦开发者的注意力和代码贡献开始在一个平台上累积,这个雪球就很难停下来

评论区

欢迎留下你的看法,支持匿名评论。

你的评论会公开展示,建议填写便于交流的昵称,并尽量提供有信息量的反馈。