ChinaModelAPI

新闻 / 模型观察 · 工具生态

开源 DeepSeek Harness (dsh) Agent 运行框架 MIT
2026-08-14 · 模型动态 · 发布于 2026-08-13 晚(UTC+8)

DeepSeek Harness v0.1:DeepSeek 正式开源其 Agent 运行框架

在推出 DeepSeek-V4-Pro-0813 数小时后,DeepSeek 发布了开发者预览版 Harness v0.1 —— 这是其用于对自身模型进行基准测试、基于 MIT 协议开源的 Agent 框架。海外媒体迅速将其定调为对抗 Claude Code 与 OpenAI Codex 的开源竞品。本文将深入解析它的真实定位、早期上手评测的实际反馈,以及 API 开发者能从中获得的启示。

更新 · 2026-08-20:Harness 迈出了多模态的第一步 —— rc.7(8 月 17 日)为 MCP/ACP 增加了持久化图片附件支持;rc.8(8 月 19 日)为 DeepSeek 适配器引入了可配置的原生图片请求,并为 /goal/plan 增加了图片输入支持。DeepSeek 的 V4 模型目前仍仅支持纯文本。阅读后续快讯 →

核心结论

DeepSeek Harness(dsh)是一款免费、基于 MIT 协议开源、支持本地运行的 Agent 框架 —— 且具备完全的模型无关性(Model-agnostic)。DeepSeek 官方 X 账号 于 2026 年 8 月 13 日(21:02 UTC+8)宣布,并发布于 github.com/deepseek-ai/deepseek-harness。 在 Cordis 插件系统之上,工具、沙箱、会话、UI 等所有模块皆为可插拔插件。可通过 npx @deepseek-ai/dsh web 启动(Web UI 运行于 127.0.0.1:3080)。 目前为 v0.1 开发者预览版,明确提示后续将包含破坏性变更 —— 建议用于评估测试,暂勿直接用于生产环境。

根据官方来源整理的更新内容

项目详情
项目概述DeepSeek Harness v0.1 —— 开源 Agent 框架(dsh)开发者预览版
发布时间2026-08-13 21:02(UTC+8)于 X 官宣;开源仓库同日当晚公开
开源协议MIT
架构设计基于 Cordis 的“万物皆插件”;工具 / 沙箱 / 会话 / UI 全面支持替换
启动方式npx @deepseek-ai/dsh web → 本地 Web UI 地址:127.0.0.1:3080
版本注意事项处于高速迭代期;README 明确提示“将包含破坏兼容性的变更(THERE WILL BE COMPATIBILITY-BREAKING CHANGES)”
官方文档关联DeepSeek 的 API 更新日志指出,V4-Flash 的公开基准测试均在 Harness 的“极简模式(minimal mode)”下运行;官方文档侧边栏现已接入 Harness 文档链接

同日当晚,DeepSeek-V4-Pro-0813 在 App/Web/API 全面正式上线(GA),支持原生 Responses API 并完成 Codex 适配 —— 详见我们的 0813 发布快讯;高峰/低谷阶梯价格调整将于 UTC 时间 8 月 16 日 16:00 生效。

海外媒体与观点评述

  • VentureBeat 直击发布核心:将其定位为与“提价后的”API 端 V4-Pro 一同推出的 “Claude Code 的开源竞品” —— 这也是本周的一体两面叙事:工具层更亲民,旗舰 Token 更昂贵。
  • The Decoder 重点剖析了其架构与团队背景:基于新发布的 Cordis 系统实现“全功能可插拔”;持久化会话日志记录每一次 Prompt、工具调用与返回结果,运行轨迹支持恢复、分支创建与回放;极简模式仅保留 Shell 与文件编辑器 —— 这正是 DeepSeek 自身用于基准测试的配置。报道还指出项目负责人为 崔天翼(Cui Tianyi),他于 2026 年 3 月从 Jane Street 加入 DeepSeek,且此前的封测招募在三天内吸引了 712 份申请
  • 36氪英文版(36Kr English)连夜发布了上手体验,给出了极其犀利的论断 —— “它不只是又一个 Claude Code,它正是为击败 Claude Code 而来” —— 并列举了具体实测发现:四种工作模式(标准模式;PTC 模式,即模型编写 TypeScript 将约 10 轮工具调用合并为单次执行;用于基准测试的极简模式;以及用于构建新模式的创作模式);仅追加(append-only)的轨迹日志;24 小时内涌现 288 个插件仓库;得益于 Cordis 的可逆副作用追踪机制,支持热插拔 20 多个插件而无需重启;并且从 Claude Code、opencode 与 Antigravity 导入会话“体验极其丝滑”。其最犀利的观察在于:模型在系统中没有任何特权地位 —— “即使 DeepSeek 自己的模型也不例外,它们不过是另一个普通插件罢了。”
  • Pandaily 称其可能是“今年最具野心的 Agent 开源项目”,并将其核心逻辑总结为公式:Model + Harness = Agent
  • Reddit(r/LocalLLaMA、r/DeepSeek)迅速关注了该仓库;社区讨论重点提及了其 Desktop/CLI 版本,以及 DeepSeek 官方公布的所有 Agent 基准测试均通过该 Harness 运行的事实。
  • 南华早报(SCMP)此前曾报道 DeepSeek“通过 Harness 测试强化 Agent AI 能力” —— 这一背景有力地印证了本次开源是早有布局,而非仓促之举。

这对国产模型技术栈意味着什么

  • Harness 本身免费,Token 才是核心成本。随着 V4-Pro 转向高峰/低谷定价(根据 The Decoder 对官方价格页的解读:低谷期每 100 万 Token 输入 $0.66 / 输出 $1.98;高峰期翻倍;缓存命中价格涨幅最大),Agent 循环调用的经济模型促使批量任务转向更便宜的开源权重模型。这正是兼容 OpenAI 协议的多模型网关大显身手的场景。
  • 原生支持模型无关(Model-agnostic)。模型层完全以插件形式存在,社区路由插件也已上线。将 dsh 指向兼容 OpenAI 的接口端点(如 DeepSeek、Qwen、GLM、Kimi 系列)属于官方推荐的标准用法而非曲线方案 —— 请务必核对各供应商的服务条款及各模型对工具调用(tool-calling)的支持情况。
  • 轨迹日志带来全新调试体验。具备恢复、分支创建与回放功能的仅追加(append-only)日志让长周期的 Agent 运行过程清晰可溯 —— 当你在 A/B 测试哪款国产前沿模型最适合处理仓库级任务时,这一特性极具价值。
  • 会话导入显著降低迁移成本。如果你积累了 Claude Code 或 opencode 的历史记录,36氪的实测表明你可以直接无缝导入 —— 在你评估下一代 Harness 技术选型时,这一点值得重点参考。
  • 暂不建议直接迁移至生产环境。当前仍为 v0.1 预览版且后续存在破坏性变更,许多交互体验目前仍依赖迭代极快但质量参差不齐的社区插件。建议先在沙箱中测试、运行基准评测,待 v0.2+ 版本后再行评估。

一手信息来源

FAQ

DeepSeek Harness 是免费的吗?

Harness 本身完全免费且采用 MIT 协议开源。你需要支付的是模型 Token 费用 —— 无论是通过 DeepSeek 官方 API,还是路由至任何兼容 OpenAI 协议的提供商。

Claude Code 杀手?

海外上手评测反响热烈但评价客观:目前为 v0.1 版本,未来有破坏性变更,且插件质量参差不齐。这是前沿实验室推出的首个具备基准测试级底层的开源 Harness —— 它是实力强劲的有力竞争者,但目前尚不能完全取而代之。

可以搭配 Qwen / GLM / Kimi 使用吗?

从架构上看完全支持 —— 模型层本身只是一个插件,且已有社区路由插件。请务必确认各提供商的工具调用(tool-calling)支持情况与服务条款;ChinaModelAPI 用户建议在控制台中确认当前可用的模型 ID。

什么是“极简模式(minimal mode)”?

仅保留 Shell 与文件编辑器,剥离所有花哨功能 —— 这正是 DeepSeek 用来评测模型原生纯净性能的基准配置。当你需要跨模型对比公平数据时,可使用该模式。

相关指南