新闻 / 模型观察 · 工具生态
DeepSeek Harness v0.1:DeepSeek 正式开源其 Agent 运行框架
在推出 DeepSeek-V4-Pro-0813 数小时后,DeepSeek 发布了开发者预览版 Harness v0.1 —— 这是其用于对自身模型进行基准测试、基于 MIT 协议开源的 Agent 框架。海外媒体迅速将其定调为对抗 Claude Code 与 OpenAI Codex 的开源竞品。本文将深入解析它的真实定位、早期上手评测的实际反馈,以及 API 开发者能从中获得的启示。
更新 · 2026-08-20:Harness 迈出了多模态的第一步 —— rc.7(8 月 17 日)为 MCP/ACP 增加了持久化图片附件支持;rc.8(8 月 19 日)为 DeepSeek 适配器引入了可配置的原生图片请求,并为 /goal 与 /plan 增加了图片输入支持。DeepSeek 的 V4 模型目前仍仅支持纯文本。阅读后续快讯 →
DeepSeek Harness(dsh)是一款免费、基于 MIT 协议开源、支持本地运行的 Agent 框架 —— 且具备完全的模型无关性(Model-agnostic)。
由 DeepSeek 官方 X 账号 于 2026 年 8 月 13 日(21:02 UTC+8)宣布,并发布于
github.com/deepseek-ai/deepseek-harness。
在 Cordis 插件系统之上,工具、沙箱、会话、UI 等所有模块皆为可插拔插件。可通过
npx @deepseek-ai/dsh web 启动(Web UI 运行于 127.0.0.1:3080)。
目前为 v0.1 开发者预览版,明确提示后续将包含破坏性变更 —— 建议用于评估测试,暂勿直接用于生产环境。
根据官方来源整理的更新内容
| 项目 | 详情 |
|---|---|
| 项目概述 | DeepSeek Harness v0.1 —— 开源 Agent 框架(dsh)开发者预览版 |
| 发布时间 | 2026-08-13 21:02(UTC+8)于 X 官宣;开源仓库同日当晚公开 |
| 开源协议 | MIT |
| 架构设计 | 基于 Cordis 的“万物皆插件”;工具 / 沙箱 / 会话 / UI 全面支持替换 |
| 启动方式 | npx @deepseek-ai/dsh web → 本地 Web UI 地址:127.0.0.1:3080 |
| 版本注意事项 | 处于高速迭代期;README 明确提示“将包含破坏兼容性的变更(THERE WILL BE COMPATIBILITY-BREAKING CHANGES)” |
| 官方文档关联 | DeepSeek 的 API 更新日志指出,V4-Flash 的公开基准测试均在 Harness 的“极简模式(minimal mode)”下运行;官方文档侧边栏现已接入 Harness 文档链接 |
同日当晚,DeepSeek-V4-Pro-0813 在 App/Web/API 全面正式上线(GA),支持原生 Responses API 并完成 Codex 适配 —— 详见我们的 0813 发布快讯;高峰/低谷阶梯价格调整将于 UTC 时间 8 月 16 日 16:00 生效。
海外媒体与观点评述
- VentureBeat 直击发布核心:将其定位为与“提价后的”API 端 V4-Pro 一同推出的 “Claude Code 的开源竞品” —— 这也是本周的一体两面叙事:工具层更亲民,旗舰 Token 更昂贵。
- The Decoder 重点剖析了其架构与团队背景:基于新发布的 Cordis 系统实现“全功能可插拔”;持久化会话日志记录每一次 Prompt、工具调用与返回结果,运行轨迹支持恢复、分支创建与回放;极简模式仅保留 Shell 与文件编辑器 —— 这正是 DeepSeek 自身用于基准测试的配置。报道还指出项目负责人为 崔天翼(Cui Tianyi),他于 2026 年 3 月从 Jane Street 加入 DeepSeek,且此前的封测招募在三天内吸引了 712 份申请。
- 36氪英文版(36Kr English)连夜发布了上手体验,给出了极其犀利的论断 —— “它不只是又一个 Claude Code,它正是为击败 Claude Code 而来” —— 并列举了具体实测发现:四种工作模式(标准模式;PTC 模式,即模型编写 TypeScript 将约 10 轮工具调用合并为单次执行;用于基准测试的极简模式;以及用于构建新模式的创作模式);仅追加(append-only)的轨迹日志;24 小时内涌现 288 个插件仓库;得益于 Cordis 的可逆副作用追踪机制,支持热插拔 20 多个插件而无需重启;并且从 Claude Code、opencode 与 Antigravity 导入会话“体验极其丝滑”。其最犀利的观察在于:模型在系统中没有任何特权地位 —— “即使 DeepSeek 自己的模型也不例外,它们不过是另一个普通插件罢了。”
- Pandaily 称其可能是“今年最具野心的 Agent 开源项目”,并将其核心逻辑总结为公式:Model + Harness = Agent。
- Reddit(r/LocalLLaMA、r/DeepSeek)迅速关注了该仓库;社区讨论重点提及了其 Desktop/CLI 版本,以及 DeepSeek 官方公布的所有 Agent 基准测试均通过该 Harness 运行的事实。
- 南华早报(SCMP)此前曾报道 DeepSeek“通过 Harness 测试强化 Agent AI 能力” —— 这一背景有力地印证了本次开源是早有布局,而非仓促之举。
这对国产模型技术栈意味着什么
- Harness 本身免费,Token 才是核心成本。随着 V4-Pro 转向高峰/低谷定价(根据 The Decoder 对官方价格页的解读:低谷期每 100 万 Token 输入 $0.66 / 输出 $1.98;高峰期翻倍;缓存命中价格涨幅最大),Agent 循环调用的经济模型促使批量任务转向更便宜的开源权重模型。这正是兼容 OpenAI 协议的多模型网关大显身手的场景。
- 原生支持模型无关(Model-agnostic)。模型层完全以插件形式存在,社区路由插件也已上线。将
dsh指向兼容 OpenAI 的接口端点(如 DeepSeek、Qwen、GLM、Kimi 系列)属于官方推荐的标准用法而非曲线方案 —— 请务必核对各供应商的服务条款及各模型对工具调用(tool-calling)的支持情况。 - 轨迹日志带来全新调试体验。具备恢复、分支创建与回放功能的仅追加(append-only)日志让长周期的 Agent 运行过程清晰可溯 —— 当你在 A/B 测试哪款国产前沿模型最适合处理仓库级任务时,这一特性极具价值。
- 会话导入显著降低迁移成本。如果你积累了 Claude Code 或 opencode 的历史记录,36氪的实测表明你可以直接无缝导入 —— 在你评估下一代 Harness 技术选型时,这一点值得重点参考。
- 暂不建议直接迁移至生产环境。当前仍为 v0.1 预览版且后续存在破坏性变更,许多交互体验目前仍依赖迭代极快但质量参差不齐的社区插件。建议先在沙箱中测试、运行基准评测,待 v0.2+ 版本后再行评估。
一手信息来源
- github.com/deepseek-ai/deepseek-harness(官方仓库:MIT 协议、开发者预览版、Cordis、运行指南)
- DeepSeek 官方 X 动态 —— Harness v0.1 开发者预览版发布公告(2026-08-13)
- DeepSeek API 更新日志 —— V4-Pro-0813 正式上线(GA)、Harness 极简模式评测说明、8 月 16 日定价变更
- The Decoder —— DeepSeek 发布升级版 V4 Pro、上调 API 价格并开源其 Agent 软件
- VentureBeat —— DeepSeek Harness 作为 Claude Code 的开源竞品正式发布
- 36氪英文版 —— 连夜通测 DeepSeek Harness(四种模式、插件生态、会话导入)
- Pandaily —— DeepSeek Harness 上手评测:四种工作模式,Model + Harness = Agent
- 南华早报(SCMP) —— DeepSeek 通过 Harness 测试强化 Agent AI 能力(发布前背景)
FAQ
DeepSeek Harness 是免费的吗?
Harness 本身完全免费且采用 MIT 协议开源。你需要支付的是模型 Token 费用 —— 无论是通过 DeepSeek 官方 API,还是路由至任何兼容 OpenAI 协议的提供商。
Claude Code 杀手?
海外上手评测反响热烈但评价客观:目前为 v0.1 版本,未来有破坏性变更,且插件质量参差不齐。这是前沿实验室推出的首个具备基准测试级底层的开源 Harness —— 它是实力强劲的有力竞争者,但目前尚不能完全取而代之。
可以搭配 Qwen / GLM / Kimi 使用吗?
从架构上看完全支持 —— 模型层本身只是一个插件,且已有社区路由插件。请务必确认各提供商的工具调用(tool-calling)支持情况与服务条款;ChinaModelAPI 用户建议在控制台中确认当前可用的模型 ID。
什么是“极简模式(minimal mode)”?
仅保留 Shell 与文件编辑器,剥离所有花哨功能 —— 这正是 DeepSeek 用来评测模型原生纯净性能的基准配置。当你需要跨模型对比公平数据时,可使用该模式。