ChinaModelAPI

新闻 / 模型观察 · 工具生态

开源 DeepSeek Harness (dsh) 多模态 rc.7 / rc.8
2026-08-20 · 模型观察 · rc.7 发布于 08-17,rc.8 发布于 08-19 (UTC)

DeepSeek Harness 新增多模态图像输入——框架有了“眼睛”,模型却还没跟上

在开源 Harness v0.1 一周后,DeepSeek 接连发布了两个候选版本,将图像输入能力引入 Agent 运行时:rc.7(持久化图像附件)与 rc.8(DeepSeek 适配器的原生图像请求、支持 /goal/plan 图像输入)。海外分析师将该框架称为“第二个 DeepSeek 时刻”。本文将详解本次具体落地的特性、仍仅限纯文本的部分,以及 API 开发者该如何应对与使用。

更新 · 2026-08-21:DeepSeek 正式上线了 deepseek-v4-flash-vision-exp——即本文此前指出的官方所缺失的视觉模型。V4-Pro 仍仅支持纯文本。阅读包含定价、快速上手代码及模型路由指南的发布简报 →
核心结论

DeepSeek Harness 现在已支持端到端的图像流转——截至 8 月 21 日,DeepSeek 官方模型也终于能够读取图像。 根据官方发布说明: rc.7(8 月 17 日)为 MCP 和 ACP 添加了持久化图像附件,并在 PTC 模式下支持嵌套图像转发; rc.8(8 月 19 日)进一步拓展了多模态支持,提供针对 DeepSeek 适配器的可配置原生图像请求/goal/plan 的图像输入,以及 @ 菜单中的文件和会话引用。 在本文最初发布时(8 月 20 日),症结在于 V4-Pro 与 V4-Flash 仍为纯文本模型;8 月 21 日,DeepSeek 推出了 deepseek-v4-flash-vision-exp,这是 Flash 家族首个官方视觉模型——详见发布简报。V4-Pro 仍仅支持纯文本。 rc.8 当前发布在 npm 的 next 标签下(latest 仍为 rc.7),其全新的 SQLite 存储格式与旧版会话不兼容。

根据官方来源整理的更新内容

项目详情
rc.7 · 2026-08-17 12:01 UTCMCP 和 ACP 支持持久化图像附件,PTC 模式支持嵌套图像转发;插件可注册自定义设置卡片;Codex 与 Claude Code 子代理任务接入任务面板;DeepSeek 模型新增 low 思考强度档位(默认维持 high);英文预设“Code mode”更名为“PTC mode”
rc.8 · 2026-08-19 15:37 UTC多模态扩展:DeepSeek 适配器支持可配置的原生图像请求/goal / /plan 图像输入、@ 菜单支持文件与会话引用(由 @LegGasai 和 @CreatixChu 贡献);Claude Code 与 Codex 子代理可按需作为 Profile Bundles 安装;Windows PTY 支持持久化 PowerShell;支持并发 web_search;精简依赖下载体积;SQLite 后端速度更快且体积更小——存储格式不兼容;“DeepSeek Harness”正式声明为注册商标并发布品牌指南
值得关注的重要修复rc.8 修复了因图片尺寸过大或累计图像负载过多导致模型请求失败的问题——这正是包含大量图像的 Agent 循环中最常遇到的故障模式;同时修复了部分自定义 OpenAI 兼容网关因请求格式差异或缺少推理内容而报错的问题
npm 发行通道(检查于 08-20)latest → 0.1.0-rc.7;next → 0.1.0-rc.8。直接执行 npx @deepseek-ai/dsh 仍会解析到 rc.7;如需体验 rc.8 请使用 npx @deepseek-ai/dsh@next
代码仓库热度167,928 stars / 17,953 forks(GitHub API,检查于 2026-08-20)——相比 Turing Post 在 8 月 17 日文章中引用的 149,000+ 进一步增长

背景:Harness v0.1 于 8 月 13 日与 V4-Pro GA 同步开源——架构详情请参阅我们的 v0.1 发布简报(基于 Cordis 的“一切皆插件”架构、四种工作模式、MIT 协议)。

架构分工:框架管道与模型能力

  • 获得多模态能力的是运行时,而非模型本身。如今在 dsh 中粘贴一张图片,它可以在 MCP/ACP 工具调用间持久化保存,通过 PTC 模式程序转发,并随 /goal/plan 规划指令一同传递。这正是 v0.1 中缺失的关键底层管道能力——首发周的早期评测者之所以吐槽当时的工具栈,正是因为纯文本模型根本无法定位哪怕只有两行的视觉 UI Bug。
  • DeepSeek 自身的 API 模型在发稿时仍仅限纯文本——并在一天后上线了视觉能力。2026 年 8 月 21 日,DeepSeek 正式推出了 deepseek-v4-flash-vision-exp,这是 Flash 家族的一款实验性视觉模型,价格保持不变;V4-Pro 仍为纯文本模型。发稿时,自 8 月 13 日 V4-Pro GA 公告以来变更日志中未包含任何视觉相关更新,Hugging Face 上关于 V4-Pro 的一条热门讨论也曾抱怨其缺乏“如今 Qwen、Kimi 等其他国产旗舰模型均已具备的原生多模态能力”——而这次发布正好填补了 Flash 的这一空白。
  • 官方文档明确阐述了设计模式。仓库的排错指南指出:如果在发送前图片被拒,说明模型“声明不支持图像模态”——解决方法是在 $DSH_HOME/settings.yaml 的模型配置项中添加 input: [text, image]。换句话说:通过 DeepSeek 适配器或任意 OpenAI 兼容端点,为真正具备视觉能力的模型开启图像请求即可。
  • 社区插件此前已经在填补视觉能力的空白。modlens(自称 dsh 的首个视觉插件)允许用户在纯文本会话中粘贴图片并获取结构化的 JSON 证据反馈(OCR、版面布局、语义),其底层路由至视觉引擎池(支持免费的 Gemini Key、Antigravity CLI 或任意 OpenAI 兼容端点;其 README 演示了通过 DashScope 兼容模式调用 Qwen-VL)。类似的社区工具还包括 agent-vision-toolkit(图像问答、长截图 OCR、UI 还原、GUI 自动化)以及 dsh-vision-router。这些均为社区独立项目,非 DeepSeek 官方出品,质量参差不齐。

海外媒体与观点评述

  • Turing Post(8 月 17 日)发表了英文圈最犀利的观点:“DeepSeek 正在迎来它的第二个 DeepSeek 时刻。”其核心论点是:DeepSeek 凭借 R1 削弱了模型护城河;而通过 Harness(采用 MIT 协议,发稿时已获 149K+ stars),它正在“彻底打开大家原本视为下一道护城河的层级”——Agent 执行层。文章还梳理了 Cordis 与 Koishi 的渊源(由现就职于 DeepSeek 的 Shigma 开发的聊天机器人框架),Koishi 历经四年探索的插件生命周期问题,本质上正是 Agent 运行时要解决的问题。
  • 首周媒体报道(详见我们的 v0.1 简报):VentureBeat 将 dsh 评价为“Claude Code 的开源竞争对手”;The Decoder 深度剖析了其技术架构及项目负责人崔天意(前 Jane Street 量化工程师);36氪的一夜实测发现 24 小时内涌现了 288 个插件仓库;Pandaily 则将其概括为“模型 + Harness = Agent”。
  • rc.7/rc.8 版本发布本身在最初 48 小时内主要由版本日志关注者和插件生态开发者追踪,而非主流媒体——第三方指南(chat-deep.ai、dshdocs.com、freedom.tech)在一天内就记录了“持久化图像附件”这一更新。如果你持续关注该项目动态,建议直接阅读发布说明,而非只看新闻头条。
  • 在 X 平台上,官方公告推文(@deepseek_ai,8 月 13 日)和维护者 @tianyi 的推文仍是权威渠道;modlens 作者 @liustack 也会第一时间在 X 上发布更新说明——这也印证了该生态的重心始终在代码仓库和 X 上,而非传统博客。

这对国产模型技术栈意味着什么

  • 框架本身免费,图像 Token 成为新的成本变量。随着 V4-Pro 实行闲忙时分时计价(根据 The Decoder 对官方定价页面的解读,闲时每 100 万 Token 输入 $0.66 / 输出 $1.98,忙时 $1.32 / $3.96),Agent 循环的成本重心已转移至图像处理环节。将视觉子调用路由至廉价的视觉模型,同时由文本模型驱动代码循环,这正是 dsh 插件模型层所专为构建的多模型协作范式。
  • rc.8 的网关修复与中转用户直接相关。本次发布修复了自定义 OpenAI 兼容网关因请求格式差异报错或丢弃推理内容的问题——任何将 dsh 指向第三方中转端点而非官方直连 Key 的开发者都很容易遇到这类 Bug。在怀疑框架问题之前,建议先在 rc.8 上测试你的端点兼容性。
  • 破坏性变更的迭代节奏正在如期发生。v0.1 曾预告会有不兼容的破坏性更新;rc.8 便带来了一项(SQLite 存储格式不兼容)。建议锁定你的 dsh 版本,避免将旧会话数据直接带入升级流程,并在每次升级 rc 版本后重新验证——该分支仍在全力冲刺稳定的 0.1.0 版本。
  • 品牌规范正式确立。rc.8 的发布说明明确指出“DeepSeek Harness”为注册商标并发布了品牌指南——插件作者和工具开发者在为衍生项目命名之前应仔细阅读相关规范。
  • 独立项目定位。dsh 是 DeepSeek 的开源项目。ChinaModelAPI 是独立的 OpenAI 兼容 API 中转服务,与 dsh 或 DeepSeek 均无官方关联——二者在实际应用中的交集在于,模型无关的框架是多模型路由的天然客户端,在接入之前建议先在服务商后台控制台中实时验证视觉模型的 Model ID。

一手信息来源

FAQ

dsh 现在支持读取图片了吗?

框架已支持流转图片——支持粘贴、持久化、转发以及在规划中使用。但真正的图像读取仍依赖模型本身:V4-Pro / V4-Flash 目前仍为纯文本模型,因此需要通过适配器配置或 OpenAI 兼容端点,将视觉处理步骤指向具备视觉能力的模型。

如何体验 rc.8?

npx @deepseek-ai/dsh@next——latest 标签当前仍会解析到 rc.7。rc.8 的 SQLite 存储格式与旧版会话不兼容;建议全新安装后重新添加你的服务商配置。

Vision-Exp 已上线——那 V4-Pro 呢?

deepseek-v4-flash-vision-exp 已于 2026 年 8 月 21 日上线——我们的发布简报汇总了定价、快速上手与使用限制。V4-Pro 的视觉支持仍未公布。

如果是自建/私有网关该怎么处理?

完全支持且稳定性进一步增强——rc.8 修复了自定义 OpenAI 兼容网关上的请求格式及缺失推理内容的报错问题。在支持图像的模型上声明 input: [text, image],dsh 即可原生发送图像请求。

相关指南