新闻 / 模型观察 · 官方发布 + 开发者指南
DeepSeek-V4-Flash-Vision-Exp (2026):官方发布、定价与开箱即用的 API 快速入门
在鲸鱼吉祥物预热两天后、模型名称在灰度发布 API 列表中泄露一天后,DeepSeek 正式将其变为现实:实验性多模态视觉理解模型 deepseek-v4-flash-vision-exp 已于 2026 年 8 月 21 日在官方 API 正式上线。文本质量与 V4-Flash 持平;多模态 Agent 能力达到“接近 Opus-4.8”的水平;定价与 V4-Flash 保持一致;同时还同步推出了全新的 Files API。本指南涵盖了发布时间线、对比西方视觉模型的定价测算、可直接运行的快速入门代码,以及各类工作负载应如何路由至对应的 DeepSeek 模型。
更新(9 月 2 日):下文的「仅支持 API」表述已成历史——2026 年 8 月 31 日 DeepSeek 已以 MIT 协议开源 Vision-Exp 权重(无门槛下载)。本文保留为发布当日记录;私有化部署请阅读跟进稿:DeepSeek Vision-Exp 开源权重(英文)。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 官方模型,于 2026 年 8 月 21 日发布,详见 2026-08-21 的 API 更新日志。
调用时指定 model='deepseek-v4-flash-vision-exp';支持通过 base64、外部 URL 或全新的 Files API 传入文本 + 图像,适用于 Chat Completions、兼容 Anthropic 的 Messages API 以及 Responses API。
据官方 定价页面 显示,其定价与 V4-Flash 完全一致 —— 闲时每 1M 输入 tokens $0.22(忙时 $0.44) —— 且每张图片计费 最多 384 tokens。
DeepSeek Harness v0.1.1-rc.1 原生支持该模型。
从预热到上线:72 小时时间线
| 发布时间 | 事件进展 · 来源 |
|---|---|
| 6 月 18 日 | DeepSeek App/Web 端上线图像视觉能力(仅限产品端,未开放 API 模型)。研究人员在 X 上发帖:“视觉功能现已在网页端和 App 端上线。” |
| 8 月 3 日–4 日 | 社区不愿等待:WebBrain 的 DeepSeek-V4-Flash-Vision-NVFP4 MoonViT 适配器和 FlyCockpit 的 0731-vision 陆续登陆 Hugging Face(详见下文)。 |
| 8 月 19 日–20 日 | DeepSeek 多模态研究员 Xiaokang Chen 在 X 上发布了鲸鱼睁眼的预热帖“Now, we see you. 👀” —— TestingCatalog 推测这与即将推出的视觉模型相关。 |
| 8 月 20 日 | 确切的模型 ID 在灰度中曝光:显示 deepseek-v4-flash-vision-exp 的 API 模型列表截图在 X(@NFT_Chen)和 DeepSeek Harness 代码中流传 —— 当时文档尚未更新。 |
| 8 月 21 日(晚 UTC+8) | 官方正式发布。更新日志新增“DeepSeek-V4-Flash-Vision-Exp Release”(2026-08-21);定价页、Vision 指南和 Files API 指南上线;微信公众号官方发布公告(一小时内媒体纷纷报道);DeepSeek Harness v0.1.1-rc.1 加入原生支持。 |
编者注:本文在 8 月 21 日上午发布前发布的较早版本曾得出结论称不存在官方模型 —— 在当时确实如此(文档中没有记录;该名称仅处于灰度发布状态),但到了晚上情况发生了变化。当天突袭发布正是我们为每一项结论标注时间戳的原因。
根据官方文档,本次发布了哪些内容
- 模型本身。实验性视觉理解模型;
model='deepseek-v4-flash-vision-exp'。官方定位:文本质量“与官方 DeepSeek-V4-Flash 持平”,多模态 Agent 能力“接近 Opus-4.8”。V4-Pro 暂未获得视觉能力 —— 目前这仍是 Flash 系列专属。 - 传入图片的三种方式。行内 Base64
data:URL;公开外部图片 URL(上限 8,192 字符,60 秒下载超时);或 Files API —— 上传一次,后续直接引用file_id。支持全部三个端点:兼容 OpenAI 的 Chat Completions、兼容 Anthropic 的 Messages(Files API 需要添加anthropic-beta: files-api-2025-04-14请求头)以及 Responses。 - 图片限制。支持 JPEG / PNG / GIF / WebP;行内或 URL 传图单张限制 32 MiB,通过 file_id 限制 64 MiB;单次请求最多支持 600 张图片;请求体限制 48 MiB(图片总计 64 MiB,使用 file_id 时为 200 MiB);单边最大 8,192 像素(发送 15 张以上图片时为 4,096 像素)。
- Files API(全新独立发布)。purpose=
user_data;单文件 64 MiB;每位用户 25 GiB 且最多 10,000 个文件;保存期限 1 小时至 30 天或永久;根据文件内容识别格式,而非文件扩展名。 - Harness 当日同步支持。DeepSeek Harness v0.1.1-rc.1(官方公众号,8 月 21 日 18:22):“DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求” —— 上周 rc.7/rc.8 铺设的图像处理底层现在终于有了第一方模型可供接入(参见我们的 rc.7/rc.8 简报)。
deepseek-v4-flash-vision-exp 定价 (2026):与 V4-Flash 相同,图片计费上限 384 tokens
deepseek-v4-flash-vision-exp 的费用与 deepseek-v4-flash 相同:输入闲时每 100 万 tokens $0.22,忙时 $0.44,输出每 100 万 tokens $0.66/$1.32 —— 且每张图片计费上限仅为 384 tokens。忙时时段为 UTC 01:00–04:00 及 06:00–10:00(北京时间 09:00–12:00 及 14:00–18:00);闲时价格为忙时的一半。
| 每 100 万 tokens(美元) | 非高峰期 | 高峰期 | 备注 |
|---|---|---|---|
| 输入 — 缓存命中 | $0.007 | $0.014 | 与 deepseek-v4-flash 完全一致 |
| 输入 — 缓存未命中 | $0.22 | $0.44 | ≈ ¥1.5 / ¥3.0 |
| 输出 | $0.66 | $1.32 | ≈ ¥4.5 / ¥9.0 |
| 图片计费 | 推理前调整尺寸:小于约 384×384 放大,较大尺寸缩小至约 800×800 等效像素 | 单张图片上限 384 tokens —— 2000×2000 与 5000×5000 图片费用相同;多图请求中每张图片独立计费 | |
来源:官方 定价页面 与 Vision token 使用指南,查阅于 2026-08-21。
一张图片的真实调用成本:vision-exp 对比西方视觉模型 (2026)
在 vision-exp 上处理一张最大尺寸图片,忙时成本最多 $0.00017(闲时 $0.000084)—— 闲时处理约 1,000 张截图仅需不到 $0.09。西方具备视觉能力的模型则按自身(更大且取决于分辨率的)token 数量计费,且其单 token 单价高出 1.7 到 13.6 倍:
| 模型 (2026) | 输入 $/1M | 对比 vision-exp | 图片计费 |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | $0.22 / $0.44(闲时/忙时) | 基准 | ≤384 tokens/图片,硬性上限 |
| Gemini 3.7 Flash (intro) | $0.75 | 1.7–3.4× | 取决于分辨率,无类似 384 的公开上限 |
| Grok 4.6 | $2.00 | 4.5–9.1× | 取决于分辨率 |
| Claude Sonnet 4.5 | $3.00 | 6.8–13.6× | 典型截图 ≈1,000+ tokens → ≈$0.003+/图片(估算) |
对比价格来源于 Claude Sonnet 4.5、Grok 4.6 公开定价页面的官方标价,以及 Google 公布的 Gemini 3.7 Flash 首发尝鲜价(参见我们的 Gemini 3.7 简报);竞品图片 token 数量因分辨率而异,均为估算值。无论如何,结构性优势依然明显:vision-exp 兼具同类模型中最低的单 token 单价与独一无二的单图硬性 token 上限。
如何调用 deepseek-v4-flash-vision-exp:快速入门 (curl + Python)
该 API 兼容 OpenAI —— 标准视觉消息格式可直接用于 https://api.deepseek.com。通过公开 URL 传图:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe the UI bug visible in this screenshot."},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
}'
使用官方 OpenAI SDK 在 Python 中进行相同调用 —— 将 base_url 指向 DeepSeek,并将图片以 base64 形式行内传入:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize this dashboard."},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64,"}},
],
}],
)
print(resp.choices[0].message.content)
- JavaScript/Node:使用
openainpm 包结构完全相同 —— 仅需替换baseURL和模型 ID。 - 重复截图(Agent 循环):通过 Files API(
purpose="user_data")上传一次,随后直接引用返回的file_id—— 单图上限 64 MiB,无需每轮重复上传。这正是 DeepSeek Harness v0.1.1-rc.1 原生采用的模式。 - Anthropic 风格技术栈:Messages 端点同样可用;引用 Files API 时需要添加
anthropic-beta: files-api-2025-04-14请求头。 - 通过中继或网关:任何能够转发
image_url内容块的 OpenAI 兼容代理都会原样透传视觉 payload —— 在怀疑模型问题前,请先确认网关是否正常转发了分段 content 数组。
该路由到哪个 DeepSeek 模型:vision-exp vs v4-flash vs v4-pro
| 业务场景 | 推荐路由 | 选择原因 |
|---|---|---|
| 纯文本 + Agent 编码循环、工具调用、长上下文 | deepseek-v4-flash | 稳定 GA 模型,价格相同;纯文本轮次无需承担视觉开销 |
| 截图、UI 调试、图表/仪表盘识别、文档图像 | deepseek-v4-flash-vision-exp | Flash 定价 + 单图 384 tokens 上限;多模态 Agent 接近 Opus-4.8 水平;实验性质 —— 建议锁定模型 ID |
| 极高难度推理、顶级质量、1M 上下文 | deepseek-v4-pro | DeepSeek 最强模型;目前仍仅支持纯文本 —— 图像处理环节可搭配 vision-exp 使用 |
| 开源权重的原生视觉模型、私有化部署 | Kimi K3 / Qwen-VL | vision-exp 权重已于 8 月 31 日开源(MIT)——详见我们的开源跟进稿(英文);更多视觉模型阵容见 Kimi API 指南 |
通过单一 OpenAI 兼容端点接入具备视觉能力的国产模型
ChinaModelAPI 是一家独立中继服务商,通过单一 OpenAI 兼容 API 为全球开发者接入 DeepSeek、Qwen、GLM、Kimi 等中国前沿大模型,支持 USDT/USD1 支付且无需订阅。像 vision-exp 这样的新模型上线正是该平台的核心使命:首日模型支持、透明的按 token 计费,以及一次集成即可调用全套中国大模型。
ChinaModelAPI 是一家独立中继服务商,与 DeepSeek 无官方关联。所有路由的模型 ID 在上线前均经过实时验证 —— 加入候补名单,以便在视觉路由上线时第一时间收到通知。
社区适配器的现状(以及命名混淆的解决)
- 名称冲突已解决 —— 官方 DeepSeek 胜出。在此前两周,“V4-Flash vision”指代的是社区权重:WebBrain 的 DeepSeek-V4-Flash-Vision-NVFP4(冻结的 V4-Flash + 冻结的 Kimi-K2.6 MoonViT + 训练好的 40.1M 参数投影层,8 月 3 日)以及 FlyCockpit 的 0731-vision(8 月 4 日)。如今官方模型正式确立了该名称的正统地位 —— 拥有社区适配器无法比拟的官方支持、文档以及 Flash 级定价。
- 适配器并非毫无价值 —— 而是有了新定位。如果你在自有 GPU 上私有化部署 V4-Flash 权重并需要离线/隔离环境下的视觉能力,它们仍然是唯一选择;官方权重一度仅限 API——直至 2026 年 8 月 31 日 DeepSeek 以 MIT 协议开源 Vision-Exp 权重,这些适配器的定位也随之从「唯一路径」变为「过渡期社区方案」。
- “灰度先于发布”的规律值得关注。这是 DeepSeek 在一个月内第二次在文档更新前就先行出现在 API 列表或代码中(V4-Flash-0731 也走了同样的路线)。对于中继平台运营者和工具开发者而言:盯紧 model-list 端点和 DSH 更新日志,远比干等官方文档更新更有效。
一手信息来源
- DeepSeek API 更新日志 —— 日期标注为 2026-08-21 的“DeepSeek-V4-Flash-Vision-Exp Release”条目
- DeepSeek 官方定价 —— vision-exp 与 V4-Flash 完全一致;忙时/闲时时间段;并发 2,500
- DeepSeek Vision 指南 —— 图像输入方式、限制规范、单图 384 tokens 计费规则
- DeepSeek Files API 指南 —— 支持格式、单文件 64 MiB、每用户 25 GiB 及 10,000 个文件上限
- DeepSeek Harness 官方公众号 — v0.1.1-rc.1 新增 vision-exp 模型选项与原生图片请求(2026-08-21)
- 爱范儿 — 突发:DeepSeek 多模态模型发布,鲸鱼终于开「天眼」(2026-08-21,含定价截图)
- X — @NFT_Chen:vision-exp 现身 API 列表灰度截图(2026-08-20)
- TestingCatalog — DeepSeek 多模态研究员 Xiaokang Chen 发布鲸鱼睁眼预热 (8月19–20日)
- LINUX DO — 官宣 DeepSeek-V4-Flash-Vision-Exp 发布(2026-08-21,社区一手讨论与价格表)
- Hugging Face — WebBrain 社区适配器(背景:发布前的社区生态)
常见问题解答 (2026)
vision-exp 现在是官方模型了吗?
是的 —— 该模型于 2026 年 8 月 21 日正式发布,包含带日期的更新日志、已上线的文档以及官方公告。8 月 20 日流出的“灰度发布”截图是真实模型在部署阶段的测试,而非谣传。
V4-Pro 也获得视觉能力了吗?
没有。目前仅 Flash 系列推出了视觉变体。V4-Pro 仍仅支持纯文本;后续是否会推出 Pro 级别的视觉版本尚未公布。
图片是如何计费的?
图片会先缩放至约 800×800 等效像素(最小约 384×384),转换为 token 后按输入计费 —— 单张图片上限为 384 tokens。2K 和 5K 图片的计费成本完全相同。
开源权重发布了吗?
情况已变:2026 年 8 月 31 日 DeepSeek 以 MIT 协议开源 Vision-Exp 权重(无门槛)。社区适配器(WebBrain NVFP4、FlyCockpit)仍可作早期非官方方案——详见开源跟进稿。
OpenRouter 或第三方提供商上线了吗?
截至发布时(UTC+8 8 月 21 日晚),该模型由 DeepSeek 官方平台提供服务;第三方提供商的可用性尚未确认。在进行路由调用前,请先核实服务商的实时模型列表。
支持视频或 PDF 输入吗?
不支持 —— 官方文档仅列出图片输入(JPEG/PNG/GIF/WebP)。对于文档,需调用方将页面提取为图片;对于视频,需自行抽帧处理。
速率限制?
官方定价页面显示两款 Flash 模型的并发限制均为 2,500(相比之下 V4-Pro 为 500)。其实验性质意味着限制可能会调整 —— 请以官方文档为准。
是否可用于生产环境?
请谨慎对待其“Exp”(实验性)标识:可能会出现行为漂移、价格/条款变动,或被废弃/重命名(DeepSeek 历史惯例:preview → 0731 GA)。建议在配置中保留原生视觉备选方案(如 Kimi K3、Qwen-VL)以便随时切换。