ChinaModelAPI

新闻 / 模型观察 · 官方发布 + 开发者指南

官方发布 deepseek-v4-flash-vision-exp Vision API 定价 快速入门
2026-08-21 · 模型观察 · 8 月 20 日灰度后于 8 月 21 日晚(UTC+8)正式发布

DeepSeek-V4-Flash-Vision-Exp (2026):官方发布、定价与开箱即用的 API 快速入门

在鲸鱼吉祥物预热两天后、模型名称在灰度发布 API 列表中泄露一天后,DeepSeek 正式将其变为现实:实验性多模态视觉理解模型 deepseek-v4-flash-vision-exp 已于 2026 年 8 月 21 日在官方 API 正式上线。文本质量与 V4-Flash 持平;多模态 Agent 能力达到“接近 Opus-4.8”的水平;定价与 V4-Flash 保持一致;同时还同步推出了全新的 Files API。本指南涵盖了发布时间线、对比西方视觉模型的定价测算、可直接运行的快速入门代码,以及各类工作负载应如何路由至对应的 DeepSeek 模型。

更新(9 月 2 日):下文的「仅支持 API」表述已成历史——2026 年 8 月 31 日 DeepSeek 已以 MIT 协议开源 Vision-Exp 权重(无门槛下载)。本文保留为发布当日记录;私有化部署请阅读跟进稿:DeepSeek Vision-Exp 开源权重(英文)

核心结论

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 官方模型,于 2026 年 8 月 21 日发布,详见 2026-08-21 的 API 更新日志。 调用时指定 model='deepseek-v4-flash-vision-exp';支持通过 base64、外部 URL 或全新的 Files API 传入文本 + 图像,适用于 Chat Completions、兼容 Anthropic 的 Messages API 以及 Responses API。 据官方 定价页面 显示,其定价与 V4-Flash 完全一致 —— 闲时每 1M 输入 tokens $0.22(忙时 $0.44) —— 且每张图片计费 最多 384 tokens。 DeepSeek Harness v0.1.1-rc.1 原生支持该模型。

从预热到上线:72 小时时间线

发布时间事件进展 · 来源
6 月 18 日DeepSeek App/Web 端上线图像视觉能力(仅限产品端,未开放 API 模型)。研究人员在 X 上发帖:“视觉功能现已在网页端和 App 端上线。”
8 月 3 日–4 日社区不愿等待:WebBrain 的 DeepSeek-V4-Flash-Vision-NVFP4 MoonViT 适配器和 FlyCockpit 的 0731-vision 陆续登陆 Hugging Face(详见下文)。
8 月 19 日–20 日DeepSeek 多模态研究员 Xiaokang Chen 在 X 上发布了鲸鱼睁眼的预热帖“Now, we see you. 👀” —— TestingCatalog 推测这与即将推出的视觉模型相关
8 月 20 日确切的模型 ID 在灰度中曝光:显示 deepseek-v4-flash-vision-exp 的 API 模型列表截图在 X(@NFT_Chen)和 DeepSeek Harness 代码中流传 —— 当时文档尚未更新。
8 月 21 日(晚 UTC+8)官方正式发布。更新日志新增“DeepSeek-V4-Flash-Vision-Exp Release”(2026-08-21);定价页、Vision 指南和 Files API 指南上线;微信公众号官方发布公告(一小时内媒体纷纷报道);DeepSeek Harness v0.1.1-rc.1 加入原生支持。

编者注:本文在 8 月 21 日上午发布前发布的较早版本曾得出结论称不存在官方模型 —— 在当时确实如此(文档中没有记录;该名称仅处于灰度发布状态),但到了晚上情况发生了变化。当天突袭发布正是我们为每一项结论标注时间戳的原因。

根据官方文档,本次发布了哪些内容

  • 模型本身。实验性视觉理解模型;model='deepseek-v4-flash-vision-exp'。官方定位:文本质量“与官方 DeepSeek-V4-Flash 持平”,多模态 Agent 能力“接近 Opus-4.8”。V4-Pro 暂未获得视觉能力 —— 目前这仍是 Flash 系列专属。
  • 传入图片的三种方式。行内 Base64 data: URL;公开外部图片 URL(上限 8,192 字符,60 秒下载超时);或 Files API —— 上传一次,后续直接引用 file_id。支持全部三个端点:兼容 OpenAI 的 Chat Completions、兼容 Anthropic 的 Messages(Files API 需要添加 anthropic-beta: files-api-2025-04-14 请求头)以及 Responses。
  • 图片限制。支持 JPEG / PNG / GIF / WebP;行内或 URL 传图单张限制 32 MiB,通过 file_id 限制 64 MiB;单次请求最多支持 600 张图片;请求体限制 48 MiB(图片总计 64 MiB,使用 file_id 时为 200 MiB);单边最大 8,192 像素(发送 15 张以上图片时为 4,096 像素)。
  • Files API(全新独立发布)。purpose=user_data;单文件 64 MiB;每位用户 25 GiB 且最多 10,000 个文件;保存期限 1 小时至 30 天或永久;根据文件内容识别格式,而非文件扩展名。
  • Harness 当日同步支持。DeepSeek Harness v0.1.1-rc.1(官方公众号,8 月 21 日 18:22):“DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求” —— 上周 rc.7/rc.8 铺设的图像处理底层现在终于有了第一方模型可供接入(参见我们的 rc.7/rc.8 简报)。

deepseek-v4-flash-vision-exp 定价 (2026):与 V4-Flash 相同,图片计费上限 384 tokens

deepseek-v4-flash-vision-exp 的费用与 deepseek-v4-flash 相同:输入闲时每 100 万 tokens $0.22,忙时 $0.44,输出每 100 万 tokens $0.66/$1.32 —— 且每张图片计费上限仅为 384 tokens。忙时时段为 UTC 01:00–04:00 及 06:00–10:00(北京时间 09:00–12:00 及 14:00–18:00);闲时价格为忙时的一半。

每 100 万 tokens(美元)非高峰期高峰期备注
输入 — 缓存命中$0.007$0.014与 deepseek-v4-flash 完全一致
输入 — 缓存未命中$0.22$0.44≈ ¥1.5 / ¥3.0
输出$0.66$1.32≈ ¥4.5 / ¥9.0
图片计费推理前调整尺寸:小于约 384×384 放大,较大尺寸缩小至约 800×800 等效像素单张图片上限 384 tokens —— 2000×2000 与 5000×5000 图片费用相同;多图请求中每张图片独立计费

来源:官方 定价页面Vision token 使用指南,查阅于 2026-08-21。

一张图片的真实调用成本:vision-exp 对比西方视觉模型 (2026)

在 vision-exp 上处理一张最大尺寸图片,忙时成本最多 $0.00017(闲时 $0.000084)—— 闲时处理约 1,000 张截图仅需不到 $0.09。西方具备视觉能力的模型则按自身(更大且取决于分辨率的)token 数量计费,且其单 token 单价高出 1.7 到 13.6 倍:

模型 (2026)输入 $/1M对比 vision-exp图片计费
deepseek-v4-flash-vision-exp$0.22 / $0.44(闲时/忙时)基准≤384 tokens/图片,硬性上限
Gemini 3.7 Flash (intro)$0.751.7–3.4×取决于分辨率,无类似 384 的公开上限
Grok 4.6$2.004.5–9.1×取决于分辨率
Claude Sonnet 4.5$3.006.8–13.6×典型截图 ≈1,000+ tokens → ≈$0.003+/图片(估算)

对比价格来源于 Claude Sonnet 4.5、Grok 4.6 公开定价页面的官方标价,以及 Google 公布的 Gemini 3.7 Flash 首发尝鲜价(参见我们的 Gemini 3.7 简报);竞品图片 token 数量因分辨率而异,均为估算值。无论如何,结构性优势依然明显:vision-exp 兼具同类模型中最低的单 token 单价与独一无二的单图硬性 token 上限。

如何调用 deepseek-v4-flash-vision-exp:快速入门 (curl + Python)

该 API 兼容 OpenAI —— 标准视觉消息格式可直接用于 https://api.deepseek.com。通过公开 URL 传图:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe the UI bug visible in this screenshot."},
        {"type": "image_url",
         "image_url": {"url": "https://example.com/screenshot.png"}}
      ]
    }]
  }'

使用官方 OpenAI SDK 在 Python 中进行相同调用 —— 将 base_url 指向 DeepSeek,并将图片以 base64 形式行内传入:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Summarize this dashboard."},
            {"type": "image_url",
             "image_url": {"url": "data:image/png;base64,"}},
        ],
    }],
)
print(resp.choices[0].message.content)
  • JavaScript/Node:使用 openai npm 包结构完全相同 —— 仅需替换 baseURL 和模型 ID。
  • 重复截图(Agent 循环):通过 Files API(purpose="user_data")上传一次,随后直接引用返回的 file_id —— 单图上限 64 MiB,无需每轮重复上传。这正是 DeepSeek Harness v0.1.1-rc.1 原生采用的模式。
  • Anthropic 风格技术栈:Messages 端点同样可用;引用 Files API 时需要添加 anthropic-beta: files-api-2025-04-14 请求头。
  • 通过中继或网关:任何能够转发 image_url 内容块的 OpenAI 兼容代理都会原样透传视觉 payload —— 在怀疑模型问题前,请先确认网关是否正常转发了分段 content 数组。

该路由到哪个 DeepSeek 模型:vision-exp vs v4-flash vs v4-pro

业务场景推荐路由选择原因
纯文本 + Agent 编码循环、工具调用、长上下文deepseek-v4-flash稳定 GA 模型,价格相同;纯文本轮次无需承担视觉开销
截图、UI 调试、图表/仪表盘识别、文档图像deepseek-v4-flash-vision-expFlash 定价 + 单图 384 tokens 上限;多模态 Agent 接近 Opus-4.8 水平;实验性质 —— 建议锁定模型 ID
极高难度推理、顶级质量、1M 上下文deepseek-v4-proDeepSeek 最强模型;目前仍仅支持纯文本 —— 图像处理环节可搭配 vision-exp 使用
开源权重的原生视觉模型、私有化部署Kimi K3 / Qwen-VLvision-exp 权重已于 8 月 31 日开源(MIT)——详见我们的开源跟进稿(英文);更多视觉模型阵容见 Kimi API 指南

通过单一 OpenAI 兼容端点接入具备视觉能力的国产模型

ChinaModelAPI 是一家独立中继服务商,通过单一 OpenAI 兼容 API 为全球开发者接入 DeepSeek、Qwen、GLM、Kimi 等中国前沿大模型,支持 USDT/USD1 支付且无需订阅。像 vision-exp 这样的新模型上线正是该平台的核心使命:首日模型支持、透明的按 token 计费,以及一次集成即可调用全套中国大模型。

ChinaModelAPI 是一家独立中继服务商,与 DeepSeek 无官方关联。所有路由的模型 ID 在上线前均经过实时验证 —— 加入候补名单,以便在视觉路由上线时第一时间收到通知。

社区适配器的现状(以及命名混淆的解决)

  • 名称冲突已解决 —— 官方 DeepSeek 胜出。在此前两周,“V4-Flash vision”指代的是社区权重:WebBrain 的 DeepSeek-V4-Flash-Vision-NVFP4(冻结的 V4-Flash + 冻结的 Kimi-K2.6 MoonViT + 训练好的 40.1M 参数投影层,8 月 3 日)以及 FlyCockpit 的 0731-vision(8 月 4 日)。如今官方模型正式确立了该名称的正统地位 —— 拥有社区适配器无法比拟的官方支持、文档以及 Flash 级定价。
  • 适配器并非毫无价值 —— 而是有了新定位。如果你在自有 GPU 上私有化部署 V4-Flash 权重并需要离线/隔离环境下的视觉能力,它们仍然是唯一选择;官方权重一度仅限 API——直至 2026 年 8 月 31 日 DeepSeek 以 MIT 协议开源 Vision-Exp 权重,这些适配器的定位也随之从「唯一路径」变为「过渡期社区方案」。
  • “灰度先于发布”的规律值得关注。这是 DeepSeek 在一个月内第二次在文档更新前就先行出现在 API 列表或代码中(V4-Flash-0731 也走了同样的路线)。对于中继平台运营者和工具开发者而言:盯紧 model-list 端点和 DSH 更新日志,远比干等官方文档更新更有效。

一手信息来源

常见问题解答 (2026)

vision-exp 现在是官方模型了吗?

是的 —— 该模型于 2026 年 8 月 21 日正式发布,包含带日期的更新日志、已上线的文档以及官方公告。8 月 20 日流出的“灰度发布”截图是真实模型在部署阶段的测试,而非谣传。

V4-Pro 也获得视觉能力了吗?

没有。目前仅 Flash 系列推出了视觉变体。V4-Pro 仍仅支持纯文本;后续是否会推出 Pro 级别的视觉版本尚未公布。

图片是如何计费的?

图片会先缩放至约 800×800 等效像素(最小约 384×384),转换为 token 后按输入计费 —— 单张图片上限为 384 tokens。2K 和 5K 图片的计费成本完全相同。

开源权重发布了吗?

情况已变:2026 年 8 月 31 日 DeepSeek 以 MIT 协议开源 Vision-Exp 权重(无门槛)。社区适配器(WebBrain NVFP4、FlyCockpit)仍可作早期非官方方案——详见开源跟进稿。

OpenRouter 或第三方提供商上线了吗?

截至发布时(UTC+8 8 月 21 日晚),该模型由 DeepSeek 官方平台提供服务;第三方提供商的可用性尚未确认。在进行路由调用前,请先核实服务商的实时模型列表。

支持视频或 PDF 输入吗?

不支持 —— 官方文档仅列出图片输入(JPEG/PNG/GIF/WebP)。对于文档,需调用方将页面提取为图片;对于视频,需自行抽帧处理。

速率限制?

官方定价页面显示两款 Flash 模型的并发限制均为 2,500(相比之下 V4-Pro 为 500)。其实验性质意味着限制可能会调整 —— 请以官方文档为准。

是否可用于生产环境?

请谨慎对待其“Exp”(实验性)标识:可能会出现行为漂移、价格/条款变动,或被废弃/重命名(DeepSeek 历史惯例:preview → 0731 GA)。建议在配置中保留原生视觉备选方案(如 Kimi K3、Qwen-VL)以便随时切换。

相关指南