Notícias / Model Watch · Lançamento Oficial + Guia para Desenvolvedores
DeepSeek-V4-Flash-Vision-Exp (2026): Lançamento Oficial, Preços e Início Rápido da API para Copiar e Colar
Dois dias após o teaser com a baleia mascote e um dia após o nome vazar em listas de API em gray-release, a DeepSeek tornou isso realidade: deepseek-v4-flash-vision-exp, um modelo experimental multimodal de compreensão visual, disponível na API oficial a partir de 21 de agosto de 2026. A qualidade do texto permanece no mesmo nível do V4-Flash; a capacidade do agente multimodal fica "próxima ao Opus-4.8"; o preço é idêntico ao do V4-Flash; e uma nova Files API é lançada em conjunto. Este guia traz o cronograma de lançamento, o comparativo de preços frente aos modelos de visão ocidentais, código funcional de início rápido e para qual modelo DeepSeek direcionar cada carga de trabalho.
O DeepSeek-V4-Flash-Vision-Exp é um modelo oficial da DeepSeek, lançado em 21 de agosto de 2026, de acordo com a entrada do changelog da API datada de 2026-08-21.
Chame-o com model='deepseek-v4-flash-vision-exp'; ele aceita texto + imagens via base64, URLs externas ou a nova Files API por meio de Chat Completions, da Messages API compatível com Anthropic e da Responses API.
Conforme a página oficial de preços, ele custa exatamente o mesmo que o V4-Flash — $0.22 por 1M de tokens de entrada fora do pico ($0.44 no pico) — e cada imagem é faturada em no máximo 384 tokens.
O DeepSeek Harness v0.1.1-rc.1 oferece suporte nativo.
Do teaser ao lançamento: a linha do tempo de 72 horas
| Quando | O que aconteceu · fonte |
|---|---|
| 18 de jun. | App/web da DeepSeek recebem visão de imagem (apenas no produto, sem modelo de API). Pesquisadores no X: "A visão agora está disponível na web e no app." |
| 3–4 de ago. | A comunidade se recusa a esperar: o adaptador MoonViT DeepSeek-V4-Flash-Vision-NVFP4 da WebBrain e o 0731-vision da FlyCockpit chegam ao Hugging Face (mais abaixo). |
| 19–20 de ago. | O pesquisador multimodal da DeepSeek Xiaokang Chen publica no X o teaser da baleia de olhos abertos "Now, we see you. 👀" — TestingCatalog conecta a publicação a um futuro modelo de visão. |
| 20 de ago. | O ID exato do modelo surge em gray-release: capturas de tela da lista de modelos da API mostrando deepseek-v4-flash-vision-exp circulam no X (@NFT_Chen) e no código do DeepSeek Harness — documentação ainda não atualizada. |
| 21 de ago. (noite UTC+8) | Lançamento oficial. Entrada do changelog "DeepSeek-V4-Flash-Vision-Exp Release" (2026-08-21); página de preços, guia de Vision e guia da Files API entram no ar; anúncio oficial no WeChat (cobertura da imprensa em menos de uma hora); DeepSeek Harness v0.1.1-rc.1 adiciona suporte nativo. |
Nota do editor: uma versão anterior deste resumo, publicada na manhã de 21 de ago. antes do lançamento, concluiu que não existia nenhum modelo oficial — correto naquele momento (a documentação não continha nenhuma entrada; o nome estava apenas em gray-release), incorreto ao anoitecer. Lançamentos oficiais no mesmo dia são exatamente o motivo pelo qual registramos a data de cada afirmação.
O que foi lançado, de acordo com a documentação oficial
- O modelo. Modelo experimental de compreensão visual;
model='deepseek-v4-flash-vision-exp'. Posicionamento oficial: qualidade de texto "no mesmo nível do DeepSeek-V4-Flash oficial", capacidades de agente multimodal "próximas ao Opus-4.8". O V4-Pro não recebeu visão — este é um recurso exclusivo da família Flash por enquanto. - Três maneiras de enviar imagens. URLs
data:em base64 inline; uma URL pública externa de imagem (limite de 8.192 caracteres, tempo limite de download de 60s); ou a Files API — envie uma vez, referencie ofile_id. Todos os três endpoints funcionam: Chat Completions compatível com OpenAI, Messages compatível com Anthropic (a Files API necessita do cabeçalhoanthropic-beta: files-api-2025-04-14) e Responses. - Limites de imagem. JPEG / PNG / GIF / WebP; 32 MiB por imagem inline ou por URL, 64 MiB via file_id; até 600 imagens por requisição; corpo da requisição de 48 MiB (64 MiB no total para imagens, 200 MiB com imagens via file_id); máximo de 8.192 px por lado (4.096 px ao enviar 15+ imagens).
- A Files API (novo lançamento separado). purpose=
user_data; 64 MiB por arquivo; 25 GiB e 10.000 arquivos por usuário; retenção de 1 hora a 30 dias ou permanente; formato detectado pelo conteúdo, não pela extensão. - Suporte no Harness, no mesmo dia. DeepSeek Harness v0.1.1-rc.1 (conta oficial, 21 de ago. às 18:22): "DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求" — a infraestrutura de imagens do rc.7/rc.8 da semana passada agora tem um modelo oficial proprietário para integrar (veja nosso resumo do rc.7/rc.8).
Preços do deepseek-v4-flash-vision-exp (2026): igual ao V4-Flash, imagens limitadas a 384 tokens
O deepseek-v4-flash-vision-exp custa o mesmo que o deepseek-v4-flash: $0.22 por 1M de tokens de entrada fora do pico, $0.44 no pico, $0.66/$1.32 de saída — e cada imagem é faturada em no máximo 384 tokens. Os horários de pico são UTC 01:00–04:00 e 06:00–10:00 (Pequim 09:00–12:00 e 14:00–18:00); fora do pico é metade do pico.
| Por 1M de tokens (USD) | Fora de pico | Pico | Notas |
|---|---|---|---|
| Entrada — acerto de cache | $0.007 | $0.014 | Idêntico ao deepseek-v4-flash |
| Entrada — falha de cache | $0.22 | $0.44 | ≈ ¥1.5 / ¥3.0 |
| Saída | $0.66 | $1.32 | ≈ ¥4.5 / ¥9.0 |
| Faturamento de imagens | Redimensionado pré-inferência: <~384×384 ampliado, maiores reduzidos para o equivalente a ~800×800 pixels | Limite máximo de 384 tokens por imagem — uma imagem de 2000×2000 e uma de 5000×5000 custam o mesmo; cada imagem em uma requisição com várias imagens é faturada de forma independente | |
Fonte: página oficial de preços e guia de uso de tokens do Vision, consultados em 2026-08-21.
Quanto uma imagem realmente custa: vision-exp vs modelos de visão ocidentais (2026)
Uma imagem no tamanho máximo no vision-exp custa no máximo $0.00017 no pico ($0.000084 fora do pico) — cerca de 1.000 capturas de tela por menos de $0.09 fora do pico. Modelos ocidentais com capacidade de visão faturam imagens por suas próprias contagens de tokens (maiores, dependentes da resolução) a preços por token de 1.7× a 13.6× mais altos:
| Modelo (2026) | Entrada $/1M | vs vision-exp | Faturamento de imagens |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | $0.22 / $0.44 (fora/pico) | linha de base | ≤384 tokens/imagem, limite estrito |
| Gemini 3.7 Flash (intro) | $0.75 | 1.7–3.4× | dependente da resolução, sem limite publicado no estilo de 384 tokens |
| Grok 4.6 | $2.00 | 4.5–9.1× | dependente da resolução |
| Claude Sonnet 4.5 | $3.00 | 6.8–13.6× | captura de tela típica ≈1.000+ tokens → ≈$0.003+/imagem (estimativa) |
Os preços de comparação são preços de tabela das páginas públicas de preços do Claude Sonnet 4.5 e Grok 4.6 e dos preços de lançamento divulgados pelo Google para o Gemini 3.7 Flash (nosso resumo do Gemini 3.7); a contagem de tokens de imagem dos concorrentes varia de acordo com a resolução e são estimativas. O ponto estrutural se mantém: o vision-exp combina o menor preço por token da sua categoria com o único limite rígido de tokens por imagem.
Como chamar o deepseek-v4-flash-vision-exp: início rápido (curl + Python)
A API é compatível com OpenAI — o formato padrão de mensagem de visão funciona como está em https://api.deepseek.com. Imagem por URL pública:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe the UI bug visible in this screenshot."},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
}'
A mesma chamada em Python com o SDK oficial da OpenAI — aponte a base_url para a DeepSeek, insira a imagem inline como base64:
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize this dashboard."},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64,"}},
],
}],
)
print(resp.choices[0].message.content)
- JavaScript/Node: estrutura idêntica com o pacote npm
openai— altere abaseURLe o ID do modelo. - Capturas de tela repetidas (loops de agentes): faça o upload uma única vez pela Files API (
purpose="user_data") e depois referencie ofile_idretornado — 64 MiB por imagem, sem reenvio a cada turno. Esse é o padrão que o DeepSeek Harness v0.1.1-rc.1 usa nativamente. - Stack no estilo Anthropic: o endpoint Messages também funciona; referências à Files API precisam do cabeçalho
anthropic-beta: files-api-2025-04-14. - Por meio de um relay ou gateway: qualquer proxy compatível com OpenAI que encaminhe os blocos de conteúdo
image_urlrepassa payloads de visão sem alterações — verifique se o seu gateway encaminha arrays de conteúdo multipart antes de culpar o modelo.
Qual modelo DeepSeek direcionar: vision-exp vs v4-flash vs v4-pro
| Sua carga de trabalho | Direcionar para | Por quê |
|---|---|---|
| Texto + loops de programação com agentes, chamadas de ferramentas, contexto longo | deepseek-v4-flash | Modelo GA estável, mesmo preço; sem motivo para pagar a sobrecarga de visão em turnos apenas de texto |
| Capturas de tela, depuração de UI, leitura de gráficos/dashboards, imagens de documentos | deepseek-v4-flash-vision-exp | Preço do Flash + limite de 384 tokens por imagem; agente multimodal próximo ao Opus-4.8; experimental — fixe o ID |
| Raciocínio mais avançado, qualidade máxima, 1M de contexto | deepseek-v4-pro | Modelo mais potente da DeepSeek; ainda apenas texto — combine-o com o vision-exp para a etapa de imagem |
| Visão nativa com pesos abertos, auto-hospedado | Kimi K3 / Qwen-VL | o vision-exp é exclusivo via API; para visão com pesos abertos, veja nosso guia da Kimi API |
Acesse modelos chineses com capacidade de visão através de um único endpoint compatível com OpenAI
A ChinaModelAPI é um relay independente que disponibiliza modelos chineses de ponta — DeepSeek, Qwen, GLM, Kimi — para desenvolvedores do mundo inteiro por meio de uma única API compatível com OpenAI, com pagamentos em USDT/USD1 e sem assinatura. Lançamentos de modelos como o vision-exp são exatamente o propósito da plataforma: disponibilidade de modelos no dia do lançamento, preços transparentes por token e uma única integração para todo o catálogo de modelos chineses.
A ChinaModelAPI é um relay independente sem vínculo oficial com a DeepSeek. Os IDs dos modelos roteados são verificados em tempo real antes do lançamento — entre na lista de espera para ser notificado quando o roteamento de visão estiver disponível.
Como isso afeta os adaptadores da comunidade (e a confusão)
- O conflito de nomes foi resolvido — a favor da DeepSeek. Por duas semanas, "V4-Flash vision" referia-se a checkpoints da comunidade: o DeepSeek-V4-Flash-Vision-NVFP4 da WebBrain (V4-Flash congelado + Kimi-K2.6 MoonViT congelado + projetor treinado de 40.1M parâmetros, 3 de ago.) e o 0731-vision da FlyCockpit (4 de ago.). O modelo oficial agora assume o nome — com suporte, documentação e preços do Flash que os adaptadores não conseguem igualar.
- Os adaptadores não são inúteis — eles foram reposicionados. Se você auto-hospeda os pesos do V4-Flash em suas próprias GPUs e deseja visão offline/air-gapped, eles continuam sendo a única opção; o vision-exp oficial é exclusivo via API, e nenhum peso de visão foi disponibilizado em código aberto.
- O padrão do gray-release ao lançamento vale a pena ser lembrado. Este é o segundo lançamento da DeepSeek em um mês que apareceu em listas de API ou código antes da atualização da documentação (o V4-Flash-0731 seguiu o mesmo caminho). Para operadores de relay e desenvolvedores de ferramentas: monitorar o endpoint da lista de modelos e as notas de lançamento do DSH é muito melhor do que esperar pelo changelog.
Fontes primárias
- Changelog da DeepSeek API — registro de "DeepSeek-V4-Flash-Vision-Exp Release" datado de 2026-08-21
- Preços oficiais da DeepSeek — vision-exp idêntico ao V4-Flash; janelas de pico/fora de pico; concorrência de 2.500
- Guia do DeepSeek Vision — métodos de entrada de imagem, limites, regra de 384 tokens por imagem
- Guia da DeepSeek Files API — formatos, 64 MiB/arquivo, 25 GiB & 10k arquivos por usuário
- DeepSeek Harness 官方公众号 — v0.1.1-rc.1 新增 vision-exp 模型选项与原生图片请求(2026-08-21)
- 爱范儿 — 突发:DeepSeek 多模态模型发布,鲸鱼终于开「天眼」(2026-08-21,含定价截图)
- X — @NFT_Chen:vision-exp 现身 API 列表灰度截图(2026-08-20)
- TestingCatalog — teaser dos olhos da baleia pelo pesquisador multimodal da DeepSeek Xiaokang Chen (19–20 de ago.)
- LINUX DO — 官宣 DeepSeek-V4-Flash-Vision-Exp 发布(2026-08-21,社区一手讨论与价格表)
- Hugging Face — adaptador da comunidade WebBrain (contexto: o ecossistema pré-lançamento)
Perguntas frequentes (2026)
O vision-exp agora é oficial?
Sim — lançado em 21 de agosto de 2026 com registro datado no changelog, documentação online e anúncios oficiais. As capturas de tela do "gray release" de 20 de agosto eram do modelo real sendo preparado, não um boato.
O V4-Pro também recebeu visão?
Não. Apenas a família Flash ganhou uma variante de visão. O V4-Pro permanece somente texto; se haverá visão no nível Pro ainda não foi anunciado.
Como as imagens são faturadas?
As imagens são redimensionadas para o equivalente a aproximadamente 800×800 pixels (mínimo ~384×384), convertidas em tokens e faturadas como entrada — limitadas a 384 tokens por imagem. Uma imagem de 2K e uma de 5K custam o mesmo.
Os pesos abertos foram lançados?
Não. O vision-exp é exclusivo via API por enquanto. Quem faz auto-hospedagem continua com os adaptadores da comunidade (WebBrain NVFP4, FlyCockpit) como opção offline — não oficiais e sem benchmarks comparativos com este lançamento.
Está no OpenRouter / provedores terceirizados?
No momento da publicação (noite de 21 de agosto, UTC+8), o modelo estava disponível na plataforma oficial da DeepSeek; a disponibilidade em provedores terceirizados ainda não havia sido confirmada. Verifique a lista de modelos atualizada do seu provedor antes de rotear.
Entrada de vídeo ou PDF?
Não — a documentação oficial lista apenas entrada de imagem (JPEG/PNG/GIF/WebP). Para documentos, extraia as páginas como imagens no lado do cliente; para vídeo, faça amostragem de quadros.
Limites de taxa?
A página oficial de preços lista concorrência de 2.500 para ambos os modelos Flash (contra 500 para o V4-Pro). O status experimental significa que os limites podem mudar — verifique na documentação.
Pronto para produção?
Leve o "Exp" a sério: possível variação de comportamento, mudanças de preço/termos ou descontinuação/renomeação (o próprio histórico da DeepSeek: preview → 0731 GA). Mantenha um fallback de visão nativa (Kimi K3, Qwen-VL) a uma flag de configuração de distância.