Guias / Modelos Chineses de Visão 2026
APIs de Modelos Chineses de Visão em 2026: DeepSeek Vision-Exp vs Qwen-VL vs Kimi
Todos os principais laboratórios chineses agora oferecem uma API com suporte a visão. O deepseek-v4-flash-vision-exp da DeepSeek (21 de ago de 2026) é a opção robusta mais recente e mais barata; a família Qwen-VL da Alibaba é a mais ampla; a linha Kimi da Moonshot possui visão nativa há mais tempo. Esta página compara o que realmente importa para decisões de roteamento — capacidade, preços, contexto, pesos abertos — com fontes identificadas por linha.
Rotear por restrição: visão robusta mais barata → deepseek-v4-flash-vision-exp ($0.22/1M de entrada fora de pico, ≤384 tokens por imagem, agente multimodal próximo ao Opus-4.8); visão de ponta com pesos abertos + contexto de 1M → Kimi K3; escada de níveis mais ampla, de modelos pequenos auto-hospedáveis ao Max proprietário → família Qwen3-VL. Todos os três utilizam o formato compatível com a OpenAI, permitindo que um único gateway atenda a todos eles com fallbacks por modelo.
A tabela comparativa de 2026
| Modelo | Visão | Contexto | Entrada $/1M | Pesos abertos | Notas |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp DeepSeek · 21 de ago de 2026 · oficial |
✓ experimental | 1M | $0.22 / $0.44 ≤384 t/imagem |
✗ (apenas API) | Paridade de texto com o V4-Flash; agente multimodal ≈ Opus-4.8; nova Files API |
| Kimi K3 Moonshot · jul de 2026 |
✓ nativa (MoonViT) | 1M | K3 a ser anunciado ref. K2.5: $0.45 (rastreador) |
✓ anunciado | Modelo topo de linha classe 2.8T; visão desde o K2.5 (jan de 2026, codificador MoonViT de 400M) |
| família Qwen3-VL Alibaba · 2025–2026 |
✓ nativa | até 1M (3.6 Plus) |
a partir de ~$0.13 (VL 30B, rastreador) |
✓ níveis pequeno/médio | Escada mais ampla: modelos abertos pequenos → Qwen3.6 Plus ($0.325, rastreador) → VL-Max proprietário; via DashScope |
| GLM-5.2 / 5.3 Zhipu · 2026 |
✗ apenas texto | 1M | $1.40 | ✓ | Incluído para fins de completude — os principais modelos abertos de código da China ainda não lançaram recursos de visão |
Linha da DeepSeek obtida da documentação oficial (21 de ago de 2026). Valores do Kimi/Qwen provenientes de rastreadores públicos de modelos (páginas de modelos Roboflow, AIViewer; atualizados de 14 a 20 de ago de 2026) e do nosso guia da API Kimi — verifique por nível no console de cada provedor antes de definir o orçamento.
Três famílias, três filosofias
- DeepSeek: visão como arma de preço. O Vision-Exp não é um produto premium separado — é o mesmo V4-Flash pelo mesmo preço por token, com um limite de 384 tokens por imagem. A estratégia é tornar a visão barata o suficiente para integrá-la em todos os loops de agentes. Ponto negativo: é experimental, apenas via API e restrito à família Flash (sem visão no V4-Pro por enquanto).
- Moonshot: visão como recurso nativo topo de linha. O Kimi oferece visão nativa por meio de seu codificador MoonViT desde o K2.5 (janeiro de 2026) — o codificador que a comunidade literalmente utilizou para dar recursos visuais não oficiais ao V4-Flash antes de a DeepSeek se atualizar. O K3 combina isso a um modelo de classe 2.8T e 1M de contexto. Ponto negativo: preço de modelo de ponta (referência do K2.5: $0.45/1M de entrada).
- Alibaba: visão como uma escada. O Qwen-VL abrange desde modelos abertos auto-hospedáveis (níveis pequenos do Qwen3-VL) até o Max proprietário — escolha seu ponto ideal de custo-benefício. Ponto negativo: a variedade significa que a responsabilidade da escolha é sua, e a cobrança de imagens depende da resolução em vez de ter um teto fixo.
Qual direcionar: tabela de decisão
| Sua carga de trabalho | Direcionar para |
|---|---|
| Loops de agentes de UI/capturas de tela de alto volume, sensíveis a custos | deepseek-v4-flash-vision-exp — ≤384t/imagem a preços do Flash |
| Raciocínio multimodal complexo em um modelo aberto de ponta | Kimi K3 — visão nativa + 2.8T + 1M ctx |
| Auto-hospedagem / visão air-gapped | Níveis abertos do Qwen3-VL (ou adaptadores da comunidade para o V4-Flash) |
| Uma única integração, todos os provedores, fallback por modelo | Relay compatível com a OpenAI cobrindo os três (somos nós — lista de espera) |
Frente às APIs ocidentais de visão
Para calibração: Claude Sonnet 4.5 lista $3/1M de entrada, Grok 4.6 $2/1M, Gemini 3.7 Flash no valor introdutório de $0.75/1M (nosso resumo do Gemini). O Vision-Exp é de 1.7 a 13.6× mais barato por token que os três, com o único limite rígido por imagem; o catálogo chinês de visão como um todo varia agora de $0.13 a $0.45/1M de entrada — uma faixa inatingível pelos preços ocidentais. Cálculo completo de custos no nosso guia de preços de Visão.
FAQ
Qual é o mais barato para agentes com uso intenso de imagens?
Vision-Exp, por ampla margem: $0.22/1M de entrada fora de pico com imagens limitadas a 384 tokens. 1.000 capturas de tela no tamanho máximo ≈ $0.08 fora de pico.
O GLM-5.2/5.3 tem visão?
Ainda não — os modelos topo de linha de 2026 da Zhipu são apenas de texto até 21 de ago de 2026. As opções abertas de visão da China são o Kimi (pesos anunciados) e os níveis do Qwen-VL.
O Vision-Exp está pronto para produção em comparação com a visão nativa do Kimi?
Perfis de risco diferentes: o Vision-Exp é experimental (possível drift/descontinuação), mas é o mais barato; a visão do Kimi já está disponível em produção desde o K2.5. Padrão sensato: Vision-Exp para custo, Kimi/Qwen-VL como fallback estável a uma flag de configuração de distância.
Esses números são estáveis?
Os preços das APIs chinesas mudam rapidamente (a DeepSeek alterou os preços duas vezes desde abril). Os valores da DeepSeek aqui são oficiais até 21 de ago de 2026; Kimi/Qwen estão listados em rastreadores. Verifique novamente antes de fechar orçamentos.