ChinaModelAPI

Guías / Modelos de visión chinos 2026

Comparativa · actualizado 2026-08-21 · Cifras oficiales de DeepSeek; Kimi/Qwen según trackers

APIs de modelos de visión chinos en 2026: DeepSeek Vision-Exp vs Qwen-VL vs Kimi

Todos los laboratorios chinos de frontera ahora ofrecen una API con capacidades de visión. deepseek-v4-flash-vision-exp de DeepSeek (21 de ago de 2026) es la opción potente más reciente y económica; la familia Qwen-VL de Alibaba es la más amplia; la línea Kimi de Moonshot es la que lleva más tiempo con visión nativa. Esta página compara lo más relevante para la toma de decisiones de enrutamiento: capacidad, precios, contexto y pesos abiertos, con fuentes etiquetadas por fila.

Respuesta directa

Enrutamiento según restricciones: visión potente más económica → deepseek-v4-flash-vision-exp ($0.22/1M input en horas valle, ≤384 tokens por imagen, agente multimodal cercano a Opus-4.8); visión de vanguardia con pesos abiertos + 1M de contexto → Kimi K3; la escala de niveles más amplia, desde modelos reducidos autohospedables hasta el propietario Max → familia Qwen3-VL. Los tres utilizan el formato compatible con OpenAI, por lo que una sola pasarela puede servirlos a todos con fallbacks por modelo.

Tabla comparativa de 2026

ModeloVisiónContextoEntrada $/1MPesos abiertosNotas
deepseek-v4-flash-vision-exp
DeepSeek · 21 ago 2026 · oficial
✓ experimental 1M $0.22 / $0.44
≤384 t/imagen
✗ (solo API) Paridad de texto con V4-Flash; agente multimodal ≈ Opus-4.8; nueva Files API
Kimi K3
Moonshot · jul 2026
✓ nativa (MoonViT) 1M K3 TBA
ref. K2.5: $0.45 (tracker)
✓ anunciados Modelo insignia de clase 2.8T; visión desde K2.5 (ene 2026, codificador MoonViT de 400M)
Familia Qwen3-VL
Alibaba · 2025–2026
✓ nativa hasta 1M
(3.6 Plus)
desde ~$0.13
(VL 30B, tracker)
✓ niveles pequeños/medianos La gama más amplia: modelos abiertos pequeños → Qwen3.6 Plus ($0.325, tracker) → VL-Max propietario; a través de DashScope
GLM-5.2 / 5.3
Zhipu · 2026
✗ solo texto 1M $1.40 Incluido para mayor exhaustividad: los principales modelos insignia abiertos de código de China aún no incorporan visión

Fila de DeepSeek de la documentación oficial (21 de ago de 2026). Cifras de Kimi/Qwen procedentes de rastreadores públicos de modelos (páginas de modelos de Roboflow, AIViewer; actualizadas del 14 al 20 de ago de 2026) y de nuestra guía de la API de Kimi; verifique cada nivel en la consola del proveedor antes de presupuestar.

Tres familias, tres filosofías

  • DeepSeek: la visión como arma de precios. Vision-Exp no es un producto prémium independiente: es el mismo V4-Flash al mismo precio por token con un límite de 384 tokens por imagen. La jugada consiste en hacer que la visión sea lo suficientemente económica como para incluirla en cada bucle de agentes. Desventaja: es experimental, solo API y exclusivo de la familia Flash (aún no hay visión en V4-Pro).
  • Moonshot: la visión como función insignia nativa. Kimi ha ofrecido visión nativa a través de su codificador MoonViT desde K2.5 (enero de 2026), el codificador que la comunidad literalmente tomó prestado para dotar a V4-Flash de visión no oficial antes de que DeepSeek se pusiera al día. K3 lo combina con un modelo de clase 2.8T y 1M de contexto. Desventaja: precios de frontera (referencia de K2.5: $0.45/1M tokens de entrada).
  • Alibaba: la visión como una escala. Qwen-VL abarca desde modelos abiertos autohospedables (niveles pequeños de Qwen3-VL) hasta el Max propietario: elija su punto de precio-rendimiento. Desventaja: tanta amplitud implica que la carga de elegir recae en usted, y la facturación de imágenes depende de la resolución en lugar de tener un límite fijo.

A cuál enrutar: tabla de decisión

Su carga de trabajoEnrutar a
Bucles de agentes de capturas de pantalla/UI de gran volumen, sensibles al costodeepseek-v4-flash-vision-exp — ≤384t/imagen a precios de Flash
Razonamiento multimodal complejo en un modelo abierto de fronteraKimi K3 — visión nativa + 2.8T + 1M ctx
Autohospedaje / visión aislada de la red (air-gapped)Niveles abiertos de Qwen3-VL (o adaptadores comunitarios para V4-Flash)
Una sola integración, todos los proveedores, fallback por modeloRelay compatible con OpenAI que cubre los tres (esos somos nosotros: lista de espera)

Frente a las APIs de visión occidentales

Para calibrar: Claude Sonnet 4.5 figura a $3/1M de entrada, Grok 4.6 a $2/1M, Gemini 3.7 Flash precio introductorio $0.75/1M (nuestro informe de Gemini). Vision-Exp es entre 1.7 y 13.6 veces más económico por token que los tres, con el único límite estricto por imagen; la oferta de visión china en conjunto abarca ahora $0.13–$0.45/1M de entrada, un rango que los precios occidentales no alcanzan. Cálculos completos de costos en nuestra guía de precios de Vision.

FAQ

¿Cuál es el más económico para agentes con uso intensivo de imágenes?

Vision-Exp, por un amplio margen: $0.22/1M de entrada en horas valle con imágenes limitadas a 384 tokens. 1,000 capturas de pantalla de tamaño máximo ≈ $0.08 en horas valle.

¿Tiene visión GLM-5.2/5.3?

Aún no: los modelos insignia de Zhipu de 2026 son solo de texto al 21 de agosto de 2026. Las opciones de visión abierta de China son Kimi (pesos anunciados) y los niveles de Qwen-VL.

¿Es Vision-Exp de nivel de producción frente a la visión nativa de Kimi?

Diferentes perfiles de riesgo: Vision-Exp es experimental (posible desvío/obsolescencia) pero el más económico; la visión de Kimi lleva utilizándose en producción desde K2.5. Patrón sensato: Vision-Exp por costo, Kimi/Qwen-VL como fallback estable a un solo flag de configuración de distancia.

¿Son estables estos números?

Los precios de las APIs chinas cambian rápido (DeepSeek ha ajustado precios dos veces desde abril). Las cifras de DeepSeek aquí son oficiales al 21 de agosto de 2026; las de Kimi/Qwen provienen de trackers. Vuelva a verificarlas antes de cerrar presupuestos.

Relacionado