Guías / Modelos de visión chinos 2026
APIs de modelos de visión chinos en 2026: DeepSeek Vision-Exp vs Qwen-VL vs Kimi
Todos los laboratorios chinos de frontera ahora ofrecen una API con capacidades de visión. deepseek-v4-flash-vision-exp de DeepSeek (21 de ago de 2026) es la opción potente más reciente y económica; la familia Qwen-VL de Alibaba es la más amplia; la línea Kimi de Moonshot es la que lleva más tiempo con visión nativa. Esta página compara lo más relevante para la toma de decisiones de enrutamiento: capacidad, precios, contexto y pesos abiertos, con fuentes etiquetadas por fila.
Enrutamiento según restricciones: visión potente más económica → deepseek-v4-flash-vision-exp ($0.22/1M input en horas valle, ≤384 tokens por imagen, agente multimodal cercano a Opus-4.8); visión de vanguardia con pesos abiertos + 1M de contexto → Kimi K3; la escala de niveles más amplia, desde modelos reducidos autohospedables hasta el propietario Max → familia Qwen3-VL. Los tres utilizan el formato compatible con OpenAI, por lo que una sola pasarela puede servirlos a todos con fallbacks por modelo.
Tabla comparativa de 2026
| Modelo | Visión | Contexto | Entrada $/1M | Pesos abiertos | Notas |
|---|---|---|---|---|---|
| deepseek-v4-flash-vision-exp DeepSeek · 21 ago 2026 · oficial |
✓ experimental | 1M | $0.22 / $0.44 ≤384 t/imagen |
✗ (solo API) | Paridad de texto con V4-Flash; agente multimodal ≈ Opus-4.8; nueva Files API |
| Kimi K3 Moonshot · jul 2026 |
✓ nativa (MoonViT) | 1M | K3 TBA ref. K2.5: $0.45 (tracker) |
✓ anunciados | Modelo insignia de clase 2.8T; visión desde K2.5 (ene 2026, codificador MoonViT de 400M) |
| Familia Qwen3-VL Alibaba · 2025–2026 |
✓ nativa | hasta 1M (3.6 Plus) |
desde ~$0.13 (VL 30B, tracker) |
✓ niveles pequeños/medianos | La gama más amplia: modelos abiertos pequeños → Qwen3.6 Plus ($0.325, tracker) → VL-Max propietario; a través de DashScope |
| GLM-5.2 / 5.3 Zhipu · 2026 |
✗ solo texto | 1M | $1.40 | ✓ | Incluido para mayor exhaustividad: los principales modelos insignia abiertos de código de China aún no incorporan visión |
Fila de DeepSeek de la documentación oficial (21 de ago de 2026). Cifras de Kimi/Qwen procedentes de rastreadores públicos de modelos (páginas de modelos de Roboflow, AIViewer; actualizadas del 14 al 20 de ago de 2026) y de nuestra guía de la API de Kimi; verifique cada nivel en la consola del proveedor antes de presupuestar.
Tres familias, tres filosofías
- DeepSeek: la visión como arma de precios. Vision-Exp no es un producto prémium independiente: es el mismo V4-Flash al mismo precio por token con un límite de 384 tokens por imagen. La jugada consiste en hacer que la visión sea lo suficientemente económica como para incluirla en cada bucle de agentes. Desventaja: es experimental, solo API y exclusivo de la familia Flash (aún no hay visión en V4-Pro).
- Moonshot: la visión como función insignia nativa. Kimi ha ofrecido visión nativa a través de su codificador MoonViT desde K2.5 (enero de 2026), el codificador que la comunidad literalmente tomó prestado para dotar a V4-Flash de visión no oficial antes de que DeepSeek se pusiera al día. K3 lo combina con un modelo de clase 2.8T y 1M de contexto. Desventaja: precios de frontera (referencia de K2.5: $0.45/1M tokens de entrada).
- Alibaba: la visión como una escala. Qwen-VL abarca desde modelos abiertos autohospedables (niveles pequeños de Qwen3-VL) hasta el Max propietario: elija su punto de precio-rendimiento. Desventaja: tanta amplitud implica que la carga de elegir recae en usted, y la facturación de imágenes depende de la resolución en lugar de tener un límite fijo.
A cuál enrutar: tabla de decisión
| Su carga de trabajo | Enrutar a |
|---|---|
| Bucles de agentes de capturas de pantalla/UI de gran volumen, sensibles al costo | deepseek-v4-flash-vision-exp — ≤384t/imagen a precios de Flash |
| Razonamiento multimodal complejo en un modelo abierto de frontera | Kimi K3 — visión nativa + 2.8T + 1M ctx |
| Autohospedaje / visión aislada de la red (air-gapped) | Niveles abiertos de Qwen3-VL (o adaptadores comunitarios para V4-Flash) |
| Una sola integración, todos los proveedores, fallback por modelo | Relay compatible con OpenAI que cubre los tres (esos somos nosotros: lista de espera) |
Frente a las APIs de visión occidentales
Para calibrar: Claude Sonnet 4.5 figura a $3/1M de entrada, Grok 4.6 a $2/1M, Gemini 3.7 Flash precio introductorio $0.75/1M (nuestro informe de Gemini). Vision-Exp es entre 1.7 y 13.6 veces más económico por token que los tres, con el único límite estricto por imagen; la oferta de visión china en conjunto abarca ahora $0.13–$0.45/1M de entrada, un rango que los precios occidentales no alcanzan. Cálculos completos de costos en nuestra guía de precios de Vision.
FAQ
¿Cuál es el más económico para agentes con uso intensivo de imágenes?
Vision-Exp, por un amplio margen: $0.22/1M de entrada en horas valle con imágenes limitadas a 384 tokens. 1,000 capturas de pantalla de tamaño máximo ≈ $0.08 en horas valle.
¿Tiene visión GLM-5.2/5.3?
Aún no: los modelos insignia de Zhipu de 2026 son solo de texto al 21 de agosto de 2026. Las opciones de visión abierta de China son Kimi (pesos anunciados) y los niveles de Qwen-VL.
¿Es Vision-Exp de nivel de producción frente a la visión nativa de Kimi?
Diferentes perfiles de riesgo: Vision-Exp es experimental (posible desvío/obsolescencia) pero el más económico; la visión de Kimi lleva utilizándose en producción desde K2.5. Patrón sensato: Vision-Exp por costo, Kimi/Qwen-VL como fallback estable a un solo flag de configuración de distancia.
¿Son estables estos números?
Los precios de las APIs chinas cambian rápido (DeepSeek ha ajustado precios dos veces desde abril). Las cifras de DeepSeek aquí son oficiales al 21 de agosto de 2026; las de Kimi/Qwen provienen de trackers. Vuelva a verificarlas antes de cerrar presupuestos.