ChinaModelAPI

Noticias / Model Watch · Lanzamiento oficial + Guía para desarrolladores

Lanzamiento oficial deepseek-v4-flash-vision-exp Vision API Precios Inicio rápido
2026-08-21 · Model Watch · lanzado el 21 de agosto por la tarde (UTC+8) tras el lanzamiento en fase gris del 20 de agosto

DeepSeek-V4-Flash-Vision-Exp (2026): lanzamiento oficial, precios y guía rápida de la API para copiar y pegar

Dos días después del adelanto con la mascota de la ballena y un día después de que el nombre se filtrara en las listas de la API de lanzamiento gradual, DeepSeek lo hizo realidad: deepseek-v4-flash-vision-exp, un modelo experimental de comprensión visual multimodal, disponible en la API oficial a partir del 21 de agosto de 2026. La calidad de texto se mantiene a la par de V4-Flash; la capacidad como agente multimodal se sitúa "cerca de Opus-4.8"; el precio se mantiene sin cambios respecto a V4-Flash; y llega acompañado de una nueva Files API. Esta guía incluye la cronología del lanzamiento, el cálculo de precios frente a los modelos de visión occidentales, código de inicio rápido funcional y a qué modelo de DeepSeek redirigir cada carga de trabajo.

Respuesta directa

DeepSeek-V4-Flash-Vision-Exp es un modelo oficial de DeepSeek, lanzado el 21 de agosto de 2026, según la entrada del registro de cambios de la API con fecha 2026-08-21. Invocable con model='deepseek-v4-flash-vision-exp'; acepta texto + imágenes mediante base64, URLs externas o la nueva Files API a través de Chat Completions, la Messages API compatible con Anthropic y la Responses API. Según la página oficial de precios, cuesta exactamente lo mismo que V4-Flash: $0.22 por 1M de tokens de entrada en horas valle ($0.44 en horas punta), y cada imagen se factura como máximo a 384 tokens. DeepSeek Harness v0.1.1-rc.1 lo admite de forma nativa.

Del adelanto al lanzamiento: la cronología de 72 horas

CuándoQué ocurrió · fuente
18 de junioLa app y web de DeepSeek reciben visión de imágenes (solo producto, sin modelo de API). Investigadores en X: "Vision ya está disponible en web y app."
3–4 de agostoLa comunidad no espera: el adaptador MoonViT DeepSeek-V4-Flash-Vision-NVFP4 de WebBrain y 0731-vision de FlyCockpit llegan a Hugging Face (más información abajo).
19–20 de agostoXiaokang Chen, investigador multimodal de DeepSeek, publica en X el adelanto de la ballena con los ojos abiertos "Now, we see you. 👀" — TestingCatalog lo conecta con un próximo modelo de visión.
20 de agostoEl ID exacto del modelo aparece en fase gris: capturas de pantalla de la lista de modelos de la API que muestran deepseek-v4-flash-vision-exp circulan en X (@NFT_Chen) y en el código de DeepSeek Harness; la documentación aún no se ha actualizado.
21 de agosto (tarde UTC+8)Lanzamiento oficial. Entrada en el registro de cambios "DeepSeek-V4-Flash-Vision-Exp Release" (2026-08-21); se publican la página de precios, la guía de Vision y la guía de Files API; anuncio oficial en WeChat (cobertura de prensa en menos de una hora); DeepSeek Harness v0.1.1-rc.1 añade soporte nativo.

Nota del editor: una versión anterior de este informe, publicada la mañana del 21 de agosto antes del lanzamiento, concluía que no existía ningún modelo oficial; una afirmación correcta a esa hora (la documentación no tenía ninguna entrada y el nombre solo estaba en fase de lanzamiento gradual gris), pero incorrecta al llegar la tarde. Los lanzamientos oficiales el mismo día son exactamente la razón por la que fechamos cada afirmación.

Novedades incluidas, según la documentación oficial

  • El modelo. Modelo experimental de comprensión visual; model='deepseek-v4-flash-vision-exp'. Definición oficial: calidad de texto "a la par del DeepSeek-V4-Flash oficial", capacidades de agente multimodal "cercanas a Opus-4.8". V4-Pro no recibió visión: por ahora es una capacidad exclusiva de la familia Flash.
  • Tres formas de enviar imágenes. URLs data: en base64 integradas; una URL pública externa de imagen (límite de 8.192 caracteres, tiempo de espera de descarga de 60 s); o la Files API: suba una vez y referencie el file_id. Los tres endpoints funcionan: Chat Completions compatible con OpenAI, Messages compatible con Anthropic (Files API requiere el encabezado anthropic-beta: files-api-2025-04-14) y Responses.
  • Límites de imagen. JPEG / PNG / GIF / WebP; 32 MiB por imagen integrada o por URL, 64 MiB mediante file_id; hasta 600 imágenes por solicitud; cuerpo de solicitud de 48 MiB (64 MiB en total para imágenes, 200 MiB con imágenes mediante file_id); máx. 8.192 px por lado (4.096 px al enviar 15+ imágenes).
  • La Files API (lanzamiento nuevo e independiente). purpose=user_data; 64 MiB por archivo; 25 GiB y 10.000 archivos por usuario; retención de 1 hora a 30 días o permanente; formato detectado por contenido, no por extensión.
  • Soporte en Harness, el mismo día. DeepSeek Harness v0.1.1-rc.1 (cuenta oficial, 21 de agosto 18:22): "DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求" — la infraestructura de imágenes de rc.7/rc.8 de la semana pasada ahora tiene un modelo oficial al que conectarse (consulte nuestro informe sobre rc.7/rc.8).

Precios de deepseek-v4-flash-vision-exp (2026): igual que V4-Flash, imágenes limitadas a 384 tokens

deepseek-v4-flash-vision-exp cuesta lo mismo que deepseek-v4-flash: $0.22 por 1M de tokens de entrada en horas valle, $0.44 en horas punta, $0.66/$1.32 de salida; y cada imagen se factura a un máximo de 384 tokens. Las horas punta son de 01:00 a 04:00 y de 06:00 a 10:00 UTC (09:00–12:00 y 14:00–18:00 en Pekín); las horas valle cuestan la mitad de las horas punta.

Por 1M de tokens (USD)Horario valleHorario picoNotas
Entrada — acierto de caché$0.007$0.014Idéntico a deepseek-v4-flash
Entrada — fallo de caché$0.22$0.44≈ ¥1.5 / ¥3.0
Salida$0.66$1.32≈ ¥4.5 / ¥9.0
Facturación de imágenesRedimensionado previo a la inferencia: <~384×384 se amplía, tamaños mayores se reducen al equivalente de ~800×800 píxelesLímite superior de 384 tokens por imagen: una imagen de 2000×2000 y una de 5000×5000 cuestan lo mismo; cada imagen en una solicitud de varias imágenes se factura de forma independiente

Fuente: página oficial de precios y guía de uso de tokens de Vision, consultadas el 2026-08-21.

Cuánto cuesta realmente una imagen: vision-exp frente a modelos de visión occidentales (2026)

Una imagen de tamaño máximo en vision-exp cuesta como máximo $0.00017 en horas punta ($0.000084 en horas valle), es decir, unas 1.000 capturas de pantalla por menos de $0.09 en horas valle. Los modelos occidentales con capacidad de visión facturan las imágenes según sus propios recuentos de tokens (mayores y dependientes de la resolución) a precios por token entre 1.7× y 13.6× más altos:

Modelo (2026)Entrada $/1Mvs. vision-expFacturación de imágenes
deepseek-v4-flash-vision-exp$0.22 / $0.44 (valle/punta)referencia≤384 tokens/imagen, límite estricto
Gemini 3.7 Flash (intro)$0.751.7–3.4×dependiente de la resolución, sin límite publicado tipo 384
Grok 4.6$2.004.5–9.1×depende de la resolución
Claude Sonnet 4.5$3.006.8–13.6×captura de pantalla típica ≈1,000+ tokens → ≈$0.003+/imagen (estimación)

Los precios de comparación son precios de lista de las páginas públicas de tarifas de Claude Sonnet 4.5 y Grok 4.6, junto con el precio promocional publicado por Google para Gemini 3.7 Flash (nuestro informe sobre Gemini 3.7); los recuentos de tokens de imagen de la competencia varían según la resolución y son estimados. El punto estructural se mantiene en cualquier caso: vision-exp combina el precio por token más económico de su categoría con el único límite máximo estricto de tokens por imagen.

Cómo invocar deepseek-v4-flash-vision-exp: guía rápida (curl + Python)

La API es compatible con OpenAI: el formato estándar de mensajes de visión funciona tal cual contra https://api.deepseek.com. Imagen mediante URL pública:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash-vision-exp",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe the UI bug visible in this screenshot."},
        {"type": "image_url",
         "image_url": {"url": "https://example.com/screenshot.png"}}
      ]
    }]
  }'

La misma llamada en Python con el SDK oficial de OpenAI: apunte base_url a DeepSeek e inserte la imagen en base64:

from openai import OpenAI

client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")

resp = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "Summarize this dashboard."},
            {"type": "image_url",
             "image_url": {"url": "data:image/png;base64,"}},
        ],
    }],
)
print(resp.choices[0].message.content)
  • JavaScript/Node: estructura idéntica con el paquete npm de openai; cambie baseURL y el ID del modelo.
  • Capturas de pantalla repetidas (bucles de agentes): súbalas una vez a través de la Files API (purpose="user_data") y luego referencie el file_id devuelto: 64 MiB por imagen, sin necesidad de volver a subirla en cada turno. Este es el patrón que DeepSeek Harness v0.1.1-rc.1 utiliza de forma nativa.
  • Pila estilo Anthropic: el endpoint Messages también funciona; las referencias a Files API necesitan el encabezado anthropic-beta: files-api-2025-04-14.
  • A través de un relay o gateway: cualquier proxy compatible con OpenAI que reenvíe los bloques de contenido image_url transmite las cargas útiles de visión sin alteraciones; verifique que su gateway reenvíe arrays de contenido multipartes antes de atribuir el problema al modelo.

A qué modelo de DeepSeek enrutar: vision-exp frente a v4-flash y v4-pro

Su carga de trabajoEnrutar aMotivo
Texto + bucles de código con agentes, llamadas a herramientas, contexto largodeepseek-v4-flashModelo GA estable, mismo precio; no hay razón para pagar sobrecostes de visión en turnos de solo texto
Capturas de pantalla, depuración de UI, lectura de gráficos/dashboards, imágenes de documentosdeepseek-v4-flash-vision-expPrecios de Flash + límite de 384 tokens por imagen; agente multimodal cercano a Opus-4.8; experimental: fije el ID
Razonamiento más complejo, máxima calidad, contexto de 1Mdeepseek-v4-proEl modelo más potente de DeepSeek; aún solo texto: combínelo con vision-exp para el paso de imagen
Visión nativa con pesos abiertos, autohospedadoKimi K3 / Qwen-VLvision-exp solo está disponible vía API; para visión con pesos abiertos, consulte nuestra guía de la API de Kimi

Acceda a modelos chinos con capacidad de visión a través de un único endpoint compatible con OpenAI

ChinaModelAPI es un relay independiente que pone a disposición de desarrolladores de todo el mundo modelos de frontera chinos — DeepSeek, Qwen, GLM, Kimi — tras una única API compatible con OpenAI, con pagos en USDT/USD1 y sin suscripción. Los lanzamientos de modelos como vision-exp son exactamente para lo que se diseñó la plataforma: disponibilidad desde el primer día, precios transparentes por token y una sola integración para todo el catálogo de modelos chinos.

ChinaModelAPI es un relay independiente sin relación oficial con DeepSeek. Los IDs de los modelos enrutados se verifican en vivo antes del lanzamiento; únase a la lista de espera para recibir una notificación cuando el enrutamiento de visión esté disponible.

En qué situación quedan los adaptadores comunitarios (y la confusión)

  • El conflicto de nombres se ha resuelto, a favor de DeepSeek. Durante dos semanas, "V4-Flash vision" hacía referencia a checkpoints de la comunidad: DeepSeek-V4-Flash-Vision-NVFP4 de WebBrain (V4-Flash congelado + Kimi-K2.6 MoonViT congelado + un proyector entrenado de 40.1M parámetros, 3 de agosto) y 0731-vision de FlyCockpit (4 de agosto). El modelo oficial ahora es dueño del nombre, con un soporte, documentación y precios de Flash que los adaptadores no pueden igualar.
  • Los adaptadores no son inútiles: se han reposicionado. Si aloja los pesos de V4-Flash en sus propias GPUs y desea visión sin conexión o aislada de la red (air-gapped), siguen siendo la única opción; el modelo oficial vision-exp solo está disponible mediante API y no se han liberado pesos de visión en código abierto.
  • Vale la pena recordar el patrón de fase gris a lanzamiento. Este es el segundo lanzamiento de DeepSeek en un mes que aparece en las listas de la API o en el código antes de que se actualice la documentación (V4-Flash-0731 siguió el mismo camino). Para operadores de relays y desarrolladores de herramientas: monitorizar el endpoint de la lista de modelos y las notas de la versión de DSH es mucho mejor que esperar al changelog.

Fuentes primarias

Preguntas frecuentes (2026)

¿Es vision-exp oficial ahora?

Sí: lanzado el 21 de agosto de 2026 con una entrada fechada en el registro de cambios, documentación publicada y anuncios oficiales. Las capturas de pantalla del "lanzamiento gradual en fase gris" del 20 de agosto correspondían al modelo real en fase de despliegue, no a un rumor.

¿V4-Pro también recibió visión?

No. Solo la familia Flash obtuvo una variante con visión. V4-Pro sigue siendo únicamente de texto; aún no se ha anunciado si habrá una versión con visión a nivel Pro.

¿Cómo se facturan las imágenes?

Las imágenes se redimensionan a un equivalente aproximado de 800×800 píxeles (mín. ~384×384), se convierten a tokens y se facturan como entrada, con un límite máximo de 384 tokens por imagen. Una imagen de 2K y una de 5K cuestan lo mismo.

¿Están disponibles los pesos abiertos?

No. Por ahora, vision-exp está disponible únicamente mediante API. Quienes autohospedan modelos conservan los adaptadores de la comunidad (WebBrain NVFP4, FlyCockpit) como opción fuera de línea: no oficiales y sin pruebas de rendimiento comparativas frente a este lanzamiento.

¿Está disponible en OpenRouter o proveedores de terceros?

Al momento de la publicación (21 de agosto por la tarde UTC+8), el modelo era servido por la plataforma oficial de DeepSeek; la disponibilidad en proveedores externos aún no estaba confirmada. Consulte la lista de modelos en vivo de su proveedor antes de enrutar.

¿Entrada de vídeo o PDF?

No: la documentación oficial solo admite entrada de imágenes (JPEG/PNG/GIF/WebP). Para documentos, extraiga las páginas como imágenes desde el lado del cliente; para vídeo, extraiga fotogramas de muestra.

¿Límites de peticiones?

La página oficial de precios indica una concurrencia de 2.500 para ambos modelos Flash (frente a 500 para V4-Pro). Su estado experimental implica que los límites pueden cambiar: verifíquelo en la documentación.

¿Listo para producción?

Tome en serio el distintivo "Exp": posibles variaciones de comportamiento, cambios de precios/términos o discontinuación/renombrado (el propio historial de DeepSeek: preview → 0731 GA). Mantenga una alternativa de visión nativa (Kimi K3, Qwen-VL) a un solo ajuste de configuración.

Guías relacionadas