Actualités / Model Watch · Lancement officiel + Guide développeur
DeepSeek-V4-Flash-Vision-Exp (2026) : Lancement officiel, tarifs et démarrage rapide de l'API prêt à copier-coller
Deux jours après le teaser de la mascotte baleine et un jour après la fuite du nom dans les listes d'API en pré-déploiement, DeepSeek concrétise l'annonce : deepseek-v4-flash-vision-exp, un modèle multimodal expérimental de compréhension visuelle, est disponible sur l'API officielle depuis le 21 août 2026. La qualité du texte reste au niveau de V4-Flash ; les capacités pour les agents multimodaux sont « proches d'Opus-4.8 » ; la tarification reste identique à celle de V4-Flash ; et une nouvelle Files API est lancée en parallèle. Ce guide détaille la chronologie du lancement, la comparaison tarifaire face aux modèles de vision occidentaux, du code de démarrage rapide fonctionnel, ainsi que des recommandations pour router chaque charge de travail vers le bon modèle DeepSeek.
DeepSeek-V4-Flash-Vision-Exp est un modèle officiel de DeepSeek, lancé le 21 août 2026, d'après l'entrée du changelog de l'API datée du 2026-08-21.
Appelez-le avec model='deepseek-v4-flash-vision-exp' ; il accepte du texte + des images via base64, des URL externes ou la nouvelle Files API à travers Chat Completions, l'API Messages compatible Anthropic et l'API Responses.
Selon la page officielle des tarifs, il coûte exactement la même chose que V4-Flash — $0.22 par 1M de tokens d'entrée en heures creuses ($0.44 en heures pleines) — et chaque image est facturée au maximum 384 tokens.
DeepSeek Harness v0.1.1-rc.1 le prend en charge nativement.
Du teaser au lancement : la chronologie des 72 heures
| Quand | Ce qui s'est passé · source |
|---|---|
| 18 juin | L'application et le web DeepSeek intègrent la vision par image (produit uniquement, pas de modèle d'API). Les chercheurs sur X : « Vision is now live on web and app. » |
| 3–4 août | La communauté refuse d'attendre : l'adaptateur MoonViT DeepSeek-V4-Flash-Vision-NVFP4 de WebBrain et 0731-vision de FlyCockpit débarquent sur Hugging Face (plus de détails ci-dessous). |
| 19–20 août | Le chercheur en multimodalité de DeepSeek, Xiaokang Chen, publie sur X le teaser de la baleine aux yeux ouverts « Now, we see you. 👀 » — TestingCatalog fait le lien avec un prochain modèle de vision. |
| 20 août | L'identifiant exact du modèle apparaît en pré-déploiement : des captures d'écran de la liste des modèles de l'API montrant deepseek-v4-flash-vision-exp circulent sur X (@NFT_Chen) et dans le code de DeepSeek Harness — documentation pas encore mise à jour. |
| 21 août (soirée UTC+8) | Lancement officiel. Entrée du changelog « DeepSeek-V4-Flash-Vision-Exp Release » (2026-08-21) ; mise en ligne de la page des tarifs, du guide Vision et du guide Files API ; annonce officielle sur WeChat (couverture médiatique dans l'heure) ; DeepSeek Harness v0.1.1-rc.1 ajoute le support natif. |
Note de la rédaction : une version antérieure de cette synthèse, publiée le matin du 21 août avant le lancement, concluait qu'aucun modèle officiel n'existait — exact à cette heure-là (la documentation ne contenait aucune entrée ; le nom n'était présent qu'en pré-déploiement), mais démenti dès le soir. Ces lancements officiels surprises sont précisément la raison pour laquelle nous horodatons chaque affirmation.
Ce qui a été livré, selon la documentation officielle
- Le modèle. Modèle expérimental de compréhension visuelle ;
model='deepseek-v4-flash-vision-exp'. Présentation officielle : qualité de texte « au niveau du DeepSeek-V4-Flash officiel », capacités d'agent multimodal « proches d'Opus-4.8 ». V4-Pro n'a pas reçu la vision — il s'agit pour l'instant d'une exclusivité de la famille Flash. - Trois façons d'envoyer des images. En ligne via des URL
data:en base64 ; une URL publique d'image externe (limite de 8 192 caractères, délai d'expiration de téléchargement de 60s) ; ou la Files API — téléversez une fois, puis référencez lefile_id. Les trois endpoints fonctionnent : Chat Completions compatible OpenAI, Messages compatible Anthropic (la Files API nécessite l'en-têteanthropic-beta: files-api-2025-04-14) et Responses. - Limites d'image. JPEG / PNG / GIF / WebP ; 32 MiB par image en ligne ou par URL, 64 MiB via file_id ; jusqu'à 600 images par requête ; corps de requête de 48 MiB (64 MiB au total pour les images, 200 MiB avec des images via file_id) ; max 8 192 px par côté (4 096 px lors de l'envoi de 15 images ou plus).
- La Files API (nouveau lancement distinct). purpose=
user_data; 64 MiB par fichier ; 25 GiB et 10 000 fichiers par utilisateur ; rétention de 1 heure à 30 jours ou permanente ; format détecté par le contenu, pas par l'extension. - Support dans Harness, le jour même. DeepSeek Harness v0.1.1-rc.1 (compte officiel, 21 août 18:22) : « DeepSeek 模型适配器新增 DeepSeek-V4-Flash-Vision-Exp 多模态模型选项,并支持配置原生图片请求 » — l'infrastructure de traitement d'images des versions rc.7/rc.8 de la semaine dernière dispose désormais d'un modèle officiel à intégrer (voir notre synthèse sur rc.7/rc.8).
Tarifs de deepseek-v4-flash-vision-exp (2026) : identiques à V4-Flash, images plafonnées à 384 tokens
deepseek-v4-flash-vision-exp coûte la même chose que deepseek-v4-flash : $0.22 par 1M de tokens d'entrée en heures creuses, $0.44 en heures pleines, $0.66/$1.32 en sortie — et chaque image est facturée au maximum 384 tokens. Les heures pleines sont de 01:00 à 04:00 et de 06:00 à 10:00 UTC (09:00–12:00 et 14:00–18:00 heure de Pékin) ; les heures creuses coûtent la moitié des heures pleines.
| Par 1M de tokens (USD) | Heures creuses | Heures pleines | Notes |
|---|---|---|---|
| Entrée — cache hit | $0.007 | $0.014 | Identique à deepseek-v4-flash |
| Entrée — cache miss | $0.22 | $0.44 | ≈ ¥1.5 / ¥3.0 |
| Sortie | $0.66 | $1.32 | ≈ ¥4.5 / ¥9.0 |
| Facturation des images | Redimensionné avant l'inférence : les images <~384×384 sont agrandies, les plus grandes sont réduites à l'équivalent de ~800×800 pixels | Plafond de 384 tokens par image — une image 2000×2000 et une 5000×5000 coûtent la même chose ; chaque image d'une requête multi-images est facturée indépendamment | |
Source : page officielle des tarifs et guide d'utilisation des tokens Vision, consultés le 2026-08-21.
Combien coûte réellement une image : vision-exp vs les modèles de vision occidentaux (2026)
Une image de taille maximale sur vision-exp coûte au plus $0.00017 en heures pleines ($0.000084 en heures creuses) — soit environ 1 000 captures d'écran pour moins de $0.09 en heures creuses. Les modèles de vision occidentaux facturent les images selon leur propre décompte de tokens (plus élevé et dépendant de la résolution) avec des prix par token 1.7× à 13.6× plus élevés :
| Modèle (2026) | Entrée $/1M | vs vision-exp | Facturation des images |
|---|---|---|---|
| deepseek-v4-flash-vision-exp | $0.22 / $0.44 (creuses/pleines) | référence | ≤384 tokens/image, plafond strict |
| Gemini 3.7 Flash (intro) | $0.75 | 1.7–3.4× | dépendant de la résolution, aucun plafond publié de type 384 |
| Grok 4.6 | $2.00 | 4.5–9.1× | dépendant de la résolution |
| Claude Sonnet 4.5 | $3.00 | 6.8–13.6× | capture d'écran typique ≈1 000+ tokens → ≈$0.003+/image (estimation) |
Les prix comparatifs sont les tarifs publics affichés pour Claude Sonnet 4.5 et Grok 4.6 ainsi que le tarif de lancement publié par Google pour Gemini 3.7 Flash (voir notre synthèse sur Gemini 3.7) ; le décompte des tokens d'image des concurrents varie selon la résolution et constitue une estimation. Le point structurel demeure : vision-exp combine le prix par token le plus bas de sa catégorie avec le seul plafond strict de tokens par image.
Comment appeler deepseek-v4-flash-vision-exp : démarrage rapide (curl + Python)
L'API est compatible avec OpenAI — le format standard de message de vision fonctionne tel quel avec https://api.deepseek.com. Image par URL publique :
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Describe the UI bug visible in this screenshot."},
{"type": "image_url",
"image_url": {"url": "https://example.com/screenshot.png"}}
]
}]
}'
Même appel en Python avec le SDK officiel OpenAI — faites pointer base_url vers DeepSeek, intégrez l'image en base64 :
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Summarize this dashboard."},
{"type": "image_url",
"image_url": {"url": "data:image/png;base64,"}},
],
}],
)
print(resp.choices[0].message.content)
- JavaScript/Node : structure identique avec le package npm
openai— remplacezbaseURLet l'identifiant du modèle. - Captures d'écran répétées (boucles d'agents) : téléversez une fois via la Files API (
purpose="user_data"), puis référencez lefile_idretourné — 64 MiB par image, sans ré-envoi à chaque tour. C'est le schéma qu'utilise nativement DeepSeek Harness v0.1.1-rc.1. - Stack de type Anthropic : l'endpoint Messages fonctionne également ; les références à la Files API nécessitent l'en-tête
anthropic-beta: files-api-2025-04-14. - Via un relais ou une passerelle : tout proxy compatible OpenAI qui transmet les blocs de contenu
image_urltransmet les charges utiles de vision sans modification — vérifiez que votre passerelle transmet bien les tableaux de contenu en plusieurs parties avant d'incriminer le modèle.
Quel modèle DeepSeek choisir : vision-exp vs v4-flash vs v4-pro
| Votre charge de travail | Router vers | Pourquoi |
|---|---|---|
| Texte + boucles de code d'agents, appels d'outils, contexte long | deepseek-v4-flash | Modèle GA stable, même prix ; aucune raison de payer le surcoût de la vision sur des tours en texte pur |
| Captures d'écran, débogage d'interface utilisateur, lecture de graphiques/tableaux de bord, images de documents | deepseek-v4-flash-vision-exp | Tarif Flash + plafond de 384 tokens par image ; agent multimodal proche d'Opus-4.8 ; expérimental — verrouillez l'identifiant |
| Raisonnement le plus complexe, qualité maximale, contexte de 1M | deepseek-v4-pro | Le modèle DeepSeek le plus puissant ; toujours exclusivement textuel — associez-le à vision-exp pour l'étape de traitement des images |
| Vision native avec poids ouverts (open weights), auto-hébergé | Kimi K3 / Qwen-VL | vision-exp est uniquement disponible via l'API ; pour la vision en open-weights, consultez notre guide de l'API Kimi |
Accédez aux modèles chinois dotés de vision via un endpoint unique compatible OpenAI
ChinaModelAPI est un relais indépendant qui met les modèles de pointe chinois — DeepSeek, Qwen, GLM, Kimi — à la disposition des développeurs du monde entier via une API unique compatible OpenAI, avec des paiements en USDT/USD1 et sans abonnement. Les lancements de modèles comme vision-exp sont précisément la raison d'être de la plateforme : disponibilité des modèles dès le premier jour, tarification transparente au token et une seule intégration pour l'ensemble du catalogue de modèles chinois.
ChinaModelAPI est un relais indépendant sans affiliation officielle avec DeepSeek. Les identifiants des modèles routés sont vérifiés en direct avant le lancement — rejoignez la liste d'attente pour être informé dès que le routage de la vision sera disponible.
Ce qu'il advient des adaptateurs communautaires (et de la confusion)
- Le conflit de nom est résolu — en faveur de DeepSeek. Pendant deux semaines, « V4-Flash vision » désignait des checkpoints communautaires : le DeepSeek-V4-Flash-Vision-NVFP4 de WebBrain (V4-Flash gelé + Kimi-K2.6 MoonViT gelé + un projecteur entraîné de 40.1M de paramètres, 3 août) et 0731-vision de FlyCockpit (4 août). Le modèle officiel s'approprie désormais ce nom — avec un support, une documentation et une tarification Flash que les adaptateurs ne peuvent égaler.
- Les adaptateurs ne sont pas inutiles — ils sont repositionnés. Si vous auto-hébergez les poids de V4-Flash sur vos propres GPU et souhaitez une vision hors ligne / isolée du réseau, ils restent la seule option ; la version officielle de vision-exp est exclusivement accessible via l'API, et aucun poids de vision n'a été publié en open source.
- Le schéma « pré-déploiement avant lancement » mérite d'être retenu. C'est la deuxième sortie de DeepSeek en un mois qui apparaît dans les listes d'API ou le code avant la mise à jour de la documentation (V4-Flash-0731 a suivi le même chemin). Pour les opérateurs de relais et les développeurs d'outils : surveiller l'endpoint de liste des modèles et les notes de version de DSH s'avère plus efficace que d'attendre le changelog.
Sources primaires
- Changelog de l'API DeepSeek — entrée « DeepSeek-V4-Flash-Vision-Exp Release » datée du 2026-08-21
- Tarifs officiels de DeepSeek — vision-exp identique à V4-Flash ; plages heures pleines/heures creuses ; 2 500 requêtes simultanées
- Guide DeepSeek Vision — méthodes d'envoi d'images, limites, règle des 384 tokens par image
- Guide DeepSeek Files API — formats, 64 MiB/fichier, 25 GiB & 10 000 fichiers par utilisateur
- Compte officiel WeChat DeepSeek Harness — v0.1.1-rc.1 ajoute l'option du modèle vision-exp et les requêtes d'images natives (2026-08-21)
- ifanr — Flash : Sortie du modèle multimodal DeepSeek, la baleine ouvre enfin ses yeux (2026-08-21, avec captures des tarifs)
- X — @NFT_Chen : capture d'écran du pré-déploiement montrant vision-exp dans la liste de l'API (2026-08-20)
- TestingCatalog — teaser de la baleine aux yeux ouverts par le chercheur en multimodalité de DeepSeek Xiaokang Chen (19–20 août)
- LINUX DO — Annonce officielle de DeepSeek-V4-Flash-Vision-Exp (2026-08-21, discussions de la communauté et grille tarifaire)
- Hugging Face — Adaptateur communautaire WebBrain (contexte : l'écosystème avant le lancement)
Questions fréquentes (2026)
vision-exp est-il désormais officiel ?
Oui — lancé le 21 août 2026 avec une entrée datée dans le changelog, une documentation en ligne et des annonces officielles. Les captures d'écran du « pré-déploiement » du 20 août montraient bien le véritable modèle en cours de mise en place, et non une simple rumeur.
V4-Pro a-t-il également reçu la vision ?
Non. Seule la famille Flash a obtenu une variante vision. V4-Pro reste exclusivement textuel ; l'arrivée éventuelle d'une vision de niveau Pro n'a pas été annoncée.
Comment les images sont-elles facturées ?
Les images sont redimensionnées à l'équivalent d'environ 800×800 pixels (min ~384×384), converties en tokens et facturées comme des données d'entrée — avec un plafond fixé à 384 tokens par image. Une image 2K et une image 5K coûtent la même chose.
Les poids ouverts sont-ils disponibles ?
Non. vision-exp est accessible uniquement via l'API pour le moment. Pour l'auto-hébergement, les adaptateurs communautaires (WebBrain NVFP4, FlyCockpit) restent la seule option hors ligne — non officiels et non évalués par rapport à cette version.
Est-il disponible sur OpenRouter / des fournisseurs tiers ?
Au moment de la publication (21 août au soir UTC+8), le modèle était proposé sur la plateforme officielle de DeepSeek ; la disponibilité chez des tiers n'était pas encore confirmée. Vérifiez la liste en temps réel des modèles de votre fournisseur avant de router vos requêtes.
Entrée vidéo ou PDF ?
Non — la documentation officielle n'indique que la prise en charge des images (JPEG/PNG/GIF/WebP). Pour les documents, extrayez les pages sous forme d'images côté appelant ; pour la vidéo, échantillonnez des images fixes.
Limites de requêtes ?
La page officielle des tarifs indique une concurrence de 2 500 pour les deux modèles Flash (contre 500 pour V4-Pro). Le statut expérimental implique que les limites peuvent changer — vérifiez dans la documentation.
Prêt pour la production ?
Prenez le « Exp » au sérieux : dérive possible du comportement, changements de tarifs/conditions ou dépréciation/renommage (comme l'a déjà montré l'historique de DeepSeek : preview → 0731 GA). Conservez une solution de secours avec vision native (Kimi K3, Qwen-VL) facilement activable dans votre configuration.