ChinaModelAPI

Guides / Modèles de vision chinois 2026

Comparatif · mis à jour le 2026-08-21 · Chiffres officiels DeepSeek ; Kimi/Qwen issus des trackers

API de modèles de vision chinois en 2026 : DeepSeek Vision-Exp vs Qwen-VL vs Kimi

Chaque grand laboratoire chinois propose désormais une API dotée de capacités de vision. Le modèle deepseek-v4-flash-vision-exp de DeepSeek (21 août 2026) est la nouveauté la plus récente et la plus abordable parmi les modèles performants ; la famille Qwen-VL d'Alibaba est la plus large ; la gamme Kimi de Moonshot intègre la vision native depuis le plus longtemps. Cette page compare les éléments clés pour le routage — performances, tarification, contexte, open weights — avec indication des sources pour chaque ligne.

Réponse directe

Routage par contrainte : vision performante la plus économique → deepseek-v4-flash-vision-exp ($0.22/1M input heures creuses, ≤384 tokens par image, agent multimodal proche d'Opus-4.8) ; vision frontier en open-weights + 1M de contexte → Kimi K3 ; gamme la plus vaste, des petits modèles auto-hébergeables au modèle propriétaire Max → famille Qwen3-VL. Tous trois utilisent le format compatible OpenAI, une seule passerelle peut donc les desservir avec des solutions de repli par modèle.

Le tableau comparatif 2026

ModèleVisionContexteEntrée $/1MPoids ouvertsNotes
deepseek-v4-flash-vision-exp
DeepSeek · 21 août 2026 · officiel
✓ expérimental 1M $0.22 / $0.44
≤384 t/image
✗ (API uniquement) Parité textuelle avec V4-Flash ; agent multimodal ≈ Opus-4.8 ; nouvelle API Files
Kimi K3
Moonshot · juil. 2026
✓ natif (MoonViT) 1M K3 à venir
Réf. K2.5 : $0.45 (tracker)
✓ annoncé Modèle phare de classe 2.8T ; vision depuis K2.5 (janv. 2026, encodeur MoonViT 400M)
Famille Qwen3-VL
Alibaba · 2025–2026
✓ natif jusqu'à 1M
(3.6 Plus)
dès ~$0.13
(VL 30B, tracker)
✓ modèles petits/moyens Gamme la plus large : petits modèles ouverts → Qwen3.6 Plus ($0.325, tracker) → VL-Max propriétaire ; via DashScope
GLM-5.2 / 5.3
Zhipu · 2026
✗ texte uniquement 1M $1.40 Inclus pour être exhaustif — les meilleurs modèles phares chinois ouverts pour le code n'intègrent pas encore la vision

Ligne DeepSeek issue de la documentation officielle (21 août 2026). Chiffres Kimi/Qwen issus des trackers publics de modèles (pages modèles Roboflow, AIViewer ; mis à jour du 14 au 20 août 2026) et de notre guide de l'API Kimi — à vérifier par version dans la console de chaque fournisseur avant de budgétiser.

Trois familles, trois philosophies

  • DeepSeek : la vision comme arme tarifaire. Vision-Exp n'est pas un produit premium distinct — c'est le même V4-Flash au même prix par token avec un plafond de 384 tokens par image. L'objectif est de rendre la vision suffisamment abordable pour l'intégrer dans chaque boucle d'agent. Compromis : il s'agit d'une version expérimentale, uniquement par API, réservée à la famille Flash (pas encore de vision sur V4-Pro).
  • Moonshot : la vision comme fonctionnalité native phare. Kimi intègre la vision native via son encodeur MoonViT depuis K2.5 (janvier 2026) — l'encodeur que la communauté a littéralement repris pour doter officieusement V4-Flash de capacités visuelles avant que DeepSeek ne rattrape son retard. K3 l'associe à un modèle de classe 2.8T et à 1M de contexte. Compromis : tarification haut de gamme (référence K2.5 : $0.45/1M input).
  • Alibaba : la vision sous forme d'échelle. Qwen-VL s'étend des modèles ouverts auto-hébergeables (petits modèles Qwen3-VL) jusqu'au modèle propriétaire Max — choisissez votre compromis rapport qualité-prix. Compromis : cette diversité implique que le choix vous incombe, et la facturation des images dépend de la résolution plutôt que d'être plafonnée.

Quel modèle router : tableau de décision

Votre charge de travailRouter vers
Boucles d'agents UI / captures d'écran à fort volume, sensibles aux coûtsdeepseek-v4-flash-vision-exp — ≤384t/image aux tarifs Flash
Raisonnement multimodal complexe sur un modèle ouvert de pointeKimi K3 — vision native + 2.8T + 1M ctx
Vision auto-hébergée / isolée du réseau (air-gap)Modèles ouverts Qwen3-VL (ou adaptateurs communautaires pour V4-Flash)
Une seule intégration, tous les fournisseurs, repli par modèleRelais compatible OpenAI couvrant les trois (c'est notre service — liste d'attente)

Face aux API de vision occidentales

À titre de comparaison : Claude Sonnet 4.5 est affiché à $3/1M input, Grok 4.6 à $2/1M, Gemini 3.7 Flash en tarif de lancement à $0.75/1M (voir notre point sur Gemini). Vision-Exp est 1,7 à 13,6× moins cher par token que ces trois modèles, avec le seul plafond strict par image ; l'offre de vision chinoise s'étend désormais globalement de $0.13 à $0.45/1M input — une fourchette tarifaire inaccessible aux offres occidentales. Détail complet des coûts dans notre guide tarifaire de Vision.

FAQ

Quel est le modèle le plus économique pour les agents traitant beaucoup d'images ?

Vision-Exp, et de loin : $0.22/1M input en heures creuses avec des images plafonnées à 384 tokens. 1 000 captures d'écran de taille maximale ≈ $0.08 en heures creuses.

GLM-5.2/5.3 dispose-t-il de la vision ?

Pas encore — les modèles phares 2026 de Zhipu sont uniquement textuels au 21 août 2026. Les options de vision ouvertes en provenance de Chine sont Kimi (poids annoncés) et les différentes versions de Qwen-VL.

Vision-Exp est-il prêt pour la production par rapport à la vision native de Kimi ?

Des profils de risque différents : Vision-Exp est expérimental (dérive ou dépréciation possibles) mais le plus économique ; la vision de Kimi est déployée en production depuis K2.5. Approche recommandée : Vision-Exp pour réduire les coûts, Kimi/Qwen-VL en solution de repli stable activable via un simple paramètre de configuration.

Ces chiffres sont-ils stables ?

Les tarifs des API chinoises évoluent rapidement (DeepSeek a ajusté ses prix deux fois depuis avril). Les chiffres de DeepSeek présentés ici sont officiels au 21 août 2026 ; ceux de Kimi/Qwen proviennent de trackers. Vérifiez-les à nouveau avant de finaliser vos budgets.

Sur le même sujet