Les API LLM chinoises les plus économiques en 2026
Les API LLM chinoises les moins chères en août 2026 : Qwen3.5 Flash à $0.029/1M tokens en entrée (l'entrée la moins chère, sans exception), DeepSeek V4 Flash à $0.14/$0.28 (le plus économique globalement — moins cher que le plus abordable des modèles américains), et GLM-5.3 à $1.40/$4.40 pour du code de pointe au quart du prix des fleurons américains.
Tableau des prix vérifiés (août 2026)
Tous les prix sont les tarifs officiels par 1M de tokens (entrée/sortie), vérifiés le 23 août 2026 auprès de la documentation des fournisseurs et des agrégateurs. Triés par prix d'entrée.
| Modèle | Fournisseur | Entrée $/1M | Sortie $/1M | Idéal pour |
|---|---|---|---|---|
| DeepSeek V4 Flash | DeepSeek | 0.14 | 0.28 | Le plus économique et polyvalent : classification, extraction, chat à fort volume |
| GPT-5.6 Luna (référence US) | OpenAI | 0.20 | 1.20 | L'option US la moins chère — pour comparaison |
| Kimi K2.5 | Moonshot AI | 0.45 | 2.25 | Boucles d'agents, codage visuel, contexte 262K |
| MiniMax M3 | MiniMax | 0.60 | 2.40 | Le modèle >80% sur SWE-bench le moins cher — meilleur rapport qualité-prix pour le code |
| GLM-5.3 / GLM-5.2 | Zhipu / Z.ai | 1.40 | 4.40 | Code de pointe + contexte 1M, le plus abordable de sa catégorie |
| Qwen3.8-Max | Alibaba | 2.00 | 6.00 | Tâches phares de « cowork », multilingue |
| Kimi K3 | Moonshot AI | 3.00 | 15.00 | Fleuron multimodal premium 2.8T, contexte 1M |
Sources : Documentation des tarifs Z.ai (GLM) · Alibaba Model Studio (Qwen3.8-Max) · OpenRouter (Kimi K2.5) · Comparatif 12 API MorphLLM (V4 Flash, MiniMax M3) · Analyse de la guerre des prix par Apidog (V4-Pro, MiMo) · LLM Abacus (Qwen3.5 Flash) · BenchLM (Kimi K3) · Jeu de données JSON en direct sur GitHub. Les prix évoluent chaque semaine — revérifiez avant tout engagement majeur.
Champions par indicateur
- Entrée la moins chère de toutes les API LLM : Qwen3.5 Flash — $0.029/1M tokens en entrée (¥0.20), selon LLM Abacus. Idéal pour les pipelines de classification et d'extraction.
- Sortie de pointe la moins chère : DeepSeek V4-Pro — $0.87/1M tokens en sortie, le coût le plus bas parmi les modèles de pointe selon l'analyse de la guerre des prix d'Apidog.
- Long contexte à tarif fixe : Xiaomi MiMo V2.5 Pro — $3/1M en sortie forfaitaire pour un contexte de 1M de tokens, pour les fenêtres massives sans tarification par paliers.
Les leviers de coût qui comptent plus que le prix facial
- Mise en cache des prompts / prompts système plus courts — L'entrée en cache pour GLM-5.3 descend à $0.26/1M (au lieu de $1.40) ; les hits de cache pour Kimi K3 tombent à $0.30 (au lieu de $3.00). Permet souvent d'économiser plus que de changer de fournisseur.
- Ne router que les tâches difficiles — utilisez Kimi K3 / les modèles de classe R1 pour les étapes complexes ; V4 Flash / Qwen Flash pour 90 % des appels.
- Découpage + récupération (Chunk + retrieve) — les contextes réduits surpassent les grands modèles pour de nombreuses tâches RAG.
- Traiter par lots les tâches non interactives — la synthèse hors ligne est plus souple ; les tarifs heures creuses du week-end pour DeepSeek s'appliquent sur certaines plateformes.
Stack pratique (recommandée)
Chat/RAG à fort volume : deepseek-v4-flash ou les paliers qwen-flash — coût inférieur à GPT-Luna avec une meilleure qualité multilingue
Agents/code : kimi-k2.5 ou minimax-m3, basculez vers glm-5.2/5.3 pour les étapes de pointe
Génération vidéo (tarification à la seconde) : seedance-2.5 (~$0.10/s 480p) / happyhorse-1.1 ($0.0988/s 720p)
Facturation : recharge en USDT, clé unique compatible OpenAI via ChinaModelAPI
FAQ
Quelle est l'API LLM chinoise la moins chère en 2026 ?
En termes de prix d'entrée, Qwen3.5 Flash d'Alibaba est l'API LLM chinoise la moins chère à $0.029 par million de tokens en entrée. Pour un tarif équilibré, DeepSeek V4 Flash ($0.14 entrée / $0.28 sortie par 1M de tokens) est l'option la plus économique et polyvalente — elle bat même le modèle américain le moins cher, GPT-5.6 Luna ($0.20/$1.20), sur les deux tableaux.
À quel point les API LLM chinoises sont-elles moins chères que GPT ?
Comparé à la référence américaine la plus abordable (GPT-5.6 Luna à $0.20/$1.20 par 1M de tokens), DeepSeek V4 Flash est ~30 % moins cher en entrée et ~77 % moins cher en sortie. Face aux fleurons américains complets, l'écart se creuse d'un facteur 5 à 10 : GLM-5.3 offre des performances de code de pointe à $1.40/$4.40.
Quel modèle chinois est le moins cher pour le code et les agents ?
Kimi K2.5 de Moonshot à $0.45/$2.25 par 1M de tokens est le choix le plus avantageux pour les boucles d'agents. MiniMax M3 ($0.60/$2.40) est le modèle le moins cher obtenant plus de 80 % sur SWE-bench. Pour le code de pointe intensif, DeepSeek V4-Pro propose les tokens de sortie les moins chers ($0.87/1M) parmi les modèles de pointe.
Un prix plus bas implique-t-il toujours une moins bonne qualité ?
Non. Pour de nombreuses tâches de RAG et de support, les modèles open-weight de pointe chinois égalent ou dépassent les modèles occidentaux de milieu de gamme pour une fraction du coût. Testez systématiquement sur un jeu d'évaluation de 20 à 50 prompts dans votre propre domaine avant de migrer.
S'agit-il de prix officiels ou de prix de relais ?
Le tableau liste les prix officiels des fournisseurs (Z.ai pour GLM-5.3, Alibaba Model Studio pour Qwen3.8-Max, Moonshot pour Kimi) vérifiés auprès d'agrégateurs (OpenRouter, MorphLLM, LLM Abacus) au 23 août 2026. Via un relais comme ChinaModelAPI, vous bénéficiez d'une clé unique compatible OpenAI pour l'ensemble d'entre eux, avec recharge en USDT.
Comment migrer d'OpenAI vers des modèles chinois plus économiques ?
Conservez votre SDK OpenAI. Modifiez base_url pour https://api.chinamodelapi.com/v1, changez la clé API, et utilisez des identifiants de modèles comme glm-5.2, deepseek-v4-pro ou qwen-plus. Aucune réécriture de code n'est nécessaire. Consultez le qwen-api-guide et deepseek-v3-api pour le code étape par étape.
Guides associés
Une clé compatible OpenAI. Modèles chinois. Recharge en USDT.
Obtenir un Accès Anticipé