Mises à jour des modèles d'IA chinois pour développeurs d'API
Briefings datés sur les modèles chinois de pointe, poids ouverts, compatibilité matérielle et accès compatible OpenAI. Documentation officielle en priorité.
Codex retrouve sa limite de 5 heures, Claude Code réduit de 25 % — Le contrepoint de l'API à l'usage
OpenAI a rétabli la limite de 5 heures de Codex le 25 août après un mois d'août marqué par de multiples réinitialisations (trois réinitialisations complètes : 8/13/21 août) ; Anthropic réduit les limites de Claude Code à partir du 14 septembre. La chronologie vérifiée, le fonctionnement des quotas, et pourquoi les API de modèles chinois avec paiement au jeton n'ont aucune fenêtre de temps.
Les poids ouverts de GLM-5.3 arrivent dans les délais : le modèle phare du post-training scaling devient téléchargeable
zai-org/GLM-5.3 a été mis en ligne dans la nuit du 28 août — 141 shards safetensors + BF16, accès libre, licence personnalisée glm-5.3 — clôturant la fenêtre d'examen de sécurité d'environ deux semaines promise le 14 août. Spécifications, détails de licence et ce que ce modèle apporte à l'écosystème en poids ouverts.
Qwen3.8-Flash-Next : Alibaba déploie l'architecture Qwen4 en avance — Poids ouverts ce soir
Compte à rebours ModelScope : le MoE multimodal en poids ouverts arrive ce soir à 23h00 (heure de Pékin) — 125B principal + 51B de plongements N-grammes avec 6B actifs par token, premier aperçu du GDN de Qwen4 + Qwen Sparse Attention. Détail de ce qui est confirmé ou non, intérêt des 6B actifs pour l'exécution locale et points à surveiller à la sortie du dépôt.
Mac mini M6 vs M5 Pro pour les LLM locaux : 32GB ou 64GB ?
Le M6 d'Apple propose une architecture d'accélération plus récente, mais le M5 Pro double le plafond de mémoire et atteint 307GB/s de bande passante. Un guide d'achat sans détour avec spécifications officielles, résultats de tests Apple, compatibilité Qwen3.8-27B et choix de mise à niveau depuis le M4.
Mac Studio M5 Max vs M5 Ultra pour les LLM locaux
Le M5 Max 128GB est la station de travail pragmatique ; le M5 Ultra 256GB/512GB est destiné aux modèles exigeants qui ne rentrent nulle part ailleurs. Calculs de mémoire pour DeepSeek V4, GLM-5, Qwen3.8 et Kimi K3, ainsi que les limites de la promesse de cluster d'Apple.
Ox Alpha révélé : Zhipu confirme GLM-5.3-Flash — Lancement officiel et poids ouverts ce soir
Mystère résolu : Zhipu a confirmé à Bloomberg qu'Ox Alpha est GLM-5.3-Flash, avec un lancement officiel et les poids ouverts ce soir (26 août). La phase de test furtive à 100T tokens/jour tournait sur des puces chinoises (SemiAnalysis) ; le scénario de Pony Alpha s'est répété à la lettre. Récit complet, analyse technique et révélations à l'intérieur.
Harvey, soutenu par OpenAI, conçoit son premier modèle sur les poids ouverts de Kimi K3
Le leader de la legal-tech Harvey (soutenu par OpenAI/Sequoia/a16z) a annoncé Harvey Tenet — un modèle de base en poids ouverts Kimi K3 post-entraîné avec Fireworks pour les travaux juridiques au long cours. ~2× plus de tâches accomplies face à la base K3 sur le benchmark LAB de Harvey au coût de l'open source ; aperçu recherche, aucun poids publié. Le signal d'adoption le plus net des poids ouverts chinois en Occident à ce jour.
DeepSeek supprime les tarifs de pointe le week-end : les samedis et dimanches sont désormais en heures creuses toute la journée
À partir du 23 août à 00h00 (heure de Pékin), les week-ends sont entièrement facturés aux tarifs heures creuses — sortie v4-pro à ¥13.5/M toute la journée contre ¥27 en heures pleines en semaine. Moins d'une semaine après le lancement du mécanisme heures pleines/heures creuses. Grille tarifaire complète du week-end, calculs de planification et sources.
HappyHorse 1.1 se déploie à l'international : API complète sur Model Studio, édition vidéo et progression devant Seedance
Alibaba a ouvert toutes les fonctionnalités de HappyHorse 1.1 via API sur Model Studio — nouveau mode d'édition vidéo, audio intégré sans frais supplémentaires, remise de lancement de 40% pendant deux semaines, $0.0988/s (720p) sur OpenRouter, et une 2e place mondiale dans l'arène vidéo devant Seedance et Sora. Plateformes, tableau des prix et sources à l'intérieur.
L'API de GLM-5.3 passe en GA : $1.40/$4.40, un jour de décalage et un écosystème qui n'a pas attendu
Zhipu a ouvert l'accès général à l'API aux premières heures du 19 août — avec un jour de retard, au même prix que GLM-5.2, score AA Index de 60 (co-n°1 en open source). Chronologie vérifiée de la semaine de lancement, tableau des tarifs comparés à Qwen3.8/K3/V4-Flash, inventaire des plateformes (ZCode, PhanRouter, internet du supercalcul) et changements attendus avant l'arrivée des poids le 28 août.
MiniMax Design : le modèle vidéo H3 se dote d'un espace de travail pour agents
Trois semaines après avoir rendu H3 open source, MiniMax livre la couche applicative destinée à sa commercialisation : un environnement de travail pour agents de création en langage naturel avec plateau de réalisation 3D et intégration ComfyUI. Un produit et non une API — les points de terminaison du modèle restant la voie programmatique. Synthèse concise accompagnée de ses sources.
Poids ouverts Qwen3.8 (2026) : checkpoints Max 2.4T + un 27B sous Apache 2.0 pour votre ordinateur portable
Première publication de poids ouverts de classe Max par Alibaba : Qwen3.8-2.4T-A95B (+FP8) sur Hugging Face, plus un modèle dense vision-langage de 27B sous Apache 2.0 qui fonctionne à partir d'un fichier de 17GB. Chronologie, détails de la licence, tarification API à $2/$6, méthode locale de Simon Willison et table de routage.
API Kling 3.0 (2026) : Tarifs officiels, Turbo & Omni, et la scission à $3B
La gamme Kling 3.0 de Kuaishou sur l'API internationale officielle : prix catalogue de $0.084–$0.42/s (4K native), Turbo incluant l'audio, Omni ajoutant l'entrée vidéo, structure d'API par tâches avec JWT. Résultats du T2 : plus de 850M+ RMB de chiffre d'affaires (+200% sur un an), 100M+ utilisateurs, levée de fonds d'environ ~$3B en juillet pour une valorisation de ~$18B. Table de routage + calcul de coût sur 10 secondes face à Seedance.
DeepSeek-V4-Flash-Vision-Exp (2026) : Lancement officiel, tarifs et démarrage rapide avec l'API
Lancé dans la soirée du 21 août (UTC+8) : modèle multimodal vision expérimental au tarif de V4-Flash ($0.22/1M en entrée, images plafonnées à 384 tokens), parité textuelle avec V4-Flash, agent multimodal proche d'Opus-4.8, nouvelle API Files, support de Harness v0.1.1-rc.1. Inclut un démarrage rapide curl/Python, un comparatif de coûts face aux offres vision de Claude/Gemini/Grok, et quel modèle DeepSeek choisir.
DeepSeek Harness ajoute l'entrée d'images multimodale : rc.7 + rc.8
Déploiement en deux étapes : pièces jointes d'images durables dans MCP/ACP avec rc.7 (17 août) ; requêtes d'images natives pour les adaptateurs DeepSeek et prise en charge des images pour /goal et /plan avec rc.8 (19 août). Le harness prend désormais en charge les images — mais V4-Pro/V4-Flash restent purement textuels, et rc.8 adopte le tag npm next. Turing Post qualifie le harness de « second tournant DeepSeek ».
Gemini 3.7 Flash : le modèle polyvalent de Google pour le code et les agents
Google a annoncé Gemini 3.7 Flash le 13 août — contexte 1M, score DeepSWE de 65.3%, tarif de lancement de $0.75/$3.75 par 1M de tokens jusqu'à fin 2026. Une note de référence sur l'état de l'art occidental ; Gemini n'est pas routé par ChinaModelAPI.
DeepSeek Harness v0.1 : DeepSeek publie son harnais d'agent en open source
Harness d'agents modulaire où tout est plugin sous licence MIT (dsh) annoncé dans la soirée du 13 août — la presse internationale le qualifie de rival open source de Claude Code. Quatre modes de travail, import de sessions depuis Claude Code, 288 plugins en 24h. Agnostique vis-à-vis des modèles par conception.
Sortie officielle de GLM-5.3 : montée en échelle du post-entraînement, cyber émergente, poids dans 2 semaines
Le blog officiel de Z.ai a annoncé GLM-5.3 le 14 août — même base que GLM-5.2, Terminal-Bench 3.0 passant de 4.6 à 28.3, CyberGym à 84.5%, 2 436 vulnérabilités réelles découvertes. Mis à jour le 19 août : API au même tarif que 5.2 ($1.40/$4.40 par 1M), indice indépendant AA de 60, poids prévus vers le 28 août ; retours presse de VentureBeat / The Decoder / Interconnects inclus.
DeepSeek-V4-Pro-0813 officiel : 正式版 GA avec des agents renforcés
La documentation officielle de l'API de DeepSeek a mis à jour deepseek-v4-pro vers DeepSeek-V4-Pro-0813 le 2026-08-13 (dans la soirée). Même ID de modèle, capacités d'agent améliorées, ajustement tarifaire mineur. Ce que les développeurs d'API doivent faire — presque rien.
Grok 4.6 : le nouveau modèle phare recommandé par xAI, désormais disponible dans l'API
La documentation développeur officielle de xAI liste désormais grok-4.6 comme son dernier modèle phare — contexte de 500k, $2/$6 par million de tokens, recommandé pour le code. Une note de référence sur l'état de l'art occidental ; Grok n'est pas routé par ChinaModelAPI.
Veille des modèles chinois — Statut hebdomadaire des modèles
Aperçu hebdomadaire des modèles d'IA chinois de référence suivis par ChinaModelAPI au 2026-08-09, comparés aux lignes de base GPT-5.6 Sol / Claude Opus 5. Synthèse automatique pour les concepteurs d'API.
Poids ouverts MiniMax H3 : modèle vidéo avec audio/vidéo natif
H3 (et non M3) est le modèle vidéo multimodal de MiniMax avec audio stéréo natif. Poids HF + ComfyUI + API hébergée. Pas d'appellation officielle « Kling ouvert » — comparaison de qualité fréquente avec Seedance.
Qwen3.8-Max : modèle phare ~2.4T — pas un nouveau générateur vidéo
Le fleuron Qwen d'août 2026 pour le code et les tâches de longue durée. Clarifie les rumeurs : il ne s'agit pas de Qwen2.5-VL / Qwen2-VL-72B sous la forme d'une sortie T2V de classe Seedance.
Veille des remises Seedance 2.0 Mini / Fast : signaux de rabais Mini à ~4折
Note de marché d'août 2026 : le Mini est souvent annoncé autour de 4折, le Fast à ~75折 sur certaines plateformes. Ces prix ne sont pas ceux de ChinaModelAPI — à vérifier par console. Le Mini pour l'itération, le 2.5 pour le rendu final.
Capacités de Seedance 2.5 : plan-séquence de 30s, 50 références, plateformes en ligne
Lancement officiel et déploiement d'août 2026 : passe unique de 30s, ~50 références multimodales, édition améliorée. Où les créateurs l'utilisent et ce que les concepteurs d'API doivent faire.
Statut de Seedance 2.5 (historique) : notes sur le report de juillet
Point de situation pré-lancement de fin juillet. Remplacé par l'article de lancement officiel du 2026-07-31 — conservé uniquement pour le contexte chronologique.
DeepSeek-V4-Pro pour les développeurs d'API : ce qui remplace la V3.2
DeepSeek-V4-Pro et V4-Flash forment le duo de référence pour 2026 (contexte de 1M, poids ouverts). Comment migrer les clients compatibles OpenAI depuis les identifiants de modèle de l'ère V3.
Kimi K3 + GLM-5.2 : Le duo de pointe ouvert pour 2026
Comment Kimi K3 de Moonshot et GLM-5.2 de Zhipu se complètent pour le code sur de longues sessions, le contexte 1M et le déploiement en poids ouverts — avec des indications pour l'accès compatible OpenAI.
data/model-watch/ ; publication après vérification des sources.