Actualités / Veille modèles · Frontière chinoise
Sortie officielle de GLM-5.3 : montée en échelle du post-entraînement, cyber émergente, poids dans 2 semaines
Z.ai a officiellement annoncé GLM-5.3 le 14 août — même modèle de base que GLM-5.2, chaque gain provenant de la montée en échelle du post-entraînement. Il est accessible dès maintenant pour tous les abonnés au GLM Coding Plan, s'accompagne d'une rupture de compatibilité d'API (breaking change) sur les paramètres de réflexion (thinking), découvre des vulnérabilités réelles à un rythme qui a surpris ses propres créateurs, et passera en poids ouverts (open-weights) d'ici environ deux semaines. Mis à jour le 22 août : l'API est passée en GA le 19 août (tarifs de $1.40/$4.40 par 1M, identiques à 5.2) — calendrier complet, disponibilité par plateforme et notes pour les développeurs disponibles dans le point dédié sur la GA de l'API. Retrouvez ci-dessous l'ensemble des chiffres, l'avertissement sur la migration et les réactions internationales.
GLM-5.3 est officiellement sorti (14 août 2026).
L'annonce officielle indique :
« Aujourd'hui, nous publions GLM-5.3. Il utilise le même modèle de base que GLM-5.2 — chaque gain provient du post-entraînement. »
Z.ai le qualifie de « modèle à poids ouverts le plus performant pour le code » (un bond de 50 % sur son benchmark interne Z.ai Code Bench) et d'état de l'art sur CyberGym pour la découverte de vulnérabilités. État du déploiement :
GLM Coding Plan — disponible pour tous les abonnés (quota basé sur des points ; remise de 50 % en heures creuses) ;
API — documentée avec migration obligatoire (trois niveaux d'effort low/high/max, et
thinking.type: "disabled" n'est plus pris en charge — les anciennes requêtes échoueront) ;
poids — attendus vers le 28 août après durcissement de sécurité (pas encore sur Hugging Face au 19 août). La tarification de l'API est désormais publiée : $1.40 en entrée / $4.40 en sortie par 1M de tokens ($0.26 en entrée avec cache) — identique à GLM-5.2, et OpenRouter référence glm-5.3 aux mêmes tarifs (18 août). La première évaluation indépendante est disponible : indice Artificial Analysis de 60 (rang 8/182).
Pour les infrastructures de production sur relais : restez sur glm-5.2 jusqu'à ce que 5.3 soit disponible en GA et stable en amont.
État vérifié en un coup d'œil
| Élément | Statut (selon les sources officielles, 2026-08-14) |
|---|---|
| Annonce | Article de blog officiel en ligne : z.ai/blog/glm-5.3 (« Today we are releasing GLM-5.3 ») |
| GLM Coding Plan | Déployé pour tous les abonnés ; quota basé sur des points ; -50 % en heures creuses (heures de pointe = jours ouvrés 14:00–18:00 UTC+8) |
| API | Page du modèle et documentation en ligne ; glm-5.3 avec effort de réflexion low / high / max (max par défaut) ; la désactivation de la réflexion n'est plus supportée. Référencé sur OpenRouter au même prix depuis le 18 août |
| Poids ouverts | « dans les deux semaines suivant le lancement, une fois l'évaluation et le durcissement de sécurité terminés » — au 19 août pas encore sur Hugging Face (zai-org) ; attendu vers le 28 août |
| Contexte / sortie | Contexte de 1M · sortie max de 128K · texte en entrée / texte en sortie (pas de vision native) |
| Tarification de l'API | $1.40 entrée / $0.26 entrée avec cache / $4.40 sortie par 1M (docs.z.ai en USD international, vérifié le 19 août) — identique à GLM-5.2. Coding Plan : basé sur des points, -50 % en heures creuses |
| Entrées du changelog | Page du modèle en ligne sur docs.bigmodel.cn ; les pages de notes de version/changelog n'étaient pas encore à jour au moment de la rédaction |
L'ordre de déploiement cette fois-ci a été le blog et le Coding Plan en premier, suivis plus tard par les changelogs — l'exact inverse d'un déploiement axé d'abord sur la documentation. Si votre repère est « est-ce déjà dans le changelog ? », vous aurez un temps de retard.
Les chiffres (communiqués par le fournisseur, d'après le tableau officiel)
Tous les scores ci-dessous correspondent aux chiffres communiqués par Z.ai lors de l'annonce. Sélection de lignes ; le tableau complet sur le blog couvre environ 20 benchmarks.
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 / GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 / 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 / 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 / 72.7 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | 48.8 | 33.1 / 42.5 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 / 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 / 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1743 / 1730 |
| CyberGym | 84.5 | 77.2 | 80.0 | 78.1 | 83.8 / 83.6 |
| ExploitBench | 54.4 | 24.4 | 32.2 | 40.0 | 78.0 / 76.5 |
- Lecture objective du tableau : GLM-5.3 égale ou surpasse globalement Kimi K3 et DeepSeek-V4-Pro-0813 (62.7 DeepSWE) sur les lignes de code et de tâches agentiques, se situe au niveau ou près d'Opus 4.8, et reste en retrait par rapport à Claude Fable 5 et GPT-5.6 Sol sur les tests les plus exigeants (Terminal Bench 3.0, DeepSWE, ExploitBench). Z.ai précise elle-même que l'écart avec les modèles propriétaires de pointe est le plus marqué précisément là où elle a le plus progressé.
- Efficacité des tokens : sur le benchmark interne Z.ai Code Bench, avec un effort High, 5.3 atteint 31.4 % avec ~50K tokens en sortie, dépassant les 29.5 % d'Opus 4.8 à 120K ; Fable 5 reste en tête à 39.5 % (effort Max).
- Revendications du fournisseur (mentionnées comme telles) : « modèle à poids ouverts le plus performant pour le code », SOTA open source sur Terminal Bench 3.0 et ALE, amélioration d'environ 50 % de l'expérience de codage. La vérification indépendante arrivera avec la publication des poids d'ici ~2 semaines.
Première vérification indépendante : Artificial Analysis (18 août)
Artificial Analysis a intégré GLM-5.3 le 18 août — la première évaluation non fournie par l'éditeur. Extrait de sa page de modèle (consultée le 19 août) :
- Intelligence Index v4.1.1 : 60 — 8e sur 182 (médiane à 35) ; classé comme propriétaire jusqu'à la publication des poids ; 84.7 tok/s, temps de premier token de 1.88s, contexte de 1M.
- Ce que cela donne : en effort maximal, les scores suivis par AA et compilés dans le fil benchmarks de HN placent GLM-5.3 à 59.5 contre 59.7 pour Kimi K3, 60.9 pour GPT-5.6 Sol et 61.5 pour Claude Opus 5 — au niveau de K3, juste en dessous des modèles propriétaires de pointe, en hausse de ~7 points par rapport aux 53.0 de GLM-5.2.
- Le bémol — la verbosité : AA signale explicitement GLM-5.3 comme « très verbeux » : il a généré 170M de tokens sur l'ensemble de l'évaluation de l'indice (contre une médiane de 72M), et ~41k tokens de sortie par tâche contre ~16.9k pour GPT-5.6 Sol. L'efficacité des tokens, plus que l'intelligence, est le facteur de coût à surveiller.
- Pas encore sur LMArena au 19 août (vérifié directement).
Le volet cybersécurité s'ancre dans le monde réel, pas seulement dans les benchmarks
L'aspect le plus singulier de cette sortie : Z.ai a testé GLM-5.2/5.3 sur des bases de code réelles avec plusieurs équipes de sécurité en Chine. Après examen par des experts et déduplication, le modèle a identifié 2 436 vulnérabilités sur 269 projets, dont 1 097 de gravité moyenne à élevée (le graphique de sévérité de l'annonce indique 107 Critiques + 990 Élevées) — couvrant des noyaux (kernels), des moteurs de rendu de navigateurs, des infrastructures open source, des applications web et des protocoles réseau. La faille la plus ancienne remonte à 1981 ; en moyenne, une vulnérabilité existait depuis 26.6 ans avant sa découverte.
- Les découvertes alimentent un registre public, le Z.ai Security Disclosure Ledger — selon l'article d'unite.ai, 53 failles étaient publiques avec des CVE lors de l'annonce et 2 383 restent sous embargo (dont des failles use-after-free du noyau Linux, des bugs de mémoire WebKit/Safari et des problèmes de validation de paramètres sous FreeBSD).
- Sur les benchmarks de profondeur d'exploitation, la tendance est constante : nets progrès par rapport à 5.2 (ExploitGym 29→105 tâches à 2h), mais Mythos 5 et GPT-5.6 Sol conservent une nette avance. Il s'agit d'une solide capacité défensive et d'audit de sécurité, non d'une percée sur le plan offensif.
- Selon la formulation de Z.ai : ces capacités « se sont développées plus vite que prévu » avec la montée en échelle du post-entraînement — d'où le délai de deux semaines pour le durcissement de sécurité avant la livraison des poids.
Développeurs API : une rupture de compatibilité (breaking change) à anticiper
- Migration requise : GLM-5.3 prend en charge l'effort de réflexion
low / high / max(maxpar défaut, recommandé pour le code) — etthinking.type: "disabled"n'est plus supporté. La documentation officielle est catégorique : remplacez-le parenabledet définissezreasoning_effortavant de changer l'identifiant du modèle, « sans quoi la requête échouera. » - Modèle économique du Coding Plan : l'abonnement fonctionne désormais par points (entrée, entrée avec cache et sortie comptabilisées séparément) ; les jours ouvrés de 14:00 à 18:00 UTC+8 correspondent aux heures de pointe, tout le reste — y compris les week-ends — ne consomme que 50 % des points standard. ZCode apporte un taux de réussite de cache supérieur à 98 % et un bonus de quota de 1,5x jusqu'au 31 août.
- Via les relais comme ChinaModelAPI : la production reste sur
glm-5.2pour l'instant ; nous ajouterons l'identifiant du modèle 5.3 dès que l'API en amont sera disponible en GA et stable. Lors de votre migration, prévoyez la modification obligatoire des paramètres de réflexion mentionnée ci-dessus. - Même base, même périmètre : contexte de 1M / sortie de 128K / même éventail de fonctionnalités (thinking, streaming, function calling, cache de contexte, sorties structurées, MCP) — la migration se résume donc à changer l'identifiant du modèle et les paramètres, puis à exécuter des tests de non-régression sur vos boucles d'agents.
- Toujours texte uniquement : la vision était la principale demande de la communauté lors de la consultation de Zhipu ; elle n'a pas été intégrée à cette version.
Réactions internationales (mis à jour le 19 août)
- VentureBeat a publié l'analyse en anglais la plus détaillée (14 août) : reprend le tableau officiel en rappelant que Z.ai Code Bench est un benchmark propriétaire de l'éditeur, rapporte les propos d'un developer advocate de Z.ai selon lesquels GLM-5.3 aurait déjà découvert une « vulnérabilité critique » dans Cursor (non confirmée par Cursor à l'heure de publication), et cite Reuters concernant les contrôles d'« accès de confiance » motivant le délai de deux semaines pour les poids. L'article mentionne également les formules promotionnelles du Coding Plan (Lite $12.60/mo, Pro $56, Max $117.60) — signalées comme promotionnelles ; les utilisateurs sur Hacker News font état des tarifs standards de $18/$80.
- The Decoder a titré son article « Zhipu AI lance GLM-5.3 et affirme qu'il s'agit du modèle de code à poids ouverts le plus puissant » — post-entraînement sur la même base, gains majeurs sur les tâches agentiques, poids d'ici deux semaines, utilisable via Coding Plan / ZCode / Claude Code / OpenCode.
- Interconnects (Nathan Lambert) a publié l'analyse indépendante la plus approfondie : « GLM-5.3 : Comment les laboratoires chinois restent au contact de la frontière » — les scores « sont bien réels », il se montre sceptique quant aux explications fondées sur la distillation, salue un rythme de publication plus rapide et un périmètre texte/code plus ciblé, note que le modèle compterait environ 750B paramètres (soit environ un tiers de la taille de Kimi K3) et cite des estimations d'environ $1B d'ARR pour Z.ai.
- Reuters (d'après des extraits de recherche ; article payant pour consultation directe) : GLM-5.3 « s'approche du Mythos 5 d'Anthropic lors des tests de cyberdéfense » — CyberGym 84.5 % contre 83.8 % — le délai sur les poids étant lié aux tests des mécanismes d'« accès de confiance » pour les capacités cyber sensibles.
- Hacker News : le fil de lancement a atteint 1 167 points / 582 commentaires ; un fil de suivi sur les benchmarks AA (18 août) et une publication sur la disponibilité sur OpenRouter (19 août) ont suivi.
- Reddit r/LocalLLaMA compte un fil « GLM 5.3 Released » pointant vers le blog officiel, soulignant en titre que les poids arriveront « dans deux semaines ».
- Reddit r/ZaiGLM : des utilisateurs du forfait Lite ont signalé que GLM-5.2 « répondait très différemment » les jours précédant l'annonce — ce qui concorde avec un déploiement progressif sous l'étiquette 5.2 plutôt qu'une bascule brutale.
- unite.ai a couvert le lancement sous l'angle d'« une capacité cyber qui a dépassé son entraînement », en mettant en avant le programme de divulgation de 2 436 vulnérabilités et la fenêtre de fin août pour la vérification indépendante des poids. (Note : unite.ai précise que l'article a été généré par IA et relu par la rédaction.)
- Laurie Voss (LinkedIn) — commentateur influent sur les modèles open-weights — a qualifié 5.2 de référence actuelle tout en évoquant « les poids ouverts de GLM 5.3 en développement », estimant que la gamme GLM a environ 6 à 9 mois d'avance sur le reste des modèles ouverts.
Bilan de la communauté après cinq jours
- Points positifs : les chercheurs en sécurité le décrivent comme le premier modèle qui « accepte et exécute intégralement des scénarios de red-teaming sérieux » (0-days de plugins WordPress, RCE, adaptation d'exploits de noyau — retours directs sur HN) ; des équipes délaissent leurs abonnements Claude en raison des frictions liées aux refus sur les outils de sécurité ; le score AA (60) confirme les impressions des testeurs du premier jour, et les tokens de raisonnement visibles permettent d'interrompre rapidement une trace qui dérive.
- Points négatifs : la verbosité fait grimper la consommation de tokens (mention « très verbeux » d'AA) ; débats sur la rentabilité du Coding Plan par rapport aux tarifs d'API (« GLM n'est avantageux qu'au prix API ») ; scepticisme quant au fait que les deux semaines de « durcissement de sécurité » ne viennent discrètement brider les capacités cyber ; et absence de multimodalité — toujours la principale attente pour les workflows de développement web.
Sources primaires
- Blog officiel de Z.ai — GLM-5.3 : Code à la frontière et capacités cyber émergentes (annonce, tableau complet des benchmarks, modifications d'API, calendrier des poids)
- docs.z.ai — tarification officielle (GLM-5.3 $1.40 / $0.26 avec cache / $4.40 par 1M, USD international ; vérifié le 19 août)
- OpenRouter — fiche GLM-5.3 (mêmes tarifs, référencé le 18 août)
- Artificial Analysis — page du modèle GLM-5.3 (indice indépendant 60, rang 8/182 ; remarque sur la verbosité)
- Documentation officielle Zhipu — page du modèle GLM-5.3 (spécifications ; déploiement du Coding Plan)
- VentureBeat — GLM-5.3 est arrivé avec des capacités cyber avancées (14 août)
- The Decoder — Zhipu AI lance GLM-5.3
- Interconnects (Nathan Lambert) — GLM-5.3 : Comment les laboratoires chinois restent au contact de la frontière
- Hacker News — Fil de lancement de GLM-5.3 (1 167 points)
- unite.ai — Z.ai lance GLM-5.3 (couverture tierce incluant les détails du registre de divulgation ; généré par IA, relu par la rédaction)
- Reddit r/LocalLLaMA — Fil « GLM 5.3 Released »
- Reddit r/ZaiGLM — observations sur le déploiement sous l'étiquette 5.2
- Z.ai Security Disclosure Ledger
FAQ
GLM-5.3 est-il disponible ?
Oui — officiellement annoncé le 14 août 2026 sur le blog de Z.ai. Les utilisateurs du Coding Plan y ont accès dès maintenant ; les poids suivront d'ici ~2 semaines.
Quels sont les tarifs de GLM-5.3 ?
Désormais publiés : $1.40 entrée / $4.40 sortie par 1M de tokens ($0.26 avec cache) sur docs.z.ai — identique à GLM-5.2 ; tarifs alignés sur OpenRouter. Le Coding Plan fonctionne par points avec 50 % de réduction en heures creuses (heures de pointe = jours ouvrés 14:00–18:00 UTC+8).
Mes appels à glm-5.2 vont-ils cesser de fonctionner ?
Non — 5.2 reste en GA, en poids ouverts et routé comme d'habitude. En revanche, lorsque vous migrerez vers 5.3, les requêtes avec thinking.type: "disabled" échoueront ; migrez vos paramètres au préalable.
5.3 intègre-t-il la vision ?
Non — texte en entrée / texte en sortie. La vision était la demande n°1 de la communauté mais n'est pas incluse dans cette version.