Actualités / Veille des modèles · Veille sur le modèle mystère
Ox Alpha révélé : Zhipu confirme qu'il s'agit de GLM-5.3-Flash — Lancement officiel et open weights ce soir
Un modèle anonyme débarque sur OpenRouter avec 1M de contexte, entrées image+vidéo et une semaine gratuite — surpasse ensuite Claude Fable 5 sur les premiers échantillons, attire le PDG de Stripe dans les commentaires, fait l'objet d'une fausse revendication par sous-entendus de Google que le web tourne impitoyablement en dérision, et encaisse toutes les analyses techniques poussées de la communauté. Les médias chinois le surnomment 牛来. Personne ne l'a revendiqué. Tout ce qui suit est attribué, daté et non confirmé lorsqu'indiqué.
Mise à jour (26 août, soir) : mystère résolu — Zhipu a confirmé à Bloomberg qu'Ox Alpha est GLM-5.3-Flash, avec la sortie officielle et l'arrivée des open weights ce soir. Zixuan Li de Zhipu : « Ox Alpha était une version préliminaire de GLM-5.3-Flash. La version officielle offre de meilleures performances et une stabilité nettement supérieure. » Les experts de l'analyse technique l'avaient prédit il y a plusieurs jours ; le scénario de Pony Alpha s'est répété à la lettre. Détails dans la section La révélation ci-dessous.
Ox Alpha est GLM-5.3-Flash — officiellement confirmé par Zhipu à Bloomberg le 26 août, avec la sortie officielle et l'arrivée des open weights ce soir via Z.ai. Cette phase furtive (OpenRouter/OpenCode depuis les 20-21 août, 1M de contexte, texte+image+vidéo, semaine gratuite) était un test de résistance public précoce : « intelligence de pointe, coût flash », mesuré par la communauté à 80 % contre 65 % pour Fable 5 sur un échantillon de 10 tâches DeepSWE, et selon SemiAnalysis, sa capacité de 100T tokens/jour tourne sur des puces chinoises. Zhipu affirme que la version officielle est plus performante et plus stable que la version furtive.
La semaine des faits, vérifiée
| Quand | Ce qui s'est passé · source |
|---|---|
| 20-21 août | Ox Alpha apparaît sur OpenRouter + OpenCode Zen — 1M de contexte, multimodal, gratuit pendant ~1 semaine, capacité de la plateforme de « 100T tokens/jour » (capacité, pas paramètres). OpenRouter : « routage uniquement ; tiers anonyme. » (36氪/APPSO) |
| 21-22 août | La Silicon Valley s'y intéresse en masse : l'auteur de DeepSWE mesure 63 % sur sa suite agentique ; échantillon de 10 tâches de Ben Davis : Ox 80 % / Fable 5 65 % / GPT-5.6 Sol 52 % ; le PDG de Stripe Patrick Collison qualifie le modèle de « 相当惊艳 » ; les PDG d'OpenRouter, T3 Chat et Box relaient. (36氪) |
| 22-23 août | Les analyses techniques convergent vers GLM : le décompte des tokens par rapport à GLM-5.3 diffère d'une constante de 75 tokens sur 25 invites (l'équivalent d'un prompt système masqué) ; la consommation de tokens vidéo correspond exactement à GLM-5V-Turbo ; les erreurs de la couche de service correspondent au dialecte de Z.ai. (TechTimes 23-08 ; 36氪) |
| 23-24 août | La fausse revendication de Google : les chercheurs de DeepMind font allusion à « Gemini » et « trust the process » — largement moqués (谷歌抢着认领被全网笑惨, 36氪). Fil de conclusion sur HN : « Ox-Alpha Is GLM » (26 pts, attribution communautaire uniquement à ce stade). |
| 24 août | 36氪 rapporte qu'il reste « moins de quatre jours » pour la fenêtre de gratuité ; le surnom chinois 牛来 se généralise. Toujours aucune revendication officielle. |
La révélation (26 août) : confirmé par Bloomberg, poids disponibles ce soir
- Zhipu a confirmé à Bloomberg (mercredi 26 août) : « le modèle Ox Alpha est une nouvelle itération de sa série GLM » — plus précisément GLM-5.3-Flash — et a indiqué qu'elle publiera les poids ce soir, en réponse aux questions de Bloomberg News.
- Zixuan Li de Zhipu (X, @zixuanli_) : « Ox Alpha était une version préliminaire de GLM-5.3-Flash. La version officielle offre de meilleures performances et une stabilité nettement supérieure. Un immense merci à @opencode et @OpenRouter de l'avoir mis à disposition de la communauté. »
- Le détail choc (SemiAnalysis) : les 100T tokens/jour revendiqués lors de cette phase furtive tournaient sur des puces chinoises — la semaine gratuite était notamment un test de résistance pour accélérateurs nationaux à très grande échelle.
- Premières réactions : Andrew Curran — « la frontière de Pareto a été redessinée » (annonce + benchmarks déjà en ligne) ; résumé de la communauté : « GLM-5.3 Flash surpasse GLM-5.2 sur tous les plans » ; slogan de positionnement qui tourne en boucle : « intelligence de pointe, coût flash. »
- Le même scénario, rejoué. L'épisode Pony Alpha de février (anonyme → revendiqué par Zhipu comme GLM-5 vers le 6e jour) l'avait parfaitement prédit : lancement furtif → trafic gratuit → benchmarks → révélation. Les analyses techniques du tokenizer qui l'avaient identifié comme GLM plusieurs jours avant la confirmation avaient vu juste.
- Poids livrés (vérification du 27 août) : zai-org/GLM-5.3-Flash (+ BF16) est en ligne sur Hugging Face. Données de la fiche officielle : 320B au total / 18B actifs, le premier modèle nativement multimodal de la série GLM-5, surpassant GLM-5.2 sur l'ensemble des benchmarks pour un dixième du prix (≈ $0.14/$0.44 par 1M vs $1.40/$4.40 pour 5.2) tout en approchant Claude Opus 4.8 sur le code et les suites agentiques — avec quantifications llama.cpp / Ollama / LM Studio pour l'inférence locale. Accueil sur HN : 809 points pour le modèle, 407 pour la révélation.
Les analyses techniques préalables à la révélation — et leur remarquable exactitude
- Empreinte du tokenizer. Sur 25 invites contrôlées, le décompte de tokens d'Ox Alpha dépasse systématiquement de 75 tokens celui de GLM-5.3 — la signature d'un prompt système masqué constant sur le même tokenizer (récapitulatif technique de 36氪).
- Signature des tokens vidéo. Quatre tests vidéo contrôlés correspondaient ligne par ligne au calcul de tokens fréquence d'images/durée/résolution de GLM-5V-Turbo ; les modèles des autres fournisseurs divergeaient.
- Plus multimodal que le GLM-5.3 public. La version 5.3 publiée est uniquement textuelle via API — par conséquent, s'il s'agit d'un modèle de Zhipu, c'est une variante multimodale non publiée (qualifiée par la communauté de bête de somme de classe GLM-5.5). Le comparatif côte à côte d'APPSO a jugé la chaîne de raisonnement « très proche de GLM-5.3 » — et Ox a résolu un test de théorie des nombres que GLM-5.3-max n'a pas pu terminer.
- Les précédents. Les quatre précédentes sorties anonymes sur OpenRouter provenaient toutes de laboratoires chinois : Pony Alpha → GLM-5 (revendiqué par Zhipu au 6e jour), Hunter/Healer Alpha → Xiaomi MiMo-V2, Elephant Alpha → Ant Ling-2.6-flash, Owl Alpha → Meituan LongCat-2.0.
- Les limites (avant révélation). Au 25 août, rien de tout cela n'était officiel — Google faisait des allusions sans revendiquer, Zhipu gardait le silence. Le 26 août, la confirmation est tombée et a validé chacune des pistes d'analyse ci-dessus.
Remarques pratiques pour les développeurs utilisant l'API
- Du mode furtif à l'officiel, ce soir. La fenêtre gratuite (~27-28 août) débouche désormais sur la sortie officielle de GLM-5.3-Flash avec ses open weights via Z.ai — la période de benchmark sans frais se termine précisément à l'arrivée du produit définitif.
- À traiter comme un stress test furtif. Aucun SLA, aucun préavis de dépréciation, aucune attribution — adapté pour les évaluations et la curiosité, mais inadapté pour le trafic de production ou les données sensibles.
- Poids + API disponibles ce soir via Z.ai — surveillez zai-org sur Hugging Face et docs.z.ai ; notre couverture de GLM-5.3 suit l'ensemble de la gamme, et le point de demain détaillera les spécifications vérifiées de la version.
Sources primaires
- Confirmation de Bloomberg (relayée par @kimmonismus/Techmeme) — Zhipu confirme mercredi qu'Ox Alpha est une nouvelle itération de GLM, poids publiés ce soir
- Agrégation Techmeme — Réactions à l'annonce de GLM-5.3-Flash (HN/r/singularity/r/LocalLLaMA + post SemiAnalysis sur les puces chinoises + remerciements de Zixuan Li)
- 36氪 — 神秘「牛来」掀翻硅谷,谷歌抢着认领被全网笑惨(实测细节与取证汇总)
- 36氪/APPSO — Le mystérieux modèle « 牛来 » fait le buzz, que vaut-il vraiment ? (analyses tokenizer/vidéo + test en théorie des nombres)
- TechTimes — Analyses de la couche de service (noms de classes Zhipu, dialecte d'erreur, 30/30 tests tokenizer) (2026-08-23)
- OrcaRouter — Ox Alpha est probablement GLM-5.3 (tableau récapitulatif des sorties de modèles anonymes)
- Trending Topics — Ox Alpha : un nouveau modèle d'IA mystérieux vise à conquérir les développeurs
- Hacker News — Fil de discussion « Ox-Alpha Is GLM » (attribution communautaire, non officielle)
Questions fréquentes (2026)
Qu'est-ce qu'Ox Alpha ?
Un modèle furtif anonyme sur OpenRouter/OpenCode depuis les 20-21 août : 1M de contexte, texte+image+vidéo, gratuit pendant ~1 semaine. Aucun laboratoire ne l'a revendiqué. Surnom dans les médias chinois : 牛来.
Quel est son niveau ?
Sur un échantillon réduit mais frappant : 80 % contre 65 % pour Fable 5 sur une série de 10 tâches DeepSWE ; 63 % sur la suite de l'auteur de DeepSWE. PDG de Stripe : « 相当惊艳 » (selon 36氪).
Qui l'a conçu ?
Confirmé le 26 août : Zhipu — Ox Alpha était une version préliminaire de GLM-5.3-Flash (Bloomberg ; Zixuan Li de Zhipu sur X). Le décalage de +75 tokens sur le tokenizer et la signature vidéo l'avaient identifié plusieurs jours plus tôt.
Google l'a-t-il revendiqué ?
Les chercheurs de DeepMind ont lourdement fait allusion (« Gemini », « trust the process ») et ont été tournés en dérision — aucune confirmation de qui que ce soit.
Est-il toujours gratuit ?
La période de gratuité furtive débouche ce soir sur la sortie officielle de GLM-5.3-Flash avec des open weights via Z.ai — l'aperçu gratuit prend fin à l'arrivée du véritable produit.
Lien vers les poids de GLM-5.3 ?
Résolu et vérifié : les poids de GLM-5.3-Flash sont disponibles sur zai-org (vérification du 27 août) — 320B / 18B actifs, premier modèle nativement multimodal de la série GLM-5, ~1/10e du prix de GLM-5.2. L'échéance prévue vers le 28 août est arrivée plus tôt pour Flash.