News / Modellbeobachtung · Mystery-Modell-Radar
Ox Alpha enthüllt: Zhipu bestätigt GLM-5.3-Flash – Offizieller Release und Open Weights heute Abend
Ein anonymes Modell landet auf OpenRouter mit 1M Kontext, Bild- und Video-Input sowie einer Gratis-Woche – schlägt Claude Fable 5 in ersten Stichproben, lockt den Stripe-CEO in die Kommentare, erhält von Google ein augenzwinkerndes Schein-Bekenntnis, über das sich das Netz gnadenlos lustig macht, und hält jeder forensischen Untersuchung der Community stand. Chinesische Medien nennen es 牛来. Niemand hat sich dazu bekannt. Alle folgenden Angaben sind mit Quellen und Daten versehen und, wo angegeben, unbestätigt.
Update (26. Aug., abends): Rätsel gelöst – Zhipu hat gegenüber Bloomberg bestätigt, dass Ox Alpha GLM-5.3-Flash ist, wobei der offizielle Release und die Open Weights heute Abend erscheinen. Zixuan Li von Zhipu: "Ox Alpha war eine frühe Version von GLM-5.3-Flash. Der offizielle Release bietet eine stärkere Performance und deutlich mehr Stabilität." Die Forensik-Community lag schon Tage zuvor richtig; das Drehbuch von Pony Alpha wiederholte sich punktgenau. Details im Abschnitt Die Enthüllung weiter unten.
Ox Alpha ist GLM-5.3-Flash – von Zhipu am 26. Aug. gegenüber Bloomberg offiziell bestätigt, der offizielle Release und die Open Weights erscheinen heute Abend über Z.ai. Der Stealth-Testlauf (OpenRouter/OpenCode seit 20.–21. Aug., 1M Kontext, Text+Bild+Video, Gratis-Woche) war ein früher öffentlicher Stresstest: "Frontier-Intelligenz zu Flash-Kosten", von der Community bei einer DeepSWE-Stichprobe mit 10 Aufgaben auf 80 % vs. 65 % bei Fable 5 gemessen, und laut SemiAnalysis läuft die Kapazität von 100T Token/Tag auf chinesischen Chips. Zhipu gibt an, dass der offizielle Release leistungsfähiger und stabiler als der Stealth-Build ist.
Die Chronologie der Ereignisse im Überblick – verifiziert
| Wann | Was geschah · Quelle |
|---|---|
| 20.–21. Aug. | Ox Alpha erscheint auf OpenRouter + OpenCode Zen – 1M Kontext, multimodal, ~1 Woche kostenlos, Plattformkapazität von "100T Token/Tag" (Kapazität, keine Parameter). OpenRouter: "Nur Routing; anonymer Drittanbieter." (36氪/APPSO) |
| 21.–22. Aug. | Das Silicon Valley schaltet sich ein: Der Autor von DeepSWE misst 63 % in seiner Agenten-Suite; Ben Davis' 10-Aufgaben-Stichprobe: Ox 80 % / Fable 5 65 % / GPT-5.6 Sol 52 %; Stripe-CEO Patrick Collison: "相当惊艳"; die CEOs von OpenRouter/T3 Chat/Box verbreiten es weiter. (36氪) |
| 22.–23. Aug. | Forensische Analysen deuten auf GLM hin: Tokenizer-Zählungen weichen über 25 Prompts hinweg konstant um exakt 75 Token von GLM-5.3 ab (der Umfang eines versteckten System-Prompts); der Video-Token-Verbrauch stimmt exakt mit GLM-5V-Turbo überein; Fehler im Serving-Layer entsprechen dem Dialekt von Z.ai. (TechTimes 08-23; 36氪) |
| 23.–24. Aug. | Googles Schein-Bekenntnis: DeepMind-Forscher deuten vage auf "Gemini" und "trust the process" hin – und werden im Netz verspottet (谷歌抢着认领被全网笑惨, 36氪). Urteils-Thread auf HN: "Ox-Alpha Is GLM" (26 Punkte, weiterhin nur Vermutung der Community). |
| 24. Aug. | 36氪 berichtet, dass das kostenlose Zeitfenster noch "weniger als vier Tage" beträgt; der chinesische Spitzname 牛来 setzt sich durch. Weiterhin keinerlei offizielle Bestätigung. |
Die Enthüllung (26. Aug.): Von Bloomberg bestätigt, Gewichte heute Abend
- Zhipu bestätigte gegenüber Bloomberg (Mittwoch, 26. Aug.): "Das Modell Ox Alpha ist eine neue Iteration seiner GLM-Serie" – konkret GLM-5.3-Flash – und erklärte auf Anfrage von Bloomberg News, man werde die Gewichte heute Abend veröffentlichen.
- Zixuan Li von Zhipu (X, @zixuanli_): "Ox Alpha war eine frühe Version von GLM-5.3-Flash. Der offizielle Release bietet eine stärkere Leistung und deutlich bessere Stabilität. Ein riesiger Dank an @opencode und @OpenRouter, die es der Community zugänglich gemacht haben."
- Das überraschende Detail (SemiAnalysis): Die für den Stealth-Testlauf angegebenen 100T Token/Tag wurden auf chinesischen Chips bereitgestellt – die Gratis-Woche war unter anderem ein Stresstest für heimische Beschleuniger auf Spitzen-Niveau.
- Erste Reaktionen: Andrew Curran – "Die Pareto-Front wurde neu definiert" (Ankündigung + Benchmarks bereits online); Community-Fazit: "GLM-5.3 Flash übertrifft GLM-5.2 in allen Belangen"; kursierender Slogan: "Frontier-Intelligenz zu Flash-Kosten."
- Das bekannte Drehbuch wiederholt sich: Pony Alpha aus dem Februar (anonym → an Tag ~6 von Zhipu als GLM-5 beansprucht) hat genau dieses Vorgehen vorweggenommen: Stealth-Release → kostenloser Traffic → Benchmarks → Enthüllung. Die Tokenizer-Forensik, die es bereits Tage vor der Bestätigung als GLM identifizierte, behielt recht.
- Gewichte bereitgestellt (Verifizierung am 27. Aug.): zai-org/GLM-5.3-Flash (+ BF16) ist live auf Hugging Face. Offizielle Model-Card-Fakten: 320B gesamt / 18B aktiv, das erste nativ multimodale Modell der GLM-5-Serie, übertrifft GLM-5.2 in sämtlichen Benchmarks zu einem Zehntel des Preises (≈ $0.14/$0.44 pro 1M ggü. $1.40/$4.40 bei 5.2), während es bei Coding- und Agenten-Suites an Claude Opus 4.8 heranreicht – mit Quantisierungen für llama.cpp / Ollama / LM Studio für lokales Serving. Resonanz auf HN: 809 Punkte für das Modell, 407 für die Enthüllung.
Die Forensik vor der Enthüllung – und wie treffsicher sie war
- Tokenizer-Fingerabdruck: Bei 25 kontrollierten Prompts liegt die Token-Anzahl von Ox Alpha exakt 75 Token über der von GLM-5.3 – das typische Merkmal eines konstanten, versteckten System-Prompts auf demselben Tokenizer (technischer Rückblick von 36氪).
- Video-Token-Signatur: Vier kontrollierte Videotests stimmten Zeile für Zeile mit der Token-Berechnung für Bildrate/Dauer/Auflösung von GLM-5V-Turbo überein; Modelle anderer Anbieter wichen ab.
- Übertrifft das öffentliche GLM-5.3 bei Multimodalität: Das veröffentlichte 5.3 ist via API rein textbasiert – wenn dies von Zhipu stammt, handelt es sich um eine unveröffentlichte multimodale Variante (im Community-Jargon: ein Arbeitstier der GLM-5.5-Klasse). Der Direktvergleich von APPSO stufte die Argumentationskette als "sehr nah an GLM-5.3" ein – und einen zahlentheoretischen Test löste Ox, an dem GLM-5.3-max scheiterte.
- Der Erfahrungswert: Vier von vier früheren anonymen OpenRouter-Releases stammten von chinesischen Labs: Pony Alpha → GLM-5 (an Tag 6 von Zhipu beansprucht), Hunter/Healer Alpha → Xiaomi MiMo-V2, Elephant Alpha → Ant Ling-2.6-flash, Owl Alpha → Meituan LongCat-2.0.
- Die Grenzen (vor der Enthüllung): Bis zum 25. August war nichts davon offiziell – Google machte Andeutungen ohne Urheberschaftsanspruch, Zhipu schwieg. Am 26. August kam die Bestätigung und validierte alle oben genannten forensischen Spuren.
Praktische Hinweise für API-Entwickler
- Vom Stealth-Modus zum offiziellen Release, heute Abend: Das kostenlose Zeitfenster (~27.–28. Aug.) geht nun nahtlos in den offiziellen Release von GLM-5.3-Flash mit Open Weights über Z.ai über – das kostenfreie Benchmark-Fenster endet genau in dem Moment, in dem das eigentliche Produkt erscheint.
- Als Stealth-Stresstest behandeln: Kein SLA, keine Deprecation-Vorwarnung, kein Urheber – für Evaluierungen und Erkundungen bestens geeignet, für Produktiv-Traffic oder sensible Daten jedoch ungeeignet.
- Weights + API erscheinen heute Abend via Z.ai – behalten Sie zai-org auf Hugging Face und docs.z.ai im Auge; unsere Berichterstattung zu GLM-5.3 deckt die gesamte Modellfamilie ab, und die morgige Ausgabe liefert verifizierte Release-Spezifikationen.
Primärquellen
- Bloomberg-Bestätigung (via @kimmonismus/Techmeme) – Zhipu bestätigt am Mittwoch Ox Alpha als neue Iteration der GLM-Serie, Gewichte erscheinen heute Abend
- Techmeme-Übersicht – Reaktionen auf die offizielle Ankündigung von GLM-5.3-Flash (HN/r/singularity/r/LocalLLaMA + SemiAnalysis-Post zu chinesischen Chips + Danksagung von Zixuan Li)
- 36氪 — 神秘「牛来」掀翻硅谷,谷歌抢着认领被全网笑惨(实测细节与取证汇总)
- 36氪/APPSO – Mysteriöses „牛来“-Modell geht viral: Was taugt es im Praxistest wirklich? (Tokenizer-/Video-Forensik + Zahlentheorie-Test)
- TechTimes – Serving-Layer-Forensik (Zhipu-Klassennamen, Fehlerdialekt, 30/30 Tokenizer-Tests) (2026-08-23)
- OrcaRouter – Ox Alpha wahrscheinlich GLM-5.3 (Scorecard zur Historie anonymer Modellveröffentlichungen)
- Trending Topics – Ox Alpha: Ein mysteriöses neues KI-Modell will Entwickler für sich gewinnen
- Hacker News – Diskussionsthread „Ox-Alpha Is GLM“ (Community-Zuordnung, inoffiziell)
Häufig gestellte Fragen (2026)
Was ist Ox Alpha?
Ein anonymes Stealth-Modell auf OpenRouter/OpenCode seit 20.–21. Aug.: 1M Kontext, Text+Bild+Video, ca. 1 Woche kostenlos. Kein KI-Labor hat die Urheberschaft beansprucht. Spitzname in chinesischen Medien: 牛来.
Wie gut ist es?
Kleine Stichprobe, aber beachtlich: 80 % gegenüber 65 % bei Fable 5 in einem DeepSWE-Durchlauf mit 10 Aufgaben; 63 % in der Testsuite des DeepSWE-Autors. Stripe-CEO: "相当惊艳" (laut 36氪).
Wer hat es entwickelt?
Am 26. Aug. bestätigt: Zhipu – Ox Alpha war eine frühe Version von GLM-5.3-Flash (Bloomberg; Zixuan Li von Zhipu auf X). Die Forensik anhand des Tokenizer-Offsets von +75 und der Video-Signatur hatte es bereits Tage zuvor vorhergesagt.
Hat Google es für sich beansprucht?
DeepMind-Forscher machten deutliche Andeutungen ("Gemini", "trust the process") und ernteten dafür Spott – keinerlei Bestätigung von irgendeiner Seite.
Ist es noch kostenlos?
Das kostenlose Stealth-Fenster geht in den heutigen offiziellen Release von GLM-5.3-Flash mit Open Weights über Z.ai über – die Gratis-Vorschau endet mit dem Eintreffen des echten Produkts.
Link zu den GLM-5.3-Gewichten?
Geklärt und verifiziert: Die Gewichte von GLM-5.3-Flash sind auf zai-org online (Überprüfung am 27. Aug.) – 320B/18B aktiv, das erste nativ multimodale Modell der GLM-5-Serie, rund 1/10 des Preises von GLM-5.2. Das ursprünglich für den ~28. Aug. erwartete Zeitfenster wurde für Flash vorgezogen.