News / Model Watch · Chinesische Spitzenmodelle
GLM-5.3 offiziell veröffentlicht: Post-Training-Skalierung, emergente Cyber-Fähigkeiten, Gewichte in 2 Wochen
Z.ai hat GLM-5.3 am 14. August offiziell angekündigt – gleiches Basismodell wie GLM-5.2, wobei sämtliche Verbesserungen auf skaliertes Post-Training zurückgehen. Es ist ab sofort für alle Abonnenten des GLM Coding Plan verfügbar, bringt einen Breaking Change in der API bei den Thinking-Parametern mit, entdeckt reale Sicherheitslücken in einem Tempo, das selbst die Entwickler überraschte, und wird in ~zwei Wochen Open-Weights. Aktualisiert am 22. Aug.: Die API ging am 19. Aug. in die GA (Preise $1.40/$4.40 pro 1M, identisch mit 5.2) — vollständige Timeline, Plattform-Übersicht und Hinweise für Entwickler jetzt im separaten API-GA-Kurzbericht. Alle Zahlen, die Migrationswarnung und internationale Reaktionen unten.
GLM-5.3 ist offiziell erschienen (14. Aug. 2026).
In der offiziellen Ankündigung heißt es:
„Heute veröffentlichen wir GLM-5.3. Es nutzt dasselbe Basismodell wie GLM-5.2 – sämtliche Leistungssteigerungen stammen aus dem Post-Training.“
Z.ai bezeichnet es als „das fähigste Open-Weights-Modell für Coding“ (ein Zuwachs von 50 % im hauseigenen Z.ai Code Bench) und
State-of-the-Art auf CyberGym bei der Erkennung von Sicherheitslücken. Rollout-Status:
GLM Coding Plan – für alle Abonnenten live (punktebasiertes Kontingent; 50 % Rabatt außerhalb der Spitzenzeiten);
API – dokumentiert mit erforderlicher Migration (drei Aufwandsstufen low/high/max, und
thinking.type: "disabled" entfällt – alte Anfragen schlagen fehl);
Gewichte – erwartet für ~28. Aug. nach Sicherheitsüberprüfung und -härtung (Stand 19. Aug. noch nicht auf Hugging Face). API-Preise sind jetzt veröffentlicht: $1.40 Input / $4.40 Output pro 1M Token ($0.26 für gecachten Input) – identisch mit GLM-5.2, und OpenRouter listet glm-5.3 zu denselben Preisen (18. Aug.). Die erste unabhängige Evaluierung liegt vor: Artificial Analysis Index 60 (Rang 8/182).
Für Produktiv-Stacks auf Relays: Vorerst bei glm-5.2 bleiben, bis 5.3 allgemein verfügbar (GA) und upstream stabil ist.
Verifizierter Status auf einen Blick
| Eintrag | Status (laut offiziellen Quellen, 14.08.2026) |
|---|---|
| Ankündigung | Offizieller Blogbeitrag online: z.ai/blog/glm-5.3 („Today we are releasing GLM-5.3“) |
| GLM Coding Plan | Für alle Abonnenten ausgerollt; punktebasiertes Kontingent; 50 % Rabatt außerhalb der Spitzenzeiten (Hauptzeit = werktags 14:00–18:00 UTC+8) |
| API | Modellseite + Dokumentation online; glm-5.3 mit Thinking-Aufwand low / high / max (Standard max); Deaktivieren von Thinking wird nicht mehr unterstützt. Seit dem 18. Aug. zum selben Preis auf OpenRouter gelistet |
| Offene Gewichte | „Zwei Wochen nach dem Launch, sobald Sicherheitsbewertung und -härtung abgeschlossen sind“ — Stand 19. Aug. noch nicht auf Hugging Face (zai-org); erwartet für ~28. Aug. |
| Kontext / Output | 1M Kontext · 128K max. Output · Text In / Text Out (keine native Bildverarbeitung) |
| API-Preise | $1.40 Input / $0.26 gecachter Input / $4.40 Output pro 1M (docs.z.ai internationale USD, verifiziert am 19. Aug.) — identisch mit GLM-5.2. Coding Plan: punktebasiert, 50 % Nebenzeit-Rabatt |
| Changelog-Einträge | Modellseite auf docs.bigmodel.cn online; die Seiten für Release-Notes/Changelog waren zum Zeitpunkt der Verfassung noch nicht nachgezogen |
Die Rollout-Reihenfolge war diesmal: Blog + Coding Plan zuerst, Changelogs folgten verzögert — das genaue Gegenteil eines Docs-First-Rollouts. Wer nur darauf wartet, ob es schon im Changelog steht, ist zu spät dran.
Die Zahlen (vom Anbieter gemeldet, aus der offiziellen Tabelle)
Alle unten aufgeführten Werte sind die von Z.ai in der Ankündigung selbst angegebenen Zahlen. Ausgewählte Zeilen; die vollständige Tabelle im Blog umfasst ~20 Benchmarks.
| Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | Opus 4.8 | Fable 5 / GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 85.0 | 88.0 / 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | 21.1 | 33.7 / 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 / 72.7 |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | 48.8 | 33.1 / 42.5 |
| Agents' Last Exam (CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 / 28.6 |
| HLE mit Tools | 62.5 | 54.7 | 59.8 | 57.9 | 63.9 / 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1588 | 1743 / 1730 |
| CyberGym | 84.5 | 77.2 | 80.0 | 78.1 | 83.8 / 83.6 |
| ExploitBench | 54.4 | 24.4 | 32.2 | 40.0 | 78.0 / 76.5 |
- Ehrliche Einordnung der Tabelle: GLM-5.3 erreicht oder übertrifft Kimi K3 und DeepSeek-V4-Pro-0813 (62.7 DeepSWE) in den Coding-/Agenten-Kategorien weitgehend, liegt auf oder nahe dem Niveau von Opus 4.8 und liegt bei den schwierigsten Benchmarks (Terminal Bench 3.0, DeepSWE, ExploitBench) weiterhin hinter Claude Fable 5 und GPT-5.6 Sol. Z.ai selbst räumt ein, dass der Abstand zur geschlossenen Spitzenklasse genau dort am größten ist, wo man sich am meisten verbessert hat.
- Token-Effizienz: Im hauseigenen Z.ai Code Bench erreicht 5.3 bei High-Aufwand 31.4 % mit ~50K Output-Tokens und übertrifft damit Opus 4.8 (29.5 % bei 120K); Fable 5 führt weiterhin mit 39.5 % (Max-Aufwand).
- Herstellerangaben, als solche gekennzeichnet: „fähigstes Open-Weights-Modell für Coding“, Open-Source-SOTA auf Terminal Bench 3.0 und ALE, ~50 % Verbesserung des Coding-Erlebnisses. Die unabhängige Verifizierung folgt mit der Veröffentlichung der Gewichte in ~2 Wochen.
Erster unabhängiger Check: Artificial Analysis (18. Aug.)
Artificial Analysis hat GLM-5.3 am 18. August aufgenommen — die erste herstellerunabhängige Evaluierung. Von der Modellseite (abgerufen am 19. Aug.):
- Intelligence Index v4.1.1: 60 — Rang 8 von 182 (Median 35); als proprietär gelistet, bis die Gewichte veröffentlicht werden; 84.7 Tok/s, 1.88 s Time-to-First-Token, 1M Kontext.
- Einordnung: Bei maximalem Aufwand liegt GLM-5.3 laut den im HN-Benchmark-Thread zusammengestellten AA-Zahlen bei 59.5 vs. Kimi K3 (59.7), GPT-5.6 Sol (60.9), Claude Opus 5 (61.5) — auf Augenhöhe mit K3, knapp unter den führenden Closed-Source-Modellen und rund 7 Punkte über den 53.0 von GLM-5.2.
- Der Haken — Ausführlichkeit: AA stuft GLM-5.3 explizit als „very verbose“ (sehr wortreich) ein: Es erzeugte über den gesamten Index-Testlauf 170M Tokens im Vergleich zum Median von 72M sowie ~41k Output-Tokens pro Aufgabe im Vergleich zu ~16.9k bei GPT-5.6 Sol. Die Token-Effizienz, nicht die Intelligenz, ist der entscheidende Kostenfaktor.
- Stand 19. Aug. noch nicht auf LMArena (direkt überprüft).
Das Thema Cyber-Sicherheit: Praxis statt reiner Benchmarks
Der ungewöhnlichste Aspekt des Releases: Z.ai hat GLM-5.2/5.3 gemeinsam mit mehreren Sicherheitsteams in China auf reale Codebasen angesetzt. Nach Expertenprüfung und Deduplizierung identifizierte das Modell 2.436 Sicherheitslücken in 269 Projekten, darunter 1.097 von mittlerer bis hoher Kritikalität (die Übersicht in der Ankündigung weist 107 Critical + 990 High aus) — quer über Kernel, Browser-Engines, Open-Source-Infrastruktur, Web-Apps und Netzwerkprotokolle. Die älteste Schwachstelle stammte aus dem Jahr 1981; im Schnitt bestand eine Sicherheitslücke 26.6 Jahre vor ihrer Entdeckung.
- Die Ergebnisse fließen in ein öffentliches Z.ai Security Disclosure Ledger ein — laut Berichterstattung von unite.ai waren bei der Ankündigung 53 mit CVEs öffentlich und 2.383 stehen weiterhin unter Embargo (darunter Use-after-Free im Linux-Kernel, WebKit/Safari-Speicherfehler und Parameter-Validierungsprobleme in FreeBSD).
- Bei Benchmarks zur Exploit-Tiefe zeigt sich ein einheitliches Bild: deutliche Sprünge gegenüber 5.2 (ExploitGym 29→105 Aufgaben @2h), doch Mythos 5 und GPT-5.6 Sol bleiben weit vorn. Es handelt sich um eine starke Fähigkeit zur defensiven Sicherheitsanalyse und Code-Review, nicht um offensive Spitzenklasse.
- Z.ai formuliert es selbst so: Die Fähigkeiten hätten sich bei der Skalierung des Post-Trainings „schneller entwickelt als erwartet“ — daher das zweiwöchige Zeitfenster zur Sicherheitshärtung vor Veröffentlichung der Gewichte.
API-Entwickler: Ein Breaking Change, den man einplanen muss
- Migration erforderlich: GLM-5.3 unterstützt Thinking-Aufwand
low / high / max(Standardmax, empfohlen für Coding) — undthinking.type: "disabled"wird nicht mehr unterstützt. Die offizielle Dokumentation sagt es deutlich: Vor dem Wechsel der Modell-ID aufenabledumstellen undreasoning_effortsetzen, „da die Anfrage andernfalls fehlschlägt.“ - Konditionen des Coding Plan: Der Tarif ist nun punktebasiert (Input, gecachter Input und Output werden separat gezählt); werktags von 14:00–18:00 Uhr UTC+8 gilt als Hauptzeit, alles andere — einschließlich Wochenenden — verbraucht 50 % der Standardpunkte. ZCode bietet eine Cache-Trefferquote von über 98 % und einen 1.5-fachen Kontingentschub bis zum 31. August.
- Über Relays wie ChinaModelAPI: Produktivumgebungen bleiben vorerst auf
glm-5.2; wir werden die Modell-ID für 5.3 hinzufügen, sobald die Upstream-API allgemein verfügbar (GA) und stabil ist. Planen Sie bei der Migration die oben erwähnte obligatorische Anpassung der Thinking-Parameter ein. - Gleiche Basis, gleiche Rahmenbedingungen: 1M Kontext / 128K Output / identischer Funktionsumfang (Thinking, Streaming, Function Calling, Kontext-Cache, strukturierte Ausgaben, MCP) — die Migration besteht also aus dem Tausch von Modell-ID und Parametern sowie Regressionstests für Ihre Agent-Loops.
- Weiterhin rein textbasiert: Vision-Unterstützung war der größte Community-Wunsch in Zhipus Feedbackrunde, hat es aber nicht in dieses Release geschafft.
Internationale Reaktionen (aktualisiert am 19. Aug.)
- VentureBeat veröffentlichte den ausführlichsten englischsprachigen Artikel (14. Aug.): gibt die offizielle Tabelle mit dem Hinweis wieder, dass Z.ai Code Bench ein herstellereigener Benchmark ist, berichtet über die Aussage eines Z.ai-Developer-Advocates, GLM-5.3 habe bereits eine „schwerwiegende Sicherheitslücke“ in Cursor gefunden (von Cursor bis Redaktionsschluss nicht bestätigt), und zitiert Reuters bezüglich der „Trusted Access“-Kontrollen hinter der zweiwöchigen Verzögerung der Gewichte. Zudem werden Rabatt-Tarife des Coding Plan aufgeführt (Lite $12.60/Monat, Pro $56, Max $117.60) — als Promo gekennzeichnet; Hacker-News-Käufer berichten von regulären Preisen von $18/$80.
- The Decoder berichtete unter dem Titel „Zhipu AI releases GLM-5.3, claims it's the strongest open weights coding model“ — gleiche Post-Training-Basis, größte Gewinne bei Agenten-Aufgaben, Gewichte in zwei Wochen, nutzbar über Coding Plan / ZCode / Claude Code / OpenCode.
- Interconnects (Nathan Lambert) veröffentlichte die fundierteste unabhängige Analyse: „GLM-5.3: How Chinese labs keep stride with the frontier“ — die Testergebnisse seien „echt“, er steht Destillationserklärungen skeptisch gegenüber, führt den Erfolg auf schnellere Release-Zyklen sowie einen fokussierten Text-/Coding-Scope zurück, merkt an, dass das Modell Berichten zufolge ~750B Parameter umfasst (etwa ein Drittel der Größe von Kimi K3), und zitiert Berichte über ~$1B ARR bei Z.ai.
- Reuters (laut Suchauszügen; Paywall beim Direktzugriff): GLM-5.3 „nähert sich Anthropics Mythos 5 in Cyber-Defense-Tests an“ — CyberGym 84.5 % vs. 83.8 % — wobei die Verzögerung der Gewichte mit der Erprobung von „Trusted Access“-Kontrollen für sensible Cyber-Funktionen begründet wird.
- Hacker News: Der Launch-Thread erreichte 1.167 Punkte / 582 Kommentare; es folgten ein weiterer AA-Benchmark-Thread (18. Aug.) und ein Post zur OpenRouter-Verfügbarkeit (19. Aug.).
- Reddit r/LocalLLaMA diskutiert im Thread „GLM 5.3 Released“ mit Link zum offiziellen Blog, wobei die Veröffentlichung der Gewichte „in zwei Wochen“ im Mittelpunkt steht.
- Reddit r/ZaiGLM: Nutzer des Lite-Plans berichteten in den Tagen vor der Ankündigung, dass GLM-5.2 „völlig anders reagierte“ — passend zu einem schrittweisen Rollout hinter dem 5.2-Label statt einer abrupten Umstellung.
- unite.ai berichtete über den Launch unter dem Titel „a cyber capability that outgrew its training“ und hob das Disclosure-Programm mit 2.436 Schwachstellen sowie das Zeitfenster für die Gewichte Ende August zur unabhängigen Verifizierung hervor. (Hinweis: unite.ai kennzeichnet den Artikel als KI-generiert und redaktionell geprüft.)
- Laurie Voss (LinkedIn) — ein vielgelesener Kommentator für Open-Weight-Modelle — empfahl 5.2 als Standardmodell mit dem Hinweis „GLM 5.3 Open Weights in Entwicklung“, womit die GLM-Reihe seiner Ansicht nach dem restlichen Open-Weight-Feld um ~6–9 Monate voraus ist.
Stimmungsbild der Community nach fünf Tagen
- Positiv: Sicherheitsforscher beschreiben es als das erste Modell, das „ernsthaften Red-Team-Szenarien zustimmt und diese vollständig ausführt“ (WordPress-Plugin-0-Days, RCE, Anpassung von Kernel-Exploits — HN, aus erster Hand); Teams migrieren von Claude-Abonnements aufgrund von Verweigerungen (Refusals) bei Sicherheitstools; der AA-Score (60) deckte sich mit den Eindrücken der Tester am Release-Tag, und sichtbare Reasoning-Tokens ermöglichen es, ausufernde Traces frühzeitig abzubrechen.
- Negativ: Hohe Ausführlichkeit treibt den Token-Verbrauch in die Höhe (AAs Einstufung „very verbose“); Diskussionen über den Nutzen des Coding Plan im Vergleich zu den API-Preisen („GLM gewinnt nur beim API-Preis“); Skepsis, ob das zweiwöchige Zeitfenster zur „Sicherheitshärtung“ die Cyber-Fähigkeiten heimlich abschwächen (nerfen) wird; und keine Multimodalität — weiterhin der am meisten gewünschte Punkt für Web-Development-Workflows.
Primärquellen
- Offizieller Z.ai-Blog — GLM-5.3: Frontier Coding with Emergent Cyber Capabilities (Ankündigung, vollständige Benchmark-Tabelle, API-Änderungen, Gewichte-Zeitplan)
- docs.z.ai — offizielle Preise (GLM-5.3 $1.40 / $0.26 gecacht / $4.40 pro 1M, internationale USD; verifiziert am 19. Aug.)
- OpenRouter — GLM-5.3-Eintrag (gleiche Preise, gelistet am 18. Aug.)
- Artificial Analysis — GLM-5.3-Modellseite (unabhängiger Index 60, Rang 8/182; Hinweis zur Ausführlichkeit)
- Offizielle Zhipu-Dokumentation — GLM-5.3-Modellseite (Spezifikationen; Rollout des Coding Plan)
- VentureBeat — GLM-5.3 is here with advanced cyber capabilities (14. Aug.)
- The Decoder — Zhipu AI veröffentlicht GLM-5.3
- Interconnects (Nathan Lambert) — GLM-5.3: Wie chinesische Labore mit der Weltspitze Schritt halten
- Hacker News — GLM-5.3-Launch-Thread (1.167 Punkte)
- unite.ai — Z.ai bringt GLM-5.3 auf den Markt (Drittanbieter-Bericht inkl. Details zum Disclosure-Ledger; KI-generiert, redaktionell geprüft)
- Reddit r/LocalLLaMA — Thread „GLM 5.3 Released“
- Reddit r/ZaiGLM — Beobachtungen zum Rollout hinter dem 5.2-Label
- Z.ai Security Disclosure Ledger
FAQ
Ist GLM-5.3 bereits veröffentlicht?
Ja — am 14. August 2026 offiziell im Z.ai-Blog angekündigt. Nutzer des Coding Plan haben bereits Zugriff; die Gewichte folgen in ~2 Wochen.
Preise für GLM-5.3?
Jetzt veröffentlicht: $1.40 Input / $4.40 Output pro 1M Token ($0.26 gecacht) auf docs.z.ai — identisch mit GLM-5.2; OpenRouter bietet dieselben Preise. Der Coding Plan ist punktebasiert mit 50 % Rabatt außerhalb der Spitzenzeiten (Hauptzeit = werktags 14:00–18:00 UTC+8).
Werden meine glm-5.2-Aufrufe fehlschlagen?
Nein — 5.2 bleibt allgemein verfügbar (GA), Open-Weight und wird wie gewohnt geroutet. Wenn Sie jedoch auf 5.3 umsteigen, schlagen Anfragen mit thinking.type: "disabled" fehl; migrieren Sie zuerst die Parameter.
Bietet 5.3 Vision-Unterstützung?
Nein — Text In / Text Out. Vision war der am häufigsten geäußerte Community-Wunsch, ist aber nicht in diesem Release enthalten.