Chinesische KI-Modell-Updates für API-Entwickler
Aktuelle Berichte über chinesische Frontier-Modelle, Open Weights, lokale Hardware und OpenAI-kompatiblen Zugriff. Offizielle Dokumente stehen an erster Stelle.
Codex erhält sein 5-Stunden-Limit zurück, Claude Code kürzt um 25 % – Der Gegenpol zur nutzungsbasierten API
OpenAI hat das 5-Stunden-Limit für Codex am 25. August nach einem reset-reichen August (drei vollständige Resets: 8./13./21. August) wiederhergestellt; Anthropic senkt die Limits für Claude Code ab dem 14. September. Die verifizierte Zeitleiste, die Kontingentmechanik und warum Pay-per-Token-APIs für chinesische Modelle keinerlei Zeitfenster kennen.
GLM-5.3 Open Weights landen nach Zeitplan: Das Post-Training-Scaling-Flaggschiff steht zum Download bereit
zai-org/GLM-5.3 ging in der Nacht zum 28. August online – 141 safetensors-Shards + BF16, frei zugänglich, individuelle GLM-5.3-Lizenz – und schließt das am 14. August versprochene ~zweiwöchige Sicherheitsüberprüfungsfenster. Spezifikationen, Lizenzhinweise und wie es das Angebot offener Gewichte komplettiert.
Qwen3.8-Flash-Next: Alibaba liefert die Qwen4-Architektur vorzeitig aus – Offene Gewichte heute Nacht
ModelScope-Countdown: Multimodales MoE mit offenen Gewichten erscheint heute Nacht um 23:00 Uhr Pekinger Zeit – 125B Hauptmodell + 51B N-Gramm-Embeddings mit 6B aktiven Parametern pro Token, ein erster Vorgeschmack auf GDN und Qwen Sparse Attention von Qwen4. Analyse bestätigter vs. unbestätigter Details, warum 6B aktive Parameter für lokale Setups entscheidend sind und worauf beim Release des Repositories zu achten ist.
Mac mini M6 vs. M5 Pro für lokale LLMs: 32GB oder 64GB?
Apples M6 bietet die neuere Beschleuniger-Architektur, doch der M5 Pro verdoppelt die Speicherobergrenze und erreicht 307GB/s Bandbreite. Ein sachlicher Kaufberater mit offiziellen Spezifikationen, Apple-Test-Labels, Eignung für Qwen3.8-27B und der Entscheidung zum Upgrade vom M4.
Mac Studio M5 Max vs. M5 Ultra für lokale LLMs
Der M5 Max mit 128GB ist die vernünftige Workstation; der M5 Ultra mit 256GB/512GB ist für Spitzenmodelle gedacht, die nirgendwo sonst hineinpassen. Speicherberechnungen für DeepSeek V4, GLM-5, Qwen3.8 und Kimi K3 sowie die Grenzen von Apples Cluster-Versprechen.
Ox Alpha enthüllt: Zhipu bestätigt GLM-5.3-Flash – Offizieller Release und offene Gewichte heute Nacht
Rätsel gelöst: Zhipu bestätigte gegenüber Bloomberg, dass Ox Alpha GLM-5.3-Flash ist, mit offiziellem Release und offenen Gewichten heute Nacht (26. Aug.). Die 100 Bio. Token/Tag des Stealth-Tests liefen auf chinesischen Chips (SemiAnalysis); das Drehbuch von Pony Alpha wiederholte sich bis ins Detail. Die ganze Chronik, Analysen und Hintergründe im Artikel.
OpenAI-unterstütztes Harvey entwickelt erstes Modell auf Basis der Open Weights von Kimi K3
Der Legal-Tech-Marktführer Harvey (unterstützt von OpenAI/Sequoia/a16z) hat Harvey Tenet angekündigt – ein auf den offenen Gewichten von Kimi K3 basierendes Modell, nachträglich mit Fireworks für anspruchsvolle juristische Langzeitaufgaben trainiert. ~2× Aufgabenbewältigung im Vergleich zur K3-Basis im LAB-Benchmark von Harvey zu Open-Source-Kosten; Forschungsvorschau ohne veröffentlichte Gewichte. Bislang das deutlichste westliche Adoptionssignal für chinesische offene Gewichte.
DeepSeek schafft Wochenend-Spitzenpreise ab: Samstags & sonntags nun ganztägig Nebenverkehrszeit
Ab dem 23. August um 00:00 Uhr Pekinger Zeit werden Wochenenden vollständig zu Nebenzeittarifen abgerechnet – v4-pro Output ganztägig für ¥13.5/M gegenüber ¥27 zu Spitzenzeiten an Wochentagen. Weniger als eine Woche nach Einführung des Spitzen-/Nebenzeittarif-Mechanismus. Vollständige Wochenend-Tariftabelle, Berechnungsbeispiele und Quellen.
HappyHorse 1.1 startet weltweit: Vollständige API auf Model Studio, Videobearbeitung und Überholen von Seedance
Alibaba hat den vollen Funktionsumfang von HappyHorse 1.1 per API auf Model Studio freigeschaltet – neuer Videobearbeitungsmodus, integriertes Audio ohne Aufpreis, 40 % Einführungsrabatt für zwei Wochen, $0.0988/s (720p) auf OpenRouter und Platz 2 in der weltweiten Video-Arena vor Seedance und Sora. Plattformen, Preistabelle und Quellen im Artikel.
GLM-5.3-API erreicht GA: $1.40/$4.40, ein Tag Verzögerung und ein Ökosystem, das nicht gewartet hat
Zhipu hat den allgemeinen API-Zugang in den frühen Morgenstunden des 19. August freigegeben – einen Tag später als geplant, preislich identisch mit GLM-5.2, AA-Index 60 (gemeinsamer Platz 1 im Open-Source-Bereich). Verifizierte Zeitleiste der Einführungswoche, Preistabelle im Vergleich zu Qwen3.8/K3/V4-Flash, Plattformübersicht (ZCode, PhanRouter, Supercomputing Internet) und was sich vor dem Erscheinen der Gewichte am 28. August noch ändert.
MiniMax Design: Das H3-Videomodell erhält eine Agent-Workbench
Drei Wochen nach dem Open-Source-Release von H3 liefert MiniMax die Anwendungsebene zur Vermarktung: Eine agentenbasierte Kreativ-Workbench mit natürlicher Sprachsteuerung, 3D-Regiebühne und ComfyUI-Anbindung. Ein eigenständiges Produkt, keine API – die Modell-Endpunkte bleiben der programmatische Weg. Kompakter Überblick mit Quellen.
Qwen3.8 Offene Gewichte (2026): 2.4T Max-Checkpoints + ein 27B-Modell unter Apache 2.0 für das Notebook
Alibabas erster Open-Weight-Release der Max-Klasse: Qwen3.8-2.4T-A95B (+FP8) auf Hugging Face sowie ein kompaktes Vision-Language-Modell mit 27B unter Apache 2.0, das aus einer 17GB-Datei läuft. Zeitleiste, Lizenzdetails, API-Preise von $2/$6, Simon Willisons lokales Rezept und eine Routing-Tabelle.
Kling 3.0 API (2026): Offizielle Preise, Turbo & Omni und das $3B-Spin-off
Kuaishous Kling 3.0-Familie auf der offiziellen internationalen API: Listenpreise von $0.084–$0.42/s (natives 4K), Turbo inklusive Audio, Omni mit Videoeingabe, JWT-basierte task-orientierte API-Struktur. Q2-Zahlen: über 850 Mio. RMB Umsatz (+200 % im Jahresvergleich), mehr als 100 Mio. Nutzer, im Juli rund ~$3B Kapitalaufnahme bei einer Bewertung von ~$18B. Routing-Tabelle + Kostenberechnung für 10 Sekunden im Vergleich zu Seedance.
DeepSeek-V4-Flash-Vision-Exp (2026): Offizieller Launch, Preise, API-Schnellstart
Veröffentlicht am Abend des 21. August (UTC+8): Experimentelles multimodales Vision-Modell zum V4-Flash-Preis ($0.22/1M Input, Bilder auf maximal 384 Token begrenzt), Textparität mit V4-Flash, multimodaler Agent nahe an Opus-4.8, neue Files API, Unterstützung für Harness v0.1.1-rc.1. Enthält curl/Python-Schnellstart, Kostenvergleich mit Vision-Modellen von Claude/Gemini/Grok und Routing-Empfehlungen für DeepSeek-Modelle.
DeepSeek Harness erhält multimodale Bildeingabe: rc.7 + rc.8
Zweistufiger Rollout: rc.7 (17. Aug.) dauerhafte Bildanhänge in MCP/ACP; rc.8 (19. Aug.) native Bildanfragen für DeepSeek-Adapter sowie Bildeingabe für /goal und /plan. Das Harness unterstützt nun Bilder – V4-Pro/V4-Flash bleiben jedoch rein textbasiert, und rc.8 läuft über das npm-next-Tag. Turing Post bezeichnet das Harness als „zweiten DeepSeek-Moment“.
Gemini 3.7 Flash: Googles Workhorse-Modell für Coding und Agenten
Google kündigte Gemini 3.7 Flash am 13. August an – 1M Kontext, DeepSWE 65,3 %, Einführungspreis $0.75/$3.75 pro 1M Token bis Ende 2026. Ein Referenzwert für westliche Spitzenmodelle; Gemini wird von ChinaModelAPI nicht geroutet.
DeepSeek Harness v0.1: DeepSeek veröffentlicht sein Agent-Harness als Open Source
MIT-lizenziertes Agent-Harness (dsh), bei dem alles ein Plugin ist, angekündigt am Abend des 13. August – internationale Medien bezeichnen es als quelloffenen Claude Code-Rivalen. Vier Arbeitsmodi, Sitzungsimport aus Claude Code, 288 Plugins in 24 Stunden. Von Grund auf modellagnostisch konzipiert.
GLM-5.3 offiziell veröffentlicht: Post-Training-Skalierung, emergente Cyber-Fähigkeiten, Gewichte in 2 Wochen
Der offizielle Blog von Z.ai kündigte GLM-5.3 am 14. August an – gleiche Basis wie GLM-5.2, Terminal-Bench 3.0 von 4,6 auf 28,3, CyberGym 84,5 %, 2.436 reale Schwachstellen gefunden. Aktualisiert am 19. August: API preislich identisch mit 5.2 ($1.40/$4.40 pro 1M), unabhängiger AA-Index 60, Gewichte erwartet für ~28. August; Berichterstattung von VentureBeat / The Decoder / Interconnects liegt vor.
DeepSeek-V4-Pro-0813 offiziell: 正式版 GA mit stärkeren Agenten
Die offizielle API-Dokumentation von DeepSeek hat deepseek-v4-pro am Abend des 13.08.2026 auf DeepSeek-V4-Pro-0813 aktualisiert. Gleiche Modell-ID, verbesserte Agenten-Fähigkeiten, minimale Preisanpassung. Was API-Entwickler tun müssen – so gut wie nichts.
Grok 4.6: Das neue empfohlene Flaggschiff von xAI – jetzt in der API
Die offizielle Entwicklerdokumentation von xAI führt grok-4.6 nun als neuestes Flaggschiff – 500k Kontext, $2/$6 pro 1M Token, empfohlen für Code. Ein Referenzwert für westliche Spitzenmodelle; Grok wird von ChinaModelAPI nicht geroutet.
China Model Watch – Wöchentlicher Modellstatus
Wöchentliche Momentaufnahme der von ChinaModelAPI erfassten chinesischen KI-Flaggschiffmodelle mit Stand vom 09.08.2026 im Vergleich zu den Referenzwerten von GPT-5.6 Sol / Claude Opus 5. Automatischer Statusbericht für API-Entwickler.
MiniMax H3 Offene Gewichte: Natives A/V-Videomodell
H3 (nicht M3) ist das multimodale Videomodell von MiniMax mit nativem Stereo-Audio. HF-Gewichte + ComfyUI + gehostete API. Kein offizieller Name als „offenes Kling“ – Qualitätsvergleiche meist mit Seedance.
Qwen3.8-Max: ~2.4T Flaggschiff – Kein neuer Videogenerator
Qwen-Flaggschiff vom August 2026 für Coding und langfristige Aufgaben. Stellt Gerüchte klar: Kein Release der Klasse Seedance für Text-to-Video als Qwen2.5-VL / Qwen2-VL-72B.
Seedance 2.0 Mini / Fast Rabattbeobachtung: Signale für ~4折 bei Mini
Marktnotiz vom August 2026: Mini wird auf einigen Plattformen oft mit rund 4折 beworben, Fast mit ~75折. Keine ChinaModelAPI-Preise – bitte im jeweiligen Dashboard prüfen. Mini für Iterationen, 2.5 für finale Ergebnisse.
Seedance 2.5 Funktionen: 30s One-Take, 50 Referenzen, verfügbare Plattformen
Offizieller Start plus Rollout im August 2026: 30s Single-Pass, ~50 multimodale Referenzen, stärkere Bearbeitung. Wo Kreative es einsetzen und was API-Entwickler tun sollten.
Seedance 2.5 Status (Historisch): Notizen zur Verzögerung im Juli
Statusbericht vor dem Launch von Ende Juli. Durch den offiziellen Launch-Post vom 31.07.2026 überholt – dient ausschließlich dem chronologischen Kontext.
DeepSeek-V4-Pro für API-Entwickler: Was V3.2 abgelöst hat
DeepSeek-V4-Pro und V4-Flash bilden das Flaggschiff-Duo für 2026 (1M Kontext, offene Gewichte). So migrieren Sie OpenAI-kompatible Clients von Modell-IDs der V3-Ära.
Kimi K3 + GLM-5.2: Das Open-Frontier-Duo für 2026
Wie sich Moonshot Kimi K3 und Zhipu GLM-5.2 bei komplexen Coding-Aufgaben, 1M Kontext und Deployments mit offenen Gewichten ergänzen – inklusive Hinweisen zum OpenAI-kompatiblen Zugriff.
data/model-watch/; Veröffentlichung nach Quellenprüfung.