News / Model Watch · Open-Weights-Release
Qwen3.8 Open Weights (2026): Alibaba veröffentlicht die 2.4T-Max-Checkpoints – und ein 27B unter Apache 2.0 für die lokale Ausführung
Als wir am 8. August über Qwen3.8-Max berichteten, war das Versprechen offener Gewichte noch eine „Demnächst verfügbar“-Fußnote. Jetzt ist es da: Die Qwen-Organisation auf Hugging Face führt Qwen3.8-2.4T-A95B (plus eine FP8-Variante) – das erste Open-Weight-Modell der Max-Klasse überhaupt – und Qwen3.8-27B, ein dichtes, bild- und videofähiges 27B-Modell unter Apache 2.0, das aus einer 17-GB-Datei läuft. Dieser Überblick liefert die Chronologie, das Kleingedruckte zur Lizenz, die API-Preise und eine praxiserprobte Anleitung für die lokale Ausführung.
Die Gewichte von Qwen3.8 sind seit dem 12.–17. August 2026 frei verfügbar: Qwen3.8-2.4T-A95B (+ FP8) ist der erste offene Checkpoint der Max-Klasse, und Qwen3.8-27B erscheint unter Apache 2.0 mit nativem Bild-/Videoverständnis und 262K Kontext (erweiterbar auf 1M).
Das 27B-Modell ist dasjenige, das man tatsächlich selbst hosten kann – Simon Willison betrieb es auf einem 128-GB-MacBook mit 15–30 tok/s und bezeichnete es als „das mit Abstand beste Pelikan-SVG, das ich je mit einem lokal laufenden Modell generieren konnte“.
API-Preise für das gehostete qwen3.8-max laut Launch-Berichten: $2 / $6 / $0.25 per 1M tokens (Input / Output / Cached).
Von der Ankündigung bis zu den Open Weights: Die Chronologie der zwei Wochen
| Wann | Was geschah · Quelle |
|---|---|
| Anfang Aug. (3. Aug. laut CCTV) | Qwen3.8-Max angekündigt und per API bereitgestellt – „bislang leistungsfähigstes Modell“, offene Gewichte versprochen. Unser Überblick vom 8. August behandelte den Launch und die Gerüchte-Verwechslung mit Qwen2.5-VL. |
| Woche ab 12. Aug. | Der offizielle Blogbeitrag „Qwen3.8-Max: A New Bar for Coding and Cowork“ markiert das erste Open-Weight-Release der Max-Klasse; die Checkpoints für 2.4T-A95B und FP8 erscheinen in den Folgetagen in der Qwen-HF-Organisation (Community-Timelines: eigent.ai, codersera). |
| 14.–16. Aug. | Qwen3.8-27B erscheint unter Apache 2.0. Simon Willison veröffentlicht einen Erfahrungsbericht (16. Aug.), der mit 798 Punkten auf der Startseite von Hacker News landet; Artificial Analysis führt das 27B-Modell mit 52 Punkten im Intelligence Index. |
| 17. Aug. (Mo.) | CNBC stellt den Vergleich mit Meta an: „Alibaba antwortet auf Metas KI-Herausforderung mit neuem laptop-tauglichem Modell.“ Hugging Face berichtet gegenüber CNBC, dass Qwen-basierte Derivate 151.448 erreichen – das 2,6-Fache der Präsenz von Meta. |
Die Datumsangaben folgen den jeweils zitierten Quellen; wo Community-Timelines um einen Tag abweichen (12. vs. 14. August für die genauen Checkpoint-Uhrzeiten), weisen wir darauf hin, anstatt es zu glätten.
Was veröffentlicht wurde – laut den offiziellen Model Cards
- Qwen3.8-2.4T-A95B (das Modell der Max-Klasse). 2,4 Billionen Gesamtparameter, basierend auf dem Architekturfundament von Qwen3.5. Offizielle Benchmark-Tabellen platzieren es auf Augenhöhe mit Opus 4.8, Claude Fable 5 und GPT-5.6 Sol: Terminal Bench 2.1 bei 86.6 (GPT-5.6 Sol max: 88.8), PaperBench bei 93.0 (Höchstwert in der Tabelle), GPQA Diamond bei 92.6, Agents' Last Exam bei 53.6. Die Artefakte sind als kompatibel mit vLLM, SGLang und TokenSpeed dokumentiert.
- Qwen3.8-27B (das Modell für die lokale Ausführung). Dichtes 27B-Modell, natives Vision-Language – Bilder und Videos – mit flexibler Thinking-Steuerung, nativem Kontext von 262.144 Token, erweiterbar auf 1.000.000. Alibabas Launch-Materialien geben an, dass es „Qwen3.7-Plus insgesamt übertrifft“; der Community-Konsens (laut Qwen-Guide von codersera) sieht darin das neue lokale Standard-Qwen als Nachfolger von Qwen3.6-27B.
- Der Unterschied zwischen gehosteter Version und reinen Gewichten ist entscheidend. Laut offizieller Model Card basiert
qwen3.8-max(die gehostete Version) auf dem 2.4T-Checkpoint und ergänzt diesen um Vision-Input, Non-Thinking-Modus, standardmäßig 1M Kontext sowie offizielle integrierte Tools. Wenn Sie den reinen Checkpoint selbst hosten, betreiben Sie nur das Basismodell – nicht den vollen Funktionsumfang der gehosteten Version. - FP8-Varianten des großen Checkpoints wurden parallel veröffentlicht – für Inferenz-Teams in Rechenzentren, die einen geringeren Speicherbedarf wünschen.
Was nicht veröffentlicht wurde – das Kleingedruckte beachten
- Die 2.4T-Lizenz ist (Berichten zufolge) kein Apache. Das 27B-Modell steht unter Apache 2.0; Community-Leitfäden weisen darauf hin, dass die Repositories des 2.4T stattdessen unter einer benutzerdefinierten Qwen-Lizenz bereitgestellt werden. Bis zum 21. August konnten wir den vollständigen Lizenztext nicht von der Repository-Seite abrufen – lesen Sie die Model Card vor einem kommerziellen Self-Hosting, insbesondere wenn Sie das Modell extern bereitstellen.
- Gehostetes 27B: Kein Datum, kein Preis. Laut offizieller Model Card ist ein gehostetes 27B in der Qwen Cloud „demnächst verfügbar“ mit standardmäßig 1M Kontext und integrierten Tools – zum Zeitpunkt der Veröffentlichung gab es keine genaueren Angaben.
- „2.4T open“ ≠ „2.4T im eigenen GPU-Server“. Laut Community-Leitfäden umfasst der FP8-Checkpoint rund 2,5 TB – das ist Multi-Node-Territorium. Die Open-Source-Veröffentlichung ist strategisch enorm und praktisch relevant für Inferenz-Plattformen, nicht für die eigene Workstation.
- Preisherkunft. Die Angaben von $2 / $6 / $0.25 pro 1M stammen aus übereinstimmenden Launch-Berichten (latent.space, eigent.ai, codersera, kie.ai im Abgleich mit dem Qwen-Cloud-Angebot) – nicht von einer direkt von uns erfassten Preisseite. Prüfen Sie dies auf Model Studio, bevor Sie Budgets festlegen.
Qwen3.8 API-Preise im Vergleich zu chinesischen Modellen (2026)
Mit gemeldeten $2.00 Input / $6.00 Output pro 1M Tokens (und $0.25 für Cached Input) liegt qwen3.8-max in derselben Preisklasse wie vergleichbare Frontier-Modelle – deutlich unter westlichen Flaggschiffen, aber über den Nebenzeiten-Tiefstpreisen von DeepSeek.
| Modell (2026) | Eingabe $/1M | Ausgabe $/1M | Offene Gewichte |
|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | 2.4T-A95B + FP8 auf HF (benutzerdefinierte Lizenz gemeldet) |
| GLM-5.3 (Z.ai) | $1.40 | $4.40 | angekündigt für ~28. Aug. (unser Überblick) |
| deepseek-v4-flash (Nebenzeiten) | $0.22 | $0.66 | MIT (V4-Familie) |
| Kimi K3 | $3.00 | $15.00 | 2.8T, modifizierte Lizenz (unser Überblick) |
Die Vergleichszeilen verwenden Preise, die bereits in unseren früheren Berichten verifiziert wurden (GLM-5.3, DeepSeek, Kimi K3); die Zeile für qwen3.8-max basiert auf Launch-Berichten – siehe Kleingedrucktes oben.
Lokal ausführen: Simon Willisons praxiserprobtes Rezept
- Das Setup. Die 17-GB-Datei im Format
Q4_K_MGGUF in LM Studio, getestet auf einem 128-GB-MacBook Pro (M5 Max) und einer NVIDIA DGX Spark – rund 15–30 Tokens/s und ca. 72 % schneller mit draft-mtp spekulativer Dekodierung in llama.cpp. - Zuerst den Standard-Kontext anpassen. Nativ 262.144 Token, doch der LM-Studio-Standardwert von 8.192 „wurde allein durch den Denkprozess aufgebraucht“. Erhöhen Sie den Wert, bevor Sie das Modell bewerten.
- Übermäßiges Nachdenken stoppen. Die Standard-Reasoning-Stufe ist xhigh: Sein Pelikan-SVG-Prompt lief 21 Minuten lang und verbrauchte 22.276 Reasoning-Token, um 3.223 Output-Token auszugeben. „Es ist ein großartiges Modell, aber diese Standardeinstellung ist wirklich kein guter Ausgangspunkt“ – nutzen Sie für alltägliche Aufgaben geringes oder gar kein Reasoning.
- Das Fazit. „Mit Abstand das beste Pelikan-SVG, das ich je mit einem lokal laufenden Modell generieren konnte“ – und im Bereich Vision: Seine Bounding-Box-Tests mit Pelikan-Fotos waren „ein sehr guter Treffer“. Der Haken ist die Geschwindigkeit des dichten Modells: Durch die Speicherbandbreite limitiert, fühlt es sich also nicht wie ein kleines MoE an. Wie er es ausdrückte: „Dass eine 17-GB-Datei all diese Dinge auf meinen Heimgeräten leisten kann, ist ein Wunder.“
Zu welchem Qwen3.8 sollten Sie routen?
| Ihr Workload | Routen an | Warum |
|---|---|---|
| Lokale Entwicklung, datenschutzsensibel, offline | Qwen3.8-27B (Self-Hosted) | Apache 2.0, 17 GB Q4, Vision+Video-Input; Thinking von xhigh herabsetzen |
| Anspruchsvollstes Coding & Agenten-Workflows, gehostet | qwen3.8-max API | Voller Funktionsumfang der gehosteten Version (Vision-Input, Non-Thinking, standardmäßig 1M, integrierte Tools) für $2/$6 |
| Günstigste solide Text-/Agenten-Schleife | deepseek-v4-flash | $0.22/$0.66 in Nebenzeiten – siehe unseren Überblick zur Flash-Familie; beachten Sie die neuen Haupt-/Nebenzeiten-Fenster |
| Open Weights der Max-Klasse, eigene Inferenz | 2.4T-A95B / FP8 | Für Inferenz-Plattformen mit Multi-Node-Kapazitäten; vLLM/SGLang/TokenSpeed dokumentiert |
Wie die Nachricht ankam: International und im Heimatmarkt
- Hacker News sorgte für Aufmerksamkeit. Willisons Review erreichte 798 Punkte; der Eintrag bei Artificial Analysis (52 im Intelligence Index) brachte einen weiteren Thread mit 380 Punkten. Die wiederkehrenden Themen: Spitzenklasse bei lokaler Leistungsfähigkeit und die Eigenheit der xhigh-Standardeinstellung.
- Westliche Berichterstattung fokussiert sich auf Meta. CNBCs Blickwinkel ist der Wettbewerb mit Metas neuen Muse-Glimmer-Laptop-Modellen; die Statistik von Hugging Face mit 151.448 Qwen-Derivaten (das 2,6-Fache von Meta) liefert die Argumente. WIRED und Axios, die dieselbe Open-Weights-Welle diesen Monat anhand von GLM-5.3 behandelten, betrachten chinesische Open-Source-Modelle inzwischen als den De-facto-Spitzenstandard für offene KI.
- Chinesische Medien sehen darin einen Dreifachschlag innerhalb einer Woche. Die Zusammenfassung der 北京商报 vom 16. August – „一周三更“ – stellt DeepSeeks Preissenkung, Alibabas Open-Source-Schritt und Zhipus Post-Training-Initiative in einer einzigen Woche gegenüber, wobei OpenRouter-Daten zeigen, dass in jener Woche 6 der weltweiten Top-10-Modelle nach Nutzung aus China stammten.
Qwen und das gesamte Angebot chinesischer Modelle über einen einzigen OpenAI-kompatiblen Endpunkt nutzen
ChinaModelAPI ist ein unabhängiges Relay, das chinesische Spitzenmodelle – Qwen, DeepSeek, GLM, Kimi – für Entwickler weltweit hinter einer einzigen OpenAI-kompatiblen API bereitstellt, mit Zahlungen in USDT/USD1 und ohne Abonnement. Veröffentlichungen wie diese sind genau das, wofür die Plattform geschaffen wurde: Modellverfügbarkeit ab Tag eins, transparente Token-Preise und eine einzige Integration für das gesamte Angebot.
ChinaModelAPI ist ein unabhängiges Relay ohne offizielle Verbindung zu Alibaba oder dem Qwen-Team. Geroutete Modell-IDs werden vor dem Launch live verifiziert – tragen Sie sich in die Warteliste ein, um benachrichtigt zu werden, sobald das Qwen3.8-Routing live geht.
Primärquellen
- Offizieller Qwen-Blog – „Qwen3.8-Max: A New Bar for Coding and Cowork“ (erstes Open-Weight-Release der Max-Klasse)
- Hugging Face – Qwen/Qwen3.8-2.4T-A95B Model Card (Benchmarks, vLLM/SGLang-Kompatibilität, Funktionsunterschiede zu Hosted-Max)
- Hugging Face – Qwen/Qwen3.8-27B Model Card (dichtes VLM, 262K→1M Kontext, gehostete Version „demnächst verfügbar“)
- Hugging Face – Qwen-Organisation (460 Modelle; FP8-Variante aufgeführt)
- Simon Willison – „Qwen 3.8 27B is excellent, but it defaults to overthinking things“ (16. August 2026)
- CNBC – „Alibaba answers Meta's AI challenge with new laptop-ready model“ (17. August 2026; HF-Statistik: 151.448 Derivate)
- Artificial Analysis – Qwen3.8-27B-Eintrag, Intelligence Index 52
- Hacker News – Diskussionsstrang zum Willison-Review (798 Punkte)
- eigent.ai – Zusammenfassung zu Qwen3.8-Max Open Weights (Preise $2/$6/$0.25 laut latent.space)
- codersera – Qwen-Generations-Guide (27B unter Apache 2.0, löst Qwen3.6-27B ab; 2.4T-Lizenzhinweis)
- kie.ai – Analyse zum 27B-Launch (Alibabas Aussage „übertrifft Qwen3.7-Plus“, Spezifikationen der HF-Card)
- 北京商报/东方财富 – „大模型一周三更“ (16. August; OpenRouter Top-10-Statistik)
Häufig gestellte Fragen (2026)
Sind die Gewichte wirklich offen?
Ja – 2.4T-A95B (+FP8) und das 27B-Modell sind in der Qwen-HF-Organisation verfügbar. Das 27B steht unter Apache 2.0; für das 2.4T gelten Berichten zufolge eigene Qwen-Lizenzbedingungen, prüfen Sie daher die Model Card vor einem kommerziellen Self-Hosting.
Kann ich das 2.4T-Modell selbst ausführen?
Nicht auf regulärer Workstation-Hardware – der FP8-Checkpoint umfasst laut Community-Leitfäden rund 2,5 TB. Er ist für Inferenz-Plattformen gedacht; alle anderen nutzen die gehostete API oder das 27B-Modell.
Hardware für das 27B-Modell?
17 GB Q4_K_M GGUF; Willison nutzte ein 128-GB-MacBook Pro (M5 Max) und eine DGX Spark mit 15–30 tok/s, +72 % mit draft-mtp. Erhöhen Sie den Standard-Kontext – 8.192 Token werden allein durch das Reasoning aufgebraucht.
Bilder- und Videoeingabe?
Ja – die offizielle 27B-Model-Card beschreibt ein natives Vision-Language-Verständnis von Bildern und Videos sowie flexible Thinking-Steuerung. Selten in dieser Größenklasse.
Was kostet die API?
Berichte zum Launch nennen durchweg $2 / $6 / $0.25 pro 1M (Input / Output / Cached) für qwen3.8-max in der Qwen Cloud. Überprüfen Sie vor der Budgetierung die aktuelle Seite von Model Studio.
Wann kommt das gehostete 27B?
„Demnächst verfügbar“ laut offizieller Model Card – standardmäßig 1M Kontext plus integrierte Tools. Bis zum 21. August 2026 gab es weder Datum noch Preis.
Warum die Kritik am übermäßigen Nachdenken?
xhigh-Reasoning ist die Standardeinstellung: 22.276 Reasoning-Token und 21 Minuten für ein einzelnes SVG. Willisons Lösung: Mit low oder ohne Reasoning starten und nur bei Bedarf erhöhen.
vs. Kimi K3 / GLM-5.3?
K3 veröffentlichte 2.8T-Gewichte (modifizierte Lizenz) am 27. Juli; Qwen3.8 ist das erste Modell mit einem Checkpoint der Max-Klasse samt dichtem Schwestermodell unter Apache-Lizenz; GLM-5.3-Gewichte werden für ~28. Aug. erwartet. Alle drei werden in unserem Model Watch beobachtet.