ChinaModelAPI

News / Model Watch · Open-Weights-Release

Open Weights Qwen3.8-2.4T-A95B Qwen3.8-27B · Apache 2.0 Anleitung für lokale Ausführung
2026-08-21 · Model Watch · Gewichte veröffentlicht am 12.–17. Aug. 2026

Qwen3.8 Open Weights (2026): Alibaba veröffentlicht die 2.4T-Max-Checkpoints – und ein 27B unter Apache 2.0 für die lokale Ausführung

Als wir am 8. August über Qwen3.8-Max berichteten, war das Versprechen offener Gewichte noch eine „Demnächst verfügbar“-Fußnote. Jetzt ist es da: Die Qwen-Organisation auf Hugging Face führt Qwen3.8-2.4T-A95B (plus eine FP8-Variante) – das erste Open-Weight-Modell der Max-Klasse überhaupt – und Qwen3.8-27B, ein dichtes, bild- und videofähiges 27B-Modell unter Apache 2.0, das aus einer 17-GB-Datei läuft. Dieser Überblick liefert die Chronologie, das Kleingedruckte zur Lizenz, die API-Preise und eine praxiserprobte Anleitung für die lokale Ausführung.

Direkte Antwort

Die Gewichte von Qwen3.8 sind seit dem 12.–17. August 2026 frei verfügbar: Qwen3.8-2.4T-A95B (+ FP8) ist der erste offene Checkpoint der Max-Klasse, und Qwen3.8-27B erscheint unter Apache 2.0 mit nativem Bild-/Videoverständnis und 262K Kontext (erweiterbar auf 1M). Das 27B-Modell ist dasjenige, das man tatsächlich selbst hosten kann – Simon Willison betrieb es auf einem 128-GB-MacBook mit 15–30 tok/s und bezeichnete es als „das mit Abstand beste Pelikan-SVG, das ich je mit einem lokal laufenden Modell generieren konnte“. API-Preise für das gehostete qwen3.8-max laut Launch-Berichten: $2 / $6 / $0.25 per 1M tokens (Input / Output / Cached).

Von der Ankündigung bis zu den Open Weights: Die Chronologie der zwei Wochen

WannWas geschah · Quelle
Anfang Aug. (3. Aug. laut CCTV)Qwen3.8-Max angekündigt und per API bereitgestellt – „bislang leistungsfähigstes Modell“, offene Gewichte versprochen. Unser Überblick vom 8. August behandelte den Launch und die Gerüchte-Verwechslung mit Qwen2.5-VL.
Woche ab 12. Aug.Der offizielle Blogbeitrag „Qwen3.8-Max: A New Bar for Coding and Cowork“ markiert das erste Open-Weight-Release der Max-Klasse; die Checkpoints für 2.4T-A95B und FP8 erscheinen in den Folgetagen in der Qwen-HF-Organisation (Community-Timelines: eigent.ai, codersera).
14.–16. Aug.Qwen3.8-27B erscheint unter Apache 2.0. Simon Willison veröffentlicht einen Erfahrungsbericht (16. Aug.), der mit 798 Punkten auf der Startseite von Hacker News landet; Artificial Analysis führt das 27B-Modell mit 52 Punkten im Intelligence Index.
17. Aug. (Mo.)CNBC stellt den Vergleich mit Meta an: „Alibaba antwortet auf Metas KI-Herausforderung mit neuem laptop-tauglichem Modell.“ Hugging Face berichtet gegenüber CNBC, dass Qwen-basierte Derivate 151.448 erreichen – das 2,6-Fache der Präsenz von Meta.

Die Datumsangaben folgen den jeweils zitierten Quellen; wo Community-Timelines um einen Tag abweichen (12. vs. 14. August für die genauen Checkpoint-Uhrzeiten), weisen wir darauf hin, anstatt es zu glätten.

Was veröffentlicht wurde – laut den offiziellen Model Cards

  • Qwen3.8-2.4T-A95B (das Modell der Max-Klasse). 2,4 Billionen Gesamtparameter, basierend auf dem Architekturfundament von Qwen3.5. Offizielle Benchmark-Tabellen platzieren es auf Augenhöhe mit Opus 4.8, Claude Fable 5 und GPT-5.6 Sol: Terminal Bench 2.1 bei 86.6 (GPT-5.6 Sol max: 88.8), PaperBench bei 93.0 (Höchstwert in der Tabelle), GPQA Diamond bei 92.6, Agents' Last Exam bei 53.6. Die Artefakte sind als kompatibel mit vLLM, SGLang und TokenSpeed dokumentiert.
  • Qwen3.8-27B (das Modell für die lokale Ausführung). Dichtes 27B-Modell, natives Vision-Language – Bilder und Videos – mit flexibler Thinking-Steuerung, nativem Kontext von 262.144 Token, erweiterbar auf 1.000.000. Alibabas Launch-Materialien geben an, dass es „Qwen3.7-Plus insgesamt übertrifft“; der Community-Konsens (laut Qwen-Guide von codersera) sieht darin das neue lokale Standard-Qwen als Nachfolger von Qwen3.6-27B.
  • Der Unterschied zwischen gehosteter Version und reinen Gewichten ist entscheidend. Laut offizieller Model Card basiert qwen3.8-max (die gehostete Version) auf dem 2.4T-Checkpoint und ergänzt diesen um Vision-Input, Non-Thinking-Modus, standardmäßig 1M Kontext sowie offizielle integrierte Tools. Wenn Sie den reinen Checkpoint selbst hosten, betreiben Sie nur das Basismodell – nicht den vollen Funktionsumfang der gehosteten Version.
  • FP8-Varianten des großen Checkpoints wurden parallel veröffentlicht – für Inferenz-Teams in Rechenzentren, die einen geringeren Speicherbedarf wünschen.

Was nicht veröffentlicht wurde – das Kleingedruckte beachten

  • Die 2.4T-Lizenz ist (Berichten zufolge) kein Apache. Das 27B-Modell steht unter Apache 2.0; Community-Leitfäden weisen darauf hin, dass die Repositories des 2.4T stattdessen unter einer benutzerdefinierten Qwen-Lizenz bereitgestellt werden. Bis zum 21. August konnten wir den vollständigen Lizenztext nicht von der Repository-Seite abrufen – lesen Sie die Model Card vor einem kommerziellen Self-Hosting, insbesondere wenn Sie das Modell extern bereitstellen.
  • Gehostetes 27B: Kein Datum, kein Preis. Laut offizieller Model Card ist ein gehostetes 27B in der Qwen Cloud „demnächst verfügbar“ mit standardmäßig 1M Kontext und integrierten Tools – zum Zeitpunkt der Veröffentlichung gab es keine genaueren Angaben.
  • „2.4T open“ ≠ „2.4T im eigenen GPU-Server“. Laut Community-Leitfäden umfasst der FP8-Checkpoint rund 2,5 TB – das ist Multi-Node-Territorium. Die Open-Source-Veröffentlichung ist strategisch enorm und praktisch relevant für Inferenz-Plattformen, nicht für die eigene Workstation.
  • Preisherkunft. Die Angaben von $2 / $6 / $0.25 pro 1M stammen aus übereinstimmenden Launch-Berichten (latent.space, eigent.ai, codersera, kie.ai im Abgleich mit dem Qwen-Cloud-Angebot) – nicht von einer direkt von uns erfassten Preisseite. Prüfen Sie dies auf Model Studio, bevor Sie Budgets festlegen.

Qwen3.8 API-Preise im Vergleich zu chinesischen Modellen (2026)

Mit gemeldeten $2.00 Input / $6.00 Output pro 1M Tokens (und $0.25 für Cached Input) liegt qwen3.8-max in derselben Preisklasse wie vergleichbare Frontier-Modelle – deutlich unter westlichen Flaggschiffen, aber über den Nebenzeiten-Tiefstpreisen von DeepSeek.

Modell (2026)Eingabe $/1MAusgabe $/1MOffene Gewichte
qwen3.8-max$2.00$6.002.4T-A95B + FP8 auf HF (benutzerdefinierte Lizenz gemeldet)
GLM-5.3 (Z.ai)$1.40$4.40angekündigt für ~28. Aug. (unser Überblick)
deepseek-v4-flash (Nebenzeiten)$0.22$0.66MIT (V4-Familie)
Kimi K3$3.00$15.002.8T, modifizierte Lizenz (unser Überblick)

Die Vergleichszeilen verwenden Preise, die bereits in unseren früheren Berichten verifiziert wurden (GLM-5.3, DeepSeek, Kimi K3); die Zeile für qwen3.8-max basiert auf Launch-Berichten – siehe Kleingedrucktes oben.

Lokal ausführen: Simon Willisons praxiserprobtes Rezept

  • Das Setup. Die 17-GB-Datei im Format Q4_K_M GGUF in LM Studio, getestet auf einem 128-GB-MacBook Pro (M5 Max) und einer NVIDIA DGX Spark – rund 15–30 Tokens/s und ca. 72 % schneller mit draft-mtp spekulativer Dekodierung in llama.cpp.
  • Zuerst den Standard-Kontext anpassen. Nativ 262.144 Token, doch der LM-Studio-Standardwert von 8.192 „wurde allein durch den Denkprozess aufgebraucht“. Erhöhen Sie den Wert, bevor Sie das Modell bewerten.
  • Übermäßiges Nachdenken stoppen. Die Standard-Reasoning-Stufe ist xhigh: Sein Pelikan-SVG-Prompt lief 21 Minuten lang und verbrauchte 22.276 Reasoning-Token, um 3.223 Output-Token auszugeben. „Es ist ein großartiges Modell, aber diese Standardeinstellung ist wirklich kein guter Ausgangspunkt“ – nutzen Sie für alltägliche Aufgaben geringes oder gar kein Reasoning.
  • Das Fazit. „Mit Abstand das beste Pelikan-SVG, das ich je mit einem lokal laufenden Modell generieren konnte“ – und im Bereich Vision: Seine Bounding-Box-Tests mit Pelikan-Fotos waren „ein sehr guter Treffer“. Der Haken ist die Geschwindigkeit des dichten Modells: Durch die Speicherbandbreite limitiert, fühlt es sich also nicht wie ein kleines MoE an. Wie er es ausdrückte: „Dass eine 17-GB-Datei all diese Dinge auf meinen Heimgeräten leisten kann, ist ein Wunder.“

Zu welchem Qwen3.8 sollten Sie routen?

Ihr WorkloadRouten anWarum
Lokale Entwicklung, datenschutzsensibel, offlineQwen3.8-27B (Self-Hosted)Apache 2.0, 17 GB Q4, Vision+Video-Input; Thinking von xhigh herabsetzen
Anspruchsvollstes Coding & Agenten-Workflows, gehostetqwen3.8-max APIVoller Funktionsumfang der gehosteten Version (Vision-Input, Non-Thinking, standardmäßig 1M, integrierte Tools) für $2/$6
Günstigste solide Text-/Agenten-Schleifedeepseek-v4-flash$0.22/$0.66 in Nebenzeiten – siehe unseren Überblick zur Flash-Familie; beachten Sie die neuen Haupt-/Nebenzeiten-Fenster
Open Weights der Max-Klasse, eigene Inferenz2.4T-A95B / FP8Für Inferenz-Plattformen mit Multi-Node-Kapazitäten; vLLM/SGLang/TokenSpeed dokumentiert

Wie die Nachricht ankam: International und im Heimatmarkt

  • Hacker News sorgte für Aufmerksamkeit. Willisons Review erreichte 798 Punkte; der Eintrag bei Artificial Analysis (52 im Intelligence Index) brachte einen weiteren Thread mit 380 Punkten. Die wiederkehrenden Themen: Spitzenklasse bei lokaler Leistungsfähigkeit und die Eigenheit der xhigh-Standardeinstellung.
  • Westliche Berichterstattung fokussiert sich auf Meta. CNBCs Blickwinkel ist der Wettbewerb mit Metas neuen Muse-Glimmer-Laptop-Modellen; die Statistik von Hugging Face mit 151.448 Qwen-Derivaten (das 2,6-Fache von Meta) liefert die Argumente. WIRED und Axios, die dieselbe Open-Weights-Welle diesen Monat anhand von GLM-5.3 behandelten, betrachten chinesische Open-Source-Modelle inzwischen als den De-facto-Spitzenstandard für offene KI.
  • Chinesische Medien sehen darin einen Dreifachschlag innerhalb einer Woche. Die Zusammenfassung der 北京商报 vom 16. August – „一周三更“ – stellt DeepSeeks Preissenkung, Alibabas Open-Source-Schritt und Zhipus Post-Training-Initiative in einer einzigen Woche gegenüber, wobei OpenRouter-Daten zeigen, dass in jener Woche 6 der weltweiten Top-10-Modelle nach Nutzung aus China stammten.

Qwen und das gesamte Angebot chinesischer Modelle über einen einzigen OpenAI-kompatiblen Endpunkt nutzen

ChinaModelAPI ist ein unabhängiges Relay, das chinesische Spitzenmodelle – Qwen, DeepSeek, GLM, Kimi – für Entwickler weltweit hinter einer einzigen OpenAI-kompatiblen API bereitstellt, mit Zahlungen in USDT/USD1 und ohne Abonnement. Veröffentlichungen wie diese sind genau das, wofür die Plattform geschaffen wurde: Modellverfügbarkeit ab Tag eins, transparente Token-Preise und eine einzige Integration für das gesamte Angebot.

ChinaModelAPI ist ein unabhängiges Relay ohne offizielle Verbindung zu Alibaba oder dem Qwen-Team. Geroutete Modell-IDs werden vor dem Launch live verifiziert – tragen Sie sich in die Warteliste ein, um benachrichtigt zu werden, sobald das Qwen3.8-Routing live geht.

Primärquellen

Häufig gestellte Fragen (2026)

Sind die Gewichte wirklich offen?

Ja – 2.4T-A95B (+FP8) und das 27B-Modell sind in der Qwen-HF-Organisation verfügbar. Das 27B steht unter Apache 2.0; für das 2.4T gelten Berichten zufolge eigene Qwen-Lizenzbedingungen, prüfen Sie daher die Model Card vor einem kommerziellen Self-Hosting.

Kann ich das 2.4T-Modell selbst ausführen?

Nicht auf regulärer Workstation-Hardware – der FP8-Checkpoint umfasst laut Community-Leitfäden rund 2,5 TB. Er ist für Inferenz-Plattformen gedacht; alle anderen nutzen die gehostete API oder das 27B-Modell.

Hardware für das 27B-Modell?

17 GB Q4_K_M GGUF; Willison nutzte ein 128-GB-MacBook Pro (M5 Max) und eine DGX Spark mit 15–30 tok/s, +72 % mit draft-mtp. Erhöhen Sie den Standard-Kontext – 8.192 Token werden allein durch das Reasoning aufgebraucht.

Bilder- und Videoeingabe?

Ja – die offizielle 27B-Model-Card beschreibt ein natives Vision-Language-Verständnis von Bildern und Videos sowie flexible Thinking-Steuerung. Selten in dieser Größenklasse.

Was kostet die API?

Berichte zum Launch nennen durchweg $2 / $6 / $0.25 pro 1M (Input / Output / Cached) für qwen3.8-max in der Qwen Cloud. Überprüfen Sie vor der Budgetierung die aktuelle Seite von Model Studio.

Wann kommt das gehostete 27B?

„Demnächst verfügbar“ laut offizieller Model Card – standardmäßig 1M Kontext plus integrierte Tools. Bis zum 21. August 2026 gab es weder Datum noch Preis.

Warum die Kritik am übermäßigen Nachdenken?

xhigh-Reasoning ist die Standardeinstellung: 22.276 Reasoning-Token und 21 Minuten für ein einzelnes SVG. Willisons Lösung: Mit low oder ohne Reasoning starten und nur bei Bedarf erhöhen.

vs. Kimi K3 / GLM-5.3?

K3 veröffentlichte 2.8T-Gewichte (modifizierte Lizenz) am 27. Juli; Qwen3.8 ist das erste Modell mit einem Checkpoint der Max-Klasse samt dichtem Schwestermodell unter Apache-Lizenz; GLM-5.3-Gewichte werden für ~28. Aug. erwartet. Alle drei werden in unserem Model Watch beobachtet.

Verwandte Leitfäden