News / Model Watch · Release-Vorschau
Qwen3.8-Flash-Next: Alibaba liefert die Qwen4-Architektur vorzeitig aus – Offene Gewichte heute Nacht
Zwei Wochen nach der Veröffentlichung des 2.4T Max und der Laptop-Klasse 27B bereitet Alibabas Qwen-Team bereits den nächsten Schritt vor: Qwen3.8-Flash-Next, ein multimodales Open-Weight-MoE, das als Vorschau auf die Architektur von Qwen4 dient – mit einem ModelScope-Countdown, der auf heute Abend, 23:00 Uhr Peking-Zeit (26. Aug.) hinweist.
Update (27. Aug.): planmäßig veröffentlicht – Gewichte sind auf Hugging Face live (Qwen/Qwen3.8-Flash-Next, 131 Safetensors-Shards, unbeschränkt zugänglich, plus eine FP8-Variante) und der technische Bericht ist da. Der Countdown hat geliefert; die nachfolgenden Spezifikationen gelten wie angekündigt, sofern der Bericht sie nicht revidiert.
Qwen3.8-Flash-Next ist ein multimodales Open-Weight-MoE, das laut offiziellem ModelScope-Countdown am 26. Aug. um ca. 23:00 Uhr Peking-Zeit erscheint – 125B Hauptparameter + 51B N-Gramm-Embedding-Parameter, 6B aktiv pro Token (laut den Teaser-Highlights), basierend auf einer GDN-Hybridarchitektur + Qwen Sparse Attention (QSA). Qwens Ansatz: die Qwen4-Architektur frühzeitig veröffentlichen, damit sich Entwickler vorbereiten können. Benchmarks, Lizenz und Kontextlänge: zum Zeitpunkt der Vorschau noch unveröffentlicht.
Was bestätigt ist vs. was nicht
- Bestätigt (Teaser + Qwen-Statement): Open-Weight-Release; multimodales MoE; die beiden wichtigsten Architekturänderungen – GDN-Hybridarchitektur und Qwen Sparse Attention; voraussichtliche Veröffentlichung am 26.08.2026 um 23:00 Uhr (UTC+08) auf ModelScope; Positionierung als Architekturvorschau für die Qwen4-Familie.
- Laut Teaser-Highlights: 125B Parameter im Hauptmodell, eine ergänzende 51B N-Gramm-Embedding-Tabelle für schnelle lokale Token-Lookups und 6B aktive Parameter pro Token – „neu gestaltetes multimodales MoE“ mit Upgrades bei Attention, Residual, Embedding und Optimierung.
- Noch nicht veröffentlicht: Benchmarks, Lizenz, Kontextfenster, Hosting-Preise und genaue Repository-Namen. Ein Skeptiker im NVIDIA-Forum interpretiert die Größe stattdessen als 35B-A3B – die Angabe 125B-A6B stammt direkt von der Teaser-Seite, dennoch sollte vor Veröffentlichung des Repositories alles als vorläufig betrachtet werden.
- Wo man heute Abend reinschauen sollte: die Qwen-Hugging-Face-Organisation und die ModelScope-Countdown-Seite. Wir liefern morgen verifizierte Spezifikationen nach.
Warum es wichtig ist: Architektur-Scout, nicht nur ein weiterer Checkpoint
- Erster Vorgeschmack auf Qwen4. GDN + QSA in einem Open-Release bedeutet, dass die Community die Serving-Wirtschaftlichkeit von Qwen4 (Attention-Kosten, Long-Context-Verhalten) Monate vor dem Start der Flaggschiff-Familie testen kann.
- 6B aktiv pro Token ist das Thema für lokale Setups. Wenn die Effizienzversprechen zutreffen, werden Hardware der DGX-Spark-Klasse (bereits Thema in den NVIDIA-Foren) und High-End-Macs zu realistischen Hosts – dasselbe Erfolgsrezept, das schon das 27B zum Hit gemacht hat.
- Die ungewöhnliche 51B N-Gramm-Embedding-Tabelle ist das große Rätsel: Schnelle lokale Token-Lookups als erstklassiges Designelement sind neu in dieser Klasse, und die genaue Berechnung des Speicherbedarfs für lokales Serving erfordert das tatsächliche Repository.
- Kontext: Sie krönt eine dreiwöchige Qwen-Offensive – Max Open Weights (12. Aug.), 27B (14. Aug.) und jetzt der Architektur-Scout –, während das Rätsel um Ox Alpha das Muster geheimer Releases chinesischer Labs weiter spannend hält.
Primärquellen
- Offizielle ModelScope-Countdown-Seite — Qwen3.8-Flash-Next „Upcoming Open-Release“, voraussichtlich 26.08.2026 23:00 (UTC+08)
- AGTP auf X — Qwen-Team: Analyse des Qwen4-Teasers (125B+51B/A6B, GDN+QSA, „Architektur vorab bereitgestellt, damit sich Entwickler vorbereiten können“)
- OrcaRouter — Qwen3.8-Flash-Next-Infoboard (Spalten Bestätigt/Gerücht + Countdown-Screenshot)
- NVIDIA Developer Forums — DGX-Spark-Diskussionsthread (inkl. Highlights-Originalzitaten und 125B-Skepsis)
- Hacker News — Qwen 3.8-Flash-Next erscheint morgen (308-Punkte-Thread)
Häufig gestellte Fragen (2026)
Was ist das?
Ein multimodales Open-Weight-MoE als Vorschau auf die Qwen4-Architektur – der ModelScope-Countdown steht auf 26. Aug., 23:00 Uhr Peking-Zeit.
Specs?
Laut Teaser-Highlights: 125B Hauptmodell + 51B N-Gramm-Embeddings, 6B aktiv/Token; GDN-Hybridarchitektur + Qwen Sparse Attention.
Wann?
Planmäßig am 26. Aug. veröffentlicht – Gewichte seit 27. Aug. auf HF verifiziert (131 Shards + FP8, ungated), technischer Bericht veröffentlicht.
Warum ist es wichtig?
Erster offener Vorgeschmack auf die Serving-Wirtschaftlichkeit von Qwen4 (GDN+QSA) mit 6B aktiven Parametern – edge- und lokal-freundlich, wenn die Angaben stimmen.
Was ist unbestätigt?
Benchmarks, Lizenz, Kontext, Preise. Sogar an der Größe gibt es Zweifel (35B-A3B-Interpretation) – alle Zahlen sind als vorläufig zu betrachten.
vs. Max und 27B?
Max (2.4T) = Flaggschiff; 27B = täglicher Begleiter auf dem Laptop; Flash-Next = Qwen4-Architektur-Scout. Gleiche Generation, drei verschiedene Aufgaben.