ChinaModelAPI

News / Model Watch · Release-Vorschau

Veröffentlicht ✓ Qwen3.8-Flash-Next 125B + 51B / A6B Qwen4-Architekturvorschau
2026-08-26 · Model Watch · planmäßig am 26. Aug. veröffentlicht (Gewichte auf HF am 27. Aug. verifiziert)

Qwen3.8-Flash-Next: Alibaba liefert die Qwen4-Architektur vorzeitig aus – Offene Gewichte heute Nacht

Zwei Wochen nach der Veröffentlichung des 2.4T Max und der Laptop-Klasse 27B bereitet Alibabas Qwen-Team bereits den nächsten Schritt vor: Qwen3.8-Flash-Next, ein multimodales Open-Weight-MoE, das als Vorschau auf die Architektur von Qwen4 dient – mit einem ModelScope-Countdown, der auf heute Abend, 23:00 Uhr Peking-Zeit (26. Aug.) hinweist.

Update (27. Aug.): planmäßig veröffentlicht – Gewichte sind auf Hugging Face live (Qwen/Qwen3.8-Flash-Next, 131 Safetensors-Shards, unbeschränkt zugänglich, plus eine FP8-Variante) und der technische Bericht ist da. Der Countdown hat geliefert; die nachfolgenden Spezifikationen gelten wie angekündigt, sofern der Bericht sie nicht revidiert.

Direkte Antwort

Qwen3.8-Flash-Next ist ein multimodales Open-Weight-MoE, das laut offiziellem ModelScope-Countdown am 26. Aug. um ca. 23:00 Uhr Peking-Zeit erscheint125B Hauptparameter + 51B N-Gramm-Embedding-Parameter, 6B aktiv pro Token (laut den Teaser-Highlights), basierend auf einer GDN-Hybridarchitektur + Qwen Sparse Attention (QSA). Qwens Ansatz: die Qwen4-Architektur frühzeitig veröffentlichen, damit sich Entwickler vorbereiten können. Benchmarks, Lizenz und Kontextlänge: zum Zeitpunkt der Vorschau noch unveröffentlicht.

Was bestätigt ist vs. was nicht

  • Bestätigt (Teaser + Qwen-Statement): Open-Weight-Release; multimodales MoE; die beiden wichtigsten Architekturänderungen – GDN-Hybridarchitektur und Qwen Sparse Attention; voraussichtliche Veröffentlichung am 26.08.2026 um 23:00 Uhr (UTC+08) auf ModelScope; Positionierung als Architekturvorschau für die Qwen4-Familie.
  • Laut Teaser-Highlights: 125B Parameter im Hauptmodell, eine ergänzende 51B N-Gramm-Embedding-Tabelle für schnelle lokale Token-Lookups und 6B aktive Parameter pro Token – „neu gestaltetes multimodales MoE“ mit Upgrades bei Attention, Residual, Embedding und Optimierung.
  • Noch nicht veröffentlicht: Benchmarks, Lizenz, Kontextfenster, Hosting-Preise und genaue Repository-Namen. Ein Skeptiker im NVIDIA-Forum interpretiert die Größe stattdessen als 35B-A3B – die Angabe 125B-A6B stammt direkt von der Teaser-Seite, dennoch sollte vor Veröffentlichung des Repositories alles als vorläufig betrachtet werden.
  • Wo man heute Abend reinschauen sollte: die Qwen-Hugging-Face-Organisation und die ModelScope-Countdown-Seite. Wir liefern morgen verifizierte Spezifikationen nach.

Warum es wichtig ist: Architektur-Scout, nicht nur ein weiterer Checkpoint

  • Erster Vorgeschmack auf Qwen4. GDN + QSA in einem Open-Release bedeutet, dass die Community die Serving-Wirtschaftlichkeit von Qwen4 (Attention-Kosten, Long-Context-Verhalten) Monate vor dem Start der Flaggschiff-Familie testen kann.
  • 6B aktiv pro Token ist das Thema für lokale Setups. Wenn die Effizienzversprechen zutreffen, werden Hardware der DGX-Spark-Klasse (bereits Thema in den NVIDIA-Foren) und High-End-Macs zu realistischen Hosts – dasselbe Erfolgsrezept, das schon das 27B zum Hit gemacht hat.
  • Die ungewöhnliche 51B N-Gramm-Embedding-Tabelle ist das große Rätsel: Schnelle lokale Token-Lookups als erstklassiges Designelement sind neu in dieser Klasse, und die genaue Berechnung des Speicherbedarfs für lokales Serving erfordert das tatsächliche Repository.
  • Kontext: Sie krönt eine dreiwöchige Qwen-Offensive – Max Open Weights (12. Aug.), 27B (14. Aug.) und jetzt der Architektur-Scout –, während das Rätsel um Ox Alpha das Muster geheimer Releases chinesischer Labs weiter spannend hält.

Primärquellen

Häufig gestellte Fragen (2026)

Was ist das?

Ein multimodales Open-Weight-MoE als Vorschau auf die Qwen4-Architektur – der ModelScope-Countdown steht auf 26. Aug., 23:00 Uhr Peking-Zeit.

Specs?

Laut Teaser-Highlights: 125B Hauptmodell + 51B N-Gramm-Embeddings, 6B aktiv/Token; GDN-Hybridarchitektur + Qwen Sparse Attention.

Wann?

Planmäßig am 26. Aug. veröffentlicht – Gewichte seit 27. Aug. auf HF verifiziert (131 Shards + FP8, ungated), technischer Bericht veröffentlicht.

Warum ist es wichtig?

Erster offener Vorgeschmack auf die Serving-Wirtschaftlichkeit von Qwen4 (GDN+QSA) mit 6B aktiven Parametern – edge- und lokal-freundlich, wenn die Angaben stimmen.

Was ist unbestätigt?

Benchmarks, Lizenz, Kontext, Preise. Sogar an der Größe gibt es Zweifel (35B-A3B-Interpretation) – alle Zahlen sind als vorläufig zu betrachten.

vs. Max und 27B?

Max (2.4T) = Flaggschiff; 27B = täglicher Begleiter auf dem Laptop; Flash-Next = Qwen4-Architektur-Scout. Gleiche Generation, drei verschiedene Aufgaben.

Verwandte Leitfäden