ChinaModelAPI

Notizie / Model Watch · Anteprima di rilascio

Rilasciato ✓ Qwen3.8-Flash-Next 125B + 51B / A6B Anteprima architettura Qwen4
2026-08-26 · Model Watch · rilasciato il 26 ago come da programma (pesi live su HF con verifica del 27 ago)

Qwen3.8-Flash-Next: Alibaba rilascia in anticipo l'architettura Qwen4 — Pesi aperti stasera

Due settimane dopo aver reso open-weight il Max da 2.4T e il 27B per laptop, il team Qwen di Alibaba sta già preparando il prossimo atto: Qwen3.8-Flash-Next, un MoE multimodale open-weight il cui scopo è offrire un'anteprima dell'architettura che alimenterà Qwen4 — con un conto alla rovescia su ModelScope che punta a stasera, alle 23:00 ora di Pechino (26 ago).

Aggiornamento (27 ago): rilasciato come previsto — i pesi sono live su Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 shard safetensors, non gated, oltre a una variante FP8), e il report tecnico è disponibile. Il conto alla rovescia ha mantenuto le aspettative; le specifiche seguenti rimangono quelle dell'anteprima, salvo modifiche nel report.

Risposta diretta

Qwen3.8-Flash-Next è un MoE multimodale open-weight in uscita il 26 ago alle ~23:00 ora di Pechino secondo il conto alla rovescia ufficiale su ModelScope125B di parametri principali + 51B di parametri di embedding N-gram, 6B attivi per token (secondo i punti salienti del teaser), basato su una architettura ibrida GDN + Qwen Sparse Attention (QSA). La strategia di Qwen: rilasciare in anticipo l'architettura di Qwen4 in modo che gli sviluppatori possano prepararsi. Benchmark, licenza e lunghezza del contesto: non pubblicati al momento dell'anteprima.

Cosa è confermato e cosa no

  • Confermato (teaser + dichiarazione di Qwen): rilascio open-weight; MoE multimodale; le due novità architetturali principali — architettura ibrida GDN e Qwen Sparse Attention; rilascio stimato il 2026-08-26 alle 23:00 (UTC+08) su ModelScope; posizionamento come anteprima dell'architettura della famiglia Qwen4.
  • Secondo i punti salienti del teaser: 125B di parametri del modello principale, una tabella supplementare di embedding N-gram da 51B per lookup locali rapidi dei token e 6B di parametri attivi per token — "MoE multimodale riprogettato", con miglioramenti ad attenzione, connessioni residue, embedding e ottimizzazione.
  • Non ancora pubblicato: benchmark, licenza, finestra di contesto, prezzi hosted e nomi esatti delle repository. Uno scettico sui forum NVIDIA stima invece le dimensioni in 35B-A3B — il dato 125B-A6B proviene dalla pagina stessa del teaser, ma è consigliabile considerare tutto come provvisorio fino alla pubblicazione della repository.
  • Dove seguire stasera: l'organizzazione Hugging Face di Qwen e la pagina del conto alla rovescia di ModelScope. Domani seguiranno le specifiche verificate.

Perché è importante: un'anteprima dell'architettura, non solo un altro checkpoint

  • Primo assaggio di Qwen4. GDN + QSA in un rilascio aperto permettono alla community di valutare i costi di serving di Qwen4 (costo dell'attenzione, comportamento su contesti lunghi) mesi prima dell'arrivo della famiglia ammiraglia.
  • I 6B attivi per token sono la vera svolta per l'esecuzione in locale. Se i dati di efficienza si confermano, hardware di classe DGX Spark (già al centro delle discussioni sui forum NVIDIA) e Mac di fascia alta diventano opzioni realistiche — la stessa formula che ha reso il 27B un successo.
  • L'insolita tabella di embedding N-gram da 51B è l'elemento più intrigante: i lookup locali rapidi dei token come elemento architetturale primario rappresentano una novità per questa categoria, e il calcolo dell'impronta di memoria per il serving locale richiederà la repository effettiva.
  • Contesto: corona tre settimane di continui annunci di Qwen — pesi aperti di Max (12 ago), 27B (14 ago) e ora l'anteprima dell'architettura — mentre il mistero di Ox Alpha tiene viva l'attenzione sui rilasci a sorpresa dei laboratori cinesi.

Fonti primarie

Domande frequenti (2026)

Di cosa si tratta?

Un MoE multimodale open-weight che anticipa l'architettura di Qwen4 — il conto alla rovescia su ModelScope indica il 26 ago alle 23:00 ora di Pechino.

Specifiche?

Secondo i punti salienti del teaser: 125B principali + 51B di embedding N-gram, 6B attivi/token; architettura ibrida GDN + Qwen Sparse Attention.

Quando?

Rilasciato come da programma il 26 ago — pesi verificati live su HF il 27 ago (131 shard + FP8, non gated), report tecnico pubblicato.

Perché è importante?

Primo assaggio aperto dell'efficienza di serving di Qwen4 (GDN+QSA) con 6B di parametri attivi — ideale per ambienti edge/locali se le promesse vengono mantenute.

Cosa non è confermato?

Benchmark, licenza, contesto, prezzi. Persino sulle dimensioni c'è chi dissente (lettura 35B-A3B) — considerare tutti i dati come pre-release.

Rispetto a Max e 27B?

Max (2.4T) = modello di punta; 27B = per l'uso quotidiano su laptop; Flash-Next = avanguardia dell'architettura Qwen4. Stessa generazione, tre compiti diversi.

Guide correlate