Notizie / Model Watch · Anteprima di rilascio
Qwen3.8-Flash-Next: Alibaba rilascia in anticipo l'architettura Qwen4 — Pesi aperti stasera
Due settimane dopo aver reso open-weight il Max da 2.4T e il 27B per laptop, il team Qwen di Alibaba sta già preparando il prossimo atto: Qwen3.8-Flash-Next, un MoE multimodale open-weight il cui scopo è offrire un'anteprima dell'architettura che alimenterà Qwen4 — con un conto alla rovescia su ModelScope che punta a stasera, alle 23:00 ora di Pechino (26 ago).
Aggiornamento (27 ago): rilasciato come previsto — i pesi sono live su Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 shard safetensors, non gated, oltre a una variante FP8), e il report tecnico è disponibile. Il conto alla rovescia ha mantenuto le aspettative; le specifiche seguenti rimangono quelle dell'anteprima, salvo modifiche nel report.
Qwen3.8-Flash-Next è un MoE multimodale open-weight in uscita il 26 ago alle ~23:00 ora di Pechino secondo il conto alla rovescia ufficiale su ModelScope — 125B di parametri principali + 51B di parametri di embedding N-gram, 6B attivi per token (secondo i punti salienti del teaser), basato su una architettura ibrida GDN + Qwen Sparse Attention (QSA). La strategia di Qwen: rilasciare in anticipo l'architettura di Qwen4 in modo che gli sviluppatori possano prepararsi. Benchmark, licenza e lunghezza del contesto: non pubblicati al momento dell'anteprima.
Cosa è confermato e cosa no
- Confermato (teaser + dichiarazione di Qwen): rilascio open-weight; MoE multimodale; le due novità architetturali principali — architettura ibrida GDN e Qwen Sparse Attention; rilascio stimato il 2026-08-26 alle 23:00 (UTC+08) su ModelScope; posizionamento come anteprima dell'architettura della famiglia Qwen4.
- Secondo i punti salienti del teaser: 125B di parametri del modello principale, una tabella supplementare di embedding N-gram da 51B per lookup locali rapidi dei token e 6B di parametri attivi per token — "MoE multimodale riprogettato", con miglioramenti ad attenzione, connessioni residue, embedding e ottimizzazione.
- Non ancora pubblicato: benchmark, licenza, finestra di contesto, prezzi hosted e nomi esatti delle repository. Uno scettico sui forum NVIDIA stima invece le dimensioni in 35B-A3B — il dato 125B-A6B proviene dalla pagina stessa del teaser, ma è consigliabile considerare tutto come provvisorio fino alla pubblicazione della repository.
- Dove seguire stasera: l'organizzazione Hugging Face di Qwen e la pagina del conto alla rovescia di ModelScope. Domani seguiranno le specifiche verificate.
Perché è importante: un'anteprima dell'architettura, non solo un altro checkpoint
- Primo assaggio di Qwen4. GDN + QSA in un rilascio aperto permettono alla community di valutare i costi di serving di Qwen4 (costo dell'attenzione, comportamento su contesti lunghi) mesi prima dell'arrivo della famiglia ammiraglia.
- I 6B attivi per token sono la vera svolta per l'esecuzione in locale. Se i dati di efficienza si confermano, hardware di classe DGX Spark (già al centro delle discussioni sui forum NVIDIA) e Mac di fascia alta diventano opzioni realistiche — la stessa formula che ha reso il 27B un successo.
- L'insolita tabella di embedding N-gram da 51B è l'elemento più intrigante: i lookup locali rapidi dei token come elemento architetturale primario rappresentano una novità per questa categoria, e il calcolo dell'impronta di memoria per il serving locale richiederà la repository effettiva.
- Contesto: corona tre settimane di continui annunci di Qwen — pesi aperti di Max (12 ago), 27B (14 ago) e ora l'anteprima dell'architettura — mentre il mistero di Ox Alpha tiene viva l'attenzione sui rilasci a sorpresa dei laboratori cinesi.
Fonti primarie
- Pagina ufficiale del conto alla rovescia di ModelScope — Qwen3.8-Flash-Next "Upcoming Open-Release", previsto per il 2026-08-26 alle 23:00 (UTC+08)
- AGTP su X — Analisi dell'anteprima di Qwen4 del team Qwen (125B+51B/A6B, GDN+QSA, "architettura rilasciata in anticipo affinché gli sviluppatori possano prepararsi")
- OrcaRouter — Bacheca informativa su Qwen3.8-Flash-Next (sezioni confermati/rumor + screenshot del conto alla rovescia)
- NVIDIA Developer Forums — Thread di discussione su DGX Spark (con citazione originale dei punti salienti e dubbi sui 125B)
- Hacker News — Qwen 3.8-Flash-Next releasing tomorrow (post da 308 punti)
Domande frequenti (2026)
Di cosa si tratta?
Un MoE multimodale open-weight che anticipa l'architettura di Qwen4 — il conto alla rovescia su ModelScope indica il 26 ago alle 23:00 ora di Pechino.
Specifiche?
Secondo i punti salienti del teaser: 125B principali + 51B di embedding N-gram, 6B attivi/token; architettura ibrida GDN + Qwen Sparse Attention.
Quando?
Rilasciato come da programma il 26 ago — pesi verificati live su HF il 27 ago (131 shard + FP8, non gated), report tecnico pubblicato.
Perché è importante?
Primo assaggio aperto dell'efficienza di serving di Qwen4 (GDN+QSA) con 6B di parametri attivi — ideale per ambienti edge/locali se le promesse vengono mantenute.
Cosa non è confermato?
Benchmark, licenza, contesto, prezzi. Persino sulle dimensioni c'è chi dissente (lettura 35B-A3B) — considerare tutti i dati come pre-release.
Rispetto a Max e 27B?
Max (2.4T) = modello di punta; 27B = per l'uso quotidiano su laptop; Flash-Next = avanguardia dell'architettura Qwen4. Stessa generazione, tre compiti diversi.