Actualités / Suivi des modèles · Aperçu de la sortie
Qwen3.8-Flash-Next : Alibaba déploie l'architecture Qwen4 en avance — Poids ouverts ce soir
Deux semaines après l'ouverture des poids du Max 2.4T et du 27B pour PC portable, l'équipe Qwen d'Alibaba prépare déjà le prochain acte : Qwen3.8-Flash-Next, un MoE multimodal en poids ouverts dont le rôle est de préfigurer l'architecture qui propulsera Qwen4 — avec un compte à rebours ModelScope pointant vers ce soir, 23:00 heure de Pékin (26 août).
Mise à jour (27 août) : sorti dans les temps — les poids sont disponibles sur Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 fragments safetensors, sans restriction, plus une variante FP8), et le rapport technique est disponible. Le compte à rebours a tenu ses promesses ; les spécifications ci-dessous restent conformes à l'aperçu, sauf révision dans le rapport.
Qwen3.8-Flash-Next est un MoE multimodal en poids ouverts disponible le 26 août vers 23:00 heure de Pékin selon le compte à rebours officiel de ModelScope — 125B de paramètres principaux + 51B de paramètres d'embedding N-gram, 6B actifs par token (selon les points clés du teaser), reposant sur une architecture hybride GDN + Qwen Sparse Attention (QSA). La stratégie de Qwen : publier l'architecture de Qwen4 en avance afin que les développeurs puissent s'y préparer. Benchmarks, licence et longueur de contexte : non publiés lors de l'aperçu.
Ce qui est confirmé vs ce qui ne l'est pas
- Confirmé (teaser + déclaration de Qwen) : sortie en poids ouverts ; MoE multimodal ; les deux changements architecturaux majeurs — architecture hybride GDN et Qwen Sparse Attention ; sortie estimée au 26-08-2026 à 23:00 (UTC+08) sur ModelScope ; positionné comme un aperçu de l'architecture de la famille Qwen4.
- D'après les points clés du teaser : 125B de paramètres pour le modèle principal, une table d'embedding N-gram supplémentaire de 51B pour des recherches locales rapides de tokens, et 6B de paramètres actifs par token — « MoE multimodal repensé », avec des améliorations sur l'attention, le résiduel, l'embedding et l'optimisation.
- Pas encore publié : benchmarks, licence, fenêtre de contexte, tarification hébergée et noms exacts des dépôts. Un sceptique du forum NVIDIA évalue plutôt la taille à 35B-A3B — le chiffre de 125B-A6B provient directement de la page du teaser, mais considérez toutes ces informations comme préliminaires jusqu'à l'arrivée du dépôt.
- Où suivre ce soir : l'organisation Qwen sur Hugging Face et la page du compte à rebours ModelScope. Nous ferons un suivi demain avec les spécifications vérifiées.
Pourquoi c'est important : un éclaireur d'architecture, pas un simple checkpoint supplémentaire
- Un premier aperçu de Qwen4. GDN + QSA dans une version ouverte permet à la communauté d'évaluer les coûts d'inférence de Qwen4 (coût de l'attention, comportement sur contexte long) plusieurs mois avant l'arrivée de la famille phare.
- 6B actifs par token, l'élément clé pour l'exécution locale. Si les promesses d'efficacité se confirment, le matériel de classe DGX-Spark (qui fait déjà parler de lui sur les forums NVIDIA) et les Mac haut de gamme deviennent des hôtes tout à fait viables — la même formule qui a fait le succès du 27B.
- L'inhabituelle table d'embedding N-gram de 51B est l'énigme à surveiller : des recherches locales rapides de tokens intégrées au cœur de la conception sont une nouveauté pour cette catégorie, et le calcul de l'empreinte mémoire pour l'inférence locale nécessitera d'examiner le dépôt réel.
- Contexte : cela vient conclure une offensive de trois semaines de Qwen — poids ouverts du Max (12 août), le 27B (14 août) et maintenant cet éclaireur d'architecture — tandis que le mystère d'Ox Alpha entretient l'effervescence autour des lancements furtifs des labos chinois.
Sources primaires
- Page officielle du compte à rebours ModelScope — Qwen3.8-Flash-Next « Upcoming Open-Release », prévu pour le 26-08-2026 à 23:00 (UTC+08)
- AGTP sur X — Analyse du teaser de Qwen4 par l'équipe Qwen (125B+51B/A6B, GDN+QSA, « architecture publiée en avance pour préparer les développeurs »)
- OrcaRouter — Tableau de bord Qwen3.8-Flash-Next (colonnes confirmé/rumeur + capture d'écran du compte à rebours)
- Forums des développeurs NVIDIA — Fil de discussion DGX Spark (avec citation originale des points clés et doutes sur le 125B)
- Hacker News — Qwen 3.8-Flash-Next sort demain (discussion à 308 points)
Questions fréquentes (2026)
De quoi s'agit-il ?
Un MoE multimodal en poids ouverts préfigurant l'architecture de Qwen4 — le compte à rebours ModelScope pointe vers le 26 août à 23:00 heure de Pékin.
Spécifications ?
Selon les points clés du teaser : 125B principal + 51B embeddings N-gram, 6B actifs/token ; architecture hybride GDN + Qwen Sparse Attention.
Quand ?
Sorti comme prévu le 26 août — poids vérifiés et disponibles sur HF le 27 août (131 fragments + FP8, sans restriction), rapport technique publié.
Pourquoi c'est important ?
Premier aperçu public des coûts d'inférence de Qwen4 (GDN+QSA) avec 6B de paramètres actifs — adapté à l'edge et à l'exécution locale si les promesses sont tenues.
Qu'est-ce qui n'est pas confirmé ?
Benchmarks, licence, contexte, tarification. Même la taille fait débat (une lecture à 35B-A3B) — traitez tous les chiffres comme préliminaires.
vs Max et 27B ?
Max (2.4T) = modèle phare ; 27B = outil du quotidien sur PC portable ; Flash-Next = éclaireur pour l'architecture Qwen4. Même génération, trois rôles distincts.