ChinaModelAPI

Actualités / Model Watch · Sortie des poids ouverts

Poids ouverts Qwen3.8-2.4T-A95B Qwen3.8-27B · Apache 2.0 Guide d'exécution locale
2026-08-21 · Model Watch · poids disponibles du 12 au 17 août 2026

Poids ouverts de Qwen3.8 (2026) : Alibaba publie les checkpoints Max 2.4T — et un 27B sous Apache-2.0 à exécuter chez soi

Lorsque nous avons présenté Qwen3.8-Max le 8 août, la promesse de poids ouverts n'était qu'une note de bas de page « bientôt disponible ». C'est désormais chose faite : l'organisation Hugging Face de Qwen propose Qwen3.8-2.4T-A95B (plus une variante FP8) — le premier modèle de classe Max en poids ouverts, tous laboratoires confondus — ainsi que Qwen3.8-27B, un 27B dense sous Apache-2.0, capable de traiter images et vidéos, fonctionnant à partir d'un fichier de 17GB. Ce point complet détaille la chronologie, les détails de la licence, la tarification de l'API et une méthode d'exécution locale éprouvée sur le terrain.

Réponse directe

Les poids de Qwen3.8 sont ouverts depuis le 12–17 août 2026 : Qwen3.8-2.4T-A95B (+ FP8) est le premier checkpoint ouvert de classe Max, et Qwen3.8-27B est distribué sous Apache 2.0 avec compréhension native des images/vidéos et un contexte de 262K (extensible à 1M). Le 27B est celui que vous pouvez réellement auto-héberger — Simon Willison l'a fait tourner sur un MacBook 128GB à 15–30 tok/s et l'a qualifié de « de loin le meilleur SVG de pélican que j'ai pu générer avec un modèle qui tourne sur une machine locale ». Tarification de l'API hébergée qwen3.8-max selon la couverture du lancement : $2 / $6 / $0.25 per 1M tokens (entrée / sortie / en cache).

De l'annonce aux poids ouverts : la chronologie sur deux semaines

QuandCe qui s'est passé · source
Début août (3 août selon CCTV)Qwen3.8-Max annoncé et servi via API — « modèle le plus performant à ce jour », poids ouverts promis. Notre point du 8 août a couvert le lancement et la confusion due aux rumeurs avec Qwen2.5-VL.
Semaine du 12 aoûtL'article de blog officiel « Qwen3.8-Max: A New Bar for Coding and Cowork » marque la première sortie en poids ouverts de classe Max ; les checkpoints 2.4T-A95B et FP8 apparaissent sur l'organisation HF de Qwen dans les jours qui suivent (chronologies communautaires : eigent.ai, codersera).
14–16 aoûtQwen3.8-27B arrive sous Apache 2.0. Simon Willison publie un retour d'expérience (16 août) qui atteint la une de Hacker News avec 798 points ; Artificial Analysis classe le 27B à 52 sur son Intelligence Index.
17 août (lun.)CNBC le met en perspective face à Meta : « Alibaba répond au défi IA de Meta avec un nouveau modèle adapté aux ordinateurs portables. » Hugging Face indique à CNBC que les dérivés basés sur Qwen atteignent 151 448 — soit 2,6× l'empreinte de Meta.

Les dates suivent les sources citées pour chaque ligne ; lorsque les chronologies communautaires divergent d'un jour (12 août contre 14 pour les heures exactes des checkpoints), nous le mentionnons explicitement au lieu de masquer les écarts.

Ce qui est sorti, selon les fiches de modèle officielles

  • Qwen3.8-2.4T-A95B (la sortie de classe Max). 2,4 billions de paramètres au total, basé sur les fondations de l'architecture Qwen3.5. Les tableaux de benchmarks officiels le placent aux côtés d'Opus 4.8, Claude Fable 5 et GPT-5.6 Sol : Terminal Bench 2.1 à 86.6 (max GPT-5.6 Sol : 88.8), PaperBench à 93.0 (le score le plus élevé du tableau), GPQA Diamond à 92.6, Agents' Last Exam à 53.6. Les artefacts sont documentés comme compatibles avec vLLM, SGLang et TokenSpeed.
  • Qwen3.8-27B (celui que vous pouvez exécuter). 27B dense, vision-langage natif — images et vidéos — avec contrôle flexible de la réflexion, contexte natif de 262 144 tokens extensible à 1 000 000. Les documents de lancement d'Alibaba affirment qu'il « surpasse globalement Qwen3.7-Plus » ; le consensus communautaire (selon le guide Qwen de codersera) le considère comme le nouveau Qwen local par défaut face à Qwen3.6-27B.
  • La distinction entre version hébergée et poids bruts est essentielle. Selon la fiche officielle, qwen3.8-max (la version hébergée) est basé sur le checkpoint 2.4T et ajoute l'entrée visuelle, le mode sans réflexion, un contexte de 1M par défaut et des outils intégrés officiels. Si vous auto-hébergez le checkpoint brut, vous servez la base — pas l'ensemble complet des fonctionnalités hébergées.
  • Des variantes FP8 du grand checkpoint sont publiées en parallèle, pour les équipes d'inférence en datacenter qui souhaitent une empreinte mémoire réduite.

Ce qui n'est pas inclus — lisez les petits caractères

  • La licence du 2.4T n'est pas (selon les retours) sous Apache. Le 27B est sous Apache 2.0 ; les guides de la communauté signalent que les dépôts du 2.4T sont plutôt distribués sous une licence Qwen personnalisée. Au 21 août, nous n'avons pas pu extraire le texte intégral de la licence depuis la page du dépôt — lisez la fiche du modèle avant tout auto-hébergement commercial, en particulier si vous le servez en externe.
  • 27B hébergé : pas de date, pas de prix. La fiche officielle indique qu'un 27B hébergé sur Qwen Cloud est « bientôt disponible » avec un contexte de 1M par défaut et des outils intégrés — rien de plus précis à la date de publication.
  • « 2.4T ouvert » ≠ « 2.4T dans votre boîtier GPU ». Les guides de la communauté évaluent le checkpoint FP8 à environ 2,5 To — un volume réservé au multi-nœuds. Cette ouverture open source est stratégiquement majeure et concrètement utile aux plateformes d'inférence, mais pas à votre station de travail.
  • Origine des tarifs. Les chiffres de $2 / $6 / $0.25 par 1M proviennent de la couverture concordante du lancement (latent.space, eigent.ai, codersera, kie.ai d'après les offres de Qwen Cloud) — et non d'une page de tarifs que nous avons directement capturée. Vérifiez sur Model Studio avant de figer vos budgets.

Tarification de l'API Qwen3.8 vs le catalogue de modèles chinois (2026)

À un tarif annoncé de $2.00 en entrée / $6.00 en sortie par million de tokens (et $0.25 en entrée en cache), qwen3.8-max se situe dans la même tranche de prix que ses pairs de pointe — nettement en dessous des fleurons occidentaux, et au-dessus du plancher en heures creuses de DeepSeek.

Modèle (2026)Entrée $/1MSortie $/1MPoids ouverts
qwen3.8-max$2.00$6.002.4T-A95B + FP8 sur HF (licence personnalisée rapportée)
GLM-5.3 (Z.ai)$1.40$4.40promis vers le 28 août (notre point)
deepseek-v4-flash (heures creuses)$0.22$0.66MIT (famille V4)
Kimi K3$3.00$15.002.8T, licence modifiée (notre point)

Les lignes de comparaison reprennent les prix déjà vérifiés dans nos précédents points (GLM-5.3, DeepSeek, Kimi K3) ; la ligne qwen3.8-max est rapportée d'après la couverture du lancement — voir les petits caractères ci-dessus.

L'exécuter chez soi : la méthode de Simon Willison éprouvée sur le terrain

  • La configuration. Le GGUF Q4_K_M de 17GB dans LM Studio, testé sur un MacBook Pro 128GB (M5 Max) et un NVIDIA DGX Spark — environ 15–30 tokens/sec, et environ 72 % plus rapide avec le décodage spéculatif draft-mtp de llama.cpp.
  • Ajustez d'abord le contexte par défaut. 262 144 tokens natifs, mais la valeur par défaut de 8 192 de LM Studio « a été épuisée par le seul raisonnement ». Augmentez-la avant d'évaluer le modèle.
  • Limitez la réflexion excessive. L'effort de raisonnement par défaut est réglé sur xhigh : son prompt de SVG de pélican a tourné pendant 21 minutes et consommé 22 276 tokens de raisonnement pour générer 3 223 tokens de sortie. « C'est un excellent modèle, mais ce paramètre par défaut est vraiment un mauvais point de départ » — utilisez un raisonnement faible ou désactivé pour les tâches courantes.
  • Le verdict. « De loin le meilleur SVG de pélican que j'ai pu générer avec un modèle qui tourne sur une machine locale » — et concernant la vision : ses tests de boîtes englobantes sur des photos de pélicans étaient « une très bonne correspondance ». La limite concerne la vitesse des modèles denses : contrainte par la bande passante mémoire, elle n'aura donc pas la vélocité d'un petit MoE. Comme il l'a résumé : « Le fait qu'un fichier de 17GB puisse faire tout cela sur mes machines personnelles est un miracle. »

Vers quel Qwen3.8 devriez-vous vous orienter ?

Votre charge de travailRouter versPourquoi
Dév local, sensible à la confidentialité, hors ligneQwen3.8-27B auto-hébergéApache 2.0, Q4 de 17GB, entrée vision+vidéo ; réduire la réflexion depuis xhigh
Tâches de code/agents les plus complexes, hébergéAPI qwen3.8-maxEnsemble complet des fonctionnalités hébergées (entrée vision, sans réflexion, 1M par défaut, outils intégrés) à $2/$6
Boucle texte/agent robuste la plus économiquedeepseek-v4-flash$0.22/$0.66 en heures creuses — voir notre point sur la famille Flash ; surveillez les nouvelles plages d'heures pleines/heures creuses
Poids ouverts de classe Max, inférence autonome2.4T-A95B / FP8Pour les plateformes d'inférence avec capacité multi-nœuds ; compatible vLLM/SGLang/TokenSpeed documenté

L'impact de l'annonce : à l'international et sur le marché domestique

  • Hacker News en a fait un événement. La critique de Willison culmine à 798 points ; la page d'Artificial Analysis (52 sur l'Intelligence Index) suscite un fil de discussion à 380 points. Les thèmes récurrents : les meilleures capacités locales de sa catégorie et la particularité du réglage par défaut en xhigh.
  • Le cadrage occidental est centré sur Meta. L'angle de CNBC met l'accent sur la concurrence avec les nouveaux modèles Muse Glimmer pour PC portables de Meta ; la statistique d'Hugging Face de 151 448 dérivés basés sur Qwen (2,6× Meta) sert d'argument principal. WIRED et Axios, qui couvrent la même vague de poids ouverts ce mois-ci via GLM-5.3, considèrent désormais les modèles ouverts chinois comme la frontière par défaut de l'IA ouverte.
  • La couverture chinoise l'inscrit dans un triplé en une semaine. Le récapitulatif du 16 août du 北京商报 — « 一周三更 » — regroupe la révision des prix de DeepSeek, la publication open source d'Alibaba et l'offensive post-entraînement de Zhipu en une seule semaine, les données d'OpenRouter montrant que 6 des 10 modèles les plus utilisés au niveau mondial cette semaine-là étaient chinois.

Accédez à Qwen et à l'ensemble du catalogue chinois via un endpoint unique compatible OpenAI

ChinaModelAPI est un relais indépendant qui met les modèles frontières chinois — Qwen, DeepSeek, GLM, Kimi — à disposition des développeurs du monde entier via une API unique compatible OpenAI, avec des paiements en USDT/USD1 et sans abonnement. Les sorties comme celle-ci sont précisément la raison d'être de la plateforme : disponibilité des modèles dès le premier jour, tarification transparente au token et une intégration unique pour l'ensemble du catalogue.

ChinaModelAPI est un relais indépendant sans affiliation officielle avec Alibaba ou l'équipe Qwen. Les identifiants de modèles routés sont vérifiés en direct avant le lancement — rejoignez la liste d'attente pour être informé dès que le routage de Qwen3.8 sera disponible.

Sources primaires

Questions fréquentes (2026)

Les poids sont-ils réellement ouverts ?

Oui — 2.4T-A95B (+FP8) et le 27B sont sur l'organisation HF de Qwen. Le 27B est sous Apache 2.0 ; le 2.4T comporterait ses propres conditions de licence Qwen, consultez donc la fiche avant tout auto-hébergement commercial.

Puis-je exécuter le 2.4T moi-même ?

Pas sur du matériel pour station de travail — le checkpoint FP8 pèse environ 2,5 To selon les guides de la communauté. Il est destiné aux plateformes d'inférence ; tous les autres utilisent l'API hébergée ou le 27B.

Quel matériel pour le 27B ?

GGUF Q4_K_M de 17GB ; Willison a utilisé un MacBook Pro 128GB (M5 Max) et un DGX Spark à 15–30 tok/s, +72 % avec draft-mtp. Augmentez la valeur de contexte par défaut — 8 192 est consommé par le seul raisonnement.

Entrée d'images et de vidéos ?

Oui — la fiche officielle du 27B décrit une compréhension vision-langage native des images et des vidéos, ainsi qu'un contrôle flexible de la réflexion. Rare pour cette catégorie de taille.

Combien coûte l'API ?

La couverture du lancement rapporte systématiquement $2 / $6 / $0.25 par 1M (entrée / sortie / en cache) pour qwen3.8-max sur Qwen Cloud. Vérifiez la page en direct de Model Studio avant de définir vos budgets.

À quand le 27B hébergé ?

« Bientôt disponible » selon la fiche officielle — contexte de 1M par défaut et outils intégrés. Aucune date ni aucun prix au 21 août 2026.

Pourquoi ces plaintes sur la réflexion excessive ?

Le raisonnement xhigh est défini par défaut : 22 276 tokens de raisonnement et 21 minutes pour un seul SVG. La solution de Willison : commencer avec un raisonnement faible ou désactivé, et n'augmenter qu'en cas de besoin.

vs Kimi K3 / GLM-5.3 ?

K3 a ouvert ses poids de 2.8T (licence modifiée) le 27 juillet ; Qwen3.8 est le premier à proposer un checkpoint de classe Max accompagné d'un équivalent dense sous Apache ; les poids de GLM-5.3 sont prévus vers le 28 août. Tous les trois sont suivis dans notre Model Watch.

Guides connexes