ChinaModelAPI

Notizie / Model Watch · Rilascio open-weight

Pesi aperti Qwen3.8-2.4T-A95B Qwen3.8-27B · Apache 2.0 Guida all'esecuzione locale
2026-08-21 · Model Watch · pesi arrivati il 12–17 ago 2026

Pesi aperti Qwen3.8 (2026): Alibaba rilascia i checkpoint 2.4T Max — e un 27B Apache-2.0 da eseguire a casa

Quando abbiamo analizzato Qwen3.8-Max l'8 agosto, la promessa dei pesi aperti era solo una nota a piè di pagina con "in arrivo". Ora è realtà: l'organizzazione Qwen su Hugging Face include Qwen3.8-2.4T-A95B (oltre a una variante FP8) — il primo modello open-weight di classe Max da qualsiasi laboratorio — e Qwen3.8-27B, un modello dense 27B con licenza Apache-2.0, capace di elaborare immagini e video, eseguibile da un file di 17GB. Questo report include la cronologia, le clausole della licenza, i prezzi delle API e una ricetta testata sul campo per l'esecuzione in locale.

Risposta diretta

I pesi di Qwen3.8 sono aperti dal 12–17 agosto 2026: Qwen3.8-2.4T-A95B (+ FP8) è il primo checkpoint aperto di classe Max, e Qwen3.8-27B viene distribuito sotto licenza Apache 2.0 con comprensione nativa di immagini/video e 262K di contesto (estendibile a 1M). Il 27B è quello che puoi davvero gestire in self-hosting — Simon Willison lo ha eseguito su un MacBook da 128GB a 15–30 tok/s definendolo "di gran lunga il miglior SVG di pellicano che sia mai riuscito a generare con un modello eseguito su una macchina locale." Prezzi delle API per qwen3.8-max hosted secondo la copertura del lancio: $2 / $6 / $0.25 per 1M tokens (input / output / cached).

Dall'annuncio ai pesi aperti: la cronologia di due settimane

QuandoCosa è successo · fonte
Inizio ago (3 ago secondo CCTV)Qwen3.8-Max annunciato e servito via API — "il modello più capace fino ad oggi", promessi pesi aperti. Il nostro report dell'8 ago ha coperto il lancio e la confusione dei rumor con Qwen2.5-VL.
Settimana del 12 agoIl post ufficiale del blog "Qwen3.8-Max: A New Bar for Coding and Cowork" segna il primo rilascio open-weight di classe Max; i checkpoint 2.4T-A95B e FP8 compaiono sull'organizzazione Qwen su HF nei giorni successivi (cronologie della community: eigent.ai, codersera).
14–16 agoQwen3.8-27B arriva sotto licenza Apache 2.0. Simon Willison pubblica una prova pratica (16 ago) che raggiunge la prima pagina di Hacker News a 798 punti; Artificial Analysis posiziona il 27B a 52 sul proprio Intelligence Index.
17 ago (lun)CNBC lo confronta con Meta: "Alibaba risponde alla sfida dell'IA di Meta con un nuovo modello pronto per laptop." Hugging Face dichiara a CNBC che i derivati basati su Qwen hanno raggiunto quota 151,448 — 2.6× la presenza di Meta.

Le date seguono le fonti citate per ciascuna riga; dove le cronologie della community differiscono di un giorno (12 ago vs 14 per l'orario esatto del checkpoint), lo specifichiamo invece di appiattirlo.

Cosa è stato rilasciato, secondo le model card ufficiali

  • Qwen3.8-2.4T-A95B (il rilascio di classe Max). 2,4 trilioni di parametri totali, basato sulle fondamenta dell'architettura Qwen3.5. Le tabelle ufficiali dei benchmark lo posizionano accanto a Opus 4.8, Claude Fable 5 e GPT-5.6 Sol: Terminal Bench 2.1 a 86.6 (massimo di GPT-5.6 Sol: 88.8), PaperBench a 93.0 (il punteggio più alto della tabella), GPQA Diamond a 92.6, Agents' Last Exam a 53.6. Gli artefatti sono documentati come compatibili con vLLM, SGLang e TokenSpeed.
  • Qwen3.8-27B (quello che puoi eseguire). Dense 27B, vision-language nativo — immagini e video — con controllo flessibile del thinking, contesto nativo di 262,144 token estendibile a 1,000,000. I materiali di lancio di Alibaba affermano che "supera complessivamente Qwen3.7-Plus"; il consenso della community (secondo la guida Qwen di codersera) lo considera il nuovo Qwen locale predefinito rispetto a Qwen3.6-27B.
  • La distinzione tra versione hosted e pesi grezzi è importante. Secondo la card ufficiale, qwen3.8-max (la versione hosted) è basato sul checkpoint 2.4T e aggiunge input visivo, modalità non-thinking, contesto da 1M predefinito e strumenti integrati ufficiali. Se ospiti in self-hosting il checkpoint grezzo, metti a disposizione solo la base — non l'insieme completo delle funzionalità hosted.
  • Le varianti FP8 del checkpoint principale sono pubblicate contestualmente, per i team di inferenza datacenter che desiderano un minore ingombro di memoria.

Cosa non è stato rilasciato — leggi le clausole

  • La licenza del 2.4T non è (secondo quanto riportato) Apache. Il 27B è Apache 2.0; le guide della community segnalano che i repo del 2.4T sono invece distribuiti sotto una licenza Qwen personalizzata. Al 21 ago non è stato possibile estrarre il testo completo della licenza dalla pagina del repo — leggi la model card prima del self-hosting commerciale, soprattutto se lo metti a disposizione esternamente.
  • 27B hosted: nessuna data, nessun prezzo. La card ufficiale afferma che una versione 27B hosted su Qwen Cloud è "in arrivo" con contesto da 1M predefinito e strumenti integrati — nulla di più specifico al momento della pubblicazione.
  • "2.4T open" ≠ "2.4T nella tua configurazione GPU." Le guide della community stimano il checkpoint FP8 intorno a 2.5TB — territorio multi-nodo. Il rilascio open source è strategicamente enorme e concretamente rilevante per le piattaforme di inferenza, non per la tua workstation.
  • Attribuzione dei prezzi. Le cifre di $2 / $6 / $0.25 per 1M provengono da una copertura di lancio concorde (latent.space, eigent.ai, codersera, kie.ai a fronte del listino di Qwen Cloud) — non da una pagina dei prezzi acquisita direttamente da noi. Verifica su Model Studio prima di confermare i budget.

Prezzi delle API di Qwen3.8 a confronto con l'offerta di modelli cinesi (2026)

Con un prezzo riportato di $2.00 input / $6.00 output per 1M token (e $0.25 input memorizzato in cache), qwen3.8-max si colloca nella stessa fascia di prezzo dei modelli di frontiera concorrenti — nettamente al di sotto dei modelli di punta occidentali, sopra la soglia minima off-peak di DeepSeek.

Modello (2026)Input $/1MOutput $/1MPesi aperti
qwen3.8-max$2.00$6.002.4T-A95B + FP8 su HF (segnalata licenza personalizzata)
GLM-5.3 (Z.ai)$1.40$4.40promesso per il ~28 ago (il nostro report)
deepseek-v4-flash (off-peak)$0.22$0.66MIT (famiglia V4)
Kimi K3$3.00$15.002.8T, licenza modificata (il nostro report)

Le righe di confronto riutilizzano i prezzi già verificati nei nostri report precedenti (GLM-5.3, DeepSeek, Kimi K3); la riga di qwen3.8-max si basa su quanto riportato dalla copertura del lancio — vedi le clausole sopra.

Eseguilo a casa: la ricetta testata sul campo di Simon Willison

  • La configurazione. Il file GGUF Q4_K_M da 17GB in LM Studio, testato su un MacBook Pro da 128GB (M5 Max) e un NVIDIA DGX Spark — circa 15–30 token/sec, e circa il 72% più veloce con la decodifica speculativa draft-mtp di llama.cpp.
  • Modifica prima il contesto predefinito. 262,144 token nativi, ma l'impostazione predefinita di 8,192 in LM Studio "è stata esaurita solo dal ragionamento." Aumentalo prima di giudicare il modello.
  • Elimina l'overthinking. Lo sforzo di ragionamento predefinito è xhigh: il suo prompt per l'SVG del pellicano ha impiegato 21 minuti e consumato 22,276 token di ragionamento per emettere 3,223 token di output. "È un ottimo modello, ma l'impostazione predefinita è davvero un pessimo punto di partenza" — usa reasoning low o nessun reasoning per i compiti quotidiani.
  • Il verdetto. "Di gran lunga il miglior SVG di pellicano che sia mai riuscito a generare con un modello eseguito su una macchina locale" — e sulla visione: i suoi test sui bounding-box con foto di pellicani hanno dato "una corrispondenza ottima." Il compromesso è la velocità del modello denso: vincolata dalla larghezza di banda della memoria, quindi non darà la sensazione di un piccolo MoE. Come ha sintetizzato: "Il fatto che un file da 17GB possa fare tutte queste cose sulle macchine di casa mia è un miracolo."

A quale Qwen3.8 dovresti indirizzare le richieste?

Il tuo carico di lavoroIndirizza aPerché
Sviluppo locale, attento alla privacy, offlineQwen3.8-27B in self-hostingApache 2.0, Q4 da 17GB, input visione+video; riduci il thinking da xhigh
Task più complessi di coding/agenti, hostedqwen3.8-max APIInsieme completo di funzionalità hosted (input visivo, non-thinking, 1M di default, strumenti integrati) a $2/$6
Loop testo/agenti solido ed economicodeepseek-v4-flash$0.22/$0.66 off-peak — vedi il nostro report sulla famiglia Flash; fai attenzione alle nuove fasce peak/off-peak
Pesi aperti di classe Max, inferenza autonoma2.4T-A95B / FP8Per piattaforme di inferenza con capacità multi-nodo; supporto documentato per vLLM/SGLang/TokenSpeed

L'impatto della notizia: all'estero e in patria

  • Hacker News ne ha fatto un evento. La recensione di Willison conta 798 punti; la scheda di Artificial Analysis (52 sull'Intelligence Index) aggiunge un thread da 380 punti. I temi ricorrenti: capacità in locale ai vertici della categoria e la particolarità del default su xhigh.
  • La narrazione occidentale è incentrata su Meta. L'angolazione di CNBC è la competizione con i nuovi modelli per laptop Muse Glimmer di Meta; la statistica di Hugging Face sui 151,448 derivati di Qwen (2.6× la presenza di Meta) sostiene la tesi. WIRED e Axios, che hanno seguito la stessa ondata di pesi aperti questo mese con GLM-5.3, considerano ormai i modelli open cinesi come la frontiera predefinita dell'IA aperta.
  • La copertura cinese parla di una tripletta in una sola settimana. La rassegna del 16 ago di 北京商报 — "一周三更" — mette in fila il ribasso dei prezzi di DeepSeek, l'open sourcing di Alibaba e la mossa di post-training di Zhipu in una sola settimana, con i dati di OpenRouter che mostrano come 6 dei 10 modelli più usati al mondo quella settimana fossero cinesi.

Ottieni Qwen e l'intero catalogo cinese tramite un unico endpoint compatibile con OpenAI

ChinaModelAPI è un relay indipendente che porta i modelli di frontiera cinesi — Qwen, DeepSeek, GLM, Kimi — agli sviluppatori di tutto il mondo dietro un'unica API compatibile con OpenAI, con pagamenti in USDT/USD1 e nessun abbonamento. Rilasci come questo sono esattamente ciò per cui la piattaforma è stata creata: disponibilità dei modelli dal primo giorno, prezzi trasparenti per token e un'unica integrazione per l'intero catalogo.

ChinaModelAPI è un relay indipendente senza alcuna relazione ufficiale con Alibaba o con il team di Qwen. Gli ID dei modelli instradati vengono verificati in tempo reale prima del lancio — iscriviti alla lista d'attesa per ricevere una notifica quando il routing di Qwen3.8 sarà attivo.

Fonti primarie

Domande frequenti (2026)

I pesi sono davvero aperti?

Sì — 2.4T-A95B (+FP8) e il 27B sono disponibili sull'organizzazione Qwen di HF. Il 27B è Apache 2.0; per il 2.4T viene segnalata una licenza con termini proprietari Qwen, quindi consulta la card prima del self-hosting per scopi commerciali.

Posso eseguire il 2.4T in autonomia?

Non su hardware da workstation — il checkpoint FP8 è di circa 2.5TB secondo le guide della community. È destinato alle piattaforme di inferenza; tutti gli altri utilizzano l'API hosted o il 27B.

Quale hardware serve per il 27B?

GGUF Q4_K_M da 17GB; Willison ha utilizzato un MacBook Pro da 128GB (M5 Max) e un DGX Spark ottenendo 15–30 tok/s, +72% con draft-mtp. Aumenta il contesto predefinito — 8,192 token vengono esauriti solo dal ragionamento.

Supporta input di immagini e video?

Sì — la card ufficiale del 27B descrive una comprensione vision-language nativa di immagini e video, oltre a un controllo flessibile del thinking. Una caratteristica rara per questa classe di parametri.

Quanto costa l'API?

La copertura del lancio riporta concordemente $2 / $6 / $0.25 per 1M (input / output / cached) per qwen3.8-max su Qwen Cloud. Verifica la pagina attiva di Model Studio prima di pianificare il budget.

Quando sarà disponibile il 27B hosted?

"In arrivo" secondo la card ufficiale — contesto predefinito da 1M e strumenti integrati. Nessuna data o prezzo al 21 ago 2026.

Perché ci sono lamentele sull'overthinking?

Il reasoning xhigh è l'impostazione predefinita: 22,276 token di reasoning e 21 minuti per un singolo SVG. La soluzione di Willison: iniziare con reasoning low o disattivato e aumentarlo solo se necessario.

vs Kimi K3 / GLM-5.3?

K3 ha aperto i pesi 2.8T (licenza modificata) il 27 luglio; Qwen3.8 è il primo con un checkpoint di classe Max accompagnato da una variante dense Apache; i pesi di GLM-5.3 sono attesi intorno al 28 ago. Tutti e tre sono monitorati sul nostro Model Watch.

Guide correlate