Notizie / Model Watch · Rilascio open-weight
Pesi aperti Qwen3.8 (2026): Alibaba rilascia i checkpoint 2.4T Max — e un 27B Apache-2.0 da eseguire a casa
Quando abbiamo analizzato Qwen3.8-Max l'8 agosto, la promessa dei pesi aperti era solo una nota a piè di pagina con "in arrivo". Ora è realtà: l'organizzazione Qwen su Hugging Face include Qwen3.8-2.4T-A95B (oltre a una variante FP8) — il primo modello open-weight di classe Max da qualsiasi laboratorio — e Qwen3.8-27B, un modello dense 27B con licenza Apache-2.0, capace di elaborare immagini e video, eseguibile da un file di 17GB. Questo report include la cronologia, le clausole della licenza, i prezzi delle API e una ricetta testata sul campo per l'esecuzione in locale.
I pesi di Qwen3.8 sono aperti dal 12–17 agosto 2026: Qwen3.8-2.4T-A95B (+ FP8) è il primo checkpoint aperto di classe Max, e Qwen3.8-27B viene distribuito sotto licenza Apache 2.0 con comprensione nativa di immagini/video e 262K di contesto (estendibile a 1M).
Il 27B è quello che puoi davvero gestire in self-hosting — Simon Willison lo ha eseguito su un MacBook da 128GB a 15–30 tok/s definendolo "di gran lunga il miglior SVG di pellicano che sia mai riuscito a generare con un modello eseguito su una macchina locale."
Prezzi delle API per qwen3.8-max hosted secondo la copertura del lancio: $2 / $6 / $0.25 per 1M tokens (input / output / cached).
Dall'annuncio ai pesi aperti: la cronologia di due settimane
| Quando | Cosa è successo · fonte |
|---|---|
| Inizio ago (3 ago secondo CCTV) | Qwen3.8-Max annunciato e servito via API — "il modello più capace fino ad oggi", promessi pesi aperti. Il nostro report dell'8 ago ha coperto il lancio e la confusione dei rumor con Qwen2.5-VL. |
| Settimana del 12 ago | Il post ufficiale del blog "Qwen3.8-Max: A New Bar for Coding and Cowork" segna il primo rilascio open-weight di classe Max; i checkpoint 2.4T-A95B e FP8 compaiono sull'organizzazione Qwen su HF nei giorni successivi (cronologie della community: eigent.ai, codersera). |
| 14–16 ago | Qwen3.8-27B arriva sotto licenza Apache 2.0. Simon Willison pubblica una prova pratica (16 ago) che raggiunge la prima pagina di Hacker News a 798 punti; Artificial Analysis posiziona il 27B a 52 sul proprio Intelligence Index. |
| 17 ago (lun) | CNBC lo confronta con Meta: "Alibaba risponde alla sfida dell'IA di Meta con un nuovo modello pronto per laptop." Hugging Face dichiara a CNBC che i derivati basati su Qwen hanno raggiunto quota 151,448 — 2.6× la presenza di Meta. |
Le date seguono le fonti citate per ciascuna riga; dove le cronologie della community differiscono di un giorno (12 ago vs 14 per l'orario esatto del checkpoint), lo specifichiamo invece di appiattirlo.
Cosa è stato rilasciato, secondo le model card ufficiali
- Qwen3.8-2.4T-A95B (il rilascio di classe Max). 2,4 trilioni di parametri totali, basato sulle fondamenta dell'architettura Qwen3.5. Le tabelle ufficiali dei benchmark lo posizionano accanto a Opus 4.8, Claude Fable 5 e GPT-5.6 Sol: Terminal Bench 2.1 a 86.6 (massimo di GPT-5.6 Sol: 88.8), PaperBench a 93.0 (il punteggio più alto della tabella), GPQA Diamond a 92.6, Agents' Last Exam a 53.6. Gli artefatti sono documentati come compatibili con vLLM, SGLang e TokenSpeed.
- Qwen3.8-27B (quello che puoi eseguire). Dense 27B, vision-language nativo — immagini e video — con controllo flessibile del thinking, contesto nativo di 262,144 token estendibile a 1,000,000. I materiali di lancio di Alibaba affermano che "supera complessivamente Qwen3.7-Plus"; il consenso della community (secondo la guida Qwen di codersera) lo considera il nuovo Qwen locale predefinito rispetto a Qwen3.6-27B.
- La distinzione tra versione hosted e pesi grezzi è importante. Secondo la card ufficiale,
qwen3.8-max(la versione hosted) è basato sul checkpoint 2.4T e aggiunge input visivo, modalità non-thinking, contesto da 1M predefinito e strumenti integrati ufficiali. Se ospiti in self-hosting il checkpoint grezzo, metti a disposizione solo la base — non l'insieme completo delle funzionalità hosted. - Le varianti FP8 del checkpoint principale sono pubblicate contestualmente, per i team di inferenza datacenter che desiderano un minore ingombro di memoria.
Cosa non è stato rilasciato — leggi le clausole
- La licenza del 2.4T non è (secondo quanto riportato) Apache. Il 27B è Apache 2.0; le guide della community segnalano che i repo del 2.4T sono invece distribuiti sotto una licenza Qwen personalizzata. Al 21 ago non è stato possibile estrarre il testo completo della licenza dalla pagina del repo — leggi la model card prima del self-hosting commerciale, soprattutto se lo metti a disposizione esternamente.
- 27B hosted: nessuna data, nessun prezzo. La card ufficiale afferma che una versione 27B hosted su Qwen Cloud è "in arrivo" con contesto da 1M predefinito e strumenti integrati — nulla di più specifico al momento della pubblicazione.
- "2.4T open" ≠ "2.4T nella tua configurazione GPU." Le guide della community stimano il checkpoint FP8 intorno a 2.5TB — territorio multi-nodo. Il rilascio open source è strategicamente enorme e concretamente rilevante per le piattaforme di inferenza, non per la tua workstation.
- Attribuzione dei prezzi. Le cifre di $2 / $6 / $0.25 per 1M provengono da una copertura di lancio concorde (latent.space, eigent.ai, codersera, kie.ai a fronte del listino di Qwen Cloud) — non da una pagina dei prezzi acquisita direttamente da noi. Verifica su Model Studio prima di confermare i budget.
Prezzi delle API di Qwen3.8 a confronto con l'offerta di modelli cinesi (2026)
Con un prezzo riportato di $2.00 input / $6.00 output per 1M token (e $0.25 input memorizzato in cache), qwen3.8-max si colloca nella stessa fascia di prezzo dei modelli di frontiera concorrenti — nettamente al di sotto dei modelli di punta occidentali, sopra la soglia minima off-peak di DeepSeek.
| Modello (2026) | Input $/1M | Output $/1M | Pesi aperti |
|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | 2.4T-A95B + FP8 su HF (segnalata licenza personalizzata) |
| GLM-5.3 (Z.ai) | $1.40 | $4.40 | promesso per il ~28 ago (il nostro report) |
| deepseek-v4-flash (off-peak) | $0.22 | $0.66 | MIT (famiglia V4) |
| Kimi K3 | $3.00 | $15.00 | 2.8T, licenza modificata (il nostro report) |
Le righe di confronto riutilizzano i prezzi già verificati nei nostri report precedenti (GLM-5.3, DeepSeek, Kimi K3); la riga di qwen3.8-max si basa su quanto riportato dalla copertura del lancio — vedi le clausole sopra.
Eseguilo a casa: la ricetta testata sul campo di Simon Willison
- La configurazione. Il file GGUF
Q4_K_Mda 17GB in LM Studio, testato su un MacBook Pro da 128GB (M5 Max) e un NVIDIA DGX Spark — circa 15–30 token/sec, e circa il 72% più veloce con la decodifica speculativa draft-mtp di llama.cpp. - Modifica prima il contesto predefinito. 262,144 token nativi, ma l'impostazione predefinita di 8,192 in LM Studio "è stata esaurita solo dal ragionamento." Aumentalo prima di giudicare il modello.
- Elimina l'overthinking. Lo sforzo di ragionamento predefinito è xhigh: il suo prompt per l'SVG del pellicano ha impiegato 21 minuti e consumato 22,276 token di ragionamento per emettere 3,223 token di output. "È un ottimo modello, ma l'impostazione predefinita è davvero un pessimo punto di partenza" — usa reasoning low o nessun reasoning per i compiti quotidiani.
- Il verdetto. "Di gran lunga il miglior SVG di pellicano che sia mai riuscito a generare con un modello eseguito su una macchina locale" — e sulla visione: i suoi test sui bounding-box con foto di pellicani hanno dato "una corrispondenza ottima." Il compromesso è la velocità del modello denso: vincolata dalla larghezza di banda della memoria, quindi non darà la sensazione di un piccolo MoE. Come ha sintetizzato: "Il fatto che un file da 17GB possa fare tutte queste cose sulle macchine di casa mia è un miracolo."
A quale Qwen3.8 dovresti indirizzare le richieste?
| Il tuo carico di lavoro | Indirizza a | Perché |
|---|---|---|
| Sviluppo locale, attento alla privacy, offline | Qwen3.8-27B in self-hosting | Apache 2.0, Q4 da 17GB, input visione+video; riduci il thinking da xhigh |
| Task più complessi di coding/agenti, hosted | qwen3.8-max API | Insieme completo di funzionalità hosted (input visivo, non-thinking, 1M di default, strumenti integrati) a $2/$6 |
| Loop testo/agenti solido ed economico | deepseek-v4-flash | $0.22/$0.66 off-peak — vedi il nostro report sulla famiglia Flash; fai attenzione alle nuove fasce peak/off-peak |
| Pesi aperti di classe Max, inferenza autonoma | 2.4T-A95B / FP8 | Per piattaforme di inferenza con capacità multi-nodo; supporto documentato per vLLM/SGLang/TokenSpeed |
L'impatto della notizia: all'estero e in patria
- Hacker News ne ha fatto un evento. La recensione di Willison conta 798 punti; la scheda di Artificial Analysis (52 sull'Intelligence Index) aggiunge un thread da 380 punti. I temi ricorrenti: capacità in locale ai vertici della categoria e la particolarità del default su xhigh.
- La narrazione occidentale è incentrata su Meta. L'angolazione di CNBC è la competizione con i nuovi modelli per laptop Muse Glimmer di Meta; la statistica di Hugging Face sui 151,448 derivati di Qwen (2.6× la presenza di Meta) sostiene la tesi. WIRED e Axios, che hanno seguito la stessa ondata di pesi aperti questo mese con GLM-5.3, considerano ormai i modelli open cinesi come la frontiera predefinita dell'IA aperta.
- La copertura cinese parla di una tripletta in una sola settimana. La rassegna del 16 ago di 北京商报 — "一周三更" — mette in fila il ribasso dei prezzi di DeepSeek, l'open sourcing di Alibaba e la mossa di post-training di Zhipu in una sola settimana, con i dati di OpenRouter che mostrano come 6 dei 10 modelli più usati al mondo quella settimana fossero cinesi.
Ottieni Qwen e l'intero catalogo cinese tramite un unico endpoint compatibile con OpenAI
ChinaModelAPI è un relay indipendente che porta i modelli di frontiera cinesi — Qwen, DeepSeek, GLM, Kimi — agli sviluppatori di tutto il mondo dietro un'unica API compatibile con OpenAI, con pagamenti in USDT/USD1 e nessun abbonamento. Rilasci come questo sono esattamente ciò per cui la piattaforma è stata creata: disponibilità dei modelli dal primo giorno, prezzi trasparenti per token e un'unica integrazione per l'intero catalogo.
ChinaModelAPI è un relay indipendente senza alcuna relazione ufficiale con Alibaba o con il team di Qwen. Gli ID dei modelli instradati vengono verificati in tempo reale prima del lancio — iscriviti alla lista d'attesa per ricevere una notifica quando il routing di Qwen3.8 sarà attivo.
Fonti primarie
- Blog ufficiale di Qwen — "Qwen3.8-Max: A New Bar for Coding and Cowork" (primo rilascio open-weight di classe Max)
- Hugging Face — Model card di Qwen/Qwen3.8-2.4T-A95B (benchmark, compatibilità con vLLM/SGLang, distinzione funzionalità di Max hosted)
- Hugging Face — Model card di Qwen/Qwen3.8-27B (VLM denso, contesto 262K→1M, versione hosted "in arrivo")
- Hugging Face — Organizzazione Qwen (460 modelli; variante FP8 elencata)
- Simon Willison — "Qwen 3.8 27B is excellent, but it defaults to overthinking things" (16 ago 2026)
- CNBC — "Alibaba answers Meta's AI challenge with new laptop-ready model" (17 ago 2026; statistica HF di 151,448 derivati)
- Artificial Analysis — Scheda di Qwen3.8-27B, Intelligence Index 52
- Hacker News — Thread sulla recensione di Willison (798 punti)
- eigent.ai — Sintesi sui pesi aperti di Qwen3.8-Max (prezzi $2/$6/$0.25 secondo latent.space)
- codersera — Guida alla generazione Qwen (27B Apache 2.0, sostituisce Qwen3.6-27B; avvertenza sulla licenza del 2.4T)
- kie.ai — Analisi del lancio del 27B (affermazione di Alibaba "supera Qwen3.7-Plus", specifiche della card HF)
- 北京商报/东方财富 — "大模型一周三更" (16 ago; statistica top-10 di OpenRouter)
Domande frequenti (2026)
I pesi sono davvero aperti?
Sì — 2.4T-A95B (+FP8) e il 27B sono disponibili sull'organizzazione Qwen di HF. Il 27B è Apache 2.0; per il 2.4T viene segnalata una licenza con termini proprietari Qwen, quindi consulta la card prima del self-hosting per scopi commerciali.
Posso eseguire il 2.4T in autonomia?
Non su hardware da workstation — il checkpoint FP8 è di circa 2.5TB secondo le guide della community. È destinato alle piattaforme di inferenza; tutti gli altri utilizzano l'API hosted o il 27B.
Quale hardware serve per il 27B?
GGUF Q4_K_M da 17GB; Willison ha utilizzato un MacBook Pro da 128GB (M5 Max) e un DGX Spark ottenendo 15–30 tok/s, +72% con draft-mtp. Aumenta il contesto predefinito — 8,192 token vengono esauriti solo dal ragionamento.
Supporta input di immagini e video?
Sì — la card ufficiale del 27B descrive una comprensione vision-language nativa di immagini e video, oltre a un controllo flessibile del thinking. Una caratteristica rara per questa classe di parametri.
Quanto costa l'API?
La copertura del lancio riporta concordemente $2 / $6 / $0.25 per 1M (input / output / cached) per qwen3.8-max su Qwen Cloud. Verifica la pagina attiva di Model Studio prima di pianificare il budget.
Quando sarà disponibile il 27B hosted?
"In arrivo" secondo la card ufficiale — contesto predefinito da 1M e strumenti integrati. Nessuna data o prezzo al 21 ago 2026.
Perché ci sono lamentele sull'overthinking?
Il reasoning xhigh è l'impostazione predefinita: 22,276 token di reasoning e 21 minuti per un singolo SVG. La soluzione di Willison: iniziare con reasoning low o disattivato e aumentarlo solo se necessario.
vs Kimi K3 / GLM-5.3?
K3 ha aperto i pesi 2.8T (licenza modificata) il 27 luglio; Qwen3.8 è il primo con un checkpoint di classe Max accompagnato da una variante dense Apache; i pesi di GLM-5.3 sono attesi intorno al 28 ago. Tutti e tre sono monitorati sul nostro Model Watch.