Notícias / Model Watch · Lançamento de Pesos Abertos
Qwen3.8 com Pesos Abertos (2026): Alibaba lança os checkpoints do Max de 2.4T — e um 27B Apache-2.0 que você pode rodar em casa
Quando publicamos o resumo do Qwen3.8-Max em 8 de agosto, a promessa de pesos abertos era apenas uma nota de rodapé de "em breve". Agora ela se concretizou: a organização do Qwen no Hugging Face disponibilizou o Qwen3.8-2.4T-A95B (além de uma variante FP8) — o primeiro modelo da classe Max com pesos abertos de qualquer laboratório — e o Qwen3.8-27B, um modelo denso de 27B com licença Apache-2.0, suporte a imagens e vídeos, que roda a partir de um arquivo de 17GB. Este resumo traz a linha do tempo, as letras miúdas da licença, os preços da API e uma receita testada na prática para execução local.
Os pesos do Qwen3.8 estão abertos desde 12–17 de agosto de 2026: o Qwen3.8-2.4T-A95B (+ FP8) é o primeiro checkpoint aberto da classe Max, e o Qwen3.8-27B chega sob a licença Apache 2.0 com compreensão nativa de imagem/vídeo e contexto de 262K (extensível para 1M).
O 27B é aquele que você realmente pode auto-hospedar — Simon Willison o executou em um MacBook de 128GB a 15–30 tok/s e o chamou de "de longe o melhor SVG de pelicano que consegui gerar com um modelo executado em uma máquina local".
Preço da API hospedada do qwen3.8-max de acordo com a cobertura de lançamento: $2 / $6 / $0.25 por 1M de tokens (entrada / saída / em cache).
Do anúncio aos pesos abertos: a linha do tempo de duas semanas
| Quando | O que aconteceu · fonte |
|---|---|
| Início de agosto (3 de agosto, segundo a CCTV) | Qwen3.8-Max anunciado e disponibilizado via API — "modelo mais capaz até o momento", com promessa de pesos abertos. Nosso resumo de 8 de agosto cobriu o lançamento e a confusão de boatos com o Qwen2.5-VL. |
| Semana de 12 de agosto | A postagem oficial no blog "Qwen3.8-Max: A New Bar for Coding and Cowork" marca o primeiro lançamento de pesos abertos da classe Max; os checkpoints 2.4T-A95B e FP8 surgem na organização do Qwen no HF nos dias seguintes (linhas do tempo da comunidade: eigent.ai, codersera). |
| 14–16 de agosto | O Qwen3.8-27B é lançado sob Apache 2.0. Simon Willison publica uma análise prática (16 de agosto) que alcança a página principal do Hacker News com 798 pontos; a Artificial Analysis classifica o 27B na posição 52 em seu Índice de Inteligência. |
| 17 de agosto (segunda-feira) | A CNBC contextualiza o anúncio em relação à Meta: "Alibaba responde ao desafio de IA da Meta com novo modelo para laptops". O Hugging Face informou à CNBC que os derivados baseados no Qwen atingiram 151.448 — 2,6 vezes a presença da Meta. |
As datas seguem as fontes citadas em cada linha; quando as linhas do tempo da comunidade divergem em um dia (12 vs. 14 de agosto para o horário exato dos checkpoints), nós explicitamos isso em vez de simplificar.
O que foi lançado, de acordo com os model cards oficiais
- Qwen3.8-2.4T-A95B (o lançamento da classe Max). 2,4 trilhões de parâmetros no total, desenvolvido sobre a base da arquitetura Qwen3.5. As tabelas oficiais de benchmark o posicionam lado a lado com Opus 4.8, Claude Fable 5 e GPT-5.6 Sol: Terminal Bench 2.1 em 86,6 (máximo do GPT-5.6 Sol: 88,8), PaperBench em 93,0 (a maior pontuação da tabela), GPQA Diamond em 92,6, Agents' Last Exam em 53,6. Os artefatos estão documentados como compatíveis com vLLM, SGLang e TokenSpeed.
- Qwen3.8-27B (aquele que você pode rodar). Modelo denso de 27B, visão-linguagem nativa — imagens e vídeos — com controle flexível de raciocínio, contexto nativo de 262.144 tokens extensível para 1.000.000. O material de lançamento do Alibaba afirma que ele "supera o Qwen3.7-Plus no geral"; o consenso da comunidade (segundo o guia do Qwen da codersera) o considera o novo Qwen local padrão em relação ao Qwen3.6-27B.
- A diferença entre a versão hospedada e os pesos brutos é importante. De acordo com o card oficial, o
qwen3.8-max(a versão hospedada) é construído sobre o checkpoint de 2.4T e adiciona entrada de visão, modo sem raciocínio (non-thinking), contexto de 1M por padrão e ferramentas integradas oficiais. Se você auto-hospedar o checkpoint bruto, estará servindo a base — e não o conjunto completo de recursos hospedados. - Variantes FP8 do grande checkpoint foram publicadas em conjunto, voltadas para equipes de inferência em datacenters que buscam uma menor pegada de memória.
O que não veio no lançamento — leia as letras miúdas
- A licença do 2.4T (segundo relatos) não é Apache. O 27B é Apache 2.0; os guias da comunidade apontam que os repositórios do 2.4T foram lançados sob uma licença personalizada do Qwen. Até 21 de agosto, não conseguimos extrair o texto completo da licença na página do repositório — leia o model card antes de fazer auto-hospedagem comercial, especialmente se você for disponibilizá-lo externamente.
- 27B hospedado: sem data, sem preço. O card oficial informa que uma versão hospedada do 27B na Qwen Cloud chegará "em breve", com contexto de 1M por padrão e ferramentas integradas — sem detalhes adicionais no momento da publicação.
- "2.4T aberto" ≠ "2.4T na sua máquina com GPU." Guias da comunidade estimam o checkpoint FP8 em torno de 2,5TB — território de múltiplos nós. A abertura do código é estrategicamente gigantesca e extremamente relevante para plataformas de inferência, não para sua estação de trabalho.
- Atribuição de preços. Os valores de $2 / $6 / $0.25 por 1M vêm de uma cobertura de lançamento consistente (latent.space, eigent.ai, codersera, kie.ai em comparação com a listagem da Qwen Cloud) — e não de uma página de preços capturada diretamente por nós. Verifique no Model Studio antes de fechar orçamentos.
Preços da API do Qwen3.8 vs. o ecossistema de modelos chineses (2026)
Com os valores relatados de $2.00 para entrada / $6.00 para saída por 1M de tokens (e $0.25 para entrada em cache), o qwen3.8-max se posiciona na mesma faixa de preço de seus pares de ponta — confortavelmente abaixo dos modelos de ponta ocidentais e acima do piso fora de pico do DeepSeek.
| Modelo (2026) | Entrada $/1M | Saída $/1M | Pesos abertos |
|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | 2.4T-A95B + FP8 no HF (relato de licença personalizada) |
| GLM-5.3 (Z.ai) | $1.40 | $4.40 | prometido para ~28 de ago. (nosso resumo) |
| deepseek-v4-flash (fora de pico) | $0.22 | $0.66 | MIT (família V4) |
| Kimi K3 | $3.00 | $15.00 | 2.8T, licença modificada (nosso resumo) |
As linhas de comparação reutilizam preços já verificados em nossos resumos anteriores (GLM-5.3, DeepSeek, Kimi K3); a linha do qwen3.8-max é baseada em relatos da cobertura de lançamento — consulte as letras miúdas acima.
Rode em casa: a receita testada na prática por Simon Willison
- A configuração. O GGUF
Q4_K_Mde 17GB no LM Studio, testado em um MacBook Pro de 128GB (M5 Max) e em um NVIDIA DGX Spark — cerca de 15–30 tokens/s, e aproximadamente 72% mais rápido com a decodificação especulativa draft-mtp do llama.cpp. - Ajuste o padrão de contexto primeiro. 262.144 tokens nativos, mas o padrão de 8.192 do LM Studio "foi esgotado apenas pelo raciocínio". Aumente esse valor antes de avaliar o modelo.
- Elimine o excesso de raciocínio. O esforço de raciocínio padrão é xhigh: o prompt dele para o SVG do pelicano rodou por 21 minutos e consumiu 22.276 tokens de raciocínio para emitir 3.223 tokens de saída. "É um ótimo modelo, mas essa configuração padrão é definitivamente um péssimo ponto de partida" — use esforço baixo ou nenhum raciocínio para tarefas cotidianas.
- O veredito. "De longe o melhor SVG de pelicano que consegui gerar com um modelo executado em máquina local" — e sobre visão: seus testes de bounding-box com fotos de pelicanos foram "uma correspondência muito boa". O ponto de atenção é a velocidade de modelo denso: limitado pela largura de banda de memória, então não terá a sensação de um MoE pequeno. Como ele destacou: "O fato de um arquivo de 17GB conseguir fazer tudo isso nas minhas máquinas domésticas é um milagre".
Para qual Qwen3.8 você deve direcionar suas requisições?
| Sua carga de trabalho | Direcionar para | Por quê |
|---|---|---|
| Desenvolvimento local, sensível à privacidade, offline | Qwen3.8-27B auto-hospedado | Apache 2.0, Q4 de 17GB, entrada de visão+vídeo; reduza o raciocínio a partir de xhigh |
| Trabalhos mais complexos de código/agentes, hospedado | qwen3.8-max API | Conjunto completo de recursos hospedados (entrada de visão, non-thinking, padrão de 1M, ferramentas integradas) a $2/$6 |
| Loop de texto/agente robusto e mais econômico | deepseek-v4-flash | $0.22/$0.66 fora de pico — veja nosso resumo da família Flash; preste atenção nas novas janelas de pico/fora de pico |
| Pesos abertos da classe Max, inferência própria | 2.4T-A95B / FP8 | Para plataformas de inferência com capacidade multi-nó; compatibilidade com vLLM/SGLang/TokenSpeed documentada |
Como a notícia repercutiu: no exterior e no mercado doméstico
- O Hacker News transformou o lançamento em um grande marco. A avaliação de Willison alcançou 798 pontos; a listagem da Artificial Analysis (52 no Índice de Inteligência) gerou outra discussão de 380 pontos. Os temas recorrentes: capacidade local topo de linha e o detalhe peculiar do padrão em xhigh.
- A abordagem ocidental foca na Meta. O ângulo da CNBC destaca a concorrência com os novos modelos Muse Glimmer para laptops da Meta; o dado do Hugging Face de 151.448 derivados baseados no Qwen (2,6× a presença da Meta) reforça o argumento. A WIRED e a Axios, ao cobrirem a mesma onda de pesos abertos este mês com o GLM-5.3, agora tratam os modelos abertos chineses como a fronteira padrão da IA aberta.
- A cobertura chinesa destaca uma trinca em uma única semana. O resumo do 北京商报 de 16 de agosto — "一周三更" — reúne o reajuste de preços do DeepSeek, a abertura de código do Alibaba e a iniciativa de pós-treinamento da Zhipu em uma só semana, com dados da OpenRouter mostrando que 6 dos 10 modelos mais usados globalmente naquela semana eram chineses.
Acesse o Qwen e todo o ecossistema de modelos chineses por meio de um único endpoint compatível com a OpenAI
A ChinaModelAPI é um relay independente que disponibiliza modelos de ponta chineses — Qwen, DeepSeek, GLM, Kimi — para desenvolvedores do mundo todo por meio de uma única API compatível com a OpenAI, com pagamentos em USDT/USD1 e sem necessidade de assinatura. Lançamentos como este são exatamente o propósito da plataforma: disponibilidade de modelos desde o primeiro dia, preços transparentes por token e uma única integração para todo o catálogo.
A ChinaModelAPI é um relay independente sem relação oficial com o Alibaba ou com a equipe do Qwen. Os IDs dos modelos roteados são verificados em tempo real antes do lançamento — entre na lista de espera para ser notificado quando o roteamento do Qwen3.8 estiver disponível.
Fontes primárias
- Blog oficial do Qwen — "Qwen3.8-Max: A New Bar for Coding and Cowork" (primeiro lançamento de pesos abertos da classe Max)
- Hugging Face — Model card do Qwen/Qwen3.8-2.4T-A95B (benchmarks, compatibilidade com vLLM/SGLang, distinção de recursos do Max hospedado)
- Hugging Face — Model card do Qwen/Qwen3.8-27B (VLM denso, contexto de 262K→1M, versão hospedada "em breve")
- Hugging Face — Organização Qwen (460 modelos; variante FP8 listada)
- Simon Willison — "Qwen 3.8 27B is excellent, but it defaults to overthinking things" (16 de agosto de 2026)
- CNBC — "Alibaba answers Meta's AI challenge with new laptop-ready model" (17 de agosto de 2026; estatística de 151.448 derivados no HF)
- Artificial Analysis — Listagem do Qwen3.8-27B, Índice de Inteligência 52
- Hacker News — Thread de avaliação de Willison (798 pontos)
- eigent.ai — Resumo dos pesos abertos do Qwen3.8-Max (preços de $2/$6/$0.25 segundo latent.space)
- codersera — Guia de gerações do Qwen (27B Apache 2.0, substitui o Qwen3.6-27B; ressalva sobre a licença do 2.4T)
- kie.ai — Análise detalhada do lançamento do 27B (declaração do Alibaba de que "supera o Qwen3.7-Plus", especificações do card no HF)
- 北京商报/东方财富 — "大模型一周三更" (16 de agosto; estatística do top-10 da OpenRouter)
Perguntas frequentes (2026)
Os pesos são realmente abertos?
Sim — o 2.4T-A95B (+FP8) e o 27B estão na organização do Qwen no HF. O 27B é Apache 2.0; o 2.4T possui termos de licença próprios do Qwen, portanto verifique o card antes da auto-hospedagem comercial.
Posso rodar o 2.4T por conta própria?
Não em hardware de workstation — o checkpoint FP8 tem cerca de 2,5TB segundo os guias da comunidade. Ele é voltado para plataformas de inferência; todos os demais utilizam a API hospedada ou o 27B.
Hardware para o 27B?
GGUF Q4_K_M de 17GB; Willison usou um MacBook Pro de 128GB (M5 Max) e um DGX Spark a 15–30 tok/s, +72% com draft-mtp. Aumente o padrão de contexto — 8.192 é consumido apenas pelo raciocínio.
Entrada de imagens e vídeos?
Sim — o card oficial do 27B descreve compreensão nativa de visão-linguagem para imagens e vídeos, além de controle flexível de raciocínio. Algo raro nessa categoria de tamanho.
Quanto custa a API?
A cobertura de lançamento relata consistentemente $2 / $6 / $0.25 por 1M (entrada / saída / em cache) para o qwen3.8-max na Qwen Cloud. Verifique a página ativa do Model Studio antes de definir seu orçamento.
Quando sai o 27B hospedado?
"Em breve", de acordo com o card oficial — contexto padrão de 1M e ferramentas integradas. Sem data ou preço definidos até 21 de agosto de 2026.
Por que as reclamações sobre excesso de raciocínio?
O raciocínio em xhigh é o padrão: 22.276 tokens de raciocínio e 21 minutos para um único SVG. A solução de Willison: comece com raciocínio baixo ou sem raciocínio e aumente apenas quando necessário.
vs. Kimi K3 / GLM-5.3?
O K3 liberou os pesos de 2.8T (licença modificada) em 27 de julho; o Qwen3.8 é o primeiro com um checkpoint da classe Max acompanhado de uma versão densa sob Apache; os pesos do GLM-5.3 são esperados para ~28 de ago. Os três são acompanhados em nosso Model Watch.