Notícias / Model Watch · Prévia de Lançamento
Qwen3.8-Flash-Next: Alibaba lança a arquitetura Qwen4 antes do previsto — Pesos abertos hoje à noite
Duas semanas após liberar os pesos do 2.4T Max e do 27B para notebooks, a equipe do Qwen da Alibaba já está preparando o próximo ato: o Qwen3.8-Flash-Next, um MoE multimodal de pesos abertos cuja função é apresentar uma prévia da arquitetura que impulsionará o Qwen4 — com uma contagem regressiva no ModelScope apontando para hoje à noite, 23:00 de Pequim (26 de ago.).
Atualização (27 de ago.): lançado conforme o cronograma — os pesos já estão disponíveis no Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 fragmentos safetensors, sem restrição de acesso, além de uma variante FP8), e o relatório técnico foi publicado. A contagem regressiva se cumpriu; as especificações abaixo permanecem conforme a prévia, a menos que o relatório as revise.
O Qwen3.8-Flash-Next é um MoE multimodal de pesos abertos com lançamento em 26 de ago. às ~23:00 de Pequim, de acordo com a contagem regressiva oficial do ModelScope — 125B de parâmetros principais + 51B de parâmetros de embedding N-gram, 6B ativos por token (segundo os destaques do próprio teaser), construído sobre uma arquitetura híbrida GDN + Qwen Sparse Attention (QSA). Abordagem da Qwen: disponibilizar a arquitetura do Qwen4 antecipadamente para que os desenvolvedores possam se preparar. Benchmarks, licença e extensão de contexto: não publicados no momento da prévia.
O que está confirmado vs. o que não está
- Confirmado (teaser + declaração da Qwen): lançamento de pesos abertos; MoE multimodal; as duas principais mudanças de arquitetura — arquitetura híbrida GDN e Qwen Sparse Attention; lançamento estimado para 2026-08-26 23:00 (UTC+08) no ModelScope; posicionamento como uma prévia da arquitetura da família Qwen4.
- Segundo os destaques do teaser: 125B de parâmetros no modelo principal, uma tabela complementar de embedding N-gram de 51B para consultas locais rápidas de tokens e 6B de parâmetros ativos por token — "MoE multimodal redesenhado", com melhorias em atenção, conexões residuais, embedding e otimização.
- Ainda não publicado: benchmarks, licença, janela de contexto, preços de hospedagem e nomes exatos dos repositórios. Um cético no fórum da NVIDIA interpreta o tamanho como 35B-A3B — o número de 125B-A6B tem origem na própria página do teaser, mas trate tudo como pré-lançamento até que o repositório seja publicado.
- Onde acompanhar hoje à noite: a organização da Qwen no Hugging Face e a página de contagem regressiva do ModelScope. Traremos as especificações verificadas amanhã.
Por que isso importa: explorador de arquitetura, não apenas mais um checkpoint
- Primeira amostra do Qwen4. GDN + QSA em um lançamento aberto significa que a comunidade pode testar a economia de inferência do Qwen4 (custo de atenção, comportamento em contextos longos) meses antes da chegada da família principal.
- 6B ativos por token é o grande destaque para quem executa localmente. Se as alegações de eficiência se confirmarem, hardwares da classe DGX-Spark (já em alta nos fóruns da NVIDIA) e Macs avançados se tornam opções realistas de hospedagem — a mesma estratégia que tornou o 27B um sucesso.
- A incomum tabela de embedding N-gram de 51B é o enigma a se observar: consultas locais rápidas de tokens como elemento central de design é uma novidade para essa classe, e o cálculo de consumo de memória para execução local precisará do repositório real.
- Contexto: isso coroa uma sequência intensa de três semanas da Qwen — pesos abertos do Max (12 de ago.), 27B (14 de ago.) e agora o explorador de arquitetura —, enquanto o mistério em torno do Ox Alpha mantém o foco no padrão de lançamentos discretos dos laboratórios chineses.
Fontes primárias
- Página oficial de contagem regressiva do ModelScope — Qwen3.8-Flash-Next "Upcoming Open-Release", previsão para 2026-08-26 23:00 (UTC+08)
- AGTP no X — Análise da prévia do Qwen4 pela equipe Qwen (125B+51B/A6B, GDN+QSA, "liberação antecipada da arquitetura para preparação dos desenvolvedores")
- OrcaRouter — Painel informativo do Qwen3.8-Flash-Next (colunas confirmado/rumor + captura de tela da contagem regressiva)
- NVIDIA Developer Forums — Tópico de discussão do DGX Spark (incluindo citação original dos destaques e questionamento sobre 125B)
- Hacker News — Qwen 3.8-Flash-Next releasing tomorrow (discussão com 308 pontos)
Perguntas frequentes (2026)
O que é?
Um MoE multimodal de pesos abertos que antecipa a arquitetura do Qwen4 — contagem regressiva no ModelScope aponta para 26 de ago., 23:00 de Pequim.
Especificações?
Segundo destaques do teaser: 125B principais + 51B embeddings N-gram, 6B ativos/token; arquitetura híbrida GDN + Qwen Sparse Attention.
Quando?
Lançado no prazo em 26 de ago. — pesos verificados e disponíveis no HF em 27 de ago. (131 fragmentos + FP8, sem restrições), relatório técnico publicado.
Por que isso importa?
Primeira prévia aberta da economia de inferência do Qwen4 (GDN+QSA) com 6B de parâmetros ativos — amigável para borda/local se as alegações se confirmarem.
O que não foi confirmado?
Benchmarks, licença, contexto, preços. Até o tamanho tem céticos (leitura de 35B-A3B) — trate todos os números como pré-lançamento.
vs. Max e 27B?
Max (2.4T) = carro-chefe; 27B = uso diário em notebook; Flash-Next = explorador da arquitetura Qwen4. Mesma geração, três funções distintas.