ChinaModelAPI

Notícias / Model Watch · Prévia de Lançamento

Lançado ✓ Qwen3.8-Flash-Next 125B + 51B / A6B Prévia da arquitetura Qwen4
2026-08-26 · Model Watch · lançado em 26 de ago. conforme o cronograma (pesos disponíveis no HF com verificação em 27 de ago.)

Qwen3.8-Flash-Next: Alibaba lança a arquitetura Qwen4 antes do previsto — Pesos abertos hoje à noite

Duas semanas após liberar os pesos do 2.4T Max e do 27B para notebooks, a equipe do Qwen da Alibaba já está preparando o próximo ato: o Qwen3.8-Flash-Next, um MoE multimodal de pesos abertos cuja função é apresentar uma prévia da arquitetura que impulsionará o Qwen4 — com uma contagem regressiva no ModelScope apontando para hoje à noite, 23:00 de Pequim (26 de ago.).

Atualização (27 de ago.): lançado conforme o cronograma — os pesos já estão disponíveis no Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 fragmentos safetensors, sem restrição de acesso, além de uma variante FP8), e o relatório técnico foi publicado. A contagem regressiva se cumpriu; as especificações abaixo permanecem conforme a prévia, a menos que o relatório as revise.

Resposta direta

O Qwen3.8-Flash-Next é um MoE multimodal de pesos abertos com lançamento em 26 de ago. às ~23:00 de Pequim, de acordo com a contagem regressiva oficial do ModelScope125B de parâmetros principais + 51B de parâmetros de embedding N-gram, 6B ativos por token (segundo os destaques do próprio teaser), construído sobre uma arquitetura híbrida GDN + Qwen Sparse Attention (QSA). Abordagem da Qwen: disponibilizar a arquitetura do Qwen4 antecipadamente para que os desenvolvedores possam se preparar. Benchmarks, licença e extensão de contexto: não publicados no momento da prévia.

O que está confirmado vs. o que não está

  • Confirmado (teaser + declaração da Qwen): lançamento de pesos abertos; MoE multimodal; as duas principais mudanças de arquitetura — arquitetura híbrida GDN e Qwen Sparse Attention; lançamento estimado para 2026-08-26 23:00 (UTC+08) no ModelScope; posicionamento como uma prévia da arquitetura da família Qwen4.
  • Segundo os destaques do teaser: 125B de parâmetros no modelo principal, uma tabela complementar de embedding N-gram de 51B para consultas locais rápidas de tokens e 6B de parâmetros ativos por token — "MoE multimodal redesenhado", com melhorias em atenção, conexões residuais, embedding e otimização.
  • Ainda não publicado: benchmarks, licença, janela de contexto, preços de hospedagem e nomes exatos dos repositórios. Um cético no fórum da NVIDIA interpreta o tamanho como 35B-A3B — o número de 125B-A6B tem origem na própria página do teaser, mas trate tudo como pré-lançamento até que o repositório seja publicado.
  • Onde acompanhar hoje à noite: a organização da Qwen no Hugging Face e a página de contagem regressiva do ModelScope. Traremos as especificações verificadas amanhã.

Por que isso importa: explorador de arquitetura, não apenas mais um checkpoint

  • Primeira amostra do Qwen4. GDN + QSA em um lançamento aberto significa que a comunidade pode testar a economia de inferência do Qwen4 (custo de atenção, comportamento em contextos longos) meses antes da chegada da família principal.
  • 6B ativos por token é o grande destaque para quem executa localmente. Se as alegações de eficiência se confirmarem, hardwares da classe DGX-Spark (já em alta nos fóruns da NVIDIA) e Macs avançados se tornam opções realistas de hospedagem — a mesma estratégia que tornou o 27B um sucesso.
  • A incomum tabela de embedding N-gram de 51B é o enigma a se observar: consultas locais rápidas de tokens como elemento central de design é uma novidade para essa classe, e o cálculo de consumo de memória para execução local precisará do repositório real.
  • Contexto: isso coroa uma sequência intensa de três semanas da Qwen — pesos abertos do Max (12 de ago.), 27B (14 de ago.) e agora o explorador de arquitetura —, enquanto o mistério em torno do Ox Alpha mantém o foco no padrão de lançamentos discretos dos laboratórios chineses.

Fontes primárias

Perguntas frequentes (2026)

O que é?

Um MoE multimodal de pesos abertos que antecipa a arquitetura do Qwen4 — contagem regressiva no ModelScope aponta para 26 de ago., 23:00 de Pequim.

Especificações?

Segundo destaques do teaser: 125B principais + 51B embeddings N-gram, 6B ativos/token; arquitetura híbrida GDN + Qwen Sparse Attention.

Quando?

Lançado no prazo em 26 de ago. — pesos verificados e disponíveis no HF em 27 de ago. (131 fragmentos + FP8, sem restrições), relatório técnico publicado.

Por que isso importa?

Primeira prévia aberta da economia de inferência do Qwen4 (GDN+QSA) com 6B de parâmetros ativos — amigável para borda/local se as alegações se confirmarem.

O que não foi confirmado?

Benchmarks, licença, contexto, preços. Até o tamanho tem céticos (leitura de 35B-A3B) — trate todos os números como pré-lançamento.

vs. Max e 27B?

Max (2.4T) = carro-chefe; 27B = uso diário em notebook; Flash-Next = explorador da arquitetura Qwen4. Mesma geração, três funções distintas.

Guias relacionados