ChinaModelAPI

Noticias / Model Watch · Avance del lanzamiento

Lanzado ✓ Qwen3.8-Flash-Next 125B + 51B / A6B Avance de arquitectura Qwen4
2026-08-26 · Model Watch · lanzado el 26 de agosto según lo previsto (pesos activos en HF tras verificación el 27 de agosto)

Qwen3.8-Flash-Next: Alibaba adelanta la arquitectura Qwen4 — Pesos abiertos esta noche

Dos semanas después de abrir el Max de 2.4T y el 27B de clase portátil, el equipo de Qwen de Alibaba ya está preparando el siguiente acto: Qwen3.8-Flash-Next, un MoE multimodal de pesos abiertos cuyo objetivo es anticipar la arquitectura que impulsará a Qwen4 — con una cuenta atrás en ModelScope que apunta a esta noche, 23:00 de Pekín (26 de agosto).

Actualización (27 de agosto): lanzado según lo previsto — los pesos ya están disponibles en Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 fragmentos safetensors, sin restricciones, más una variante en FP8), y el informe técnico ya se ha publicado. La cuenta atrás cumplió; las especificaciones a continuación se mantienen según lo anticipado a menos que el informe las revise.

Respuesta directa

Qwen3.8-Flash-Next es un MoE multimodal de pesos abiertos que se lanza el 26 de agosto a las ~23:00 de Pekín según la cuenta atrás oficial de ModelScope125B de parámetros principales + 51B de parámetros de incrustación N-gram, 6B activos por token (según los aspectos destacados del propio teaser), desarrollado sobre una arquitectura híbrida GDN + Qwen Sparse Attention (QSA). El planteamiento de Qwen: lanzar la arquitectura de Qwen4 con antelación para que los desarrolladores puedan prepararse. Benchmarks, licencia y longitud de contexto: no publicados al momento del avance.

Qué está confirmado frente a qué no lo está

  • Confirmado (teaser + comunicado de Qwen): lanzamiento de pesos abiertos; MoE multimodal; los dos cambios principales de arquitectura — arquitectura híbrida GDN y Qwen Sparse Attention; lanzamiento estimado para el 2026-08-26 23:00 (UTC+08) en ModelScope; posicionamiento como un avance de la arquitectura de la familia Qwen4.
  • Según los aspectos destacados del teaser: 125B de parámetros del modelo principal, una tabla complementaria de incrustaciones N-gram de 51B para búsquedas locales rápidas de tokens y 6B de parámetros activos por token — «MoE multimodal rediseñado», con mejoras en atención, conexiones residuales, incrustaciones y optimización.
  • Aún no publicado: benchmarks, licencia, ventana de contexto, precios de alojamiento y nombres exactos de los repositorios. Un escéptico en los foros de NVIDIA interpreta el tamaño como 35B-A3B en su lugar; la cifra de 125B-A6B proviene de la propia página del teaser, pero trate todo como preliminar hasta que el repositorio esté disponible.
  • Dónde seguirlo esta noche: la organización de Qwen en Hugging Face y la página de cuenta atrás de ModelScope. Mañana haremos el seguimiento con las especificaciones verificadas.

Por qué es importante: explorador de arquitectura, no solo otro checkpoint

  • Primer contacto con Qwen4. GDN + QSA en un lanzamiento abierto significa que la comunidad puede evaluar los costes de servicio de Qwen4 (coste de atención, comportamiento con contexto largo) meses antes de que llegue la familia insignia.
  • 6B activos por token es la clave para la ejecución local. Si las afirmaciones sobre eficiencia se cumplen, el hardware de clase DGX-Spark (del que ya se habla intensamente en los foros de NVIDIA) y los Mac de gama alta se convertirán en opciones viables: la misma estrategia que convirtió al 27B en un éxito.
  • La inusual tabla de incrustaciones N-gram de 51B es el enigma a seguir: las búsquedas locales rápidas de tokens como elemento de diseño de primer nivel son una novedad en esta categoría, y el cálculo de la huella de memoria para la inferencia local requerirá el repositorio real.
  • Contexto: culmina una ofensiva de tres semanas de Qwen — pesos abiertos de Max (12 de agosto), 27B (14 de agosto) y ahora el explorador de arquitectura —, mientras que el misterio de Ox Alpha mantiene el interés sobre el patrón de lanzamientos sigilosos de los laboratorios chinos.

Fuentes primarias

Preguntas frecuentes (2026)

¿Qué es?

Un MoE multimodal de pesos abiertos que anticipa la arquitectura de Qwen4 — la cuenta atrás de ModelScope apunta al 26 de agosto a las 23:00 de Pekín.

¿Especificaciones?

Según los aspectos destacados del teaser: 125B principales + 51B de incrustaciones N-gram, 6B activos/token; arquitectura híbrida GDN + Qwen Sparse Attention.

¿Cuándo?

Lanzado según lo previsto el 26 de agosto — pesos verificados y disponibles en HF el 27 de agosto (131 fragmentos + FP8, sin restricciones), informe técnico publicado.

¿Por qué es importante?

Primer contacto abierto con los costes de servicio de Qwen4 (GDN+QSA) con 6B de parámetros activos: ideal para edge/local si se confirman las afirmaciones.

¿Qué falta por confirmar?

Benchmarks, licencia, contexto y precios. Incluso el tamaño tiene escépticos (lectura de 35B-A3B); considere todas las cifras como preliminares.

¿Frente a Max y 27B?

Max (2.4T) = buque insignia; 27B = modelo habitual para portátiles; Flash-Next = explorador de la arquitectura Qwen4. Misma generación, tres propósitos distintos.

Guías relacionadas