Noticias / Model Watch · Avance del lanzamiento
Qwen3.8-Flash-Next: Alibaba adelanta la arquitectura Qwen4 — Pesos abiertos esta noche
Dos semanas después de abrir el Max de 2.4T y el 27B de clase portátil, el equipo de Qwen de Alibaba ya está preparando el siguiente acto: Qwen3.8-Flash-Next, un MoE multimodal de pesos abiertos cuyo objetivo es anticipar la arquitectura que impulsará a Qwen4 — con una cuenta atrás en ModelScope que apunta a esta noche, 23:00 de Pekín (26 de agosto).
Actualización (27 de agosto): lanzado según lo previsto — los pesos ya están disponibles en Hugging Face (Qwen/Qwen3.8-Flash-Next, 131 fragmentos safetensors, sin restricciones, más una variante en FP8), y el informe técnico ya se ha publicado. La cuenta atrás cumplió; las especificaciones a continuación se mantienen según lo anticipado a menos que el informe las revise.
Qwen3.8-Flash-Next es un MoE multimodal de pesos abiertos que se lanza el 26 de agosto a las ~23:00 de Pekín según la cuenta atrás oficial de ModelScope — 125B de parámetros principales + 51B de parámetros de incrustación N-gram, 6B activos por token (según los aspectos destacados del propio teaser), desarrollado sobre una arquitectura híbrida GDN + Qwen Sparse Attention (QSA). El planteamiento de Qwen: lanzar la arquitectura de Qwen4 con antelación para que los desarrolladores puedan prepararse. Benchmarks, licencia y longitud de contexto: no publicados al momento del avance.
Qué está confirmado frente a qué no lo está
- Confirmado (teaser + comunicado de Qwen): lanzamiento de pesos abiertos; MoE multimodal; los dos cambios principales de arquitectura — arquitectura híbrida GDN y Qwen Sparse Attention; lanzamiento estimado para el 2026-08-26 23:00 (UTC+08) en ModelScope; posicionamiento como un avance de la arquitectura de la familia Qwen4.
- Según los aspectos destacados del teaser: 125B de parámetros del modelo principal, una tabla complementaria de incrustaciones N-gram de 51B para búsquedas locales rápidas de tokens y 6B de parámetros activos por token — «MoE multimodal rediseñado», con mejoras en atención, conexiones residuales, incrustaciones y optimización.
- Aún no publicado: benchmarks, licencia, ventana de contexto, precios de alojamiento y nombres exactos de los repositorios. Un escéptico en los foros de NVIDIA interpreta el tamaño como 35B-A3B en su lugar; la cifra de 125B-A6B proviene de la propia página del teaser, pero trate todo como preliminar hasta que el repositorio esté disponible.
- Dónde seguirlo esta noche: la organización de Qwen en Hugging Face y la página de cuenta atrás de ModelScope. Mañana haremos el seguimiento con las especificaciones verificadas.
Por qué es importante: explorador de arquitectura, no solo otro checkpoint
- Primer contacto con Qwen4. GDN + QSA en un lanzamiento abierto significa que la comunidad puede evaluar los costes de servicio de Qwen4 (coste de atención, comportamiento con contexto largo) meses antes de que llegue la familia insignia.
- 6B activos por token es la clave para la ejecución local. Si las afirmaciones sobre eficiencia se cumplen, el hardware de clase DGX-Spark (del que ya se habla intensamente en los foros de NVIDIA) y los Mac de gama alta se convertirán en opciones viables: la misma estrategia que convirtió al 27B en un éxito.
- La inusual tabla de incrustaciones N-gram de 51B es el enigma a seguir: las búsquedas locales rápidas de tokens como elemento de diseño de primer nivel son una novedad en esta categoría, y el cálculo de la huella de memoria para la inferencia local requerirá el repositorio real.
- Contexto: culmina una ofensiva de tres semanas de Qwen — pesos abiertos de Max (12 de agosto), 27B (14 de agosto) y ahora el explorador de arquitectura —, mientras que el misterio de Ox Alpha mantiene el interés sobre el patrón de lanzamientos sigilosos de los laboratorios chinos.
Fuentes primarias
- Página oficial de cuenta atrás de ModelScope — Qwen3.8-Flash-Next «Upcoming Open-Release», previsto para el 2026-08-26 23:00 (UTC+08)
- AGTP en X — Análisis del teaser de Qwen4 por el equipo de Qwen (125B+51B/A6B, GDN+QSA, «publicación anticipada de la arquitectura para que los desarrolladores se preparen»)
- OrcaRouter — Panel de información de Qwen3.8-Flash-Next (columnas de confirmados/rumores + captura de pantalla de la cuenta atrás)
- NVIDIA Developer Forums — Hilo de discusión sobre DGX Spark (con citas textuales de highlights y dudas sobre los 125B)
- Hacker News — Qwen 3.8-Flash-Next se lanza mañana (hilo con 308 puntos)
Preguntas frecuentes (2026)
¿Qué es?
Un MoE multimodal de pesos abiertos que anticipa la arquitectura de Qwen4 — la cuenta atrás de ModelScope apunta al 26 de agosto a las 23:00 de Pekín.
¿Especificaciones?
Según los aspectos destacados del teaser: 125B principales + 51B de incrustaciones N-gram, 6B activos/token; arquitectura híbrida GDN + Qwen Sparse Attention.
¿Cuándo?
Lanzado según lo previsto el 26 de agosto — pesos verificados y disponibles en HF el 27 de agosto (131 fragmentos + FP8, sin restricciones), informe técnico publicado.
¿Por qué es importante?
Primer contacto abierto con los costes de servicio de Qwen4 (GDN+QSA) con 6B de parámetros activos: ideal para edge/local si se confirman las afirmaciones.
¿Qué falta por confirmar?
Benchmarks, licencia, contexto y precios. Incluso el tamaño tiene escépticos (lectura de 35B-A3B); considere todas las cifras como preliminares.
¿Frente a Max y 27B?
Max (2.4T) = buque insignia; 27B = modelo habitual para portátiles; Flash-Next = explorador de la arquitectura Qwen4. Misma generación, tres propósitos distintos.