Noticias / Model Watch · Lanzamiento de pesos abiertos
Pesos abiertos de Qwen3.8 (2026): Alibaba lanza los checkpoints de 2.4T Max — y un 27B con Apache-2.0 que puedes ejecutar en casa
Cuando analizamos Qwen3.8-Max el 8 de agosto, la promesa de pesos abiertos era solo una nota al pie de "próximamente". Ahora ya está aquí: la organización de Qwen en Hugging Face incluye Qwen3.8-2.4T-A95B (más una variante FP8) —el primer modelo de clase Max con pesos abiertos de cualquier laboratorio— y Qwen3.8-27B, un modelo denso de 27B con Apache-2.0, capaz de procesar imágenes y video, que se ejecuta desde un archivo de 17GB. Este informe incluye el cronograma, la letra pequeña de la licencia, los precios de la API y una receta probada en el terreno para ejecutarlo localmente.
Los pesos de Qwen3.8 están disponibles desde el 12–17 de agosto de 2026: Qwen3.8-2.4T-A95B (+ FP8) es el primer checkpoint abierto de clase Max, y Qwen3.8-27B se distribuye bajo Apache 2.0 con comprensión nativa de imagen/video y 262K de contexto (extensible a 1M).
El 27B es el que realmente puedes autoalojar: Simon Willison lo ejecutó en una MacBook de 128GB a 15–30 tok/s y lo calificó como "con diferencia, el mejor SVG de un pelícano que he podido generar con un modelo que corre en una máquina local".
Precios de la API alojada de qwen3.8-max según la cobertura del lanzamiento: $2 / $6 / $0.25 por 1M de tokens (entrada / salida / en caché).
Del anuncio a los pesos abiertos: el cronograma de dos semanas
| Cuándo | Qué ocurrió · fuente |
|---|---|
| Principios de agosto (3 de agosto según CCTV) | Se anuncia Qwen3.8-Max y se ofrece mediante API — "el modelo más capaz hasta la fecha", prometiendo pesos abiertos. Nuestro informe del 8 de agosto cubrió el lanzamiento y la confusión de rumores con Qwen2.5-VL. |
| Semana del 12 de agosto | La publicación oficial del blog "Qwen3.8-Max: A New Bar for Coding and Cowork" marca el primer lanzamiento de clase Max con pesos abiertos; los checkpoints 2.4T-A95B y FP8 aparecen en la organización de Qwen en HF en los días siguientes (cronologías de la comunidad: eigent.ai, codersera). |
| 14–16 de agosto | Qwen3.8-27B llega bajo Apache 2.0. Simon Willison publica un análisis práctico (16 de agosto) que alcanza la portada de Hacker News con 798 puntos; Artificial Analysis sitúa el 27B en el puesto 52 de su Intelligence Index. |
| 17 de agosto (lun) | CNBC lo compara con Meta: "Alibaba responde al desafío de IA de Meta con un nuevo modelo listo para portátiles". Hugging Face declara a CNBC que los derivados basados en Qwen alcanzaron los 151,448 — 2.6× la presencia de Meta. |
Las fechas siguen las fuentes citadas en cada fila; donde las cronologías de la comunidad difieren por un día (12 frente a 14 de agosto para las horas exactas del checkpoint), lo indicamos explícitamente en lugar de simplificarlo.
Qué se lanzó, según las fichas oficiales del modelo
- Qwen3.8-2.4T-A95B (el lanzamiento de clase Max). 2.4 billones de parámetros totales, construido sobre la base de la arquitectura Qwen3.5. Las tablas de benchmarks oficiales lo sitúan junto a Opus 4.8, Claude Fable 5 y GPT-5.6 Sol: Terminal Bench 2.1 con 86.6 (máximo de GPT-5.6 Sol: 88.8), PaperBench con 93.0 (la puntuación más alta de la tabla), GPQA Diamond con 92.6, Agents' Last Exam con 53.6. Los artefactos están documentados como compatibles con vLLM, SGLang y TokenSpeed.
- Qwen3.8-27B (el que puedes ejecutar). 27B denso, visión-lenguaje nativo (imágenes y videos), con control flexible de razonamiento, contexto nativo de 262,144 tokens extensible a 1,000,000. Los materiales de lanzamiento de Alibaba afirman que "supera a Qwen3.7-Plus en general"; el consenso de la comunidad (según la guía de Qwen de codersera) lo considera el nuevo Qwen local por defecto frente a Qwen3.6-27B.
- La diferencia entre la versión alojada y los pesos es clave. Según la ficha oficial,
qwen3.8-max(la versión alojada) está construido sobre el checkpoint 2.4T y añade entrada de visión, modo sin razonamiento, 1M de contexto por defecto y herramientas integradas oficiales. Si autoalojas el checkpoint sin procesar, estarás sirviendo la base, no el conjunto completo de funciones de la versión alojada. - Variantes FP8 del checkpoint grande se publican a la par, para equipos de inferencia en centros de datos que buscan un menor consumo de memoria.
Lo que no se incluyó: lee la letra pequeña
- La licencia del 2.4T no es (según reportes) Apache. El 27B es Apache 2.0; las guías de la comunidad señalan que los repositorios del 2.4T se distribuyen bajo una licencia personalizada de Qwen. Hasta el 21 de agosto no pudimos extraer el texto completo de la licencia desde la página del repositorio; lee la ficha del modelo antes del autoalojamiento comercial, especialmente si lo sirves externamente.
- 27B alojado: sin fecha ni precio. La ficha oficial indica que un 27B alojado en Qwen Cloud llegará "próximamente" con 1M de contexto por defecto y herramientas integradas; nada más específico al momento de la publicación.
- "2.4T abierto" ≠ "2.4T en tu caja de GPU". Las guías de la comunidad sitúan el checkpoint FP8 alrededor de los 2.5TB, territorio de múltiples nodos. La apertura de los pesos es estratégicamente gigantesca y prácticamente relevante para plataformas de inferencia, no para tu estación de trabajo.
- Atribución de precios. Las cifras de $2 / $6 / $0.25 por millón provienen de la cobertura consistente del lanzamiento (latent.space, eigent.ai, codersera, kie.ai frente al catálogo de Qwen Cloud), no de una página de precios capturada directamente por nosotros. Verifica en Model Studio antes de fijar presupuestos.
Precios de la API de Qwen3.8 frente al panorama de modelos chinos (2026)
Con un precio reportado de $2.00 entrada / $6.00 salida por 1M de tokens (y $0.25 entrada en caché), qwen3.8-max se sitúa en el mismo rango de precios que sus pares de vanguardia: cómodamente por debajo de los modelos insignia occidentales y por encima del mínimo en horas valle de DeepSeek.
| Modelo (2026) | Entrada $/1M | Salida $/1M | Pesos abiertos |
|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | 2.4T-A95B + FP8 en HF (licencia personalizada según reportes) |
| GLM-5.3 (Z.ai) | $1.40 | $4.40 | prometido ~28 de agosto (nuestro informe) |
| deepseek-v4-flash (horas valle) | $0.22 | $0.66 | MIT (familia V4) |
| Kimi K3 | $3.00 | $15.00 | 2.8T, licencia modificada (nuestro informe) |
Las filas de comparación reutilizan precios ya verificados en nuestros informes anteriores (GLM-5.3, DeepSeek, Kimi K3); la fila de qwen3.8-max se basa en lo reportado durante la cobertura del lanzamiento; consulta la letra pequeña arriba.
Ejecútalo en casa: la receta probada en el terreno de Simon Willison
- La configuración. El GGUF
Q4_K_Mde 17GB en LM Studio, probado en una MacBook Pro de 128GB (M5 Max) y una NVIDIA DGX Spark: aproximadamente 15–30 tokens/s, y cerca de un 72% más rápido con la decodificación especulativa draft-mtp de llama.cpp. - Ajusta primero el contexto por defecto. 262,144 tokens nativos, pero los 8,192 por defecto de LM Studio "se agotaron solo con el razonamiento". Auméntalo antes de juzgar el modelo.
- Elimina el exceso de razonamiento. El esfuerzo de razonamiento por defecto es xhigh: su prompt para el SVG del pelícano tardó 21 minutos y consumió 22,276 tokens de razonamiento para emitir 3,223 tokens de salida. "Es un gran modelo, pero vaya que esa configuración por defecto es un mal punto de partida"; usa razonamiento bajo o sin razonamiento para tareas cotidianas.
- El veredicto. "Con diferencia, el mejor SVG de un pelícano que he podido generar con un modelo que corre en una máquina local"; y en visión: sus pruebas de bounding-box sobre fotos de pelícanos fueron "una coincidencia excelente". La contrapartida es la velocidad propia de un modelo denso: limitado por el ancho de banda de la memoria, por lo que no se sentirá como un MoE pequeño. Como él mismo dijo: "El hecho de que un archivo de 17GB pueda hacer todo esto en las máquinas de mi casa es un milagro".
¿Hacia qué Qwen3.8 deberías dirigir tus solicitudes?
| Su carga de trabajo | Enrutar a | Motivo |
|---|---|---|
| Desarrollo local, sensible a la privacidad, offline | Qwen3.8-27B autoalojado | Apache 2.0, Q4 de 17GB, entrada de visión+video; reducir el razonamiento desde xhigh |
| Tareas más complejas de código/agentes, alojado | qwen3.8-max API | Conjunto completo de funciones alojadas (entrada de visión, sin razonamiento, 1M por defecto, herramientas integradas) a $2/$6 |
| Bucle de texto/agente sólido más económico | deepseek-v4-flash | $0.22/$0.66 en horas valle — consulta nuestro informe de la familia Flash; presta atención a las nuevas franjas pico/valle |
| Pesos abiertos de clase Max, inferencia propia | 2.4T-A95B / FP8 | Para plataformas de inferencia con capacidad multinodo; compatibilidad documentada con vLLM/SGLang/TokenSpeed |
Cómo se recibió la noticia: en el extranjero y a nivel local
- Hacker News lo convirtió en un hito. La reseña de Willison cuenta con 798 puntos; la ficha en Artificial Analysis (52 en el Intelligence Index) suma un hilo de 380 puntos. Los temas recurrentes: capacidad local líder en su categoría y la peculiaridad del valor por defecto en xhigh.
- El enfoque occidental se centra en Meta. El ángulo de CNBC es la competencia con los nuevos modelos para portátiles Muse Glimmer de Meta; la estadística de Hugging Face de 151,448 derivados basados en Qwen (2.6× la presencia de Meta) respalda el argumento. WIRED y Axios, al cubrir la misma ola de pesos abiertos este mes mediante GLM-5.3, ahora consideran a los modelos abiertos chinos como la frontera predeterminada de la IA abierta.
- La cobertura china lo sitúa en un triplete en una sola semana. El resumen del 16 de agosto de 北京商报 —"一周三更"— alinea la bajada de precios de DeepSeek, la apertura de pesos de Alibaba y la jugada de post-entrenamiento de Zhipu en una sola semana, con datos de OpenRouter que muestran que 6 de los 10 modelos principales a nivel global por uso esa semana fueron chinos.
Accede a Qwen y a todo el catálogo chino mediante un único endpoint compatible con OpenAI
ChinaModelAPI es un intermediario independiente que pone a disposición de desarrolladores de todo el mundo modelos chinos de vanguardia —Qwen, DeepSeek, GLM, Kimi— mediante una única API compatible con OpenAI, con pagos en USDT/USD1 y sin suscripciones. Lanzamientos como este son exactamente para lo que se diseñó la plataforma: disponibilidad de modelos desde el primer día, precios transparentes por token y una sola integración para todo el catálogo.
ChinaModelAPI es un intermediario independiente sin relación oficial con Alibaba ni con el equipo de Qwen. Los ID de modelos enrutados se verifican en vivo antes del lanzamiento; únete a la lista de espera para recibir una notificación cuando el enrutamiento de Qwen3.8 esté disponible.
Fuentes primarias
- Blog oficial de Qwen — "Qwen3.8-Max: A New Bar for Coding and Cowork" (primer lanzamiento de clase Max con pesos abiertos)
- Hugging Face — Ficha de modelo Qwen/Qwen3.8-2.4T-A95B (benchmarks, compatibilidad con vLLM/SGLang, desglose de funciones de la versión alojada de Max)
- Hugging Face — Ficha de modelo Qwen/Qwen3.8-27B (VLM denso, contexto 262K→1M, versión alojada "próximamente")
- Hugging Face — Organización Qwen (460 modelos; variante FP8 incluida)
- Simon Willison — "Qwen 3.8 27B is excellent, but it defaults to overthinking things" (16 de agosto de 2026)
- CNBC — "Alibaba answers Meta's AI challenge with new laptop-ready model" (17 de agosto de 2026; estadística de 151,448 derivados en HF)
- Artificial Analysis — Ficha de Qwen3.8-27B, Intelligence Index 52
- Hacker News — Hilo sobre la reseña de Willison (798 puntos)
- eigent.ai — Resumen de pesos abiertos de Qwen3.8-Max (precios $2/$6/$0.25 según latent.space)
- codersera — Guía de generación Qwen (27B Apache 2.0, reemplaza a Qwen3.6-27B; advertencia sobre la licencia de 2.4T)
- kie.ai — Análisis del lanzamiento del 27B (afirmación de Alibaba de que "supera a Qwen3.7-Plus", especificaciones de la ficha de HF)
- 北京商报/东方财富 — "大模型一周三更" (16 de agosto; estadística top-10 de OpenRouter)
Preguntas frecuentes (2026)
¿Están realmente abiertos los pesos?
Sí: 2.4T-A95B (+FP8) y el 27B están en la organización de Qwen en HF. El 27B es Apache 2.0; se informa que el 2.4T cuenta con sus propios términos de licencia de Qwen, así que revisa la ficha antes de realizar autoalojamiento comercial.
¿Puedo ejecutar el 2.4T yo mismo?
No en hardware de estación de trabajo: el checkpoint FP8 ronda los 2.5TB según las guías de la comunidad. Está destinado a plataformas de inferencia; los demás usan la API alojada o el 27B.
¿Qué hardware se necesita para el 27B?
GGUF Q4_K_M de 17GB; Willison utilizó una MacBook Pro de 128GB (M5 Max) y una DGX Spark a 15–30 tok/s, +72% con draft-mtp. Aumenta el contexto por defecto: los 8,192 se consumen únicamente con el razonamiento.
¿Entrada de imágenes y video?
Sí: la ficha oficial del 27B describe comprensión nativa de visión y lenguaje para imágenes y videos, además de control flexible de razonamiento. Algo poco común en esta categoría de tamaño.
¿Cuánto cuesta la API?
La cobertura del lanzamiento reporta de manera consistente $2 / $6 / $0.25 por 1M (entrada / salida / en caché) para qwen3.8-max en Qwen Cloud. Verifica la página activa de Model Studio antes de presupuestar.
¿Cuándo estará disponible el 27B alojado?
"Próximamente" según la ficha oficial: contexto predeterminado de 1M más herramientas integradas. Sin fecha ni precio hasta el 21 de agosto de 2026.
¿A qué se deben las quejas por el exceso de razonamiento?
El razonamiento en xhigh viene por defecto: 22,276 tokens de razonamiento y 21 minutos para un solo SVG. La solución de Willison: comenzar con razonamiento bajo o sin razonamiento y aumentarlo solo cuando sea necesario.
¿Frente a Kimi K3 / GLM-5.3?
K3 liberó pesos de 2.8T (licencia modificada) el 27 de julio; Qwen3.8 es el primero con un checkpoint de clase Max junto a una versión densa bajo Apache; los pesos de GLM-5.3 están previstos para ~28 de agosto. Los tres son seguidos en nuestro Model Watch.