Actualizaciones de modelos de IA chinos para desarrolladores de API
Informes fechados sobre actualizaciones de modelos de IA chinos, pesos abiertos, compatibilidad de hardware local y acceso compatible con OpenAI.
Codex recupera su límite de 5 horas y Claude Code reduce un 25%: el contrapunto de las API de pago por uso
OpenAI restableció el límite de 5 horas de Codex el 25 de agosto tras un mes lleno de reinicios (tres reinicios completos: 8, 13 y 21 de agosto); Anthropic recortará los límites de Claude Code a partir del 14 de septiembre. Cronología verificada, mecánica de cuotas y por qué las API de modelos chinos de pago por token no tienen ventanas de tiempo.
Los pesos abiertos de GLM-5.3 llegan según lo previsto: el buque insignia escalado con post-entrenamiento ya está disponible para descargar
zai-org/GLM-5.3 se publicó la noche del 28 de agosto: 141 fragmentos safetensors + BF16, sin restricciones de acceso, licencia personalizada glm-5.3, cerrando así la ventana de revisión de seguridad de unas dos semanas prometida el 14 de agosto. Especificaciones, detalles de la licencia y qué aporta al catálogo de pesos abiertos.
Qwen3.8-Flash-Next: Alibaba adelanta la arquitectura Qwen4 — Pesos abiertos esta noche
Cuenta atrás en ModelScope: el MoE multimodal de pesos abiertos llega esta noche a las 23:00 (hora de Pekín) — 125B principales + 51B de embeddings N-gram con 6B activos por token, un primer vistazo a GDN y Qwen Sparse Attention de Qwen4. Desglose de datos confirmados frente a no confirmados, por qué los 6B activos importan para la ejecución local y qué tener en cuenta cuando se publique el repositorio.
Mac mini M6 frente a M5 Pro para LLM locales: ¿32GB o 64GB?
El M6 de Apple cuenta con una arquitectura de aceleración más reciente, pero el M5 Pro duplica el límite de memoria y alcanza un ancho de banda de 307GB/s. Una guía de compra directa y sin rodeos con especificaciones oficiales, pruebas de Apple, compatibilidad con Qwen3.8-27B y la decisión de actualizar desde el M4.
Mac Studio M5 Max frente a M5 Ultra para LLM locales
El M5 Max de 128GB es la estación de trabajo sensata; el M5 Ultra de 256GB/512GB es para modelos destacados que no caben en ningún otro lugar. Cálculos de memoria para DeepSeek V4, GLM-5, Qwen3.8 y Kimi K3, además de los límites reales de la propuesta de clúster de Apple.
Ox Alpha al descubierto: Zhipu confirma GLM-5.3-Flash — Lanzamiento oficial y pesos abiertos esta noche
Misterio resuelto: Zhipu confirmó a Bloomberg que Ox Alpha es GLM-5.3-Flash, con lanzamiento oficial y pesos abiertos esta noche (26 de agosto). La fase de prueba encubierta de 100T tokens/día funcionó con chips chinos (SemiAnalysis); el guión de Pony Alpha se repitió al pie de la letra. Toda la historia, análisis forense y revelaciones en el interior.
Harvey, respaldada por OpenAI, desarrolla su primer modelo sobre los pesos abiertos de Kimi K3
El líder en tecnología jurídica Harvey (respaldado por OpenAI/Sequoia/a16z) anunció Harvey Tenet: una base de pesos abiertos Kimi K3 postentrenada con Fireworks para tareas legales de largo alcance. ~2× en tareas frente a K3 base en el LAB de Harvey a coste open-source; vista previa de investigación sin pesos publicados. La señal más clara de adopción occidental de pesos abiertos chinos hasta la fecha.
DeepSeek elimina la tarifa punta de los fines de semana: los sábados y domingos ahora son valle todo el día
A partir del 23 de agosto a las 00:00 (hora de Pekín), los fines de semana se facturan íntegramente a tarifas de horas valle: salida de v4-pro a ¥13.5/M todo el día frente a los ¥27 en horas punta entre semana. Menos de una semana después de la llegada del sistema punta/valle. Tabla completa de tarifas de fin de semana, cálculos de planificación y fuentes.
HappyHorse 1.1 se expande a nivel global: API completa en Model Studio, edición de video y ascenso superando a Seedance
Alibaba habilitó todas las capacidades de HappyHorse 1.1 a través de API en Model Studio: nuevo modo de edición de vídeo, audio integrado sin coste adicional, 40% de descuento de lanzamiento durante dos semanas, $0.0988/s (720p) en OpenRouter y el puesto n.º 2 global en la arena de vídeo por delante de Seedance y Sora. Plataformas, tabla de precios y fuentes en el interior.
La API de GLM-5.3 llega a GA: $1.40/$4.40, un día de retraso y un ecosistema que no esperó
Zhipu abrió el acceso general a la API en la madrugada del 19 de agosto, con un día de retraso, al mismo precio que GLM-5.2 e índice AA de 60 (co-n.º 1 en código abierto). Cronología verificada de la semana de lanzamiento, tabla de precios frente a Qwen3.8/K3/V4-Flash, plataformas disponibles (ZCode, PhanRouter, internet de supercomputación) y qué cambiará antes de la llegada de los pesos el 28 de agosto.
MiniMax Design: el modelo de vídeo H3 estrena un entorno de trabajo con agentes
Tres semanas después de liberar el código de H3, MiniMax lanzó la capa con la que busca comercializarlo: un entorno de trabajo con agentes de creación en lenguaje natural, escenario de dirección 3D e integración con ComfyUI. Un producto, no una API: los endpoints del modelo siguen siendo la vía programática. Informe conciso con fuentes.
Pesos abiertos de Qwen3.8 (2026): checkpoints Max de 2.4T y un modelo 27B con Apache-2.0 para tu portátil
El primer lanzamiento de clase Max en pesos abiertos de Alibaba: Qwen3.8-2.4T-A95B (+FP8) en Hugging Face, más un modelo denso de visión y lenguaje de 27B con licencia Apache 2.0 que se ejecuta desde un archivo de 17GB. Cronología, letra pequeña de la licencia, precios de la API a $2/$6, la receta de ejecución local de Simon Willison y tabla de enrutamiento.
API de Kling 3.0 (2026): precios oficiales, Turbo & Omni y la escisión de $3B
La familia Kling 3.0 de Kuaishou en la API internacional oficial: precios de lista de $0.084–$0.42/s (4K nativo), Turbo con audio integrado, Omni con entrada de vídeo, estructura de API basada en tareas con JWT. Resultados del 2T: más de 850M RMB de ingresos (+200% interanual), más de 100M de usuarios y ronda de ~$3B en julio con una valoración de ~$18B. Tabla de enrutamiento y cálculo de costes para 10 segundos frente a Seedance.
DeepSeek-V4-Flash-Vision-Exp (2026): lanzamiento oficial, precios y guía de inicio rápido de la API
Lanzado la noche del 21 de agosto (UTC+8): modelo de visión multimodal experimental con precios de V4-Flash ($0.22/1M de entrada, imágenes con un límite de 384 tokens), paridad de texto con V4-Flash, agente multimodal cercano a Opus-4.8, nueva Files API y compatibilidad con Harness v0.1.1-rc.1. Incluye inicio rápido con curl/Python, cálculo de costes frente a la visión de Claude/Gemini/Grok y qué modelo de DeepSeek enrutar.
DeepSeek Harness añade entrada de imágenes multimodales: rc.7 + rc.8
Despliegue en dos fases: rc.7 (17 de agosto) archivos adjuntos de imagen persistentes en MCP/ACP; rc.8 (19 de agosto) solicitudes de imagen nativas para adaptadores de DeepSeek además de entrada de imágenes para /goal y /plan. El harness ahora admite imágenes, aunque V4-Pro/V4-Flash siguen siendo solo de texto, y rc.8 está disponible bajo la etiqueta next de npm. Turing Post califica este harness como un «segundo momento DeepSeek».
Gemini 3.7 Flash: el modelo caballo de batalla de Google para programación y agentes
Google anunció Gemini 3.7 Flash el 13 de agosto: 1M de contexto, 65.3% en DeepSWE, precio promocional de $0.75/$3.75 por 1M de tokens durante 2026. Una referencia de vanguardia occidental; Gemini no se enruta a través de ChinaModelAPI.
DeepSeek Harness v0.1: DeepSeek publica como código abierto su harness de agentes
Entorno de agentes con licencia MIT donde todo es un plugin (dsh), anunciado la noche del 13 de agosto; la prensa internacional lo califica como un rival abierto de Claude Code. Cuatro modos de trabajo, importación de sesiones desde Claude Code y 288 plugins en 24 h. Agnóstico al modelo por diseño.
GLM-5.3 lanzado oficialmente: escalado de post-entrenamiento, capacidades cibernéticas emergentes y pesos en 2 semanas
El blog oficial de Z.ai anunció GLM-5.3 el 14 de agosto: misma base que GLM-5.2, Terminal-Bench 3.0 pasa de 4.6 a 28.3, CyberGym 84.5%, 2436 vulnerabilidades reales encontradas. Actualizado el 19 de agosto: API al mismo precio que 5.2 ($1.40/$4.40 por 1M), índice AA independiente de 60, pesos previstos para ~28 de agosto; incluye cobertura de VentureBeat, The Decoder e Interconnects.
DeepSeek-V4-Pro-0813 oficial: disponibilidad general (正式版 / GA) con agentes más potentes
La documentación oficial de la API de DeepSeek actualizó deepseek-v4-pro a DeepSeek-V4-Pro-0813 el 13 de agosto de 2026 (por la noche). Mismo ID de modelo, mayor capacidad para agentes y un ajuste menor de precios. Qué deben hacer los desarrolladores de API: prácticamente nada.
Grok 4.6: el nuevo buque insignia recomendado de xAI, ya en la API
La documentación oficial para desarrolladores de xAI incluye ahora grok-4.6 como su modelo insignia más reciente: 500k de contexto, $2/$6 por 1M de tokens, recomendado para código. Una referencia de vanguardia occidental; Grok no se enruta a través de ChinaModelAPI.
Seguimiento de modelos chinos — Estado semanal de modelos
Resumen semanal de los modelos chinos insignia de IA monitorizados por ChinaModelAPI a fecha de 2026-08-09, frente a las referencias GPT-5.6 Sol y Claude Opus 5. Informe de estado automático para desarrolladores de API.
Pesos abiertos de MiniMax H3: modelo de vídeo con A/V nativo
H3 (no M3) es el modelo de vídeo multimodal de MiniMax con audio estéreo nativo. Pesos en HF + ComfyUI + API alojada. No es un nombre oficial de «Kling abierto»; las comparaciones de calidad suelen hacerse frente a Seedance.
Qwen3.8-Max: buque insignia de ~2.4T — No es un nuevo generador de vídeo
Modelo insignia de Qwen de agosto de 2026 para programación y tareas de largo alcance. Aclara los rumores: no se trata de una versión T2V al estilo de Seedance tipo Qwen2.5-VL o Qwen2-VL-72B.
Seguimiento de descuentos de Seedance 2.0 Mini / Fast: indicios de Mini a ~4折
Nota de mercado de agosto de 2026: Mini suele anunciarse con descuentos de en torno al 4折 y Fast al ~75折 en algunas plataformas. No son precios de ChinaModelAPI; verificar en cada consola. Mini para iteración, 2.5 para versiones finales.
Capacidades de Seedance 2.5: toma única de 30 s, 50 referencias, plataformas disponibles
Lanzamiento oficial y despliegue de agosto de 2026: 30 s en una sola pasada, ~50 referencias multimodales y edición mejorada. Dónde lo usan los creadores y qué deben hacer los desarrolladores de API.
Estado de Seedance 2.5 (Histórico): notas sobre el retraso de julio
Informe de estado previo al lanzamiento de finales de julio. Sustituido por la publicación oficial de lanzamiento del 2026-07-31; se conserva únicamente por contexto cronológico.
DeepSeek-V4-Pro para desarrolladores de API: qué reemplazó a V3.2
DeepSeek-V4-Pro y V4-Flash son el dúo insignia de 2026 (1M de contexto, pesos abiertos). Cómo migrar clientes compatibles con OpenAI desde los identificadores de modelo de la era V3.
Kimi K3 + GLM-5.2: la combinación de vanguardia abierta de 2026
Cómo se complementan Kimi K3 de Moonshot y GLM-5.2 de Zhipu para programación de largo alcance, contexto de 1M y despliegue de pesos abiertos, con notas de acceso compatible con OpenAI.
data/model-watch/; publicar tras verificar las fuentes.