Atualizações de modelos de IA chineses para desenvolvedores de API
Briefings atualizados sobre modelos de ponta chineses, pesos abertos, compatibilidade de hardware local e acesso compatível com OpenAI.
Codex recupera seu limite de 5 horas, Claude Code reduz 25% — O contraponto das APIs tarifadas
A OpenAI restaurou o limite de 5 horas do Codex em 25 de agosto após um mês repleto de resets (três resets completos: 8, 13 e 21 de agosto); a Anthropic reduz os limites do Claude Code a partir de 14 de setembro. A linha do tempo verificada, a mecânica das cotas e por que as APIs de modelos chineses com pagamento por token não têm janelas de uso.
Pesos abertos do GLM-5.3 chegam no prazo: o topo de linha focado em escalonamento pós-treinamento já pode ser baixado
zai-org/GLM-5.3 foi ao ar na noite de 28 de agosto — 141 shards safetensors + BF16, sem restrições (ungated), licença personalizada glm-5.3 — encerrando a janela de revisão de segurança de cerca de duas semanas prometida em 14 de agosto. Especificações, notas sobre a licença e o que ele complementa no catálogo de pesos abertos.
Qwen3.8-Flash-Next: Alibaba lança a arquitetura Qwen4 antes do previsto — Pesos abertos hoje à noite
Contagem regressiva no ModelScope: MoE multimodal de pesos abertos chega hoje às 23:00 de Pequim — 125B principais + 51B de embeddings N-gram com 6B ativos por token, a primeira amostra do GDN + Qwen Sparse Attention do Qwen4. Comparativo de detalhes confirmados vs. não confirmados, por que os 6B ativos importam para execução local e o que acompanhar quando o repositório for lançado.
Mac mini M6 vs M5 Pro para LLMs locais: 32GB ou 64GB?
O M6 da Apple traz aceleradores mais novos, mas o M5 Pro dobra o limite de memória e atinge 307GB/s de largura de banda. Um guia de compra sem exageros com especificações oficiais, rótulos de testes da Apple, compatibilidade com Qwen3.8-27B e a decisão de upgrade do M4.
Mac Studio M5 Max vs M5 Ultra para LLMs locais
O M5 Max de 128GB é a estação de trabalho mais sensata; o M5 Ultra de 256GB/512GB é para modelos específicos que não cabem em outro lugar. Cálculos de memória para DeepSeek V4, GLM-5, Qwen3.8 e Kimi K3, além dos limites da promessa de cluster da Apple.
Ox Alpha revelado: Zhipu confirma GLM-5.3-Flash — Lançamento oficial e pesos abertos hoje à noite
Mistério resolvido: a Zhipu confirmou à Bloomberg que o Ox Alpha é o GLM-5.3-Flash, com lançamento oficial e pesos abertos hoje à noite (26 de agosto). A fase furtiva de 100T tokens/dia rodou em chips chineses (SemiAnalysis); o roteiro do Pony Alpha repetido ao pé da letra. Saga completa, perícia e revelações na íntegra.
Apoiada pela OpenAI, Harvey Desenvolve Seu Primeiro Modelo com Base nos Pesos Abertos do Kimi K3
A líder em legal-tech Harvey (apoiada por OpenAI/Sequoia/a16z) anunciou o Harvey Tenet — uma base de pesos abertos do Kimi K3 pós-treinada com a Fireworks para tarefas jurídicas de longo horizonte. ~2× tarefas vs. K3 base no LAB da Harvey com custo de open source; prévia de pesquisa, sem pesos publicados. O sinal mais evidente até agora de adoção ocidental de pesos abertos chineses.
DeepSeek Elimina Preços de Pico no Fim de Semana: Sábados & Domingos Agora Fora de Pico o Dia Todo
A partir de 23 de agosto às 00:00 (horário de Pequim), os finais de semana serão cobrados integralmente a tarifas fora de pico — saída do v4-pro a ¥13,5/M o dia todo vs. ¥27 no pico em dias de semana. Menos de uma semana após a introdução do sistema pico/fora de pico. Tabela completa de tarifas de fim de semana, cálculos de agendamento e fontes.
HappyHorse 1.1 se torna global: API completa no Model Studio, edição de vídeo e ultrapassagem da Seedance
A Alibaba disponibilizou todas as capacidades do HappyHorse 1.1 via API no Model Studio — novo modo de edição de vídeo, áudio integrado sem custo adicional, 40% de desconto de lançamento por duas semanas, $0.0988/s (720p) no OpenRouter e 2º lugar global na arena de vídeo à frente de Seedance e Sora. Plataformas, tabela de preços e fontes no artigo.
API do GLM-5.3 entra em GA: $1.40/$4.40, adiamento de um dia e um ecossistema que não esperou
A Zhipu abriu o acesso geral à API na madrugada de 19 de agosto — com um dia de atraso, mesmo preço do GLM-5.2, AA Index 60 (co-líder open source). Linha do tempo verificada da semana de lançamento, tabela de preços vs. Qwen3.8/K3/V4-Flash, lista de plataformas (ZCode, PhanRouter, supercomputing internet) e o que muda antes da chegada dos pesos em 28 de agosto.
MiniMax Design: o modelo de vídeo H3 ganha um workbench de agentes
Três semanas após disponibilizar o H3 em código aberto, a MiniMax lançou a camada pensada para comercializá-lo: um workbench de agentes de criação em linguagem natural com palco de direção 3D e integração com o ComfyUI. Um produto, não uma API — os endpoints do modelo continuam sendo o caminho programático. Resumo compacto com fontes.
Pesos abertos do Qwen3.8 (2026): checkpoints Max de 2.4T + um 27B sob Apache-2.0 para seu notebook
O primeiro lançamento de pesos abertos de classe Max da Alibaba: Qwen3.8-2.4T-A95B (+FP8) no Hugging Face, além de um modelo denso de visão e linguagem de 27B sob Apache 2.0 que roda a partir de um arquivo de 17GB. Linha do tempo, letras miúdas da licença, preços de $2/$6 na API, a receita de execução local de Simon Willison e tabela de roteamento.
API do Kling 3.0 (2026): preços oficiais, Turbo & Omni e o spin-off de $3B
A família Kling 3.0 da Kuaishou na API internacional oficial: preços de tabela entre $0.084 e $0.42/s (4K nativo), Turbo com áudio incluso, Omni adicionando entrada de vídeo, formato de API baseada em tarefas com JWT. Resultados do 2º trimestre: receita acima de 850M RMB (+200% YoY), mais de 100M de usuários, captação de ~$3B em julho com valuation de ~$18B. Tabela de roteamento + cálculo de custo de 10 segundos vs. Seedance.
DeepSeek-V4-Flash-Vision-Exp (2026): lançamento oficial, preços e guia rápido da API
Lançado na noite de 21 de agosto (UTC+8): modelo experimental de visão multimodal com preços de V4-Flash ($0.22/1M na entrada, imagens limitadas a 384 tokens), paridade de texto com o V4-Flash, agente multimodal próximo ao Opus-4.8, nova Files API, suporte ao Harness v0.1.1-rc.1. Inclui guia rápido com curl/Python, comparativo de custos vs. visão do Claude/Gemini/Grok e qual modelo DeepSeek rotear.
DeepSeek Harness adiciona entrada de imagens multimodais: rc.7 + rc.8
Lançamento em duas etapas: rc.7 (17 de agosto) anexos persistentes de imagens em MCP/ACP; rc.8 (19 de agosto) requisições nativas de imagens para adaptadores DeepSeek e entrada de imagens para /goal e /plan. O harness agora suporta imagens — mas V4-Pro/V4-Flash continuam apenas em texto, e o rc.8 está na tag next do npm. O Turing Post chamou o harness de um "segundo momento DeepSeek".
Gemini 3.7 Flash: O modelo de alta eficiência do Google para programação e agentes
O Google anunciou o Gemini 3.7 Flash em 13 de agosto — contexto de 1M, DeepSWE 65.3%, preço introdutório de $0.75/$3.75 por 1M de tokens durante 2026. Uma nota de referência de fronteira ocidental; o Gemini não é roteado pela ChinaModelAPI.
DeepSeek Harness v0.1: DeepSeek Abre o Código do Seu Harness de Agentes
Harness de agentes sob licença MIT onde tudo é um plugin (dsh) anunciado na noite de 13 de agosto — a imprensa internacional o chama de rival aberto do Claude Code. Quatro modos de trabalho, importação de sessões do Claude Code, 288 plugins em 24h. Agnóstico em relação a modelos por design.
GLM-5.3 Lançado Oficialmente: Escalonamento de Pós-Treinamento, Cibersegurança Emergente e Pesos em 2 Semanas
O blog oficial da Z.ai anunciou o GLM-5.3 em 14 de agosto — mesma base do GLM-5.2, Terminal-Bench 3.0 4.6→28.3, CyberGym 84.5%, 2.436 vulnerabilidades reais encontradas. Atualizado em 19 de agosto: API com mesmo preço do 5.2 ($1.40/$4.40 por 1M), índice AA independente de 60, pesos previstos para ~28 de agosto; com cobertura do VentureBeat / The Decoder / Interconnects.
DeepSeek-V4-Pro-0813 oficial: GA 正式版 com agentes mais poderosos
A documentação oficial da API da DeepSeek atualizou o deepseek-v4-pro para DeepSeek-V4-Pro-0813 na noite de 13/08/2026. Mesmo ID de modelo, recursos aprimorados para agentes, pequeno ajuste de preços. O que desenvolvedores de API precisam fazer — quase nada.
Grok 4.6: O Novo Flagship Recomendado da xAI, Agora na API
A documentação oficial para desenvolvedores da xAI agora lista o grok-4.6 como o flagship mais recente — contexto de 500k, $2/$6 por 1M de tokens, recomendado para código. Uma nota de referência da fronteira ocidental; o Grok não é roteado pela ChinaModelAPI.
Radar de Modelos Chineses — Status semanal dos modelos
Panorama semanal dos flagships de modelos de IA chineses monitorados pela ChinaModelAPI em 09/08/2026, vs. referências do GPT-5.6 Sol / Claude Opus 5. Resumo automático de status para desenvolvedores de API.
Pesos abertos do MiniMax H3: modelo de vídeo com áudio e vídeo nativos
O H3 (e não M3) é o modelo de vídeo multimodal da MiniMax com áudio estéreo nativo. Pesos no HF + ComfyUI + API hospedada. Não é um nome oficial de "Kling aberto" — discussões sobre qualidade frequentemente o comparam ao Seedance.
Qwen3.8-Max: flagship de ~2.4T — Não é um novo gerador de vídeo
Flagship Qwen de agosto de 2026 para programação e trabalho de longo horizonte. Esclarece rumores: não é o Qwen2.5-VL / Qwen2-VL-72B como um lançamento T2V no nível do Seedance.
Monitoramento de descontos Seedance 2.0 Mini / Fast: sinais de ~4折 no Mini
Nota de mercado de agosto de 2026: Mini frequentemente anunciado a cerca de 4折, Fast a ~75折 em algumas plataformas. Não são preços da ChinaModelAPI — confirme em cada console. Mini para iteração, 2.5 para versões finais.
Capacidades do Seedance 2.5: 30s em tomada única, 50 referências, plataformas ativas
Lançamento oficial e distribuição em agosto de 2026: 30s em passagem única, ~50 referências multimodais, edição aprimorada. Onde os criadores estão usando e o que desenvolvedores de API devem fazer.
Status do Seedance 2.5 (Histórico): notas sobre o adiamento de julho
Resumo de status pré-lançamento do final de julho. Substituído pela postagem oficial de lançamento de 31/07/2026 — mantido apenas para contexto da linha do tempo.
DeepSeek-V4-Pro para Desenvolvedores de API: O Que Substituiu o V3.2
DeepSeek-V4-Pro e V4-Flash são a dupla flagship de 2026 (contexto de 1M, pesos abertos). Como migrar clientes compatíveis com a OpenAI a partir dos IDs de modelos da era V3.
Kimi K3 + GLM-5.2: A dupla de fronteira aberta de 2026
Como o Kimi K3 da Moonshot e o GLM-5.2 da Zhipu se complementam para programação de longo horizonte, contexto de 1M e implantação com pesos abertos — com notas de acesso compatíveis com a OpenAI.
data/model-watch/; publicar após verificação das fontes.