Notícias / Observatório de Modelos · Observatório de Modelo Misterioso
Ox Alpha Revelado: Zhipu Confirma que É o GLM-5.3-Flash — Lançamento Oficial e Pesos Abertos Hoje à Noite
Um modelo anônimo chega ao OpenRouter com 1M de contexto, entrada de imagem+vídeo e uma semana gratuita — supera o Claude Fable 5 em amostras iniciais, atrai o CEO da Stripe para os comentários, recebe uma insinuação não assumida do Google da qual a internet zomba impiedosamente, e absorve todas as investigações forenses que a comunidade consegue lançar sobre ele. A mídia chinesa o chama de 牛来. Ninguém assumiu a autoria. Tudo abaixo está atribuído, datado e não confirmado onde indicado.
Atualização (26 de ago, noite): mistério resolvido — a Zhipu confirmou à Bloomberg que o Ox Alpha é o GLM-5.3-Flash, com o lançamento oficial e pesos abertos chegando hoje à noite. Zixuan Li, da Zhipu: "O Ox Alpha era uma versão preliminar do GLM-5.3-Flash. O lançamento oficial oferece melhor desempenho e estabilidade significativamente superior." A comunidade forense já havia cantado a bola dias atrás; o roteiro do Pony Alpha se repetiu à risca. Detalhes na seção A revelação abaixo.
O Ox Alpha é o GLM-5.3-Flash — confirmado oficialmente pela Zhipu à Bloomberg em 26 de ago, com o lançamento oficial e pesos abertos chegando hoje à noite via Z.ai. A fase stealth (OpenRouter/OpenCode desde 20-21 de ago, 1M de contexto, texto+imagem+vídeo, semana gratuita) foi um teste de estresse público preliminar: "inteligência de fronteira, custo flash", avaliado pela comunidade em 80% contra 65% do Fable 5 em uma amostra de 10 tarefas do DeepSWE e, segundo a SemiAnalysis, sua capacidade de 100T tokens/dia roda em chips chineses. A Zhipu afirma que a versão oficial é mais potente e mais estável do que a versão stealth.
A semana em que aconteceu, verificada
| Quando | O que aconteceu · fonte |
|---|---|
| 20-21 de ago | O Ox Alpha surge no OpenRouter + OpenCode Zen — 1M de contexto, multimodal, gratuito por ~1 semana, capacidade de plataforma de "100T tokens/dia" (capacidade, não parâmetros). OpenRouter: "apenas roteamento; terceiro anônimo." (36氪/APPSO) |
| 21-22 de ago | O Vale do Silício entra em peso: o autor do DeepSWE mede 63% em sua suíte de agentes; amostra de 10 tarefas de Ben Davis: Ox 80% / Fable 5 65% / GPT-5.6 Sol 52%; Patrick Collison, CEO da Stripe, comenta "相当惊艳"; CEOs de OpenRouter/T3 Chat/Box repercutem. (36氪) |
| 22-23 de ago | A análise forense converge para o GLM: a contagem do tokenizer em relação ao GLM-5.3 difere por uma constante de 75 tokens em 25 prompts (o equivalente a um system prompt oculto); o consumo de tokens de vídeo corresponde exatamente ao GLM-5V-Turbo; erros na camada de serviço coincidem com o dialeto da Z.ai. (TechTimes 08-23; 36氪) |
| 23-24 de ago | A insinuação sem confirmação do Google: pesquisadores da DeepMind sugerem "Gemini" e "confie no processo" — amplamente ridicularizados (谷歌抢着认领被全网笑惨, 36氪). Tópico de veredito no HN: "Ox-Alpha Is GLM" (26 pts, ainda apenas atribuição da comunidade). |
| 24 de ago | A 36氪 relata que restam "menos de quatro dias" de gratuidade; o apelido chinês 牛来 se populariza. Ainda zero reivindicações oficiais. |
A revelação (26 de ago): confirmado pela Bloomberg, pesos hoje à noite
- A Zhipu confirmou à Bloomberg (26 de ago, quarta-feira): "o modelo Ox Alpha é uma nova iteração de sua série GLM" — especificamente o GLM-5.3-Flash — e afirmou que irá liberar os pesos hoje à noite, em resposta a consultas da Bloomberg News.
- Zixuan Li, da Zhipu (X, @zixuanli_): "O Ox Alpha era uma versão preliminar do GLM-5.3-Flash. O lançamento oficial oferece melhor desempenho e estabilidade significativamente superior. Um enorme agradecimento à @opencode e ao @OpenRouter por disponibilizá-lo para a comunidade."
- O detalhe surpreendente (SemiAnalysis): os alegados 100T tokens/dia da fase stealth foram processados em chips chineses — a semana gratuita foi, entre outras coisas, um teste de estresse de aceleradores domésticos em escala de fronteira.
- Primeiras reações: Andrew Curran — "a Fronteira de Pareto foi redesenhada" (anúncio + benchmarks já publicados); resumo da comunidade: "O GLM-5.3 Flash supera o GLM-5.2 em tudo"; slogan de posicionamento que circula: "inteligência de fronteira, custo flash."
- O roteiro repetido. O Pony Alpha de fevereiro (anônimo → reivindicado pela Zhipu como GLM-5 por volta do 6º dia) previu isso com exatidão: lançamento stealth → tráfego gratuito → benchmarks → revelação. A análise forense do tokenizer que o apontou como GLM dias antes da confirmação estava certa.
- Pesos disponibilizados (verificação em 27 de ago): zai-org/GLM-5.3-Flash (+ BF16) já está disponível no Hugging Face. Dados do model card oficial: 320B no total / 18B ativos, o primeiro modelo nativamente multimodal da série GLM-5, superando o GLM-5.2 em todos os benchmarks por um décimo do preço (≈ $0.14/$0.44 por 1M vs $1.40/$4.40 do 5.2) e aproximando-se do Claude Opus 4.8 em programação e suítes de agentes — com quantizações para llama.cpp / Ollama / LM Studio para execução local. Recepção no HN: 809 pontos no modelo, 407 na revelação.
A investigação forense pré-revelação — e como ela estava certa
- A impressão digital do tokenizer. Em 25 prompts controlados, a contagem de tokens do Ox Alpha fica exatamente 75 tokens acima da do GLM-5.3 — a assinatura de um system prompt oculto constante sobre o mesmo tokenizer (análise técnica da 36氪).
- Assinatura de tokens de vídeo. Quatro testes de vídeo controlados coincidiram linha por linha com a matemática de tokens de taxa de quadros/duração/resolução do GLM-5V-Turbo; modelos de outros provedores divergiram.
- Mais multimodal que o GLM-5.3 público. O 5.3 lançado é apenas de texto via API — portanto, se este é da Zhipu, trata-se de uma variante multimodal não lançada (jargão da comunidade: um cavalo de batalha da classe GLM-5.5). O comparativo lado a lado da APPSO constatou que a cadeia de raciocínio era "muito próxima à do GLM-5.3" — além de um teste de teoria dos números resolvido pelo Ox que o GLM-5.3-max não concluiu.
- O histórico anterior. Quatro de quatro lançamentos anônimos anteriores no OpenRouter eram de laboratórios chineses: Pony Alpha → GLM-5 (reivindicado pela Zhipu no 6º dia), Hunter/Healer Alpha → Xiaomi MiMo-V2, Elephant Alpha → Ant Ling-2.6-flash, Owl Alpha → Meituan LongCat-2.0.
- Os limites (pré-revelação). Até 25 de ago, nada disso era oficial — o Google insinuou sem assumir, a Zhipu permaneceu em silêncio. Em 26 de ago, a confirmação chegou e validou todas as pistas forenses acima.
Notas práticas para desenvolvedores de API
- De stealth a oficial, hoje à noite. A janela de gratuidade (~27-28 de ago) agora se converte no lançamento oficial do GLM-5.3-Flash com pesos abertos via Z.ai — a janela de benchmark sem custo termina exatamente com a chegada do produto real.
- Trate-o como um teste de estresse stealth. Sem SLA, sem aviso de descontinuação, sem atribuição — excelente para avaliações e curiosidades, mas o lugar errado para tráfego de produção ou dados confidenciais.
- Pesos + API chegando hoje à noite via Z.ai — acompanhe zai-org no Hugging Face e docs.z.ai; nossa cobertura do GLM-5.3 acompanha toda a família de modelos, e a edição de amanhã trará as especificações de lançamento verificadas.
Fontes primárias
- Confirmação da Bloomberg (via @kimmonismus/Techmeme) — Zhipu confirma na quarta-feira que o Ox Alpha é uma nova iteração da série GLM, pesos liberados hoje à noite
- Agregação Techmeme — Reações ao anúncio oficial do GLM-5.3-Flash (HN/r/singularity/r/LocalLLaMA + post da SemiAnalysis sobre chips chineses + agradecimento de Zixuan Li)
- 36氪 — 神秘「牛来」掀翻硅谷,谷歌抢着认领被全网笑惨(实测细节与取证汇总)
- 36氪/APPSO — O misterioso modelo "牛来" viraliza; testes práticos revelam se ele é realmente impressionante (análise forense de tokenizer/vídeo + teste de teoria dos números)
- TechTimes — Análise forense da camada de serviço (nomes de classe da Zhipu, dialeto de erros, 30/30 testes de tokenizer) (2026-08-23)
- OrcaRouter — Ox Alpha provavelmente é o GLM-5.3 (placar histórico de lançamentos de modelos anônimos)
- Trending Topics — Ox Alpha: Um Novo e Misterioso Modelo de IA Pretende Conquistar os Desenvolvedores
- Hacker News — Tópico de discussão "Ox-Alpha Is GLM" (atribuição da comunidade, não oficial)
Perguntas frequentes (2026)
O que é o Ox Alpha?
Um modelo stealth anônimo no OpenRouter/OpenCode desde 20-21 de ago: 1M de contexto, texto+imagem+vídeo, gratuito por ~1 semana. Nenhum laboratório assumiu a autoria. Apelido na mídia chinesa: 牛来.
Quão bom ele é?
Amostra pequena, mas impressionante: 80% contra 65% do Fable 5 em uma bateria de 10 tarefas do DeepSWE; 63% na suíte do autor do DeepSWE. CEO da Stripe: "相当惊艳" (segundo a 36氪).
Quem o desenvolveu?
Confirmado em 26 de ago: Zhipu — o Ox Alpha era uma versão preliminar do GLM-5.3-Flash (Bloomberg; Zixuan Li, da Zhipu, no X). O deslocamento de +75 no tokenizer e a análise forense da assinatura de vídeo anteciparam o resultado com dias de antecedência.
O Google assumiu a autoria?
Pesquisadores da DeepMind deram fortes indiretas ("Gemini", "confie no processo") e viraram motivo de piada — sem confirmação de ninguém.
Ainda é gratuito?
A janela de gratuidade stealth se encerra com o lançamento oficial do GLM-5.3-Flash hoje à noite, com pesos abertos via Z.ai — a prévia gratuita termina no momento em que o produto real é lançado.
Link para os pesos do GLM-5.3?
Resolvido e verificado: os pesos do GLM-5.3-Flash estão disponíveis no zai-org (verificação de 27 de ago) — 320B/18B ativos, primeiro modelo nativamente multimodal da série GLM-5, ~1/10 do preço do GLM-5.2. A previsão de ~28 de ago foi antecipada para o Flash.