뉴스 / 모델 워치 · 미스터리 모델 워치
Ox Alpha 정체 공개: Zhipu, GLM-5.3-Flash 확인 — 오늘 밤 공식 출시 및 오픈 가중치 공개
익명의 모델이 1M 컨텍스트, 이미지+비디오 입력, 1주일 무료 제공과 함께 OpenRouter에 등장했습니다 — 이후 초기 샘플 테스트에서 Claude Fable 5를 능가하고, Stripe CEO의 댓글 반응을 이끌어냈으며, Google의 은근한 암시로 인해 인터넷에서 큰 조롱을 샀고, 커뮤니티의 모든 포렌식 조사를 받아냈습니다. 중국 언론은 이를 牛来라고 부릅니다. 아직 소유권을 밝힌 곳은 없습니다. 아래의 모든 내용은 출처와 날짜가 명시되어 있으며, 미확인된 사항은 별도로 표기되었습니다.
업데이트 (8월 26일 저녁): 미스터리 해결 — Zhipu가 블룸버그를 통해 Ox Alpha가 GLM-5.3-Flash임을 공식 확인했으며, 오늘 밤 공식 출시와 함께 오픈 가중치가 공개될 예정입니다. Zhipu의 Zixuan Li: "Ox Alpha는 GLM-5.3-Flash의 초기 버전이었습니다. 공식 출시 버전은 더 강력한 성능과 대폭 향상된 안정성을 제공합니다." 포렌식 커뮤니티는 며칠 전에 이미 이를 밝혔으며, 이전 Pony Alpha의 흐름이 그대로 재연되었습니다. 자세한 내용은 아래 The reveal 섹션을 확인하세요.
Ox Alpha는 GLM-5.3-Flash입니다 — 8월 26일 Zhipu가 블룸버그에 공식 확인했으며, 오늘 밤 Z.ai를 통해 공식 출시 및 오픈 가중치가 공개됩니다. 스텔스 운영(8월 20~21일부터 OpenRouter/OpenCode에서 진행, 1M 컨텍스트, 텍스트+이미지+비디오, 1주일 무료)은 "플래시급 비용으로 누리는 프론티어 지능"을 테스트하기 위한 초기 공개 스트레스 테스트였습니다. 10개 태스크 DeepSWE 샘플에서 커뮤니티 측정 기준 80% 대 Fable 5의 65%를 기록했으며, SemiAnalysis에 따르면 일일 100T 토큰 처리 용량이 중국산 칩에서 구동됩니다. Zhipu는 공식 출시 버전이 스텔스 빌드보다 더 강력하고 안정적이라고 밝혔습니다.
사건이 전개된 일주일, 팩트 체크
| 공개 시점 | 주요 경과 · 출처 |
|---|---|
| 8월 20-21일 | Ox Alpha가 OpenRouter + OpenCode Zen에 등장 — 1M 컨텍스트, 멀티모달, 약 1주일 무료, 플랫폼 용량 "일일 100T 토큰"(파라미터가 아닌 처리 용량). OpenRouter: "라우팅만 지원하며, 익명의 제3자 모델임." (36氪/APPSO) |
| 8월 21-22일 | 실리콘밸리의 뜨거운 관심: DeepSWE 개발자가 자체 에이전트 스위트에서 63% 기록; Ben Davis의 10개 태스크 샘플: Ox 80% / Fable 5 65% / GPT-5.6 Sol 52%; Stripe CEO Patrick Collison "相当惊艳"; OpenRouter/T3 Chat/Box CEO들의 확산 가세. (36氪) |
| 8월 22-23일 | 포렌식 분석이 GLM으로 수렴: 25개 프롬프트 전반에서 GLM-5.3 대비 토크나이저 카운트가 일관되게 75토큰 차이(숨은 시스템 프롬프트 1개 분량); 비디오 토큰 소비량이 GLM-5V-Turbo와 정확히 일치; 서빙 레이어 에러가 Z.ai의 고유 양식과 일치. (TechTimes 08-23; 36氪) |
| 8월 23-24일 | Google의 애매한 암시: DeepMind 연구원들이 "Gemini" 및 "과정을 믿어라(trust the process)"라는 힌트를 던졌으나 네티즌들의 거센 조롱을 받음 (谷歌抢着认领被全网笑惨, 36氪). HN 최종 판단 스레드: "Ox-Alpha Is GLM" (26점, 여전히 커뮤니티 추정에 불과). |
| 8월 24일 | 36氪는 무료 이용 기간이 "4일 미만" 남았다고 보도; 중국어 닉네임 牛来가 널리 확산. 여전히 공식적인 발표는 없음. |
정체 공개 (8월 26일): 블룸버그 확인, 오늘 밤 가중치 공개
- Zhipu, 블룸버그에 확인 (8월 26일 수요일): 블룸버그 뉴스의 질의에 대해 "Ox Alpha 모델은 자사 GLM 시리즈의 새로운 버전" — 구체적으로는 GLM-5.3-Flash — 이며 오늘 밤 가중치를 공개할 예정이라고 답변.
- Zhipu의 Zixuan Li (X, @zixuanli_): "Ox Alpha는 GLM-5.3-Flash의 초기 버전이었습니다. 공식 출시 버전은 더 강력한 성능과 대폭 향상된 안정성을 제공합니다. 커뮤니티에 공개될 수 있도록 도와준 @opencode와 @OpenRouter에 감사드립니다."
- 충격적인 세부 사실 (SemiAnalysis): 스텔스 운영 기간 동안 언급된 일일 100T 토큰 용량이 중국산 칩에서 구동되었습니다 — 1주일 무료 기간은 무엇보다도 프론티어 규모에서 진행된 자국산 가속기 스트레스 테스트였습니다.
- 초기 반응: Andrew Curran — "파레토 최적선이 새로 쓰였다" (공식 발표 및 벤치마크 이미 공개); 커뮤니티 총평: "GLM-5.3 Flash는 모든 면에서 GLM-5.2를 압도한다"; 널리 회자되는 포지셔닝 문구: "최첨단 지능, 플래시급 비용."
- 익숙한 각본의 재연. 2월의 Pony Alpha(익명 출시 → 6일 차경 Zhipu가 GLM-5로 공개)가 이번 상황을 정확히 예견했습니다: 스텔스 출시 → 무료 트래픽 유입 → 벤치마크 검증 → 정체 공개. 공식 확인 며칠 전 GLM임을 밝혀낸 토크나이저 포렌식이 적중했습니다.
- 가중치 배포 완료 (8월 27일 확인): Hugging Face에 zai-org/GLM-5.3-Flash (+ BF16)가 공개되었습니다. 공식 모델 카드 정보: 총 320B / 활성 18B, GLM-5 시리즈 최초의 네이티브 멀티모달 모델, 코딩 및 에이전트 스위트에서 Claude Opus 4.8에 근접하면서도 GLM-5.2를 모든 벤치마크에서 능가하며 가격은 10분의 1 수준(1M 토큰당 약 $0.14/$0.44 vs 5.2의 $1.40/$4.40) — 로컬 서빙을 위한 llama.cpp / Ollama / LM Studio 양자화 지원. HN 반응: 모델 게시물 809점, 정체 공개 게시물 407점.
공개 전 포렌식 분석 — 그리고 그 놀라운 적중률
- 토크나이저 지문. 25개의 통제된 프롬프트에서 Ox Alpha의 토큰 수는 GLM-5.3보다 정확히 75토큰 많았습니다 — 동일한 토크나이저에 고정된 숨겨진 시스템 프롬프트가 존재함을 보여주는 시그니처입니다 (36氪 기술 분석 요약).
- 비디오 토큰 시그니처. 4개의 통제된 비디오 테스트 결과 프레임 레이트/재생 시간/해상도 토큰 계산 공식이 GLM-5V-Turbo와 줄 단위로 완벽히 일치했으며, 타사 모델들과는 확연히 달랐습니다.
- 공개된 GLM-5.3보다 뛰어난 멀티모달 역량. 기존에 공개된 5.3은 API 기준 텍스트 전용이므로, 이것이 Zhipu의 모델이라면 미공개 멀티모달 파생 모델(커뮤니티 은어: GLM-5.5급 주력 모델)입니다. APPSO의 비교 분석에 따르면 추론 체인이 "GLM-5.3과 매우 유사"했으며, GLM-5.3-max가 해결하지 못한 정수론 문제 하나를 Ox가 풀어냈습니다.
- 과거 선례. OpenRouter에서 익명으로 출시되었던 이전 4개 모델 모두 중국 연구소의 모델이었습니다: Pony Alpha → GLM-5 (6일 차에 Zhipu 공개), Hunter/Healer Alpha → Xiaomi MiMo-V2, Elephant Alpha → Ant Ling-2.6-flash, Owl Alpha → Meituan LongCat-2.0.
- 한계 (공개 전 시점). 8월 25일 기준으로는 공식 확인된 바가 없었습니다 — Google은 인정 없이 힌트만 주었고, Zhipu는 침묵했습니다. 8월 26일 공식 확인이 나오면서 위의 모든 포렌식 분석이 사실로 입증되었습니다.
API 빌더를 위한 실무 참고 사항
- 스텔스에서 공식 출시로, 오늘 밤 전환. 무료 이용 기간(~8월 27-28일)은 이제 Z.ai를 통한 오픈 가중치 배포와 함께 공식 GLM-5.3-Flash 출시로 이어집니다 — 정식 제품이 등장하면서 무료 벤치마크 이용 기간은 정확히 종료됩니다.
- 스텔스 스트레스 테스트로 간주할 것. SLA 없음, 지원 중단 예고 없음, 개발사 미표기 — 벤치마크 평가나 호기심 목적에는 적합하지만, 프로덕션 트래픽이나 민감한 데이터 처리에는 부적합합니다.
- 오늘 밤 Z.ai를 통해 가중치 + API 공개 — Hugging Face의 zai-org 및 docs.z.ai를 확인하세요. 당사의 GLM-5.3 보도에서 전체 라인업을 다루고 있으며, 내일 발행본에서 검증된 출시 스펙을 전해드립니다.
주요 출처
- 블룸버그 확인 (@kimmonismus/Techmeme 인용) — Zhipu, 수요일 Ox Alpha가 GLM 계열 새 버전임을 확인, 오늘 밤 가중치 공개
- Techmeme 종합 — GLM-5.3-Flash 공식 발표 반응 (HN/r/singularity/r/LocalLLaMA + SemiAnalysis 중국산 칩 게시글 + Zixuan Li 감사 인사)
- 36氪 — 神秘「牛来」掀翻硅谷,谷歌抢着认领被全网笑惨(实测细节与取证汇总)
- 36氪/APPSO — 화제의 미스터리 '牛来' 모델, 실측 성능은 어떨까 (토크나이저/비디오 포렌식 + 정수론 실측)
- TechTimes — 서빙 레이어 포렌식 (Zhipu 클래스명, 에러 양식, 30/30 토크나이저 조사) (2026-08-23)
- OrcaRouter — Ox Alpha는 GLM-5.3일 가능성 높음 (익명 모델 출시 역사 스코어카드)
- Trending Topics — Ox Alpha: 개발자의 마음을 사로잡으려는 의문의 신규 AI 모델
- Hacker News — "Ox-Alpha Is GLM" 토론 스레드 (커뮤니티 추정, 비공식)
자주 묻는 질문 (2026)
Ox Alpha란 무엇인가요?
8월 20~21일부터 OpenRouter/OpenCode에 등장한 익명의 스텔스 모델입니다: 1M 컨텍스트, 텍스트+이미지+비디오 지원, 약 1주일간 무료 제공. 공식적으로 인정한 연구소는 없습니다. 중국 언론 닉네임: 牛来.
성능은 어느 정도인가요?
적은 샘플이지만 인상적입니다: 10개 태스크 DeepSWE 테스트에서 80% 대 Fable 5의 65%; DeepSWE 개발자의 자체 테스트에서 63% 기록. Stripe CEO: "相当惊艳" (36氪 인용).
누가 개발했나요?
8월 26일 확인됨: Zhipu — Ox Alpha는 GLM-5.3-Flash의 초기 버전이었습니다 (블룸버그, X의 Zhipu Zixuan Li 확인). 토크나이저 +75 오프셋 및 비디오 시그니처 포렌식이 며칠 일찍 이를 밝혀냈습니다.
Google이 개발했다고 주장했나요?
DeepMind 연구원들이 강력한 힌트("Gemini", "trust the process")를 던졌다가 조롱을 받았습니다 — 공식적으로 확인해 준 곳은 없습니다.
아직도 무료인가요?
스텔스 무료 이용 기간은 오늘 밤 Z.ai를 통한 오픈 가중치 배포 및 공식 GLM-5.3-Flash 출시로 전환됩니다 — 실제 제품이 출시되면서 무료 미리보기는 종료됩니다.
GLM-5.3 가중치 링크는 어디에 있나요?
확인 완료: GLM-5.3-Flash 가중치가 zai-org에 공개되었습니다 (8월 27일 확인 기준) — 총 320B / 활성 18B, GLM-5 시리즈 최초의 네이티브 멀티모달 모델, GLM-5.2 가격의 약 10분의 1 수준. Flash 버전의 출시가 예정(약 8월 28일)보다 앞당겨졌습니다.