API 개발자를 위한 중국 AI 모델 최신 업데이트
중국 프론티어 모델 업데이트, 오픈 가중치, 로컬 하드웨어 적합성 및 OpenAI 호환 액세스에 대한 시의성 있는 브리핑. 공식 문서를 우선하며, 추정치 및 벤치마크는 명확히 표기.
Codex 5시간 한도 복구, Claude Code 25% 축소 — 종량제 API 관점에서 본 대조
OpenAI는 잦은 리셋이 발생했던 8월(8월 8/13/21일 세 차례의 전체 리셋) 이후 8월 25일 Codex의 5시간 한도를 복원했으며, Anthropic은 9월 14일부터 Claude Code 한도를 축소합니다. 검증된 타임라인, 쿼터 메커니즘, 그리고 토큰당 과금 방식의 중국 모델 API에는 왜 시간 윈도우 제한이 전혀 없는지 살펴봅니다.
GLM-5.3 오픈 가중치 예정대로 공개: 사후 학습 스케일링 플래그십 모델 다운로드 개시
zai-org/GLM-5.3이 8월 28일 밤 공개되었습니다 — 141개의 safetensors 샤드 + BF16, 비게이트(ungated), 커스텀 glm-5.3 라이선스 적용으로 8월 14일에 약속했던 약 2주간의 안전성 검토 기간을 마쳤습니다. 세부 스펙, 라이선스 주의사항, 그리고 오픈 가중치 생태계에서 어떤 빈자리를 채우는지 정리합니다.
Qwen3.8-Flash-Next: Alibaba, Qwen4 아키텍처 조기 탑재 — 오늘 밤 오픈 가중치 공개
ModelScope 카운트다운: 오늘 밤 베이징 시간 23:00 오픈 가중치 멀티모달 MoE 출시 — 125B 메인 + 51B N-gram 임베딩 및 토큰당 6B 활성화, Qwen4의 GDN + Qwen Sparse Attention 첫 공개. 확인된 정보와 미확인 정보 분석, 로컬 실행 환경에서 6B 활성화가 중요한 이유, 저장소 공개 시 주목할 포인트.
로컬 LLM을 위한 Mac mini M6 vs M5 Pro: 32GB인가 64GB인가?
Apple M6는 더 새로운 가속기 구조를 갖추었지만, M5 Pro는 메모리 상한을 2배로 늘리고 307GB/s 대역폭에 도달합니다. 공식 사양, Apple 테스트 라벨, Qwen3.8-27B 적합성, M4 업그레이드 결정 기준을 담은 과장 없는 구매 가이드.
로컬 LLM을 위한 Mac Studio M5 Max vs M5 Ultra
M5 Max 128GB는 합리적인 워크스테이션이며, M5 Ultra 256GB/512GB는 다른 곳에 올릴 수 없는 대형 모델을 위한 선택입니다. DeepSeek V4, GLM-5, Qwen3.8, Kimi K3에 대한 메모리 계산과 Apple의 클러스터 주장의 한계를 함께 짚어봅니다.
Ox Alpha의 정체 공개: Zhipu, GLM-5.3-Flash 공식 인정 — 오늘 밤 공식 출시 및 오픈 가중치 배포
미스터리 해결: Zhipu는 Bloomberg를 통해 Ox Alpha가 GLM-5.3-Flash임을 확인했으며, 오늘 밤(8월 26일) 공식 출시 및 오픈 가중치가 공개됩니다. 비공개 테스트 당시 일일 100조(100T) 토큰 처리는 중국산 칩(SemiAnalysis)에서 구동되었으며, 과거 Pony Alpha의 행보를 그대로 재현했습니다. 전체 전말과 기술 분석, 공개 내역을 확인해 보세요.
OpenAI의 투자를 받은 Harvey, Kimi K3 오픈 가중치 기반 첫 자체 모델 구축
리걸테크 선도 기업 Harvey(OpenAI/Sequoia/a16z 투자)가 장기적 법률 작업을 위해 Fireworks와 함께 포스트 트레이닝한 Kimi K3 오픈 가중치 기반 모델 'Harvey Tenet'을 발표했습니다. Harvey LAB 기준 기본 K3 대비 작업 처리량이 약 2배 향상되었으며 오픈소스 비용으로 구동됩니다. 리서치 프리뷰 단계로 가중치는 미공개입니다. 중국 오픈 가중치에 대한 서구권의 가장 확실한 도입 신호입니다.
DeepSeek 주말 피크 요금 폐지: 이제 토요일 & 일요일은 종일 비수기 적용
베이징 시간 8월 23일 00:00부터 주말 요금은 전 시간대 비피크 요금으로 청구됩니다 — v4-pro 출력 기준 주중 피크 시 ¥27 대비 종일 ¥13.5/M입니다. 피크/비피크 요금제 도입 후 일주일도 채 되지 않아 적용되었습니다. 전체 주말 요금표, 스케줄링 비용 계산 및 출처를 확인하세요.
HappyHorse 1.1 글로벌 출시: Model Studio 전 기능 API 지원, 비디오 편집 기능 및 Seedance 추월
Alibaba가 Model Studio에서 API를 통해 HappyHorse 1.1의 모든 기능을 공개했습니다 — 새로운 비디오 편집 모드, 추가 비용 없는 통합 오디오 지원, 2주간 40% 출시 할인, OpenRouter 기준 초당 $0.0988(720p), Seedance와 Sora를 앞서는 글로벌 비디오 아레나 2위 달성. 플랫폼별 요금표 및 출처를 확인해 보세요.
GLM-5.3 API 정식 출시: $1.40/$4.40 가격 동결, 하루 지연, 그리고 기다리지 않은 생태계
Zhipu는 8월 19일 새벽에 일반 API 접근을 개방했습니다 — 하루 늦어졌지만 GLM-5.2와 동일한 가격 책정, AA 인덱스 60(오픈소스 공동 1위)을 기록했습니다. 검증된 출시 주간 타임라인, Qwen3.8/K3/V4-Flash 대비 가격표, 플랫폼 지원 현황(ZCode, PhanRouter, 국가 슈퍼컴퓨팅 인터넷), 그리고 8월 28일 가중치 공개 전까지 변경되는 사항을 전달합니다.
MiniMax Design: H3 비디오 모델, 에이전트 워크벤치 탑재
H3를 오픈소스로 공개한 지 3주 만에 MiniMax는 이를 상품화하기 위한 레이어를 출시했습니다. 3D 디렉터 스테이지와 ComfyUI 연동을 지원하는 자연어 기반 창작 에이전트 워크벤치입니다. 이는 API가 아닌 제품 형태이며, 모델 엔드포인트는 여전히 프로그래밍 방식의 경로로 유지됩니다. 출처를 포함한 핵심 요약입니다.
Qwen3.8 오픈 가중치 (2026): 2.4T Max 체크포인트 + 노트북용 Apache-2.0 27B
Alibaba의 첫 번째 오픈 가중치 Max급 공개: Hugging Face에 공개된 Qwen3.8-2.4T-A95B(+FP8)와 17GB 파일 하나로 구동되는 Apache 2.0 라이선스의 27B Dense 비전-언어 모델. 타임라인, 라이선스 세부 조항, $2/$6 API 가격, Simon Willison의 로컬 실행 레시피, 라우팅 테이블 수록.
Kling 3.0 API (2026): 공식 가격, Turbo & Omni, 그리고 30억 달러 분사
공식 글로벌 API에 출시된 Kuaishou의 Kling 3.0 패밀리: 정가 초당 $0.084~$0.42(네이티브 4K), 오디오가 포함된 Turbo, 비디오 입력을 지원하는 Omni, JWT 작업 기반 API 구조. 2분기 실적: 매출 8억 5천만 위안 이상(전년 대비 +200%), 사용자 1억 명 이상, 7월 약 180억 달러 기업가치로 약 30억 달러 유치. 라우팅 테이블 + Seedance 대비 10초 생성 비용 계산 포함.
DeepSeek-V4-Flash-Vision-Exp (2026): 공식 출시, 가격, API 빠른 시작 가이드
8월 21일 저녁(UTC+8) 출시: V4-Flash 가격(입력 1M 토큰당 $0.22, 이미지 최대 384토큰 제한)의 실험적 멀티모달 비전 모델, V4-Flash와 동일한 텍스트 성능, Opus-4.8에 근접한 멀티모달 에이전트 기능, 신규 Files API, Harness v0.1.1-rc.1 지원. curl/Python 퀵스타트, Claude/Gemini/Grok 비전 대비 비용 계산, 적절한 DeepSeek 모델 라우팅 가이드 포함.
DeepSeek Harness, 멀티모달 이미지 입력 지원 추가: rc.7 + rc.8
2단계 롤아웃: rc.7(8월 17일) MCP/ACP의 지속성 있는 이미지 첨부 지원, rc.8(8월 19일) DeepSeek 어댑터를 위한 네이티브 이미지 요청 및 /goal과 /plan을 위한 이미지 입력 지원. 이제 하네스에서 이미지를 처리할 수 있지만 V4-Pro/V4-Flash는 텍스트 전용으로 유지되며, rc.8은 npm next 태그로 배포됩니다. Turing Post는 이 하네스를 "두 번째 DeepSeek 모먼트"라고 평가했습니다.
Gemini 3.7 Flash: Google의 코딩 및 에이전트용 주력 모델
Google은 8월 13일 Gemini 3.7 Flash를 발표했습니다 — 1M 컨텍스트, DeepSWE 65.3%, 2026년까지 출시 특가 1M 토큰당 $0.75/$3.75. 서구권 프론티어 기준선 참고 정보이며, Gemini는 ChinaModelAPI를 통해 라우팅되지 않습니다.
DeepSeek Harness v0.1: DeepSeek, 자체 에이전트 하네스 오픈소스 공개
8월 13일 저녁, MIT 라이선스 기반의 플러그인 중심 에이전트 하네스(dsh)가 발표되었습니다 — 해외 언론에서는 이를 오픈소스 Claude Code의 대항마로 부르고 있습니다. 4가지 작업 모드, Claude Code 세션 가져오기 지원, 24시간 만에 288개 플러그인 확보, 모델 무관(Model-agnostic) 설계가 특징입니다.
GLM-5.3 공식 출시: 사후 학습 스케일링, 창발적 사이버 보안 역량, 2주 내 가중치 공개
Z.ai 공식 블로그에서 8월 14일 GLM-5.3을 발표했습니다 — GLM-5.2와 동일한 베이스, Terminal-Bench 3.0 점수 4.6→28.3, CyberGym 84.5%, 2,436개의 실제 취약점 발견. 8월 19일 업데이트: API 가격은 5.2와 동일(1M 토큰당 $1.40/$4.40), 독립 AA 인덱스 60 기록, 가중치는 8월 28일경 공개 예정; VentureBeat / The Decoder / Interconnects 보도 포함.
DeepSeek-V4-Pro-0813 공식 발표: 에이전트 성능이 강화된 정식 버전 GA
DeepSeek 공식 API 문서에서 2026-08-13(저녁) deepseek-v4-pro를 DeepSeek-V4-Pro-0813으로 업데이트했습니다. 동일한 모델 ID, 향상된 에이전트 성능, 소폭의 가격 조정이 포함됩니다. API 빌더가 조치해야 할 사항은 거의 없습니다.
Grok 4.6: xAI의 새로운 추천 플래그십, 이제 API에서 지원
xAI 공식 개발자 문서에 최신 플래그십으로 grok-4.6이 등재되었습니다 — 500k 컨텍스트, 1M 토큰당 $2/$6, 코딩 작업에 권장됩니다. 서구권 프론티어 기준선 참고 정보이며, Grok은 ChinaModelAPI를 통해 라우팅되지 않습니다.
중국 모델 워치 — 주간 모델 현황
2026-08-09 기준 ChinaModelAPI가 추적하는 중국 AI 모델 플래그십과 GPT-5.6 Sol / Claude Opus 5 기준선 비교 주간 스냅샷입니다. API 빌더를 위한 자동 상태 브리핑.
MiniMax H3 오픈 가중치: 네이티브 오디오/비디오 모델
H3(M3가 아님)는 네이티브 스테레오 오디오를 지원하는 MiniMax의 멀티모달 비디오 모델입니다. HF 가중치 + ComfyUI + 호스팅 API 제공. 공식적인 "오픈 Kling" 명칭은 아니며, 품질 면에서 자주 Seedance와 비교됩니다.
Qwen3.8-Max: 약 2.4T 규모 플래그십 — 신규 비디오 생성기가 아닙니다
2026년 8월 출시된 코딩 및 장기 작업을 위한 Qwen 플래그십. 루머 정리: Qwen2.5-VL / Qwen2-VL-72B 기반의 Seedance급 T2V 모델 출시가 아닙니다.
Seedance 2.0 Mini / Fast 할인 동향: Mini 약 60% 할인(4折) 신호
2026년 8월 시장 동향: 일부 플랫폼에서 Mini는 약 60% 할인(4折), Fast는 약 25% 할인(75折)으로 안내되는 경우가 많습니다. 이는 ChinaModelAPI 가격이 아니므로 각 콘솔에서 확인해야 합니다. 반복 테스트에는 Mini를, 최종 결과물에는 2.5를 추천합니다.
Seedance 2.5 주요 기능: 30초 원테이크, 50개 참조 지원, 지원 플랫폼 안내
공식 출시 및 2026년 8월 롤아웃: 30초 단일 패스 생성, 약 50개의 멀티모달 참조, 강화된 편집 기능. 크리에이터의 활용처와 API 빌더의 대응 방안을 소개합니다.
Seedance 2.5 현황 (이전 기록): 7월 연기 관련 노트
7월 하순의 출시 전 현황 브리프입니다. 2026-07-31 공식 출시 게시물로 대체되었으며 타임라인 맥락 참고용으로만 유지됩니다.
API 빌더를 위한 DeepSeek-V4-Pro: V3.2를 대체한 모델
DeepSeek-V4-Pro와 V4-Flash는 2026년 플래그십 페어입니다(1M 컨텍스트, 오픈 가중치). V3 시절의 모델 ID에서 OpenAI 호환 클라이언트로 마이그레이션하는 방법.
Kimi K3 + GLM-5.2: 2026년 오픈 프론티어 조합
장기 코딩 작업, 1M 컨텍스트, 오픈 가중치 배포 측면에서 Moonshot Kimi K3와 Zhipu GLM-5.2가 서로를 보완하는 방식 — OpenAI 호환 접근 방식 안내 포함.
data/model-watch/에 저장되며, 출처 확인 후 발행됩니다.