ChinaModelAPI

뉴스 / Model Watch · 오픈 가중치 출시

오픈 가중치 Qwen3.8-2.4T-A95B Qwen3.8-27B · Apache 2.0 로컬 실행 가이드
2026-08-21 · Model Watch · 2026년 8월 12~17일 가중치 공개

Qwen3.8 오픈 가중치 (2026): 알리바바, 2.4T Max 체크포인트 및 로컬 실행 가능한 Apache-2.0 27B 공개

지난 8월 8일 Qwen3.8-Max 브리핑 당시만 해도 오픈 가중치 출시는 '출시 예정' 각주에 불과했습니다. 이제 실제로 출시되었습니다. Qwen Hugging Face 조직에 모든 AI 연구소를 통틀어 최초의 오픈 가중치 Max급 모델인 Qwen3.8-2.4T-A95B(및 FP8 버전)와, 17GB 단일 파일로 실행 가능한 Dense 구조의 Apache-2.0 이미지·비디오 지원 모델 Qwen3.8-27B가 등록되었습니다. 본 브리핑에서는 출시 타임라인, 라이선스 세부 조항, API 가격, 그리고 실전 검증된 로컬 실행 레시피를 다룹니다.

핵심 결론

2026년 8월 12~17일부로 Qwen3.8의 가중치가 공개되었습니다: Qwen3.8-2.4T-A95B(+ FP8)는 최초의 Max급 오픈 체크포인트이며, Qwen3.8-27B는 네이티브 이미지/비디오 이해 기능과 262K 컨텍스트(최대 1M 확장 가능)를 갖추고 Apache 2.0 라이선스로 배포됩니다. 27B는 실제로 로컬에서 직접 호스팅할 수 있는 모델입니다. Simon Willison은 128GB MacBook에서 이를 실행해 15~30 tok/s의 속도를 기록하며 "로컬 머신에서 실행되는 모델로 생성한 펠리컨 SVG 중 단연 최고"라고 평가했습니다. 출시 보도에 따른 호스팅형 qwen3.8-max API 가격: 1M 토큰당 $2 / $6 / $0.25 (입력 / 출력 / 캐시).

발표부터 가중치 공개까지: 2주간의 타임라인

공개 시점주요 경과 · 출처
8월 초 (CCTV 보도 기준 8월 3일)Qwen3.8-Max 발표 및 API 제공 시작 — "역대 최고 성능 모델" 발표 및 오픈 가중치 공개 약속. 당사의 8월 8일 브리핑에서 출시 소식 및 Qwen2.5-VL 루머 혼선에 대해 다루었습니다.
8월 12일 주간공식 블로그 포스트 "Qwen3.8-Max: A New Bar for Coding and Cowork"를 통해 최초의 Max급 오픈 가중치 출시를 알렸으며, 이후 며칠 동안 2.4T-A95B 및 FP8 체크포인트가 Qwen HF 조직에 등록되었습니다(커뮤니티 타임라인: eigent.ai, codersera).
8월 14~16일Qwen3.8-27B가 Apache 2.0 라이선스로 공개되었습니다. Simon Willison이 직접 사용 후기(8월 16일)를 게시하여 Hacker News 메인 페이지에서 798점을 기록했으며, Artificial Analysis는 27B를 인텔리전스 인덱스 52점에 등재했습니다.
8월 17일 (월)CNBC는 이를 Meta와의 대결 구도로 조명했습니다: "알리바바, 랩톱 구동 신규 모델로 Meta의 AI 도전에 맞불." Hugging Face는 CNBC에 Qwen 기반 파생 모델 수가 151,448개에 도달해 Meta의 2.6배에 달한다고 밝혔습니다.

날짜는 각 항목별로 인용된 출처를 따릅니다. 커뮤니티 타임라인 간에 하루 정도의 차이가 있는 경우(정확한 체크포인트 공개 시점에 대해 8월 12일 vs 14일), 이를 임의로 일원화하지 않고 명시했습니다.

공식 모델 카드 기준 출시 내역

  • Qwen3.8-2.4T-A95B (Max급 출시 모델). 총 파라미터 2.4조 개로, Qwen3.5 아키텍처 기반으로 구축되었습니다. 공식 벤치마크 표에 따르면 Opus 4.8, Claude Fable 5, GPT-5.6 Sol과 대등한 수준입니다: Terminal Bench 2.1 86.6점 (GPT-5.6 Sol 최고 88.8점), PaperBench 93.0점 (표 내 최고점), GPQA Diamond 92.6점, Agents' Last Exam 53.6점. 산출물은 vLLM, SGLang 및 TokenSpeed와 호환되는 것으로 명시되어 있습니다.
  • Qwen3.8-27B (직접 실행 가능한 모델). Dense 27B 모델로, 유연한 사고(thinking) 제어 기능과 262,144 토큰 네이티브 컨텍스트(최대 1,000,000 토큰 확장 가능)를 갖춘 네이티브 비전-언어(이미지 및 비디오 지원) 모델입니다. 알리바바의 출시 자료에 따르면 "전반적으로 Qwen3.7-Plus를 능가"한다고 주장하며, 커뮤니티의 일치된 의견(codersera의 Qwen 가이드 기준)은 이를 Qwen3.6-27B를 대체할 새로운 기본 로컬 Qwen 모델로 평가하고 있습니다.
  • 호스팅 버전과 가중치 배포 버전의 차이점에 유의해야 합니다. 공식 카드에 따르면, qwen3.8-max(호스팅 버전)는 2.4T 체크포인트를 기반으로 비전 입력, 비사고(non-thinking) 모드, 기본 1M 컨텍스트 및 공식 빌트인 도구가 추가되어 있습니다. 순수 체크포인트를 직접 자체 호스팅할 경우 호스팅 버전의 전체 기능 세트가 아닌 기본(base) 모델을 구동하게 됩니다.
  • 메모리 사용량을 줄이고자 하는 데이터센터 추론 팀을 위해 대형 체크포인트의 FP8 버전도 함께 공개되었습니다.

출시되지 않은 항목 — 세부 조건 확인 필요

  • 2.4T의 라이선스는 Apache가 아닌 것으로 알려졌습니다. 27B는 Apache 2.0이지만, 커뮤니티 가이드에 따르면 2.4T 저장소는 별도의 Qwen 커스텀 라이선스로 배포된 것으로 확인되었습니다. 8월 21일 기준 저장소 페이지에서 전체 라이선스 텍스트를 추출할 수 없었으므로, 상업적 목적으로 자체 호스팅하거나 특히 외부에 서비스를 제공하는 경우 모델 카드를 먼저 반드시 확인하십시오.
  • 호스팅형 27B: 출시일 및 가격 미정. 공식 카드에는 Qwen Cloud 호스팅형 27B가 기본 1M 컨텍스트와 빌트인 도구를 탑재하여 "출시 예정"이라고 명시되어 있으나, 발행 시점 기준 구체적인 일정은 공개되지 않았습니다.
  • "2.4T 공개"가 "개인 GPU 장비에서 2.4T 구동 가능"을 의미하지는 않습니다. 커뮤니티 가이드에 따르면 FP8 체크포인트 용량만 약 2.5TB에 달하여 멀티 노드 환경이 필수적입니다. 이 오픈소스화는 전략적으로 매우 중대하며 추론 플랫폼에는 실질적인 의미가 있지만, 개인 워크스테이션 환경을 위한 것은 아닙니다.
  • 가격 출처 안내. 1M 토큰당 $2 / $6 / $0.25 수치는 출시 관련 보도(Qwen Cloud 등록 정보에 대한 latent.space, eigent.ai, codersera, kie.ai 등)를 바탕으로 한 것으로, 당사가 가격 페이지를 직접 캡처한 것은 아닙니다. 예산을 확정하기 전에 Model Studio에서 직접 확인하시기 바랍니다.

Qwen3.8 API 가격 비교: 중국 주요 모델 라인업 (2026)

보도된 1M 토큰당 입력 $2.00 / 출력 $6.00 (및 캐시 입력 $0.25)을 기준으로 볼 때, qwen3.8-max는 동급 프론티어 모델들과 유사한 가격대에 위치합니다. 서구권 플래그십 모델보다 확연히 저렴하며, DeepSeek의 비피크 최저가보다는 높은 수준입니다.

모델 (2026)입력 $/1M출력 $/1M오픈 가중치
qwen3.8-max$2.00$6.00HF의 2.4T-A95B + FP8 (커스텀 라이선스 적용 보도)
GLM-5.3 (Z.ai)$1.40$4.408월 28일경 공개 예정 (당사 브리핑)
deepseek-v4-flash (비피크)$0.22$0.66MIT (V4 패밀리)
Kimi K3$3.00$15.002.8T, 수정된 라이선스 (당사 브리핑)

비교 항목의 가격은 이전 브리핑(GLM-5.3, DeepSeek, Kimi K3)에서 이미 검증된 가격을 재사용했습니다. qwen3.8-max 항목은 출시 보도를 기반으로 작성되었으므로 위의 세부 조건을 참조하십시오.

로컬 실행 방법: Simon Willison의 실전 검증 레시피

  • 환경 설정. LM Studio에서 17GB Q4_K_M GGUF를 사용해 128GB MacBook Pro (M5 Max) 및 NVIDIA DGX Spark에서 테스트했습니다 — 약 15~30 tokens/sec의 속도를 보였으며, llama.cpp의 draft-mtp 추측 디코딩(speculative decoding)을 적용하면 약 72% 더 빨라집니다.
  • 컨텍스트 기본값부터 수정하십시오. 네이티브 262,144 토큰을 지원하지만, LM Studio의 기본값인 8,192는 "추론(reasoning) 과정만으로 모두 소진되었습니다." 모델을 평가하기 전에 이 값을 먼저 늘리십시오.
  • 과도한 생각(overthinking)을 줄이십시오. 기본 추론 강도가 xhigh로 설정되어 있어, 펠리컨 SVG 프롬프트 실행에 21분이 소요되었고 3,223개의 출력 토큰을 내기 위해 22,276개의 추론 토큰을 소모했습니다. "훌륭한 모델이지만 기본 설정으로 시작하는 것은 정말 좋지 않다"며, 일상적인 작업에는 low 또는 추론 없음을 사용할 것을 권장했습니다.
  • 총평. "로컬 머신에서 실행되는 모델로 생성한 펠리컨 SVG 중 단연 최고"라고 평가했으며, 비전 성능에 대해서도 펠리컨 사진을 사용한 바운딩 박스 테스트 결과 "매우 잘 일치했다"고 밝혔습니다. 다만 Dense 모델 특성상 메모리 대역폭의 한계로 인해 소형 MoE 모델처럼 빠르지는 않다는 점이 단점입니다. 그는 "17GB 파일 하나로 개인 장비에서 이 모든 작업을 수행할 수 있다는 것 자체가 기적"이라고 덧붙였습니다.

어떤 Qwen3.8 모델을 선택해야 할까요?

워크로드 유형추천 라우팅선택 이유
로컬 개발, 프라이버시 민감, 오프라인 환경Qwen3.8-27B 자체 호스팅Apache 2.0, 17GB Q4, 비전+비디오 입력; 사고 강도를 xhigh에서 낮춰서 사용
고난도 코딩/에이전트 작업, 호스팅형qwen3.8-max API$2/$6에 전체 호스팅 기능 세트(비전 입력, 비사고 모드, 기본 1M 컨텍스트, 빌트인 도구) 제공
가장 경제적인 텍스트/에이전트 루프deepseek-v4-flash비피크 시 $0.22/$0.66 — Flash 패밀리 브리핑 참조; 신규 피크/비피크 시간대 확인 필요
Max급 오픈 가중치, 자체 추론 구동2.4T-A95B / FP8멀티 노드 용량을 갖춘 추론 플랫폼용; vLLM/SGLang/TokenSpeed 지원 문서화됨

국내외 시장 및 커뮤니티 반응

  • Hacker News에서 큰 주목을 받았습니다. Willison의 리뷰는 798점을 기록했고, Artificial Analysis 등재(인텔리전스 인덱스 52점) 관련 스레드도 380점을 기록했습니다. 주요 공통 반응은 동급 최강의 로컬 성능과 xhigh 기본 설정의 특이점이었습니다.
  • 서구권 언론은 Meta와의 경쟁 구도에 주목하고 있습니다. CNBC는 Meta의 새로운 Muse Glimmer 랩톱 모델과의 경쟁 관점에서 조명했으며, Hugging Face의 151,448개 Qwen 파생 모델 통계(Meta의 2.6배 규모)가 이를 뒷받침합니다. 이번 달 GLM-5.3을 통해 동일한 오픈 가중치 흐름을 보도한 WIRED와 Axios는 이제 중국의 오픈 모델을 오픈 AI의 실질적인 프론티어로 평가하고 있습니다.
  • 중국 매체들은 이번 발표를 1주일간의 '3대 연속 업데이트'로 평가했습니다. 베이징상보(北京商报)의 8월 16일자 종합 기사("一周三更")는 DeepSeek의 가격 인하, 알리바바의 오픈소스화, 즈푸(Zhipu)의 사후 학습(post-training) 전략을 한 주에 일어난 3대 사건으로 정리했으며, 해당 주간 OpenRouter 사용량 기준 글로벌 상위 10개 모델 중 6개가 중국 모델이었다는 데이터를 제시했습니다.

단 하나의 OpenAI 호환 엔드포인트로 Qwen 및 중국의 모든 주요 모델을 이용하세요

ChinaModelAPI는 Qwen, DeepSeek, GLM, Kimi 등 중국 프론티어 모델을 전 세계 빌더들에게 단일 OpenAI 호환 API로 제공하는 독립 릴레이 서비스입니다. 구독료 없이 USDT/USD1 결제를 지원합니다. 이번과 같은 신규 모델 공개야말로 당사 플랫폼의 존재 이유입니다. 출시 당일 모델 지원, 투명한 토큰당 과금, 단 한 번의 연동으로 모든 라인업을 활용할 수 있습니다.

ChinaModelAPI는 알리바바 또는 Qwen 팀과 공식적인 제휴 관계가 없는 독립 릴레이 서비스입니다. 라우팅되는 모델 ID는 출시 전 실시간으로 검증됩니다 — Qwen3.8 라우팅이 활성화될 때 알림을 받으려면 대기자 명단에 등록하세요.

주요 출처

자주 묻는 질문 (2026)

가중치가 실제로 공개되었나요?

네, 그렇습니다 — 2.4T-A95B(+FP8) 및 27B가 Qwen HF 조직에 등록되어 있습니다. 27B는 Apache 2.0이며, 2.4T는 독자적인 Qwen 라이선스 조항이 적용되는 것으로 알려져 있으므로 상업적 자체 호스팅 전에 카드를 확인하시기 바랍니다.

2.4T 모델을 직접 실행할 수 있나요?

일반 워크스테이션 하드웨어에서는 불가능합니다 — 커뮤니티 가이드에 따르면 FP8 체크포인트 용량만 약 2.5TB에 달합니다. 추론 플랫폼용이며, 그 외에는 호스팅형 API나 27B를 사용해야 합니다.

27B 구동에 필요한 하드웨어는 어떻게 되나요?

17GB Q4_K_M GGUF 기준입니다. Willison은 128GB MacBook Pro (M5 Max) 및 DGX Spark에서 15~30 tok/s를 기록했으며, draft-mtp 적용 시 +72% 빨라집니다. 기본 컨텍스트 길이를 먼저 늘리십시오 — 8,192는 추론 과정만으로 모두 소진됩니다.

이미지 및 비디오 입력이 지원되나요?

네, 지원됩니다 — 공식 27B 카드에 따르면 이미지와 비디오에 대한 네이티브 비전-언어 이해 및 유연한 사고 제어를 지원합니다. 이 체급의 모델에서는 보기 드문 사양입니다.

API 비용은 얼마인가요?

출시 보도에 따르면 Qwen Cloud의 qwen3.8-max 가격은 1M 토큰당 $2 / $6 / $0.25(입력 / 출력 / 캐시)로 일관되게 보고되고 있습니다. 예산 책정 전 실제 Model Studio 페이지에서 확인하십시오.

호스팅형 27B는 언제 출시되나요?

공식 카드 기준 "출시 예정"입니다 — 기본 1M 컨텍스트 및 빌트인 도구가 포함됩니다. 2026년 8월 21일 기준 구체적인 출시일이나 가격은 공개되지 않았습니다.

과도한 생각(overthinking)에 대한 불만이 나오는 이유는 무엇인가요?

기본 추론 강도가 xhigh로 설정되어 있기 때문입니다: 단 하나의 SVG 생성에 21분이 걸리고 22,276개의 추론 토큰을 소모했습니다. Willison의 해결책은 low 또는 추론 없음으로 시작하고 필요한 경우에만 강도를 높이는 것입니다.

Kimi K3 / GLM-5.3과의 비교는?

K3는 7월 27일에 2.8T 가중치(수정된 라이선스)를 공개했고, Qwen3.8은 Max급 체크포인트와 Apache 라이선스의 Dense 자매 모델을 함께 최초로 공개했으며, GLM-5.3 가중치는 8월 28일경 공개 예정입니다. 세 모델 모두 당사의 Model Watch에서 추적 중입니다.

관련 가이드