뉴스 / Model Watch · 출시 프리뷰
Qwen3.8-Flash-Next: Alibaba, Qwen4 아키텍처 조기 탑재 — 오늘 밤 오픈 가중치 공개
2.4T Max 및 노트북급 27B를 공개한 지 2주 만에, 알리바바 Qwen 팀은 벌써 다음 행보인 Qwen3.8-Flash-Next를 준비하고 있습니다. 이는 Qwen4를 구동할 아키텍처를 미리 선보이는 오픈 가중치 멀티모달 MoE로, ModelScope 카운트다운은 오늘 밤 23:00 베이징 시간(8월 26일)을 가리키고 있습니다.
업데이트(8월 27일): 예정대로 출시되었습니다 — Hugging Face에 가중치가 공개되었으며 (Qwen/Qwen3.8-Flash-Next, 131개 safetensors 샤드, 비게이트, FP8 변형 버전 포함), 기술 보고서도 공개되었습니다. 카운트다운대로 정상 출시되었으며, 아래 사양은 보고서에서 수정되지 않는 한 프리뷰 내용 그대로 유지됩니다.
Qwen3.8-Flash-Next는 공식 ModelScope 카운트다운 기준 8월 26일 약 23:00(베이징 시간)에 출시되는 오픈 가중치 멀티모달 MoE입니다 — 메인 파라미터 125B + N-gram 임베딩 파라미터 51B, 토큰당 활성 파라미터 6B(티저 주요 특징 기준), GDN 하이브리드 아키텍처 + Qwen Sparse Attention (QSA) 기반으로 구축되었습니다. Qwen 팀의 의도: 개발자가 미리 준비할 수 있도록 Qwen4 아키텍처를 조기에 공개하는 것입니다. 벤치마크, 라이선스 및 컨텍스트 길이는 프리뷰 시점에 미공개 상태였습니다.
확인된 사항 vs 미확인 사항
- 확인된 사항 (티저 + Qwen 공식 발표): 오픈 가중치 출시; 멀티모달 MoE; 두 가지 핵심 아키텍처 변화 — GDN 하이브리드 아키텍처 및 Qwen Sparse Attention; ModelScope 기준 2026-08-26 23:00 (UTC+08) 출시 예정; Qwen4 제품군 아키텍처 프리뷰로 포지셔닝.
- 티저 하이라이트 기준: 125B 메인 모델 파라미터, 빠른 로컬 토큰 조회를 위한 보조 51B N-gram 임베딩 테이블, 토큰당 활성 파라미터 6B — 어텐션, 레지듀얼, 임베딩 및 최적화 전반에 걸친 업그레이드가 적용된 "재설계된 멀티모달 MoE".
- 아직 공개되지 않은 사항: 벤치마크, 라이선스, 컨텍스트 윈도우, 호스팅 가격 및 정확한 저장소 이름. NVIDIA 포럼의 한 회의론자는 모델 크기를 35B-A3B로 해석하기도 했습니다. 125B-A6B 수치는 티저 페이지 자체에 나온 것이지만, 저장소가 정식 공개될 때까지는 모든 정보를 출시 전 사전 정보로 취급해야 합니다.
- 오늘 밤 주목할 곳: Qwen Hugging Face 조직 페이지 및 ModelScope 카운트다운 페이지. 내일 검증된 사양으로 후속 소식을 전해드리겠습니다.
주목해야 하는 이유: 단순한 또 하나의 체크포인트가 아닌 아키텍처 선발대
- Qwen4를 미리 맛보다. 오픈 릴리스에 GDN + QSA가 적용되었다는 것은, 플래그십 제품군이 출시되기 수개월 전에 커뮤니티에서 Qwen4의 서빙 경제성(어텐션 비용, 롱 컨텍스트 동작 특성)을 벤치마킹할 수 있음을 의미합니다.
- 토큰당 활성 파라미터 6B는 로컬 사용자에게 핵심입니다. 효율성에 대한 주장이 사실이라면, (이미 NVIDIA 포럼에서 화제가 되고 있는) DGX-Spark급 하드웨어와 고사양 Mac이 현실적인 호스트가 될 수 있습니다 — 27B를 흥행시켰던 것과 동일한 전략입니다.
- 이례적인 51B N-gram 임베딩 테이블은 주목해야 할 의문점입니다. 빠른 로컬 토큰 조회를 일급 설계 요소로 도입한 것은 이 체급에서 새로운 시도이며, 로컬 서빙을 위한 메모리 사용량 계산은 실제 저장소가 나와봐야 알 수 있습니다.
- 배경: 이는 Max 오픈 가중치(8월 12일), 27B(8월 14일), 그리고 이번 아키텍처 선발대에 이르기까지 3주간 이어진 Qwen의 연속 공세를 마무리하는 것입니다. 한편 Ox Alpha의 미스터리는 중국 AI 연구소들의 스텔스 출시 흐름에 대한 관심을 계속 고조시키고 있습니다.
주요 출처
- ModelScope 공식 카운트다운 페이지 — Qwen3.8-Flash-Next 'Upcoming Open-Release', 2026-08-26 23:00 (UTC+08) 예정
- X의 AGTP — Qwen 팀의 Qwen4 예고 분석(125B+51B/A6B, GDN+QSA, '개발자 준비를 위한 아키텍처 사전 공개')
- OrcaRouter — Qwen3.8-Flash-Next 대시보드(확인/루머 구분 컬럼 + 카운트다운 스크린샷)
- NVIDIA 개발자 포럼 — DGX Spark 토론 스레드(하이라이트 원문 인용 및 125B에 대한 의문 포함)
- Hacker News — Qwen 3.8-Flash-Next 내일 출시 (308포인트 게시물)
자주 묻는 질문 (2026)
어떤 모델인가요?
Qwen4의 아키텍처를 미리 선보이는 오픈 가중치 멀티모달 MoE — ModelScope 카운트다운 기준 8월 26일 23:00(베이징 시간) 공개.
주요 사양은?
티저 하이라이트 기준: 메인 125B + 51B N-gram 임베딩, 토큰당 활성 6B, GDN 하이브리드 아키텍처 + Qwen Sparse Attention.
출시 시기는?
8월 26일 예정대로 출시 — 8월 27일 HF 가중치 공개 확인(131개 샤드 + FP8, 비게이트), 기술 보고서 공개 완료.
왜 중요한가요?
6B 활성 파라미터를 갖춘 Qwen4의 서빙 경제성(GDN+QSA)을 최초로 오픈 공개 — 주장이 사실이라면 엣지/로컬 환경에 매우 유리.
미확인된 사항은?
벤치마크, 라이선스, 컨텍스트 길이, 가격. 심지어 모델 크기에도 의문(35B-A3B로 해석)이 제기되고 있으므로, 모든 수치는 출시 전 사전 정보로 취급해야 합니다.
Max 및 27B와의 차이점은?
Max (2.4T) = 플래그십, 27B = 노트북용 데일리 모델, Flash-Next = Qwen4 아키텍처 선발대. 동일 세대이지만 세 가지 서로 다른 역할을 수행합니다.