新闻 / 模型追踪 · 发布前瞻
Qwen3.8-Flash-Next:阿里提前推出 Qwen4 架构——今晚开源权重
在开源 2.4T Max 与笔记本级 27B 两周后,阿里巴巴 Qwen 团队已紧锣密鼓地筹备下一步动作:Qwen3.8-Flash-Next。这是一款开源权重的多模态 MoE 模型,旨在提前预览将驱动 Qwen4 的新架构——ModelScope 倒计时直指今晚 23:00(北京时间 8 月 26 日)。
更新(9 月 2 日):Qwen 官方博客已上线(qwen.ai/blog — Qwen3.8-Flash-Next: A New Architecture),口径与预热完全一致:多模态 MoE、Qwen4 架构的提前预览。同时确认了下文标记为「尚未公布」的关键项——生产版 Qwen3.8-Flash 将默认 1M 上下文,QwenCloud 定价 $0.16/百万输入 · $0.47/百万输出;官方渠道还确认 Flash-Next 可在 CPU 内存/统一内存中运行,得益于 6B 激活参数的轻量足迹。
更新(8 月 27 日):已如期发布——权重现已上线 Hugging Face(Qwen/Qwen3.8-Flash-Next,131 个 safetensors 分片,无门槛开源,外加 FP8 版本),且技术报告已发布。倒计时如期兑现;以下规格与前瞻一致,除非报告另有修正。
据 ModelScope 官方倒计时显示,Qwen3.8-Flash-Next 是一款开源权重的多模态 MoE 模型,将于北京时间 8 月 26 日约 23:00 发布——基于预热亮点,其拥有 125B 主参数 + 51B N-gram 嵌入参数,单 token 激活 6B,采用 GDN 混合架构 + Qwen 稀疏注意力(QSA)。 Qwen 团队的定位:提前发布 Qwen4 架构,以便开发者提前做好准备。基准测试、开源协议和上下文长度在预览时尚未公布。
已确认 vs 未确认信息
- 已确认(预热页面 + Qwen 官方声明):开源权重发布;多模态 MoE;两大核心架构变革——GDN 混合架构与 Qwen 稀疏注意力(QSA);预计于 2026-08-26 23:00 (UTC+08) 在 ModelScope 上线;定位为 Qwen4 家族的架构前瞻。
- 来自预热亮点:125B 主模型参数,用于本地快速 token 查找的 51B 补充 N-gram 嵌入表,以及单 token 激活 6B 参数——“重新设计的多模态 MoE”,在注意力、残差、嵌入和优化方面均有升级。
- 已补齐(9 月 2 日跟进):官方博客上线,此前待定项均已明确——生产版 Qwen3.8-Flash 默认 1M 上下文,QwenCloud 定价 $0.16/百万输入、$0.47/百万输出。英文报道见 Reuters 与 The New Stack(「在关键编码基准上超过更大体量的对手」)。Flash-Next 本体继续以开源权重形式免费提供于 Hugging Face 与 ModelScope。
- 主要阅读入口:qwen.ai 官方博客、Hugging Face 上的 Qwen/Qwen3.8-Flash-Next 仓库与技术报告。生产版 Flash 将随后上线 QwenCloud API。
为何重要:架构探路者,而不仅是又一次 Checkpoint 迭代
- Qwen4 的初次体验。在开源版本中引入 GDN + QSA,意味着社区可以在旗舰系列正式发布前数月,先行评测 Qwen4 的推理部署经济性(注意力开销、长上下文表现)。
- 单 token 激活 6B 是本地部署的核心看点。如果效率宣传属实,DGX-Spark 级别的硬件(已在 NVIDIA 论坛引发热议)和高端 Mac 将成为切实可行的宿主机——这与让 27B 一炮而红的策略如出一辙。
- 非同寻常的 51B N-gram 嵌入表是值得关注的最大悬念:将本地快速 token 查找作为一等公民设计元素在该级别模型中尚属首次,而本地推理部署所需的显存占用精算仍需等待实际仓库确认。
- 背景:这是 Qwen 连续三周密集发布的压轴之作——Max 开源权重(8 月 12 日)、27B(8 月 14 日),再到如今的架构探路者——与此同时,神秘的 Ox Alpha 也让中国大模型实验室的“静默发布”模式持续升温。
一手信息来源
- ModelScope 官方倒计时页 — Qwen3.8-Flash-Next「Upcoming Open-Release」,预计 2026-08-26 23:00 (UTC+08)
- Qwen 官方博客 — Qwen3.8-Flash-Next: A New Architecture(9 月 2 日验证上线;生产版 Flash 1M 上下文与 $0.16/$0.47 定价出处)
- The New Stack — Qwen3.8-Flash Previews Qwen4(编码基准超过更大对手)
- Reuters — 阿里 Qwen 发布 Qwen3.8-Flash,训练成本更低(2026-08-26)
- AGTP on X — Qwen 团队 Qwen4 预告拆解(125B+51B/A6B、GDN+QSA、「提前放出架构供开发者准备」)
- OrcaRouter — Qwen3.8-Flash-Next 信息板(confirmed/rumor 分栏 + 倒计时截图)
- NVIDIA Developer Forums — DGX Spark 讨论串(含 highlights 原文引用与 125B 质疑)
- Hacker News — Qwen 3.8-Flash-Next 明日发布(308 分帖)
常见问题解答 (2026)
它是什么?
一款提前预览 Qwen4 架构的开源多模态 MoE 模型——ModelScope 倒计时指向北京时间 8 月 26 日 23:00。
规格参数?
根据预热亮点:125B 主参数 + 51B N-gram 嵌入,单 token 激活 6B;GDN 混合架构 + Qwen 稀疏注意力(QSA)。
发布时间?
8 月 26 日如期发布——权重已于 8 月 27 日上线 HF 并完成验证(131 个分片 + FP8 版本,无门槛开放),技术报告已同步发布。
为何重要?
首次公开体验 Qwen4 的推理部署经济性(GDN+QSA)及 6B 激活参数——若宣传属实,将对边缘端/本地部署极其友好。
哪些尚未确认?
官方博客(8 月末上线)已确认生产版 Flash 为 1M 上下文、QwenCloud 定价 $0.16/$0.47 每百万 token。剩余未知:Flash 正式版上线日期与中转平台的接入时间。
与 Max 和 27B 相比?
Max (2.4T) = 旗舰;27B = 笔记本日常主力;Flash-Next = Qwen4 架构探路者。同属一代,各司其职。