ChinaModelAPI

新闻 / 模型追踪 · 发布前瞻

已发布 ✓ Qwen3.8-Flash-Next 125B + 51B / A6B Qwen4 架构前瞻
2026-08-26 · 模型追踪 · 8 月 26 日如期发布(权重已于 8 月 27 日上线 HF 验证)

Qwen3.8-Flash-Next:阿里提前推出 Qwen4 架构——今晚开源权重

在开源 2.4T Max 与笔记本级 27B 两周后,阿里巴巴 Qwen 团队已紧锣密鼓地筹备下一步动作:Qwen3.8-Flash-Next。这是一款开源权重的多模态 MoE 模型,旨在提前预览将驱动 Qwen4 的新架构——ModelScope 倒计时直指今晚 23:00(北京时间 8 月 26 日)

更新(9 月 2 日):Qwen 官方博客已上线qwen.ai/blog — Qwen3.8-Flash-Next: A New Architecture),口径与预热完全一致:多模态 MoE、Qwen4 架构的提前预览。同时确认了下文标记为「尚未公布」的关键项——生产版 Qwen3.8-Flash默认 1M 上下文,QwenCloud 定价 $0.16/百万输入 · $0.47/百万输出;官方渠道还确认 Flash-Next 可在 CPU 内存/统一内存中运行,得益于 6B 激活参数的轻量足迹。

更新(8 月 27 日):已如期发布——权重现已上线 Hugging FaceQwen/Qwen3.8-Flash-Next,131 个 safetensors 分片,无门槛开源,外加 FP8 版本),且技术报告已发布。倒计时如期兑现;以下规格与前瞻一致,除非报告另有修正。

核心结论

据 ModelScope 官方倒计时显示,Qwen3.8-Flash-Next 是一款开源权重的多模态 MoE 模型,将于北京时间 8 月 26 日约 23:00 发布——基于预热亮点,其拥有 125B 主参数 + 51B N-gram 嵌入参数,单 token 激活 6B,采用 GDN 混合架构 + Qwen 稀疏注意力(QSA)。 Qwen 团队的定位:提前发布 Qwen4 架构,以便开发者提前做好准备。基准测试、开源协议和上下文长度在预览时尚未公布。

已确认 vs 未确认信息

  • 已确认(预热页面 + Qwen 官方声明):开源权重发布;多模态 MoE;两大核心架构变革——GDN 混合架构与 Qwen 稀疏注意力(QSA);预计于 2026-08-26 23:00 (UTC+08) 在 ModelScope 上线;定位为 Qwen4 家族的架构前瞻。
  • 来自预热亮点:125B 主模型参数,用于本地快速 token 查找的 51B 补充 N-gram 嵌入表,以及单 token 激活 6B 参数——“重新设计的多模态 MoE”,在注意力、残差、嵌入和优化方面均有升级。
  • 已补齐(9 月 2 日跟进):官方博客上线,此前待定项均已明确——生产版 Qwen3.8-Flash 默认 1M 上下文,QwenCloud 定价 $0.16/百万输入、$0.47/百万输出。英文报道见 Reuters 与 The New Stack(「在关键编码基准上超过更大体量的对手」)。Flash-Next 本体继续以开源权重形式免费提供于 Hugging Face 与 ModelScope。
  • 主要阅读入口:qwen.ai 官方博客Hugging Face 上的 Qwen/Qwen3.8-Flash-Next 仓库与技术报告。生产版 Flash 将随后上线 QwenCloud API。

为何重要:架构探路者,而不仅是又一次 Checkpoint 迭代

  • Qwen4 的初次体验。在开源版本中引入 GDN + QSA,意味着社区可以在旗舰系列正式发布前数月,先行评测 Qwen4 的推理部署经济性(注意力开销、长上下文表现)。
  • 单 token 激活 6B 是本地部署的核心看点。如果效率宣传属实,DGX-Spark 级别的硬件(已在 NVIDIA 论坛引发热议)和高端 Mac 将成为切实可行的宿主机——这与让 27B 一炮而红的策略如出一辙。
  • 非同寻常的 51B N-gram 嵌入表是值得关注的最大悬念:将本地快速 token 查找作为一等公民设计元素在该级别模型中尚属首次,而本地推理部署所需的显存占用精算仍需等待实际仓库确认。
  • 背景:这是 Qwen 连续三周密集发布的压轴之作——Max 开源权重(8 月 12 日)、27B(8 月 14 日),再到如今的架构探路者——与此同时,神秘的 Ox Alpha 也让中国大模型实验室的“静默发布”模式持续升温。

一手信息来源

常见问题解答 (2026)

它是什么?

一款提前预览 Qwen4 架构的开源多模态 MoE 模型——ModelScope 倒计时指向北京时间 8 月 26 日 23:00。

规格参数?

根据预热亮点:125B 主参数 + 51B N-gram 嵌入,单 token 激活 6B;GDN 混合架构 + Qwen 稀疏注意力(QSA)。

发布时间?

8 月 26 日如期发布——权重已于 8 月 27 日上线 HF 并完成验证(131 个分片 + FP8 版本,无门槛开放),技术报告已同步发布。

为何重要?

首次公开体验 Qwen4 的推理部署经济性(GDN+QSA)及 6B 激活参数——若宣传属实,将对边缘端/本地部署极其友好。

哪些尚未确认?

官方博客(8 月末上线)已确认生产版 Flash 为 1M 上下文、QwenCloud 定价 $0.16/$0.47 每百万 token。剩余未知:Flash 正式版上线日期与中转平台的接入时间。

与 Max 和 27B 相比?

Max (2.4T) = 旗舰;27B = 笔记本日常主力;Flash-Next = Qwen4 架构探路者。同属一代,各司其职。

相关指南