新闻 / 模型观察 · 开放权重发布
Qwen3.8 权重开源(2026):阿里上线 2.4T Max 检查点,并推出支持 Apache-2.0 协议、可在本地运行的 27B 模型
我们在 8 月 8 日报道 Qwen3.8-Max 时,开源权重的承诺还只是写着“即将推出”的注脚。现在它正式来了:Qwen Hugging Face 官方组织已上线 Qwen3.8-2.4T-A95B(以及 FP8 版本)——这是业内首个开源的 Max 级模型——以及 Qwen3.8-27B,一款采用 Apache-2.0 协议、支持图像与视频理解的稠密 27B 模型,仅需一个 17GB 文件即可运行。本期简报汇总了完整时间线、开源协议细节、API 定价以及实测的本地运行指南。
Qwen3.8 权重已于 2026 年 8 月 12–17 日正式开源:Qwen3.8-2.4T-A95B(+ FP8)是首个 Max 级别的开源检查点,而 Qwen3.8-27B 基于 Apache 2.0 协议发布,具备原生图像/视频理解能力与 262K 上下文(可扩展至 1M)。
27B 是真正适合个人本地私有化部署的版本——Simon Willison 在一台 128GB 的 MacBook 上以 15–30 tok/s 的速度运行了该模型,并称其为“迄今为止我用本地运行的模型生成过的最好的鹈鹕 SVG 图”。
根据发布报道,托管版 qwen3.8-max API 定价为:每 100 万 token $2 / $6 / $0.25(输入 / 输出 / 缓存)。
从官宣到权重开源:两周完整时间线
| 发布时间 | 事件进展 · 来源 |
|---|---|
| 8 月初(央视报道为 8 月 3 日) | Qwen3.8-Max 官宣并通过 API 提供服务——被誉为“迄今为止最强模型”,并承诺开源权重。我们的 8 月 8 日简报 报道了此次发布以及与 Qwen2.5-VL 的传闻混淆事件。 |
| 8 月 12 日当周 | 官方博客文章 《Qwen3.8-Max:代码与协同工作的新标杆》 标志着首个 Max 级开源权重的发布;2.4T-A95B 和 FP8 检查点在随后的几天内陆续上线 Qwen HF 组织(社区时间线参考:eigent.ai、codersera)。 |
| 8 月 14–16 日 | Qwen3.8-27B 以 Apache 2.0 协议发布。Simon Willison 发布实测体验(8 月 16 日),以 798 点的高分登上 Hacker News 首页;Artificial Analysis 将 27B 列入其 智能指数,评分为 52。 |
| 8 月 17 日(周一) | CNBC 将其与 Meta 进行对比:“阿里推出适配笔记本电脑的新模型,回应 Meta 的 AI 挑战。”Hugging Face 向 CNBC 透露,基于 Qwen 的衍生模型数量已达到 151,448 个——是 Meta 规模的 2.6 倍。 |
日期依据各行引用的来源;在社区时间线存在一天出入的地方(如检查点上线的具体时间是 8 月 12 日还是 14 日),我们均如实注明而非强行统一。
根据官方模型卡:具体发布了哪些内容
- Qwen3.8-2.4T-A95B(Max 级重磅发布)。总参数量达 2.4 万亿,基于 Qwen3.5 架构基础构建。官方基准测试表显示其表现与 Opus 4.8、Claude Fable 5 和 GPT-5.6 Sol 旗鼓相当:Terminal Bench 2.1 达到 86.6(GPT-5.6 Sol 最高为 88.8),PaperBench 达到 93.0(榜单最高分),GPQA Diamond 达到 92.6,Agents' Last Exam 达到 53.6。文档显示模型权重兼容 vLLM、SGLang 和 TokenSpeed。
- Qwen3.8-27B(本地可运行版本)。稠密 27B 模型,具备原生视觉语言能力——支持图像与视频,拥有灵活的思考控制,原生 262,144 token 上下文且可扩展至 1,000,000。阿里的发布资料称其“综合表现超越 Qwen3.7-Plus”;社区共识(参考 codersera 的 Qwen 指南)已将其视作取代 Qwen3.6-27B 的新一代默认本地 Qwen 模型。
- 托管版与开源权重版的差异至关重要。根据官方模型卡,
qwen3.8-max(云端托管版)基于 2.4T 检查点构建,并增加了视觉输入、非思考模式、默认 1M 上下文以及官方内置工具。如果您自行私有化部署原始权重,运行的只是基础底座——并不包含托管版的完整功能集。 - FP8 变体版本已与大型检查点同步发布,专为追求更低显存占用的数据中心推理团队设计。
未包含的内容——细读条款与限制
- 据报道 2.4T 并非 Apache 协议。27B 采用 Apache 2.0 协议;而社区指南指出 2.4T 仓库改用了自定义的 Qwen 许可协议。截至 8 月 21 日,我们未能在仓库页面提取到完整许可协议文本——在进行商业化私有化部署前,特别是对外提供服务时,请务必仔细阅读模型卡条款。
- 托管版 27B:暂无具体日期与定价。官方模型卡显示 Qwen Cloud 托管版 27B“即将推出”,默认支持 1M 上下文并附带内置工具——截至发布时未公布更多具体信息。
- “2.4T 开源”不等于“个人 GPU 设备能跑”。社区指南指出 FP8 检查点体积约 2.5TB——这属于多节点集群级别。此次开源具有重大的战略意义,主要适用于专业推理平台,而非个人工作站。
- 定价来源说明。每 100 万 token $2 / $6 / $0.25 的数据来自各大媒体发布报道的一致信息(latent.space、eigent.ai、codersera、kie.ai 对照 Qwen Cloud 列表)——并非直接截取自我们捕获的定价页面。在最终敲定预算前,请在 Model Studio 上核实最新价格。
Qwen3.8 API 定价对比国内大模型阵容(2026)
据报道,qwen3.8-max 定价为每 100 万 token 输入 $2.00 / 输出 $6.00(缓存输入 $0.25),与同梯队的前沿模型处于同一价格区间——远低于西方旗舰模型,高于 DeepSeek 的闲时底价。
| 模型 (2026) | 输入 $/1M | 输出 $/1M | 权重已开源 |
|---|---|---|---|
| qwen3.8-max | $2.00 | $6.00 | HF 上的 2.4T-A95B + FP8(据报道为自定义许可协议) |
| GLM-5.3 (Z.ai) | $1.40 | $4.40 | 承诺约 8 月 28 日上线(我们的简报) |
| deepseek-v4-flash(闲时) | $0.22 | $0.66 | MIT(V4 系列) |
| Kimi K3 | $3.00 | $15.00 | 2.8T,修改版许可协议(我们的简报) |
对比行复用了我们此前简报中已核实的价格(GLM-5.3、DeepSeek、Kimi K3);qwen3.8-max 这一行的数据来自发布报道——详见上方说明。
本地上手运行:Simon Willison 的实测配置方案
- 环境配置。在 LM Studio 中加载 17GB 的
Q4_K_MGGUF 文件,分别在配备 128GB 内存的 MacBook Pro (M5 Max) 和 NVIDIA DGX Spark 上进行了测试——生成速度约为 15–30 token/秒,配合 llama.cpp 的 draft-mtp 投机采样可提速约 72%。 - 先调整默认上下文长度。模型原生支持 262,144 token,但 LM Studio 默认的 8,192“光是推理思考过程就给占满了”。在评估模型能力前,请务必调大该数值。
- 关闭过度思考。默认的思考强度为 xhigh:他生成鹈鹕 SVG 的提示词耗时 21 分钟,消耗了 22,276 个推理 token 才输出 3,223 个结果 token。“这确实是个优秀的模型,但这个默认设置实在很不友好”——日常任务建议调低或关闭思考模式。
- 实测结论。“这是迄今为止我用本地运行的模型生成过的最好的鹈鹕 SVG 图”——在视觉能力方面:他对鹈鹕照片进行的边界框测试结果“匹配度极高”。不足之处在于稠密模型的运行速度受限于内存带宽,因此体验上不如小型 MoE 那样轻快。正如他所说:“一个 17GB 的文件能在我的个人设备上完成所有这些任务,简直就是个奇迹。”
你应该选择调用哪款 Qwen3.8?
| 业务场景 | 推荐路由 | 选择原因 |
|---|---|---|
| 本地开发、注重隐私、离线运行 | Qwen3.8-27B 本地私有化部署 | Apache 2.0 协议、17GB Q4、图像+视频输入;建议将思考强度从 xhigh 调低 |
| 高难度代码/Agent 任务、云端托管 | qwen3.8-max API | $2/$6 享受完整托管功能集(视觉输入、非思考模式、默认 1M 上下文、内置工具) |
| 最具性价比的稳定文本/Agent 循环 | deepseek-v4-flash | 闲时 $0.22/$0.66——参见我们的 Flash 系列简报;请留意最新的高峰/闲时时段划分 |
| Max 级开源权重、自建推理 | 2.4T-A95B / FP8 | 适用于具备多节点算力的推理平台;文档已支持 vLLM/SGLang/TokenSpeed |
各界反响:海外与国内热议
- Hacker News 引发热烈讨论。Willison 的评测获得 798 点高赞;Artificial Analysis 的评级(智能指数 52)也带来了 380 点的讨论热度。核心焦点集中于:同类顶级的本地运行能力,以及默认开启 xhigh 思考强度的槽点。
- 西方媒体聚焦与 Meta 的对决。CNBC 从与 Meta 新推出的 Muse Glimmer 笔记本模型竞争切入;Hugging Face 提供的 151,448 个 Qwen 衍生模型数据(Meta 的 2.6 倍)有力佐证了其实力。WIRED 和 Axios 本月在报道以 GLM-5.3 为代表的开源浪潮时,已将中国开源大模型视作全球开源 AI 的前沿代表。
- 国内媒体称之为“一周三更”重磅连击。《北京商报》8 月 16 日的盘点将 DeepSeek 调价、阿里开源与智谱的后训练布局归纳在同一周内,OpenRouter 数据更显示当周全球使用量前 10 的模型中有 6 款来自中国。
通过一个兼容 OpenAI 的接口调用 Qwen 及全套国产大模型
ChinaModelAPI 是一个独立的中继服务平台,通过单一兼容 OpenAI 的 API 为全球开发者接入 Qwen、DeepSeek、GLM、Kimi 等中国前沿大模型,支持 USDT/USD1 支付,无需订阅。类似本次的模型发布正是该平台的设计初衷:首日即刻可用、透明的按 token 计费,一次集成即可调用全套模型。
ChinaModelAPI 为独立中继平台,与阿里巴巴或 Qwen 团队无官方关联。路由的模型 ID 在上线前均经过实时验证——欢迎加入候补名单,以便在 Qwen3.8 路由上线时第一时间收到通知。
一手信息来源
- Qwen 官方博客 ——《Qwen3.8-Max:代码与协同工作的新标杆》(首个 Max 级开源权重发布)
- Hugging Face —— Qwen/Qwen3.8-2.4T-A95B 模型卡(基准测试、vLLM/SGLang 兼容性、托管版 Max 功能差异)
- Hugging Face —— Qwen/Qwen3.8-27B 模型卡(稠密 VLM、262K→1M 上下文、托管版“即将推出”)
- Hugging Face —— Qwen 组织主页(460 个模型;包含已上线的 FP8 变体)
- Simon Willison ——《Qwen 3.8 27B 表现优异,但默认设置存在过度思考问题》(2026 年 8 月 16 日)
- CNBC ——《阿里推出适配笔记本电脑的新模型,回应 Meta 的 AI 挑战》(2026 年 8 月 17 日;HF 上 151,448 个衍生模型数据)
- Artificial Analysis —— Qwen3.8-27B 页面,智能指数 52
- Hacker News —— Willison 评测讨论帖(798 点赞)
- eigent.ai —— Qwen3.8-Max 开源权重总结(定价 $2/$6/$0.25 参考 latent.space)
- codersera —— Qwen 代际指南(27B Apache 2.0 协议,取代 Qwen3.6-27B;2.4T 许可协议注意事项)
- kie.ai —— 27B 发布深度解析(阿里“超越 Qwen3.7-Plus”声明、HF 模型卡参数规格)
- 北京商报/东方财富 ——《大模型一周三更》(8 月 16 日;OpenRouter 前 10 名使用数据)
常见问题解答 (2026)
权重真的开源了吗?
是的——2.4T-A95B(+FP8)和 27B 均已上线 Qwen HF 组织。27B 采用 Apache 2.0 协议;据报道 2.4T 附带 Qwen 自定义许可条款,因此在进行商业化私有化部署前请仔细核对模型卡。
我自己可以运行 2.4T 吗?
个人工作站硬件无法运行——根据社区指南,FP8 检查点体积约 2.5TB。该版本主要面向专业推理平台;其他用户建议使用云端托管 API 或 27B 模型。
运行 27B 需要什么硬件配置?
需加载 17GB 的 Q4_K_M GGUF 文件;Willison 在 128GB 的 MacBook Pro (M5 Max) 和 DGX Spark 上实测速度为 15–30 tok/s,开启 draft-mtp 可提升 72%。建议调大默认上下文——默认的 8,192 光是推理思考过程就会被耗尽。
支持图像和视频输入吗?
支持——官方 27B 模型卡表明其具备对图像和视频的原生视觉语言理解能力,并支持灵活的思考控制。这在同级别尺寸的模型中十分罕见。
API 的价格是多少?
发布报道普遍显示 Qwen Cloud 上的 qwen3.8-max 定价为每 100 万 token $2 / $6 / $0.25(输入 / 输出 / 缓存)。在制定预算前,请以 Model Studio 实时页面为准。
托管版 27B 何时上线?
官方模型卡显示“即将推出”——默认支持 1M 上下文并提供内置工具。截至 2026 年 8 月 21 日,尚未公布具体日期与价格。
为什么会有关于“过度思考”的抱怨?
因为默认开启了 xhigh 思考强度:生成一个 SVG 就消耗了 22,276 个推理 token、耗时 21 分钟。Willison 的解决建议:先从 low(低强度)或无思考模式开始,仅在必要时逐步提高。
对比 Kimi K3 / GLM-5.3 如何?
K3 于 7 月 27 日开源了 2.8T 权重(修改版协议);Qwen3.8 是首个开源 Max 级检查点并附带 Apache 协议稠密兄弟模型的版本;GLM-5.3 权重预计将于 8 月 28 日左右发布。这三款模型均已收录在我们的 Model Watch 追踪中。