面向 API 开发者的中国 AI 模型前沿动态
按时间追踪中国前沿大模型迭代、权重开源、本地硬件配置及 OpenAI 兼容接入简报。以官方文档为准,第三方估算与测试均清晰标注。
Codex 恢复 5 小时用量限制,Claude Code 额度下调 25% —— 按量计费 API 的对比观察
在经历频繁重置的 8 月(8 月 8 日、13 日、21 日三次完整重置)后,OpenAI 于 8 月 25 日恢复了 Codex 的 5 小时限额;Anthropic 则自 9 月 14 日起下调 Claude Code 限额。本文梳理已核实的时间线、额度机制,以及为何按 Token 付费的国产大模型 API 完全不存在时间窗口限制。
GLM-5.3 开放权重如期而至:后训练扩展旗舰模型现已开放下载
zai-org/GLM-5.3 于 8 月 28 日晚正式上线——包含 141 个 safetensors 分片及 BF16 格式,无需审批直接下载,采用自定义 glm-5.3 许可证——如 8 月 14 日所承诺,结束了为期约两周的安全审查窗口。本文带来规格参数、许可证说明以及它在开源权重生态中所补齐的关键拼图。
Qwen3.8-Flash-Next:阿里提前推出 Qwen4 架构——今晚开源权重
魔搭社区(ModelScope)倒计时:开源多模态 MoE 今晚北京时间 23:00 登场——125B 主干 + 51B N-gram 嵌入,每个 Token 仅激活 6B,抢先体验 Qwen4 的 GDN 与 Qwen 稀疏注意力(Qwen Sparse Attention)机制。本文详解已确认与待确认信息、为何 6B 激活参数对本地部署至关重要,以及开源仓库发布时的核心看点。
用于本地 LLM 的 Mac mini M6 与 M5 Pro 对比:选 32GB 还是 64GB?
苹果 M6 拥有更新的加速器架构,但 M5 Pro 将内存上限翻倍并达到 307GB/s 带宽。这是一份去除营销炒作的选购指南,涵盖官方规格、苹果测试标注、Qwen3.8-27B 适配情况以及 M4 用户的升级决策。
用于本地 LLM 的 Mac Studio M5 Max 与 M5 Ultra 对比
128GB 的 M5 Max 是务实的工作站之选;256GB/512GB 的 M5 Ultra 则专为其他设备无法容纳的知名大模型而生。本文测算 DeepSeek V4、GLM-5、Qwen3.8 和 Kimi K3 的内存需求,并剖析苹果集群方案的实际局限。
Ox Alpha 身份揭晓:智谱确认其为 GLM-5.3-Flash——今晚正式发布并开源权重
悬念揭晓:智谱向彭博社证实,Ox Alpha 即为 GLM-5.3-Flash,将于今晚(8 月 26 日)正式发布并开源权重。据 SemiAnalysis 报道,其隐身测试期间每天 100T Token 的推理完全基于国产芯片运行;精准复刻了此前 Pony Alpha 的演进剧本。内附完整始末、技术溯源与解密详情。
OpenAI 投资的 Harvey 基于 Kimi K3 开源权重打造其首个模型
法律科技领军企业 Harvey(由 OpenAI、红杉资本、a16z 投资)发布了 Harvey Tenet——基于 Kimi K3 开源权重基座,并联合 Fireworks 进行后训练,专为长流程法律工作设计。在 Harvey LAB 评测中任务表现约为基座 K3 的 2 倍,且成本仅为开源级别;目前为研究预览阶段,尚未公开发布权重。这是迄今为止西方采用中国开源模型权重最明确的信号。
DeepSeek 取消周末高峰计费:周六 & 周日现为全天低谷
自北京时间 8 月 23 日 00:00 起,周末将全程按闲时费率计费——v4-pro 输出全天 ¥13.5/M,而工作日忙时为 ¥27。此时距离峰谷闲时计费机制上线还不足一周。内附完整周末价格表、调用排程测算及官方来源。
HappyHorse 1.1 走向全球:Model Studio 全量 API 上线、新增视频编辑、排名超越 Seedance
阿里在百炼平台(Model Studio)通过 API 全面开放 HappyHorse 1.1 能力——新增视频编辑模式、免费集成音频、上线前两周享 6 折优惠、OpenRouter 标价 $0.0988/秒(720p),并在全球视频竞技场中排名第二,超越 Seedance 与 Sora。内含支持平台、价格表及来源。
GLM-5.3 API 正式上线:$1.40/$4.40、延期一天与抢先布局的生态
智谱于 8 月 19 日凌晨全面开放 API 访问——虽比预期推迟一天,但定价与 GLM-5.2 持平,AA 指数达 60(并列开源第一)。本文梳理上线首周已核实时间线、与 Qwen3.8/K3/V4-Flash 的价格对比表、各平台接入情况(ZCode、PhanRouter、超算互联网),以及 8 月 28 日权重开源前的变动。
MiniMax Design:H3 视频大模型迎来专属 Agent 工作台
在开源 H3 三周后,MiniMax 推出了面向商业落地的应用层:一个具备 3D 导演舞台并支持连接 ComfyUI 的自然语言创作 Agent 工作台。这是一款产品而非 API——模型 Endpoint 仍是代码调用的途径。内附精简速报及来源。
Qwen3.8 开源权重(2026):2.4T Max 权重发布 + 适合笔记本运行的 Apache-2.0 27B 模型
阿里首次开源 Max 级别模型:Hugging Face 现已上线 Qwen3.8-2.4T-A95B(含 FP8 版本),以及采用 Apache 2.0 协议、仅需 17GB 文件即可运行的稠密视觉语言 27B 模型。内附时间线、开源协议细则、$2/$6 API 定价、Simon Willison 的本地运行配置方案及模型路由表。
Kling 3.0 API(2026):官方定价、Turbo 与 Omni,以及 30 亿美元独立分拆
快手 Kling 3.0 家族已上线官方国际版 API:官方标价 $0.084–$0.42/秒(原生 4K),Turbo 内置音频生成,Omni 增加视频输入支持,采用基于 JWT 的异步任务 API 架构。二季度财报:收入超 8.5 亿元(同比增 200%),用户超 1 亿,7 月完成约 30 亿美元融资、估值达约 180 亿美元。内附路由表及与 Seedance 的 10 秒视频成本测算对比。
DeepSeek-V4-Flash-Vision-Exp(2026):官方发布、定价与 API 快速入门
于 8 月 21 日晚(UTC+8)发布:实验性多模态视觉模型,延续 V4-Flash 定价(输入 $0.22/1M Token,单图最高 384 Token),文本能力与 V4-Flash 持平,多模态 Agent 表现接近 Opus-4.8,新增 Files API,并支持 Harness v0.1.1-rc.1。包含 curl/Python 快速入门指南、与 Claude/Gemini/Grok 视觉成本测算对比,以及 DeepSeek 各模型的路由选型建议。
DeepSeek Harness 新增多模态图像输入支持:rc.7 与 rc.8 版本
分两步推出:rc.7(8 月 17 日)在 MCP/ACP 中支持持久化图片附件;rc.8(8 月 19 日)为 DeepSeek 适配器引入原生图片请求,并为 /goal 和 /plan 支持图片输入。该 Harness 现已支持图片——但 V4-Pro/V4-Flash 仍为纯文本模型,rc.8 目前发布在 npm next 标签下。Turing Post 称该 Harness 为“第二个 DeepSeek 时刻”。
Gemini 3.7 Flash:Google 主打代码与 Agent 的主力模型
Google 于 8 月 13 日发布了 Gemini 3.7 Flash——1M 上下文,DeepSWE 达 65.3%,2026 年内尝鲜价每 100 万 Token 为 $0.75/$3.75。此文为海外前沿基准参考速记;ChinaModelAPI 暂不提供 Gemini 路由。
DeepSeek Harness v0.1:DeepSeek 正式开源其 Agent 运行框架
采用 MIT 协议、以“一切皆插件”为核心的 Agent 框架(dsh)于 8 月 13 日晚发布——海外媒体称其为开源版 Claude Code 的强劲对手。支持四种工作模式、可直接从 Claude Code 导入会话,并在 24 小时内涌现了 288 个插件。架构设计上天然适配各类模型。
GLM-5.3 正式发布:后训练 Scaling 突破、网络安全能力涌现、权重两周后开源
Z.ai 官方博客于 8 月 14 日宣布推出 GLM-5.3——沿用 GLM-5.2 同款基座,Terminal-Bench 3.0 从 4.6 跃升至 28.3,CyberGym 达 84.5%,发现 2,436 个真实安全漏洞。8 月 19 日更新:API 定价与 5.2 保持一致(每 100 万 Token 为 $1.40/$4.40),第三方 AA 指数达 60,权重预计 8 月 28 日左右开源;已获 VentureBeat / The Decoder / Interconnects 等外媒报道。
DeepSeek-V4-Pro-0813 官方发布:正式版 GA,带来更强 Agent 能力
DeepSeek 官方 API 文档于 2026-08-13(晚)将 deepseek-v4-pro 更新为 DeepSeek-V4-Pro-0813。模型 ID 保持不变,Agent 能力增强,价格微调。API 开发者需要做什么——几乎无需任何改动。
Grok 4.6:xAI 官方推荐新旗舰,现已上线 API
xAI 官方开发者文档现已将 grok-4.6 列为最新旗舰模型——支持 500k 上下文,每 100 万 Token 价格为 $2/$6,推荐用于编程场景。此文为海外前沿基准参考速记;ChinaModelAPI 暂不提供 Grok 路由。
国产大模型速递 —— 每周模型动态
截至 2026-08-09 由 ChinaModelAPI 追踪的国产 AI 旗舰模型每周快照,对照 GPT-5.6 Sol / Claude Opus 5 基准。专为 API 开发者提供的自动化状态简报。
MiniMax H3 开源权重:原生音视频多模态模型
H3(非 M3)是 MiniMax 推出的原生支持立体声音频的多模态视频模型。提供 HF 权重、ComfyUI 支持以及托管 API。虽非官方冠以“开源 Kling”之名,但在生成质量上常被拿来与 Seedance 比较。
Qwen3.8-Max:约 2.4T 旗舰模型——并非新款视频生成模型
2026 年 8 月发布的 Qwen 旗舰模型,专为编程与长流程任务打造。澄清传闻:并非 Qwen2.5-VL / Qwen2-VL-72B 那样的 Seedance 级别文本生成视频(T2V)发布。
Seedance 2.0 Mini / Fast 折扣观察:Mini 迎来约 4 折信号
2026 年 8 月市场速记:部分平台上 Mini 常有约 4 折优惠,Fast 约 7.5 折。此非 ChinaModelAPI 定价——请以各控制台为准。建议用 Mini 进行快速迭代,用 2.5 进行最终成片交付。
Seedance 2.5 能力解析:30 秒一镜到底、50 张参考图、已上线平台
官方发布及 2026 年 8 月上线进展:30 秒单次生成、约 50 张多模态参考图、更强大的编辑能力。创作者的使用场景以及 API 开发者的接入建议。
Seedance 2.5 状态(历史存档):7 月延期备忘
7 月下旬发布前的状态简报。已被 2026-07-31 的官方发布文章取代——仅作时间线背景留存。
面向 API 开发者的 DeepSeek-V4-Pro:全面取代 V3.2
DeepSeek-V4-Pro 与 V4-Flash 是 2026 年的双旗舰组合(1M 上下文,开源权重)。如何将兼容 OpenAI 的客户端从 V3 时代的模型 ID 平滑迁移。
Kimi K3 + GLM-5.2:2026 年开源前沿双子星
月之暗面 Kimi K3 与智谱 GLM-5.2 如何在长流程编程、1M 上下文及开源权重部署上优势互补——附兼容 OpenAI 的接入说明。
data/model-watch/;核实信源后发布。