ChinaModelAPI
Apple Silicon · 本地 AI · 2026-08-26

用于本地 LLM 的 Mac Studio M5 Max 与 M5 Ultra 对比

配备 128GB 内存的 M5 Max 是明智的高端本地 LLM 工作站之选。仅在特定模型或研究工作流确实无法装入 128GB 时,才建议购买 256GB 或 512GB 的 M5 Ultra。Ultra 的核心价值首先在于内存容量,其次才是 1.2TB/s 的带宽。

目前尚无独立的 M5 Studio 基准测试

Apple 于 8 月 25 日发布了新款 Mac Studio,并将于 9 月 22 日开始发货。512GB 版本将于 10 月下旬上市。Apple 的发布会数据测定于 2026 年 7 月。本页面采用官方规格与基于参数量的内存估算,绝不凭空捏造生成速度。

M5 Max 与 M5 Ultra 规格对比

功能特性M5 Max Mac StudioM5 Ultra Mac Studio
CPU / GPU18 核 CPU;32 核 GPU,最高可选配 40 核30 核 CPU;64 核 GPU,最高可选配 36/80 核
统一内存36GB; 48GB, 64GB, or 128GB96GB; 256GB or 512GB
内存带宽460GB/s;搭配 40 核 GPU 时为 614GB/s1.2TB/s
神经网络引擎 (Neural Engine)16 核外加 GPU 神经网络加速单元32 核外加 GPU 神经网络加速单元
美国起售价$2,499$5,499
发售时间9 月 22 日9 月 22 日;512GB 版本将于 10 月下旬发售

来源:Apple 技术规格Apple 发布公告

模型适配:128GB、256GB 与 512GB 带来的改变

内存档位实际定位当前国产模型实例
M5 Max 128GB70B 级别 4-bit 模型、更长上下文、多服务并发运行 Qwen3.8-27B 游刃有余;无法完整运行 V4 Flash 或 GLM-5
M5 Ultra 256GB若运行时支持该架构,可运行高效格式的 200B-300B 级别模型DeepSeek V4 Flash 是可行的目标;建议先验证其混合 FP4/FP8 构建版本
M5 Ultra 512GB超大尺寸量化 MoE 研究以及大缓存/高并发工作负载GLM-5 理想化的 4-bit 权重底线为 372GB;截至 8 月 26 日 GLM-5.3 权重尚未公开

哪些前沿模型仍然无法装入?

稀疏 MoE 模型每个 token 仅激活部分参数,但设备仍需完整加载专家权重。激活参数量衡量的是计算量,而非存储占用。

计费模式总参数量理想化 4-bit 内存底线单台 512GB M5 Ultra?
DeepSeek V4 Flash284B142GB,实际混合精度占用更高在受支持的构建版本下可行
GLM-5744B372GB理论可行但空间极其紧张
DeepSeek V4-Pro1.6T800GBNo
Qwen3.8 2.4T2.4T1.2TBNo
Kimi K32.8T1.4TBNo

4-bit 内存底线计算公式为:参数量 × 0.5 字节。该数值尚未包含量化缩放因子、运行时状态、KV 缓存、临时缓冲区以及 macOS 系统占用。

如何在 M5 Max 与 M5 Ultra 之间做出选择

在以下情况下选择 M5 Max 128GB
  • 主要运行 27B 至 70B 级别的模型。
  • 需要更快的本地 Agent 响应速度和更大的上下文窗口。
  • 需要同时运行多个本地服务,而非单个超大 Checkpoint。
  • 追求最佳的性价比与可用内存比。
在以下情况下选择 M5 Ultra 256GB/512GB
  • 明确需要运行体积超过 128GB 的具体模型文件。
  • 所使用的运行时已在 Apple silicon 上支持该模型架构。
  • 已具备同模型的基准测试数据,且延迟目标在可接受范围内。
  • 出于隐私或本地数据安全考量,不适合使用 API 推理。

Apple 关于 LM Studio 的宣传:有参考价值,但并不全面

Apple 宣称在 LM Studio 中,M5 Max 的 Prompt 处理速度最高比 M4 Max 快 3.9 倍,M5 Ultra 最高比 M3 Ultra 快 4 倍;同时顶配 M5 Max 带宽达 614GB/s,M5 Ultra 达 1.2TB/s。

  • 这些数据来自 Apple 官方测试,而非独立评测机构。
  • Prompt 吞吐速度(输入处理)与输出 Token 生成速度并不是同一指标。
  • 公开发布的内容并未提供通用的模型、量化与上下文配置方案。
  • 实际表现取决于 MLX、llama.cpp、LM Studio 或其他运行时是否正确调用了硬件。

多台 Mac Studio 组建集群

Apple 表示雷雳 5 (Thunderbolt 5) 和 RDMA 支持多台 Mac 组建集群,在 Apple 的测试中,四机集群的推理性能最高可达单机的 3 倍。但这并不意味着两台 Mac 会自动合并为一台共享内存的计算机。

分布式推理会增加软件、网络、同步以及故障处理等多方面的成本。对绝大多数个人而言,单台 128GB M5 Max 或 256GB M5 Ultra 都比集群更省心。建议仅在单机出现实测容量或吞吐量瓶颈后再考虑扩展。

在采购集群前:请确认具体运行时是否支持该模型架构的分布式推理、权重如何分片、网络传输是否会成为瓶颈,以及如何处理节点故障。在独立实现复现之前,请将 Apple 的集群数据视为厂商自测结果。

FAQ

本地运行 LLM,选 M5 Max 还是 M5 Ultra 更好?

在 128GB 及以内,M5 Max 的性价比更高。仅在工作负载需要 256GB/512GB 内存、1.2TB/s 带宽或经过验证的分布式推理时,才选择 Ultra。

M5 Ultra 能运行 DeepSeek V4 吗?

在受支持的高效格式下,V4 Flash 可以装入 256GB 或 512GB 内存。单台 512GB 的 Mac 无法运行 V4-Pro,因为其乐观估算的 4-bit 权重底线就达到约 800GB。

512GB 的 Mac Studio 能运行 Kimi K3 吗?

不能。Kimi K3 的 2.8T 参数意味着在不计额外开销前,其 4-bit 权重底线就约为 1.4TB。

128GB 内存对本地 LLM 够用吗?

对于许多严肃的单用户工作负载完全够用,包括 70B 级别 4-bit 模型、更长上下文和并发服务;但对于体量最大的前沿 Checkpoint 则不够用。

相关指南