用于本地 LLM 的 Mac Studio M5 Max 与 M5 Ultra 对比
配备 128GB 内存的 M5 Max 是明智的高端本地 LLM 工作站之选。仅在特定模型或研究工作流确实无法装入 128GB 时,才建议购买 256GB 或 512GB 的 M5 Ultra。Ultra 的核心价值首先在于内存容量,其次才是 1.2TB/s 的带宽。
Apple 于 8 月 25 日发布了新款 Mac Studio,并将于 9 月 22 日开始发货。512GB 版本将于 10 月下旬上市。Apple 的发布会数据测定于 2026 年 7 月。本页面采用官方规格与基于参数量的内存估算,绝不凭空捏造生成速度。
M5 Max 与 M5 Ultra 规格对比
| 功能特性 | M5 Max Mac Studio | M5 Ultra Mac Studio |
|---|---|---|
| CPU / GPU | 18 核 CPU;32 核 GPU,最高可选配 40 核 | 30 核 CPU;64 核 GPU,最高可选配 36/80 核 |
| 统一内存 | 36GB; 48GB, 64GB, or 128GB | 96GB; 256GB or 512GB |
| 内存带宽 | 460GB/s;搭配 40 核 GPU 时为 614GB/s | 1.2TB/s |
| 神经网络引擎 (Neural Engine) | 16 核外加 GPU 神经网络加速单元 | 32 核外加 GPU 神经网络加速单元 |
| 美国起售价 | $2,499 | $5,499 |
| 发售时间 | 9 月 22 日 | 9 月 22 日;512GB 版本将于 10 月下旬发售 |
来源:Apple 技术规格与 Apple 发布公告。
模型适配:128GB、256GB 与 512GB 带来的改变
| 内存档位 | 实际定位 | 当前国产模型实例 |
|---|---|---|
| M5 Max 128GB | 70B 级别 4-bit 模型、更长上下文、多服务并发 | 运行 Qwen3.8-27B 游刃有余;无法完整运行 V4 Flash 或 GLM-5 |
| M5 Ultra 256GB | 若运行时支持该架构,可运行高效格式的 200B-300B 级别模型 | DeepSeek V4 Flash 是可行的目标;建议先验证其混合 FP4/FP8 构建版本 |
| M5 Ultra 512GB | 超大尺寸量化 MoE 研究以及大缓存/高并发工作负载 | GLM-5 理想化的 4-bit 权重底线为 372GB;截至 8 月 26 日 GLM-5.3 权重尚未公开 |
哪些前沿模型仍然无法装入?
稀疏 MoE 模型每个 token 仅激活部分参数,但设备仍需完整加载专家权重。激活参数量衡量的是计算量,而非存储占用。
| 计费模式 | 总参数量 | 理想化 4-bit 内存底线 | 单台 512GB M5 Ultra? |
|---|---|---|---|
| DeepSeek V4 Flash | 284B | 142GB,实际混合精度占用更高 | 在受支持的构建版本下可行 |
| GLM-5 | 744B | 372GB | 理论可行但空间极其紧张 |
| DeepSeek V4-Pro | 1.6T | 800GB | No |
| Qwen3.8 2.4T | 2.4T | 1.2TB | No |
| Kimi K3 | 2.8T | 1.4TB | No |
4-bit 内存底线计算公式为:参数量 × 0.5 字节。该数值尚未包含量化缩放因子、运行时状态、KV 缓存、临时缓冲区以及 macOS 系统占用。
如何在 M5 Max 与 M5 Ultra 之间做出选择
- 主要运行 27B 至 70B 级别的模型。
- 需要更快的本地 Agent 响应速度和更大的上下文窗口。
- 需要同时运行多个本地服务,而非单个超大 Checkpoint。
- 追求最佳的性价比与可用内存比。
- 明确需要运行体积超过 128GB 的具体模型文件。
- 所使用的运行时已在 Apple silicon 上支持该模型架构。
- 已具备同模型的基准测试数据,且延迟目标在可接受范围内。
- 出于隐私或本地数据安全考量,不适合使用 API 推理。
Apple 关于 LM Studio 的宣传:有参考价值,但并不全面
Apple 宣称在 LM Studio 中,M5 Max 的 Prompt 处理速度最高比 M4 Max 快 3.9 倍,M5 Ultra 最高比 M3 Ultra 快 4 倍;同时顶配 M5 Max 带宽达 614GB/s,M5 Ultra 达 1.2TB/s。
- 这些数据来自 Apple 官方测试,而非独立评测机构。
- Prompt 吞吐速度(输入处理)与输出 Token 生成速度并不是同一指标。
- 公开发布的内容并未提供通用的模型、量化与上下文配置方案。
- 实际表现取决于 MLX、llama.cpp、LM Studio 或其他运行时是否正确调用了硬件。
多台 Mac Studio 组建集群
Apple 表示雷雳 5 (Thunderbolt 5) 和 RDMA 支持多台 Mac 组建集群,在 Apple 的测试中,四机集群的推理性能最高可达单机的 3 倍。但这并不意味着两台 Mac 会自动合并为一台共享内存的计算机。
分布式推理会增加软件、网络、同步以及故障处理等多方面的成本。对绝大多数个人而言,单台 128GB M5 Max 或 256GB M5 Ultra 都比集群更省心。建议仅在单机出现实测容量或吞吐量瓶颈后再考虑扩展。
FAQ
本地运行 LLM,选 M5 Max 还是 M5 Ultra 更好?
在 128GB 及以内,M5 Max 的性价比更高。仅在工作负载需要 256GB/512GB 内存、1.2TB/s 带宽或经过验证的分布式推理时,才选择 Ultra。
M5 Ultra 能运行 DeepSeek V4 吗?
在受支持的高效格式下,V4 Flash 可以装入 256GB 或 512GB 内存。单台 512GB 的 Mac 无法运行 V4-Pro,因为其乐观估算的 4-bit 权重底线就达到约 800GB。
512GB 的 Mac Studio 能运行 Kimi K3 吗?
不能。Kimi K3 的 2.8T 参数意味着在不计额外开销前,其 4-bit 权重底线就约为 1.4TB。
128GB 内存对本地 LLM 够用吗?
对于许多严肃的单用户工作负载完全够用,包括 70B 级别 4-bit 模型、更长上下文和并发服务;但对于体量最大的前沿 Checkpoint 则不够用。