ChinaModelAPI
Apple Silicon · ローカルAI · 2026-08-26

ローカルLLM向け Mac Studio M5 Max vs M5 Ultra

128GB搭載のM5 Maxは、実用的なハイエンドローカルLLMワークステーションです。256GBまたは512GBのM5 Ultraを購入するのは、128GBに収まらない特定のモデルや研究ワークフローがある場合に限られます。Ultraの真価はまずメモリ容量にあり、次いで1.2TB/sの帯域幅にあります。

M5 Studioに関する独立したベンチマークはまだありません

Appleは8月25日に新しいMac Studioを発表し、9月22日に出荷を開始します。512GBオプションは10月下旬に登場します。Appleの発表時の測定値は2026年7月に計測されたものです。本ページでは架空の生成速度ではなく、公式仕様とパラメータに基づくメモリ概算値を使用しています。

M5 Max vs M5 Ultraの仕様

特徴M5 Max Mac StudioM5 Ultra Mac Studio
CPU / GPU18コアCPU、32コアGPU(最大40)30コアCPU、64コアGPU(最大36/80)
ユニファイドメモリ36GB; 48GB, 64GB, or 128GB96GB; 256GB or 512GB
メモリ帯域幅460GB/s、40コアGPU構成では614GB/s1.2TB/s
Neural Engine16コアおよびGPU Neural Accelerators32コアおよびGPU Neural Accelerators
米国開始価格$2,499$5,499
発売時期9月22日9月22日(512GBは10月下旬)

出典: Apple公式技術仕様およびApple発表資料

モデル適合性:128GB、256GB、512GBで何が変わるか

メモリ構成実用的な役割現在の中国モデルの例
M5 Max 128GB70Bクラスの4ビットモデル、より大きなコンテキスト、複数サービスの同時運用十分な余裕を持つQwen3.8-27B(完全なV4 FlashやGLM-5には不足)
M5 Ultra 256GBランタイムがアーキテクチャをサポートしている場合、高効率フォーマットでの200B〜300BクラスDeepSeek V4 Flashは現実的なターゲット(まず混合FP4/FP8ビルドの検証が必要)
M5 Ultra 512GB超大規模な量子化MoEの研究、大規模キャッシュ/高並列ワークロードGLM-5の理想的な4ビット下限は372GB。GLM-5.3の重みは8月26日時点で未公開

それでも収まらないフロンティアモデルとは?

スパースMoEモデルはトークンごとにパラメータの一部のみをアクティブ化しますが、マシンは依然としてエキスパートの重み全体にアクセスできる必要があります。アクティブパラメータは計算量を見積もるものであり、ストレージ(メモリ容量)の見積もりではありません。

課金方式総パラメータ数理想的な4ビット最小容量単一の512GB M5 Ultraで可能か?
DeepSeek V4 Flash284B142GB(実際の混合精度ではさらに増加)対応ビルドであれば現実的
GLM-5744B372GB理論上可能だが極めてタイト
DeepSeek V4-Pro1.6T800GBNo
Qwen3.8 2.4T2.4T1.2TBNo
Kimi K32.8T1.4TBNo

4ビット最小容量は「パラメータ数 × 0.5バイト」で算出されます。これには量子化スケール、ランタイム状態、KVキャッシュ、一時バッファ、macOSの消費メモリは含まれません。

M5 MaxとM5 Ultraの選び方

M5 Max 128GBを選ぶべきケース
  • 27B〜70Bモデルを実行する場合。
  • より高速なローカルエージェントや大きなコンテキストを求める場合。
  • 単一の巨大なチェックポイントではなく、複数のローカルサービスを運用する場合。
  • 実用メモリあたりのコストパフォーマンスを最優先する場合。
M5 Ultra 256GB/512GBを選ぶべきケース
  • 128GBを超える特定のモデルファイルがある場合。
  • 使用するランタイムがすでにAppleシリコン上でそのアーキテクチャに対応している場合。
  • 同一モデルでのベンチマーク結果があり、許容可能なレイテンシ目標が明確な場合。
  • プライバシーやローカルデータの制約によりAPI推論が適さない場合。

LM Studioに関するAppleの主張:有用だが不完全

AppleはLM Studioにおいて、M5 Maxのプロンプト処理がM4 Max比で最大3.9倍、M5 UltraがM3 Ultra比で最大4倍高速であると発表しています。また、最上位のM5 Maxで614GB/s、M5 Ultraで1.2TB/sのメモリ帯域幅を実現していると報告しています。

  • これらの数値はAppleの社内テストによるものであり、独立したレビュアーによるものではありません。
  • プロンプトの読み込み(処理)は、出力トークン生成と同じ指標ではありません。
  • 公開情報には、汎用的なモデル、量子化、コンテキスト設定のレシピが示されていません。
  • 実際の性能は、MLX、llama.cpp、LM Studioなどの各ランタイムがハードウェアを適切に活用できるかに左右されます。

複数のMac Studioのクラスタリング

AppleはThunderbolt 5とRDMAによるマルチMacクラスタをサポートしており、同社のテストでは4台構成のクラスタで単一システムの最大3倍の推論性能に達したと述べています。ただし、これは2台のMacが自動的に1つの共有メモリコンピュータになることを意味するわけではありません。

分散推論には、ソフトウェア、ネットワーク、同期、障害管理のコストが加わります。大半の個人利用においては、クラスタを組むよりも1台の128GB M5 Maxまたは256GB M5 Ultraを選ぶほうがシンプルです。スケールアウトは、単一マシンで測定された容量やスループットの限界に達した後にのみ行うべきです。

クラスタ購入前の確認事項:使用するランタイムがそのモデルアーキテクチャの分散推論に対応しているか、重みがどのようにシャーディングされるか、ネットワーク経路がボトルネックにならないか、障害時にどう対処されるかを確認してください。独立した実装で再現されるまでは、Appleのクラスタ性能数値はあくまでベンダー公表値として扱ってください。

FAQ

ローカルLLMにはM5 MaxとM5 Ultraのどちらが適していますか?

128GBまではM5 Maxの方がコストパフォーマンスに優れています。Ultraを選ぶべきなのは、256GB/512GB、1.2TB/sの帯域幅、または検証済みの分散推論を必要とするワークロードがある場合のみです。

M5 UltraでDeepSeek V4を実行できますか?

V4 Flashであれば、サポートされている効率的なフォーマットで256GBまたは512GBに収まる可能性があります。V4-Proは、最も楽観的な4ビット重み下限でも約800GBとなるため、512GBのMac 1台には収まりません。

512GBのMac StudioでKimi K3を実行できますか?

いいえ。Kimi K3の2.8Tパラメータは、オーバーヘッドを除いた4ビット重みの下限だけでも約1.4TBを必要とします。

ローカルLLMに128GBは十分ですか?

70Bクラスの4ビットモデル、大規模コンテキスト、サービスの同時運用など、多くの本格的なシングルユーザー向けワークロードには十分です。ただし、最大級のフロンティアモデルのチェックポイントには不足します。

関連ガイド