ChinaModelAPI
Apple Silicon · IA locale · 2026-08-26

Mac Studio M5 Max vs M5 Ultra pour les LLM locaux

Le M5 Max avec 128GB est la station de travail locale haut de gamme la plus judicieuse pour les LLM. N'achetez le M5 Ultra avec 256GB ou 512GB que pour un modèle précis ou un flux de recherche qui ne peut pas tenir dans 128GB. L'atout premier de l'Ultra est sa capacité mémoire, suivie de sa bande passante de 1.2TB/s.

Pas encore de benchmarks indépendants pour le M5 Studio

Apple a annoncé le nouveau Mac Studio le 25 août et débutera les livraisons le 22 septembre. L'option 512GB arrivera fin octobre. Les mesures de lancement d'Apple ont été effectuées en juillet 2026. Cette page s'appuie sur les caractéristiques officielles et des estimations de mémoire basées sur les paramètres, et non sur des vitesses de génération inventées.

Spécifications du M5 Max vs M5 Ultra

CaractéristiqueMac Studio M5 MaxMac Studio M5 Ultra
CPU / GPUCPU 18 cœurs ; GPU 32 cœurs, jusqu'à 40CPU 30 cœurs ; GPU 64 cœurs, jusqu'à 36/80
Mémoire unifiée36GB; 48GB, 64GB, or 128GB96GB; 256GB or 512GB
Bande passante mémoire460GB/s ; 614GB/s avec GPU 40 cœurs1.2TB/s
Neural Engine16 cœurs avec accélérateurs neuronaux GPU32 cœurs avec accélérateurs neuronaux GPU
Prix de départ aux États-Unis$2,499$5,499
Disponibilité22 septembre22 septembre ; 512GB fin octobre

Sources : Spécifications techniques d'Apple et annonce de lancement d'Apple.

Compatibilité des modèles : ce que changent 128GB, 256GB et 512GB

Configuration mémoireUsage concretExemples actuels de modèles chinois
M5 Max 128GBModèles 4-bit de classe 70B, contextes plus larges, services multiplesQwen3.8-27B avec une marge confortable ; pas V4 Flash complet ni GLM-5
M5 Ultra 256GBClasse 200B-300B dans des formats optimisés, si le runtime prend en charge l'architectureDeepSeek V4 Flash est une cible plausible ; validez d'abord sa version mixte FP4/FP8
M5 Ultra 512GBRecherche sur les très grands MoE quantifiés et charges de travail à gros cache/concurrence élevéeGLM-5 a un plancher théorique de 372GB en 4-bit ; les poids de GLM-5.3 n'étaient pas publics au 26 août

Quels modèles de pointe ne rentrent toujours pas ?

Les modèles MoE clairsemés n'activent qu'une partie de leurs paramètres par token, mais la machine a toujours besoin d'accéder à l'ensemble complet des poids des experts. Les paramètres actifs mesurent le calcul, pas le stockage.

ModèleParamètres totauxPlancher théorique en 4-bitUn seul M5 Ultra 512GB ?
DeepSeek V4 Flash284B142GB, la précision mixte réelle est supérieurePlausible avec un build pris en charge
GLM-5744B372GBThéorique et très serré
DeepSeek V4-Pro1.6T800GBNo
Qwen3.8 2.4T2.4T1.2TBNo
Kimi K32.8T1.4TBNo

Le plancher en 4-bit correspond aux paramètres × 0,5 octet. Il exclut les échelles de quantification, l'état du runtime, le cache KV, les tampons temporaires et macOS.

Comment choisir entre M5 Max et M5 Ultra

Choisissez le M5 Max 128GB si
  • Vous utilisez des modèles de 27B à 70B.
  • Vous voulez des agents locaux plus rapides et des contextes plus larges.
  • Vous avez besoin de plusieurs services locaux plutôt que d'un seul checkpoint géant.
  • Vous recherchez le meilleur rapport coût/mémoire utile.
Choisissez le M5 Ultra 256GB/512GB si
  • Vous disposez d'un fichier de modèle précis qui dépasse 128GB.
  • Votre runtime prend déjà en charge cette architecture sur Apple silicon.
  • Vous avez un benchmark sur le même modèle et un objectif de latence acceptable.
  • La confidentialité ou les données locales rendent l'inférence via API inadaptée.

Les affirmations d'Apple concernant LM Studio : utiles, mais incomplètes

Apple annonce un traitement des prompts sur M5 Max jusqu'à 3,9x plus rapide que sur M4 Max, et sur M5 Ultra jusqu'à 4x plus rapide que sur M3 Ultra dans LM Studio. La marque rapporte également une bande passante de 614GB/s pour le M5 Max haut de gamme et de 1.2TB/s pour le M5 Ultra.

  • Ces chiffres proviennent des tests d'Apple, et non d'examinateurs indépendants.
  • L'ingestion de prompts n'est pas la même métrique que la génération de tokens en sortie.
  • La communication publique ne fournit pas de configuration universelle pour le modèle, la quantification et le contexte.
  • Les résultats réels dépendent de la capacité de MLX, llama.cpp, LM Studio ou d'un autre runtime à exploiter correctement le matériel.

Mettre en cluster plusieurs systèmes Mac Studio

Apple indique que le Thunderbolt 5 et le RDMA prennent en charge les clusters multi-Mac, un cluster de quatre machines atteignant jusqu'à 3x les performances d'inférence d'un seul système dans les tests d'Apple. Cela ne signifie pas que deux Mac deviennent automatiquement un seul ordinateur à mémoire partagée.

L'inférence distribuée ajoute des coûts logiciels, de réseau, de synchronisation et de gestion des pannes. Pour la plupart des utilisateurs, un seul M5 Max 128GB ou un M5 Ultra 256GB est plus simple qu'un cluster. N'envisagez l'extension qu'après avoir atteint la limite mesurée de capacité ou de débit d'une machine.

Avant d'acheter un cluster : vérifiez que le runtime exact prend en charge l'inférence distribuée pour l'architecture du modèle, la manière dont les poids sont partitionnés, si la liaison réseau constitue le goulot d'étranglement et comment les pannes sont gérées. Considérez les chiffres de cluster d'Apple comme des résultats constructeur jusqu'à ce que des implémentations indépendantes les reproduisent.

FAQ

Le M5 Max ou le M5 Ultra est-il meilleur pour les LLM en local ?

Le M5 Max offre un meilleur rapport qualité-prix jusqu'à 128GB. Ne choisissez l'Ultra que pour une charge de travail nécessitant 256GB/512GB, une bande passante de 1.2TB/s ou une inférence distribuée validée.

Le M5 Ultra peut-il faire tourner DeepSeek V4 ?

V4 Flash peut tenir dans 256GB ou 512GB dans un format optimisé et pris en charge. V4-Pro ne rentre pas sur un seul Mac de 512GB car son plancher de poids théorique optimiste en 4-bit est d'environ 800GB.

Le Mac Studio 512GB peut-il faire tourner Kimi K3 ?

Non. Les 2.8T de paramètres de Kimi K3 impliquent un plancher de poids d'environ 1.4TB en 4-bit avant la surcharge système.

128GB sont-ils suffisants pour les LLM en local ?

Oui pour de nombreuses charges de travail exigeantes en mono-utilisateur, y compris les modèles 4-bit de classe 70B, des contextes plus larges et des services simultanés. Ce n'est pas suffisant pour les plus grands checkpoints de pointe.

Guides connexes