Mac Studio M5 Max vs M5 Ultra pour les LLM locaux
Le M5 Max avec 128GB est la station de travail locale haut de gamme la plus judicieuse pour les LLM. N'achetez le M5 Ultra avec 256GB ou 512GB que pour un modèle précis ou un flux de recherche qui ne peut pas tenir dans 128GB. L'atout premier de l'Ultra est sa capacité mémoire, suivie de sa bande passante de 1.2TB/s.
Apple a annoncé le nouveau Mac Studio le 25 août et débutera les livraisons le 22 septembre. L'option 512GB arrivera fin octobre. Les mesures de lancement d'Apple ont été effectuées en juillet 2026. Cette page s'appuie sur les caractéristiques officielles et des estimations de mémoire basées sur les paramètres, et non sur des vitesses de génération inventées.
Spécifications du M5 Max vs M5 Ultra
| Caractéristique | Mac Studio M5 Max | Mac Studio M5 Ultra |
|---|---|---|
| CPU / GPU | CPU 18 cœurs ; GPU 32 cœurs, jusqu'à 40 | CPU 30 cœurs ; GPU 64 cœurs, jusqu'à 36/80 |
| Mémoire unifiée | 36GB; 48GB, 64GB, or 128GB | 96GB; 256GB or 512GB |
| Bande passante mémoire | 460GB/s ; 614GB/s avec GPU 40 cœurs | 1.2TB/s |
| Neural Engine | 16 cœurs avec accélérateurs neuronaux GPU | 32 cœurs avec accélérateurs neuronaux GPU |
| Prix de départ aux États-Unis | $2,499 | $5,499 |
| Disponibilité | 22 septembre | 22 septembre ; 512GB fin octobre |
Sources : Spécifications techniques d'Apple et annonce de lancement d'Apple.
Compatibilité des modèles : ce que changent 128GB, 256GB et 512GB
| Configuration mémoire | Usage concret | Exemples actuels de modèles chinois |
|---|---|---|
| M5 Max 128GB | Modèles 4-bit de classe 70B, contextes plus larges, services multiples | Qwen3.8-27B avec une marge confortable ; pas V4 Flash complet ni GLM-5 |
| M5 Ultra 256GB | Classe 200B-300B dans des formats optimisés, si le runtime prend en charge l'architecture | DeepSeek V4 Flash est une cible plausible ; validez d'abord sa version mixte FP4/FP8 |
| M5 Ultra 512GB | Recherche sur les très grands MoE quantifiés et charges de travail à gros cache/concurrence élevée | GLM-5 a un plancher théorique de 372GB en 4-bit ; les poids de GLM-5.3 n'étaient pas publics au 26 août |
Quels modèles de pointe ne rentrent toujours pas ?
Les modèles MoE clairsemés n'activent qu'une partie de leurs paramètres par token, mais la machine a toujours besoin d'accéder à l'ensemble complet des poids des experts. Les paramètres actifs mesurent le calcul, pas le stockage.
| Modèle | Paramètres totaux | Plancher théorique en 4-bit | Un seul M5 Ultra 512GB ? |
|---|---|---|---|
| DeepSeek V4 Flash | 284B | 142GB, la précision mixte réelle est supérieure | Plausible avec un build pris en charge |
| GLM-5 | 744B | 372GB | Théorique et très serré |
| DeepSeek V4-Pro | 1.6T | 800GB | No |
| Qwen3.8 2.4T | 2.4T | 1.2TB | No |
| Kimi K3 | 2.8T | 1.4TB | No |
Le plancher en 4-bit correspond aux paramètres × 0,5 octet. Il exclut les échelles de quantification, l'état du runtime, le cache KV, les tampons temporaires et macOS.
Comment choisir entre M5 Max et M5 Ultra
- Vous utilisez des modèles de 27B à 70B.
- Vous voulez des agents locaux plus rapides et des contextes plus larges.
- Vous avez besoin de plusieurs services locaux plutôt que d'un seul checkpoint géant.
- Vous recherchez le meilleur rapport coût/mémoire utile.
- Vous disposez d'un fichier de modèle précis qui dépasse 128GB.
- Votre runtime prend déjà en charge cette architecture sur Apple silicon.
- Vous avez un benchmark sur le même modèle et un objectif de latence acceptable.
- La confidentialité ou les données locales rendent l'inférence via API inadaptée.
Les affirmations d'Apple concernant LM Studio : utiles, mais incomplètes
Apple annonce un traitement des prompts sur M5 Max jusqu'à 3,9x plus rapide que sur M4 Max, et sur M5 Ultra jusqu'à 4x plus rapide que sur M3 Ultra dans LM Studio. La marque rapporte également une bande passante de 614GB/s pour le M5 Max haut de gamme et de 1.2TB/s pour le M5 Ultra.
- Ces chiffres proviennent des tests d'Apple, et non d'examinateurs indépendants.
- L'ingestion de prompts n'est pas la même métrique que la génération de tokens en sortie.
- La communication publique ne fournit pas de configuration universelle pour le modèle, la quantification et le contexte.
- Les résultats réels dépendent de la capacité de MLX, llama.cpp, LM Studio ou d'un autre runtime à exploiter correctement le matériel.
Mettre en cluster plusieurs systèmes Mac Studio
Apple indique que le Thunderbolt 5 et le RDMA prennent en charge les clusters multi-Mac, un cluster de quatre machines atteignant jusqu'à 3x les performances d'inférence d'un seul système dans les tests d'Apple. Cela ne signifie pas que deux Mac deviennent automatiquement un seul ordinateur à mémoire partagée.
L'inférence distribuée ajoute des coûts logiciels, de réseau, de synchronisation et de gestion des pannes. Pour la plupart des utilisateurs, un seul M5 Max 128GB ou un M5 Ultra 256GB est plus simple qu'un cluster. N'envisagez l'extension qu'après avoir atteint la limite mesurée de capacité ou de débit d'une machine.
FAQ
Le M5 Max ou le M5 Ultra est-il meilleur pour les LLM en local ?
Le M5 Max offre un meilleur rapport qualité-prix jusqu'à 128GB. Ne choisissez l'Ultra que pour une charge de travail nécessitant 256GB/512GB, une bande passante de 1.2TB/s ou une inférence distribuée validée.
Le M5 Ultra peut-il faire tourner DeepSeek V4 ?
V4 Flash peut tenir dans 256GB ou 512GB dans un format optimisé et pris en charge. V4-Pro ne rentre pas sur un seul Mac de 512GB car son plancher de poids théorique optimiste en 4-bit est d'environ 800GB.
Le Mac Studio 512GB peut-il faire tourner Kimi K3 ?
Non. Les 2.8T de paramètres de Kimi K3 impliquent un plancher de poids d'environ 1.4TB en 4-bit avant la surcharge système.
128GB sont-ils suffisants pour les LLM en local ?
Oui pour de nombreuses charges de travail exigeantes en mono-utilisateur, y compris les modèles 4-bit de classe 70B, des contextes plus larges et des services simultanés. Ce n'est pas suffisant pour les plus grands checkpoints de pointe.