Mac Studio M5 Max vs M5 Ultra per LLM locali
M5 Max con 128GB è la workstation di fascia alta più sensata per LLM locali. Acquista M5 Ultra con 256GB o 512GB solo per uno specifico modello o flusso di lavoro di ricerca che non può entrare in 128GB. Il valore di Ultra risiede prima di tutto nella capacità di memoria, e secondariamente nella larghezza di banda da 1.2TB/s.
Apple ha annunciato il nuovo Mac Studio il 25 agosto e inizierà le consegne il 22 settembre. L'opzione da 512GB arriverà a fine ottobre. Le metriche di lancio di Apple sono state misurate a luglio 2026. Questa pagina utilizza le specifiche ufficiali e le stime di memoria basate sui parametri, non velocità di generazione inventate.
Specifiche di M5 Max vs M5 Ultra
| Caratteristica | Mac Studio M5 Max | Mac Studio M5 Ultra |
|---|---|---|
| CPU / GPU | CPU 18-core; GPU 32-core, fino a 40 | CPU 30-core; GPU 64-core, fino a 36/80 |
| Memoria unificata | 36GB; 48GB, 64GB, or 128GB | 96GB; 256GB or 512GB |
| Larghezza di banda della memoria | 460GB/s; 614GB/s con GPU 40-core | 1.2TB/s |
| Neural Engine | 16-core più acceleratori neurali della GPU | 32-core più acceleratori neurali della GPU |
| Prezzo di partenza USA | $2,499 | $5,499 |
| Disponibilità | 22 settembre | 22 settembre; 512GB a fine ottobre |
Fonti: specifiche tecniche Apple e annuncio di lancio Apple.
Compatibilità dei modelli: cosa cambia tra 128GB, 256GB e 512GB
| Taglio di memoria | Ruolo pratico | Esempi attuali di modelli cinesi |
|---|---|---|
| M5 Max 128GB | Modelli a 4-bit di classe 70B, contesti più ampi, servizi multipli | Qwen3.8-27B con ampio margine; non V4 Flash completo o GLM-5 |
| M5 Ultra 256GB | Classe 200B-300B in formati efficienti, se il runtime supporta l'architettura | DeepSeek V4 Flash è un obiettivo plausibile; verificare prima la build mista FP4/FP8 |
| M5 Ultra 512GB | Ricerca su modelli MoE quantizzati molto grandi e carichi di lavoro con cache estesa o elevata concorrenza | GLM-5 ha una soglia minima teorica a 4-bit di 372GB; i pesi di GLM-5.3 non erano pubblici al 26 agosto |
Quali modelli di frontiera non entrano ancora?
I modelli MoE sparsi attivano solo una parte dei loro parametri per token, ma la macchina deve comunque avere accesso all'intero set di pesi degli esperti. I parametri attivi stimano il calcolo, non lo spazio di memoria occupato.
| Modello | Parametri totali | Soglia minima teorica a 4-bit | Singolo M5 Ultra da 512GB? |
|---|---|---|---|
| DeepSeek V4 Flash | 284B | 142GB, la precisione mista effettiva è superiore | Plausibile con una build supportata |
| GLM-5 | 744B | 372GB | Teorico e al limite |
| DeepSeek V4-Pro | 1.6T | 800GB | No |
| Qwen3.8 2.4T | 2.4T | 1.2TB | No |
| Kimi K3 | 2.8T | 1.4TB | No |
La soglia a 4-bit è calcolata come parametri × 0.5 byte. Esclude i fattori di scala della quantizzazione, lo stato del runtime, la cache KV, i buffer temporanei e macOS.
Come scegliere tra M5 Max e M5 Ultra
- Esegui modelli da 27B-70B.
- Vuoi agenti locali più veloci e finestre di contesto più ampie.
- Hai bisogno di più servizi locali, non di un unico checkpoint gigante.
- Cerchi il miglior rapporto costo/memoria utilizzabile.
- Hai uno specifico file di modello che supera i 128GB.
- Il tuo runtime supporta già quell'architettura su Apple silicon.
- Disponi di un benchmark sullo stesso modello e di un obiettivo di latenza accettabile.
- La privacy o i dati locali rendono inadeguata l'inferenza tramite API.
I dati dichiarati da Apple per LM Studio: utili, ma incompleti
Apple dichiara per M5 Max un'elaborazione dei prompt fino a 3.9 volte più veloce rispetto a M4 Max e per M5 Ultra fino a 4 volte più veloce rispetto a M3 Ultra in LM Studio. Dichiara inoltre 614GB/s di larghezza di banda per il modello M5 Max di punta e 1.2TB/s per M5 Ultra.
- I dati provengono dai test di Apple, non da recensori indipendenti.
- L'ingestione del prompt non è la stessa metrica della generazione dei token di output.
- La release pubblica non fornisce una combinazione universale per modello, quantizzazione e contesto.
- I risultati reali dipendono da come MLX, llama.cpp, LM Studio o altri runtime sfruttano l'hardware.
Cluster con più sistemi Mac Studio
Apple afferma che Thunderbolt 5 e RDMA supportano cluster multi-Mac, con un cluster di quattro sistemi che raggiunge fino a 3 volte le prestazioni di inferenza di un singolo sistema nei test Apple. Questo non significa che due Mac diventino automaticamente un unico computer a memoria condivisa.
L'inferenza distribuita introduce costi legati a software, rete, sincronizzazione e gestione degli errori. Per la maggior parte degli utenti, un singolo M5 Max da 128GB o un M5 Ultra da 256GB è più semplice di un cluster. Scala orizzontalmente solo dopo che una singola macchina ha raggiunto un limite effettivo di capacità o throughput.
FAQ
È meglio M5 Max o M5 Ultra per i LLM locali?
M5 Max offre un miglior rapporto qualità-prezzo fino a 128GB. Scegli Ultra solo per carichi di lavoro che richiedono 256GB/512GB, 1.2TB/s di banda o un'inferenza distribuita convalidata.
M5 Ultra può eseguire DeepSeek V4?
V4 Flash potrebbe entrare in 256GB o 512GB in un formato efficiente e supportato. V4-Pro non entra in un singolo Mac da 512GB perché la sua soglia teorica ottimistica per i pesi a 4-bit è di circa 800GB.
Il Mac Studio da 512GB può eseguire Kimi K3?
No. I 2.8T parametri di Kimi K3 implicano una soglia minima teorica per i pesi a 4-bit di circa 1.4TB prima dell'overhead.
128GB sono sufficienti per i LLM locali?
Sì per molti carichi di lavoro impegnativi per singolo utente, inclusi modelli a 4-bit di classe 70B, finestre di contesto più ampie e servizi concorrenti. Non sono sufficienti per i checkpoint di frontiera più grandi.