Mac Studio M5 Max vs M5 Ultra para LLMs locais
O M5 Max com 128GB é a estação de trabalho de ponta mais sensata para LLMs locais. Compre o M5 Ultra com 256GB ou 512GB apenas para um modelo específico ou fluxo de trabalho de pesquisa que não caiba em 128GB. O valor do Ultra está primeiro na capacidade de memória e, em seguida, na largura de banda de 1.2TB/s.
A Apple anunciou o novo Mac Studio em 25 de agosto e inicia as entregas em 22 de setembro. A opção de 512GB chega no final de outubro. As métricas de lançamento da Apple foram medidas em julho de 2026. Esta página utiliza especificações oficiais e estimativas de memória baseadas em parâmetros, não velocidades de geração inventadas.
Especificações do M5 Max vs M5 Ultra
| Recurso | M5 Max Mac Studio | M5 Ultra Mac Studio |
|---|---|---|
| CPU / GPU | CPU de 18 núcleos; GPU de 32 núcleos, até 40 | CPU de 30 núcleos; GPU de 64 núcleos, até 36/80 |
| Memória unificada | 36GB; 48GB, 64GB, or 128GB | 96GB; 256GB or 512GB |
| Largura de banda de memória | 460GB/s; 614GB/s com GPU de 40 núcleos | 1.2TB/s |
| Neural Engine | 16 núcleos mais aceleradores neurais na GPU | 32 núcleos mais aceleradores neurais na GPU |
| Preço inicial nos EUA | $2,499 | $5,499 |
| Disponibilidade | 22 de setembro | 22 de setembro; 512GB no final de outubro |
Fontes: especificações técnicas da Apple e comunicado de lançamento da Apple.
Compatibilidade de modelos: o que 128GB, 256GB e 512GB mudam
| Nível de memória | Papel prático | Exemplos atuais de modelos chineses |
|---|---|---|
| M5 Max 128GB | Modelos de classe 70B em 4 bits, contexto maior, múltiplos serviços | Qwen3.8-27B com bastante folga; não o V4 Flash completo ou GLM-5 |
| M5 Ultra 256GB | Classe de 200B-300B em formatos eficientes, se o runtime suportar a arquitetura | DeepSeek V4 Flash é um alvo plausível; valide primeiro sua compilação mista em FP4/FP8 |
| M5 Ultra 512GB | Pesquisa com MoE quantizado de grande porte e cargas de trabalho com cache/concorrência elevados | O GLM-5 tem um piso idealizado de 372GB em 4 bits; os pesos do GLM-5.3 não eram públicos em 26 de agosto |
Quais modelos de ponta ainda não cabem?
Modelos MoE esparsos ativam apenas parte de seus parâmetros por token, mas a máquina ainda precisa de acesso ao conjunto completo de pesos dos especialistas. Parâmetros ativos estimam computação, não armazenamento.
| Modelo | Total de parâmetros | Piso idealizado em 4 bits | Um único M5 Ultra de 512GB? |
|---|---|---|---|
| DeepSeek V4 Flash | 284B | 142GB, a precisão mista real é maior | Plausível com uma compilação suportada |
| GLM-5 | 744B | 372GB | Teórico e apertado |
| DeepSeek V4-Pro | 1.6T | 800GB | No |
| Qwen3.8 2.4T | 2.4T | 1.2TB | No |
| Kimi K3 | 2.8T | 1.4TB | No |
O piso de 4 bits é calculado como parâmetros × 0.5 bytes. Isso exclui escalas de quantização, estado de runtime, cache KV, buffers temporários e o macOS.
Como escolher entre o M5 Max e o M5 Ultra
- Você executa modelos de 27B a 70B.
- Você deseja agentes locais mais rápidos e contextos maiores.
- Você precisa de vários serviços locais, e não de um único checkpoint gigante.
- Você busca a melhor relação custo-benefício em memória útil.
- Você tem um arquivo de modelo específico que ultrapassa 128GB.
- Seu runtime já oferece suporte a essa arquitetura no Apple silicon.
- Você possui um benchmark do mesmo modelo e uma meta aceitável de latência.
- Privacidade ou dados locais tornam a inferência via API inadequada.
Alegações da Apple sobre o LM Studio: úteis, mas incompletas
A Apple relata um processamento de prompts no LM Studio até 3.9x mais rápido no M5 Max do que no M4 Max, e até 4x mais rápido no M5 Ultra em comparação ao M3 Ultra. Ela também informa largura de banda de 614GB/s para o M5 Max topo de linha e 1.2TB/s para o M5 Ultra.
- Os dados são provenientes de testes da Apple, não de analistas independentes.
- O processamento de prompts não é a mesma métrica que a geração de tokens de saída.
- A divulgação pública não fornece uma receita universal de modelo, quantização e contexto.
- Os resultados reais dependem de o MLX, llama.cpp, LM Studio ou outro runtime utilizar o hardware corretamente.
Criação de clusters com múltiplos sistemas Mac Studio
A Apple afirma que o Thunderbolt 5 e o RDMA suportam clusters de múltiplos Macs, com um cluster de quatro sistemas alcançando até 3x o desempenho de inferência de um único sistema nos testes da Apple. Isso não significa que dois Macs se tornem automaticamente um computador com memória compartilhada.
A inferência distribuída acrescenta custos de software, rede, sincronização e gestão de falhas. Para a maioria dos usuários, um M5 Max de 128GB ou um M5 Ultra de 256GB é mais simples do que um cluster. Escale horizontalmente apenas depois que uma única máquina atingir um limite comprovado de capacidade ou taxa de transferência.
FAQ
O M5 Max ou o M5 Ultra é melhor para LLMs locais?
O M5 Max oferece melhor custo-benefício até 128GB. Escolha o Ultra apenas para cargas de trabalho que exijam 256GB/512GB, largura de banda de 1.2TB/s ou inferência distribuída validada.
O M5 Ultra consegue executar o DeepSeek V4?
O V4 Flash pode caber em 256GB ou 512GB em um formato eficiente e suportado. O V4-Pro não cabe em um único Mac de 512GB porque seu piso otimista de pesos em 4 bits é de cerca de 800GB.
O Mac Studio de 512GB consegue executar o Kimi K3?
Não. Os 2.8T de parâmetros do Kimi K3 implicam um piso de pesos em 4 bits de aproximadamente 1.4TB antes dos custos adicionais.
128GB são suficientes para LLMs locais?
Sim, para muitas cargas de trabalho sérias de usuário único, incluindo modelos de classe 70B em 4 bits, contextos maiores e serviços simultâneos. Não é suficiente para os maiores checkpoints de ponta.