ChinaModelAPI
Apple Silicon · IA Local · 2026-08-26

Mac Studio M5 Max vs M5 Ultra para LLMs locais

O M5 Max com 128GB é a estação de trabalho de ponta mais sensata para LLMs locais. Compre o M5 Ultra com 256GB ou 512GB apenas para um modelo específico ou fluxo de trabalho de pesquisa que não caiba em 128GB. O valor do Ultra está primeiro na capacidade de memória e, em seguida, na largura de banda de 1.2TB/s.

Ainda não há benchmarks independentes do M5 Studio

A Apple anunciou o novo Mac Studio em 25 de agosto e inicia as entregas em 22 de setembro. A opção de 512GB chega no final de outubro. As métricas de lançamento da Apple foram medidas em julho de 2026. Esta página utiliza especificações oficiais e estimativas de memória baseadas em parâmetros, não velocidades de geração inventadas.

Especificações do M5 Max vs M5 Ultra

RecursoM5 Max Mac StudioM5 Ultra Mac Studio
CPU / GPUCPU de 18 núcleos; GPU de 32 núcleos, até 40CPU de 30 núcleos; GPU de 64 núcleos, até 36/80
Memória unificada36GB; 48GB, 64GB, or 128GB96GB; 256GB or 512GB
Largura de banda de memória460GB/s; 614GB/s com GPU de 40 núcleos1.2TB/s
Neural Engine16 núcleos mais aceleradores neurais na GPU32 núcleos mais aceleradores neurais na GPU
Preço inicial nos EUA$2,499$5,499
Disponibilidade22 de setembro22 de setembro; 512GB no final de outubro

Fontes: especificações técnicas da Apple e comunicado de lançamento da Apple.

Compatibilidade de modelos: o que 128GB, 256GB e 512GB mudam

Nível de memóriaPapel práticoExemplos atuais de modelos chineses
M5 Max 128GBModelos de classe 70B em 4 bits, contexto maior, múltiplos serviçosQwen3.8-27B com bastante folga; não o V4 Flash completo ou GLM-5
M5 Ultra 256GBClasse de 200B-300B em formatos eficientes, se o runtime suportar a arquiteturaDeepSeek V4 Flash é um alvo plausível; valide primeiro sua compilação mista em FP4/FP8
M5 Ultra 512GBPesquisa com MoE quantizado de grande porte e cargas de trabalho com cache/concorrência elevadosO GLM-5 tem um piso idealizado de 372GB em 4 bits; os pesos do GLM-5.3 não eram públicos em 26 de agosto

Quais modelos de ponta ainda não cabem?

Modelos MoE esparsos ativam apenas parte de seus parâmetros por token, mas a máquina ainda precisa de acesso ao conjunto completo de pesos dos especialistas. Parâmetros ativos estimam computação, não armazenamento.

ModeloTotal de parâmetrosPiso idealizado em 4 bitsUm único M5 Ultra de 512GB?
DeepSeek V4 Flash284B142GB, a precisão mista real é maiorPlausível com uma compilação suportada
GLM-5744B372GBTeórico e apertado
DeepSeek V4-Pro1.6T800GBNo
Qwen3.8 2.4T2.4T1.2TBNo
Kimi K32.8T1.4TBNo

O piso de 4 bits é calculado como parâmetros × 0.5 bytes. Isso exclui escalas de quantização, estado de runtime, cache KV, buffers temporários e o macOS.

Como escolher entre o M5 Max e o M5 Ultra

Escolha o M5 Max de 128GB quando
  • Você executa modelos de 27B a 70B.
  • Você deseja agentes locais mais rápidos e contextos maiores.
  • Você precisa de vários serviços locais, e não de um único checkpoint gigante.
  • Você busca a melhor relação custo-benefício em memória útil.
Escolha o M5 Ultra de 256GB/512GB quando
  • Você tem um arquivo de modelo específico que ultrapassa 128GB.
  • Seu runtime já oferece suporte a essa arquitetura no Apple silicon.
  • Você possui um benchmark do mesmo modelo e uma meta aceitável de latência.
  • Privacidade ou dados locais tornam a inferência via API inadequada.

Alegações da Apple sobre o LM Studio: úteis, mas incompletas

A Apple relata um processamento de prompts no LM Studio até 3.9x mais rápido no M5 Max do que no M4 Max, e até 4x mais rápido no M5 Ultra em comparação ao M3 Ultra. Ela também informa largura de banda de 614GB/s para o M5 Max topo de linha e 1.2TB/s para o M5 Ultra.

  • Os dados são provenientes de testes da Apple, não de analistas independentes.
  • O processamento de prompts não é a mesma métrica que a geração de tokens de saída.
  • A divulgação pública não fornece uma receita universal de modelo, quantização e contexto.
  • Os resultados reais dependem de o MLX, llama.cpp, LM Studio ou outro runtime utilizar o hardware corretamente.

Criação de clusters com múltiplos sistemas Mac Studio

A Apple afirma que o Thunderbolt 5 e o RDMA suportam clusters de múltiplos Macs, com um cluster de quatro sistemas alcançando até 3x o desempenho de inferência de um único sistema nos testes da Apple. Isso não significa que dois Macs se tornem automaticamente um computador com memória compartilhada.

A inferência distribuída acrescenta custos de software, rede, sincronização e gestão de falhas. Para a maioria dos usuários, um M5 Max de 128GB ou um M5 Ultra de 256GB é mais simples do que um cluster. Escale horizontalmente apenas depois que uma única máquina atingir um limite comprovado de capacidade ou taxa de transferência.

Antes de comprar um cluster: confirme se o runtime específico suporta inferência distribuída para a arquitetura do modelo, como os pesos são particionados, se a conexão de rede é o gargalo e como as falhas são tratadas. Considere os números de cluster da Apple como resultados do fabricante até que implementações independentes os reproduzam.

FAQ

O M5 Max ou o M5 Ultra é melhor para LLMs locais?

O M5 Max oferece melhor custo-benefício até 128GB. Escolha o Ultra apenas para cargas de trabalho que exijam 256GB/512GB, largura de banda de 1.2TB/s ou inferência distribuída validada.

O M5 Ultra consegue executar o DeepSeek V4?

O V4 Flash pode caber em 256GB ou 512GB em um formato eficiente e suportado. O V4-Pro não cabe em um único Mac de 512GB porque seu piso otimista de pesos em 4 bits é de cerca de 800GB.

O Mac Studio de 512GB consegue executar o Kimi K3?

Não. Os 2.8T de parâmetros do Kimi K3 implicam um piso de pesos em 4 bits de aproximadamente 1.4TB antes dos custos adicionais.

128GB são suficientes para LLMs locais?

Sim, para muitas cargas de trabalho sérias de usuário único, incluindo modelos de classe 70B em 4 bits, contextos maiores e serviços simultâneos. Não é suficiente para os maiores checkpoints de ponta.

Guias relacionados