ChinaModelAPI
Apple Silicon · IA local · 2026-08-26

Mac Studio M5 Max frente a M5 Ultra para LLM locales

El M5 Max con 128GB es la estación de trabajo de gama alta más sensata para LLM locales. Compra el M5 Ultra con 256GB o 512GB solo para un modelo específico o un flujo de trabajo de investigación que no quepa en 128GB. El valor del Ultra radica primero en su capacidad de memoria y luego en su ancho de banda de 1.2TB/s.

Aún no hay benchmarks independientes del M5 Studio

Apple anunció el nuevo Mac Studio el 25 de agosto y comenzará las entregas el 22 de septiembre. La opción de 512GB llegará a finales de octubre. Las métricas de lanzamiento de Apple se midieron en julio de 2026. Esta página utiliza especificaciones oficiales y estimaciones de memoria basadas en parámetros, no velocidades de generación inventadas.

Especificaciones de M5 Max vs M5 Ultra

CaracterísticaMac Studio M5 MaxMac Studio M5 Ultra
CPU / GPUCPU de 18 núcleos; GPU de 32 núcleos, hasta 40CPU de 30 núcleos; GPU de 64 núcleos, hasta 36/80
Memoria unificada36GB; 48GB, 64GB, or 128GB96GB; 256GB or 512GB
Ancho de banda de memoria460GB/s; 614GB/s con GPU de 40 núcleos1.2TB/s
Neural Engine16 núcleos más aceleradores neuronales de GPU32 núcleos más aceleradores neuronales de GPU
Precio inicial en EE. UU.$2,499$5,499
Disponibilidad22 de septiembre22 de septiembre; 512GB a finales de octubre

Fuentes: especificaciones técnicas de Apple y anuncio de lanzamiento de Apple.

Ajuste de modelos: qué cambia entre 128GB, 256GB y 512GB

Nivel de memoriaRol prácticoEjemplos actuales de modelos chinos
M5 Max 128GBModelos de clase 70B en 4 bits, mayor contexto y múltiples serviciosQwen3.8-27B con amplio margen; no V4 Flash completo ni GLM-5
M5 Ultra 256GBClase 200B-300B en formatos eficientes, si el runtime admite la arquitecturaDeepSeek V4 Flash es un objetivo viable; valida primero su compilación mixta FP4/FP8
M5 Ultra 512GBInvestigación con MoE cuantizados muy grandes y cargas de trabajo con caché/concurrencia ampliasGLM-5 tiene un mínimo idealizado de 372GB en 4 bits; los pesos de GLM-5.3 no eran públicos el 26 de agosto

¿Qué modelos de frontera siguen sin caber?

Los modelos MoE dispersos activan solo una parte de sus parámetros por token, pero la máquina aún necesita acceso a todo el conjunto de pesos de los expertos. Los parámetros activos estiman el cómputo, no el almacenamiento.

ModeloParámetros totalesMínimo idealizado en 4 bits¿Un solo M5 Ultra de 512GB?
DeepSeek V4 Flash284B142GB, la precisión mixta real es mayorFactible con una compilación compatible
GLM-5744B372GBTeórico y muy ajustado
DeepSeek V4-Pro1.6T800GBNo
Qwen3.8 2.4T2.4T1.2TBNo
Kimi K32.8T1.4TBNo

El mínimo en 4 bits es parámetros × 0,5 bytes. Excluye escalas de cuantización, estado del runtime, caché KV, búferes temporales y macOS.

Cómo elegir entre M5 Max y M5 Ultra

Elige M5 Max 128GB cuando
  • Ejecutas modelos de 27B a 70B.
  • Buscas agentes locales más rápidos y contextos más amplios.
  • Necesitas varios servicios locales, no un único checkpoint gigante.
  • Buscas la mejor relación costo-memoria útil.
Elige M5 Ultra 256GB/512GB cuando
  • Tienes un archivo de modelo exacto que supera los 128GB.
  • Tu runtime ya es compatible con esa arquitectura en Apple silicon.
  • Tienes un benchmark del mismo modelo y un objetivo de latencia aceptable.
  • La privacidad o los datos locales hacen que la inferencia por API no sea adecuada.

Las afirmaciones de Apple sobre LM Studio: útiles, pero incompletas

Apple reporta un procesamiento de prompts en el M5 Max hasta 3.9x más rápido que en el M4 Max y en el M5 Ultra hasta 4x más rápido que en el M3 Ultra en LM Studio. También reporta 614GB/s de ancho de banda para el M5 Max superior y 1.2TB/s para el M5 Ultra.

  • Las cifras provienen de pruebas de Apple, no de revisores independientes.
  • La ingesta de prompts no es la misma métrica que la generación de tokens de salida.
  • El lanzamiento público no proporciona una fórmula universal de modelo, cuantización y contexto.
  • Los resultados reales dependen de que MLX, llama.cpp, LM Studio u otro runtime aprovechen el hardware correctamente.

Creación de clústeres con múltiples sistemas Mac Studio

Apple afirma que Thunderbolt 5 y RDMA admiten clústeres multi-Mac, con un clúster de cuatro sistemas alcanzando hasta 3x el rendimiento de inferencia de un solo sistema en las pruebas de Apple. Esto no significa que dos Mac se conviertan automáticamente en un ordenador con memoria compartida.

La inferencia distribuida añade costos de software, redes, sincronización y gestión de fallos. Para la mayoría de las personas, un M5 Max de 128GB o un M5 Ultra de 256GB es más sencillo que un clúster. Escala horizontalmente solo después de que una máquina alcance un límite medido de capacidad o rendimiento.

Antes de comprar un clúster: confirma que el runtime exacto admita inferencia distribuida para la arquitectura del modelo, cómo se distribuyen los pesos (sharding), si la ruta de red es el cuello de botella y cómo se gestionan los fallos. Considera la cifra de clúster de Apple como el resultado de un fabricante hasta que implementaciones independientes la reproduzcan.

FAQ

¿Es mejor el M5 Max o el M5 Ultra para LLM locales?

El M5 Max ofrece mejor relación calidad-precio hasta 128GB. Elige el Ultra solo para una carga de trabajo que requiera 256GB/512GB, 1.2TB/s de ancho de banda o inferencia distribuida validada.

¿Puede el M5 Ultra ejecutar DeepSeek V4?

V4 Flash puede caber en 256GB o 512GB en un formato compatible eficiente. V4-Pro no cabe en un solo Mac de 512GB porque su límite inferior optimista de pesos en 4 bits es de unos 800GB.

¿Puede el Mac Studio de 512GB ejecutar Kimi K3?

No. Los 2.8T parámetros de Kimi K3 implican un límite inferior de pesos en 4 bits de aproximadamente 1.4TB antes de la sobrecarga.

¿Son suficientes 128GB para LLM locales?

Sí para muchas cargas de trabajo serias de un solo usuario, incluidos modelos de clase 70B en 4 bits, contextos más amplios y servicios simultáneos. No es suficiente para los checkpoints de frontera más grandes.

Guías relacionadas