아침부터 제가 사용하는 패턴하고 앞으로 할일 그리고 3년 뒤까지 메모리 가격이 안 내릴거라는 예상을 바탕으로 아래와 같이 성능 표를 뽑아봤습니다.
결론 : 싸네요.
결론 2 : pro 구독 끊자.
결론 3 : 집에다가는 맥미니 산다고…
M5 Ultra 256GB vs RTX 5090 + RTX PRO 6000 — 로컬 AI 기준
항목 | Mac Studio M5 Ultra 256GB | RTX 5090 + RTX PRO 6000 PC |
|---|
CPU | 최대 36코어 | Ryzen 9950X3D 16C/32T |
GPU | 최대 80코어 GPU + 코어별 Neural Accelerator | 21,760 + 24,064 CUDA Core |
AI 연산 | Apple: M3 Ultra 대비 최대 4.3배 | 3,352 + 4,000 = 이론상 7,352 AI TOPS* |
메모리 | 256GB Unified Memory | 32GB + 96GB = 128GB VRAM |
메모리 구조 | 하나의 통합 메모리 풀 | 두 GPU의 VRAM이 분리됨 |
메모리 대역폭 | 1.2TB/s | 각 GPU 1.792TB/s |
GPU간 통신 | 칩 내부 UltraFusion | PCIe를 통한 GPU간 통신 |
CUDA | X | O |
전력/소음 | 매우 유리 | 5090 + PRO 6000만으로 약 1.2kW급 |
국내 가격 | M5 Ultra 시작가 949만원 + 256GB 옵션 | 약 3,600~4,400만원 |
최대 모델 크기 | 200~400B급 Q4도 가능 | 실질적으로 96GB 단일 GPU / 128GB 분산 한계 |
* NVIDIA의 AI TOPS를 단순 합산한 이론값이며, 두 GPU가 하나의 GPU처럼 7,352 TOPS를 내는 것은 아님.
LLM 추론 성능 예상
모델 / 조건 | M5 Ultra 256GB 예상 | RTX PRO 6000 중심 PC |
|---|
70B Dense Q4 | 약 20~25 tok/s | 약 30~45 tok/s |
GPT-OSS 120B MXFP4 | 약 100~120 tok/s | 약 160~190 tok/s |
Qwen3.5 397B-A17B Q4 | 약 55~60 tok/s | 메모리 부족 |
Qwen 397B Q4 / 64K context | 약 38~42 tok/s | 메모리 부족 |
Qwen 397B Q4 / 128K context | 약 28~32 tok/s | 메모리 부족 |
M5 Ultra 수치는 아직 정식 출시 전이므로 M3 Ultra 256GB의 실제 MLX/oMLX 벤치마크와
M5 Ultra의 1.2TB/s 메모리 대역폭, 80코어 GPU, Neural Accelerator 성능 향상을 기준으로 추정한 값.
참고로 M3 Ultra 256GB에서도 Qwen3.5 397B-A17B Q4가 실제 구동되며:
1K context: 약 40 tok/s
32K: 약 32 tok/s
64K: 약 27 tok/s
128K: 약 20 tok/s
까지 실측됨.
M5 Ultra는 M3 Ultra 대비 메모리 대역폭이 약 1.47배(819GB/s → 1.2TB/s) 증가했고,
Apple 발표 기준 LLM prompt processing은 최대 약 4배, AI compute는 최대 약 4.3배 향상됨.
결론
RTX 5090 + RTX PRO 6000
장점
120B 이하 모델의 절대 속도는 확실히 빠름
CUDA / vLLM / SGLang / TensorRT 생태계
학습, LoRA, 이미지 생성, 병렬 서빙에 강함
RTX 5090과 PRO 6000에 서로 다른 모델을 올리면 매우 강력함
단점
M5 Ultra 256GB
장점
256GB를 GPU가 사실상 하나의 메모리 풀로 사용
Qwen 397B급 모델까지 한 머신에서 구동 가능
1.2TB/s 메모리 대역폭
GPU Neural Accelerator 추가로 이전 Ultra보다 AI 연산 크게 향상
가격/전력/소음 대비 대형 LLM 구동능력이 매우 좋음
단점
같은 모델이 NVIDIA VRAM 안에 들어간다면 NVIDIA가 더 빠름
CUDA/SGLang을 그대로 사용할 수 없음
MLX/llama.cpp 등 Apple Silicon용 런타임 필요
한 줄 결론
70~120B 모델을 최고 속도로 돌리는 것이 목적이면 NVIDIA.
200~400B급 대형 모델, 긴 Context, 로컬 AI Agent가 목적이면 M5 Ultra 256GB가 훨씬 합리적.
결국
NVIDIA = 연산 성능과 속도를 사는 것
M5 Ultra = 거대한 고속 메모리 풀을 사는 것
로컬 LLM에서는 모델이 커질수록 후자의 가치가 급격히 커짐.