「Macの方が速い」と「DGXが13〜45%上」という一見矛盾する実測が両方存在する。一次データを突き合わせて、この論争の真の構造を解剖した。
メモリ帯域はdecode速度の物理的上限を決める。273GB/sのLPDDR5xしか持たないDGX Sparkは、batch=1のDenseモデルdecodeでは原理的にM5 Maxに勝てない。lmsys自身が「帯域が主要ボトルネック」と実証。HN理論派もこの見方。さらにDGX SparkのD-V4-Flash vLLM移植版は<2 t/sという惨敗記録も。
lmsys実測: Llama 3.1 8B SGLang batch1で7,991 prefill / 20.5 decode → batch32で7,949 / 368 tpsへ線形スケール。CUDAの成熟したスタックが並列処理で効く。RTX 5090は215 tps。M5 Maxにこの水準の並列スループット実測は存在しない(oMLXでbatch8=27.9が最高記録)。
| 条件 | prefill tps | decode tps | 意味 |
|---|---|---|---|
| Llama 3.1 8B FP8 / SGLang / batch 1 | 7,991 | 20.5 | 単発decodeは帯域の壁で遅い |
| 同上 / batch 32 | 7,949 | 368 | 並列では18倍スループット |
| RTX 5090 (比較) | 8,519 | 205 | Sparkの並列効率が上回る場面も |
| Mac Studio M3 Ultra (比較) | 10,108 | 215 | prefill 4倍・decodeも上 |
| speculative decoding (EAGLE3) | — | 最大2× | ソフトウェアで帯域の壁を緩和 |
GB10: 20 CPUコア・1 PFLOP FP4・128GB LPDDR5x 273GB/s。GPT-OSS 120B/Llama 70Bは動くが「試作・実験向け、本番向けではない」とlmsys自身が結論。 → 原文
| ソース | 比較対象 | 結論 | 条件の注意 |
|---|---|---|---|
| lmsys (2025-10) | DGX Spark 単体 | batch1 decode遅・batch32強い | FP8/q4_K_M混在、SGLang+Ollama |
| presenc.ai | DGX vs Mac Studio M5 Max | 場面によりDGX +13〜45% | プロダクション設定・CUDAスタック前提 |
| digitalapplied (2026) | DGX vs M5 Max vs RTX 6000 | 3者の使い分けマップ | NVFP4中心の評価 |
| contracollective (2026) | M5 Max vs 5090 vs DGX | コスト/ワット分析 | スループット中心的 |
| agentnativedev (Medium) | M5 Max vs 4090 vs 2×3090 | 128GB unifiedの利点強調 | 大モデル載ることを重視 |
| GitButler | 多機種ガントレット | Mac=コーディング実用可 | 実タスク評価 |
284B D-V4-Flashを34〜39 tok/sで。122Bを65 tok/s。帯域614GB/s+128GB unifiedが効く。DGXに284Bは2bitで辛うじて、実用速度は出ない。
batch32で368 tps。CUDA生態系・EAGLE3投機decode・NVFP4。複数人・複数エージェント同時なら圧倒。1 PFLOP FP4でファインチューンも。
1人1エージェントならM5 Max(帯域・電力・静音)。並列エージェント群ならDGX。@jun_songの$7k vs $4k階層はまさにこの使い分け。
@jun_song: ハードウェアガイドで両者を階層分け($4k DGX / $7k M5 Max)。@bridgemindai: DGX GB10の37tpsを見て「Apple税の代替を検討したがM5 Maxの方が速い」。HN理論派: 帯域比でMac優位を主張。ただし投機decodeやCUDA成熟度を挙げるDGX擁護も。
r/LocalLLaMAのDGXスレでは「1人用ならMac、サーバーならDGX」「訓練するならDGX一択、推論だけならMac」が定番コメント。感情論より実測文化が根付いている。