Benchmark Database // 実測のみ

数字だけは嘘をつかない

実測値のみ収録。出典チップの色: 直接実測 README/一次記事 コミュニティ投稿

M5 Max 128GB decode実測

同一マシン(M5 Max 40c/128GB)での比較。kamo78のOllama条件: temperature=0/seed=1/max_tokens=256、GPU<45°C冷却後に計測。

モデル構造量子化decode tok/sprefill帯域使用率出典
gpt-oss 120BMoE 117Bmxfp4 / 65GB72912 tok/s22%kamo78実測
Qwen3.6-35B-A3BMoE 35BQ4_K_M / 23GB581,148 tok/s15%kamo78実測
Qwen3.6-35B-A3BMoE 35BQ8_0 / 38GB511,177 tok/s15%kamo78実測
DeepSeek V4 Flash (ds4)MoE 284B-a13BIQ2XXS / 81GB34.1231 (cold)16%kamo78実測
DeepSeek V4 Flash (ds4)MoE 284B2bit級39.35ds4 README
DeepSeek V4 Flash + DSparkMoE 284Bspeculative37.4@callebtc
Gemma4 31BDense 31BQ4 / 19GB23184 tok/s94%kamo78実測
Hermes3 70BDense 70BQ4_K_M / 42GB1180 tok/s46%kamo78実測
読み方の鍵 — 帯域使用率の列: MoE勢(gpt-oss/Qwen3.6/D-V4-Flash)は15〜22%しか帯域を使わずGPU演算律速。Dense勢(Gemma4 94%、Hermes3 46%)は帯域に張り付く。同じ128GB機でも「載るモデルの種類」で律速要因が180度変わる。

122Bクラス 実測

マシンモデル量子化decodectxメモリ出典
M4 Max 128GB (M5同等帯域)Qwen3.5-122B-A10B4bit65.84k71.9GBu/ConformalFuelTank
M4 Max 128GBQwen3.5-122B-A10B4bit60.616k73.8GBu/ConformalFuelTank
M4 Max 128GBQwen3.5-122B-A10B4bit54.932k76.4GBu/ConformalFuelTank
M3 Max 128GBQwen3.5-122B-A10B5bit30100ku/Dumperandumper
M4 Max 128GBQwen3-Coder-Next8bit63.74k87.1GBu/ConformalFuelTank
M5 Max (LLMCheck index)Qwen3-235B-A22BQ418 (推定)128GB限界LLMCheck

M4 Max → M5 Max 進化比較

u/purealgoの自作MLXベンチ。両機128GB/40c、同一プロンプト512トークン上限複数回平均。M5 Neural Acceleratorの実効果。

モデルM4 GenM5 GenGen向上M4 PPM5 PPPP向上
GLM-4.7-Flash-4bit90.5698.32+8.6%174.5204.8+17.3%
gpt-oss-20b MXFP4-Q8121.61139.34+14.6%624.0792.3+27.0%
Qwen3.5-9B-4bit90.81105.17+15.8%241.1333.0+38.1%
gpt-oss-120b MXFP4-Q881.4793.11+14.3%301.5355.1+17.8%
Qwen3-Coder-Next-4bit91.67105.75+15.4%210.9306.9+45.5%
Gen(生成)は+9〜16%の着実な向上、PP(プロンプト処理)は+17〜46%の大幅向上。M5のNeural Acceleratorは「長いコンテキストを読む」仕事で最大の差をつける。→ スレ本体

熱 — 隠れた敵

kamo78実測。連続3分decode・冷却なし。ピーク速度ではなく「throttle後の速度」が実力。

環境モデル温度クロックdecode劣化出典
M5 Max (MBP薄型筐体)Qwen3.6 35B (MoE)44→98°C1620→1525MHz-13.1%kamo78
M5 Max (MBP薄型筐体)Gemma4 31B (Dense)43→93°C1299→690MHz-29.8%kamo78
RTX 5090 (WSL2)Qwen3.6 35B (MoE)45→49°C2325MHz固定なし(+2.6%)kamo78
RTX 5090 (WSL2)Gemma4 31B (Dense)44→64°C2332MHz固定なしkamo78
RTX 5090は3分連続でクロック1MHzも下がらず。M5 MaxはDenseでクロック半減・-30%。薄型ノート筐体のApple Siliconで長時間推論すると熱が本気で効いてくる。kamo78氏自身も「Mac Studioにしておけば良かったかも」「冷却台を買う」と結論。ピークtok/sだけで購入判断してはいけない。

RTX 5090 vs M5 Max like-for-like

モデルM5 MaxRTX 5090倍率prefill 2k
qwen3.6 35B MoE Q458.2 tok/s (sd 0.7%)118 tok/s2.0x1148→2364
gemma4 31B Dense21.6 tok/s (sd 4.9%)~61 tok/s2.8x184→2445
decodeで2.0〜2.8倍、prefillで2〜13倍の5090優位。ただし5090の32GB VRAMには81GBのDeepSeek V4 Flashは載らない。「載る最新フロンティア」ではM5 Max 128GBが独壇場。これは性能比較ではなく容量の壁の話。

oMLX コミュニティベンチ 抜粋

38万行のコミュニティ実測DBから。M5 Max 40c・gemma-4-31b bf16の例(長ctxでTG急落・バッチで回復)。

ctxPP tok/sTG tok/sメモリ
1k555.87.060.0GB
4k687.17.161.6GB
32k494.04.065.2GB
128k277.31.679.5GB
195k191.71.289.1GB

バッチ並列: batch1=7.0 → batch8=27.9 tok/s (3.99x)。bf16は量子化なし故の低速。 → 元データ

LLMCheck 128GB適合 トップ10

#モデル規模速度 capability ライセンス
1DeepSeek V4 Flash284B MoE39 tok/s47/50MIT
2Qwen3.8-27B27.8B29 tok/s (推定)46/50Apache 2.0
3Inkling-Small276B MoE22 tok/s46/50Apache 2.0
4Qwen3-235B-A22B235B MoE18 tok/s46/50Apache 2.0
5Qwen 3.6-27B27B30 tok/s44/50Apache 2.0
6Laguna S 2.1118B MoE26 tok/s43/50OpenMDW
7Muse Glimmer 30B30B27 tok/s42/50Apache 2.0
8KAT-Coder-V2.535B MoE52 tok/s39/50Apache 2.0
9Qwen 3.6-35B-A3B35B MoE48 tok/s38/50Light MDW
10Nemotron 3.5 Lightning30B MoE60 tok/s36/50OpenMDW

128GBで収まる81モデル中59種。 → LLMCheck詳細