実測値のみ収録。出典チップの色: 直接実測 README/一次記事 コミュニティ投稿
同一マシン(M5 Max 40c/128GB)での比較。kamo78のOllama条件: temperature=0/seed=1/max_tokens=256、GPU<45°C冷却後に計測。
| モデル | 構造 | 量子化 | decode tok/s | prefill | 帯域使用率 | 出典 |
|---|---|---|---|---|---|---|
| gpt-oss 120B | MoE 117B | mxfp4 / 65GB | 72 | 912 tok/s | 22% | kamo78実測 |
| Qwen3.6-35B-A3B | MoE 35B | Q4_K_M / 23GB | 58 | 1,148 tok/s | 15% | kamo78実測 |
| Qwen3.6-35B-A3B | MoE 35B | Q8_0 / 38GB | 51 | 1,177 tok/s | 15% | kamo78実測 |
| DeepSeek V4 Flash (ds4) | MoE 284B-a13B | IQ2XXS / 81GB | 34.1 | 231 (cold) | 16% | kamo78実測 |
| DeepSeek V4 Flash (ds4) | MoE 284B | 2bit級 | 39.35 | — | — | ds4 README |
| DeepSeek V4 Flash + DSpark | MoE 284B | speculative | 37.4 | — | — | @callebtc |
| Gemma4 31B | Dense 31B | Q4 / 19GB | 23 | 184 tok/s | 94% | kamo78実測 |
| Hermes3 70B | Dense 70B | Q4_K_M / 42GB | 11 | 80 tok/s | 46% | kamo78実測 |
| マシン | モデル | 量子化 | decode | ctx | メモリ | 出典 |
|---|---|---|---|---|---|---|
| M4 Max 128GB (M5同等帯域) | Qwen3.5-122B-A10B | 4bit | 65.8 | 4k | 71.9GB | u/ConformalFuelTank |
| M4 Max 128GB | Qwen3.5-122B-A10B | 4bit | 60.6 | 16k | 73.8GB | u/ConformalFuelTank |
| M4 Max 128GB | Qwen3.5-122B-A10B | 4bit | 54.9 | 32k | 76.4GB | u/ConformalFuelTank |
| M3 Max 128GB | Qwen3.5-122B-A10B | 5bit | 30 | 100k | — | u/Dumperandumper |
| M4 Max 128GB | Qwen3-Coder-Next | 8bit | 63.7 | 4k | 87.1GB | u/ConformalFuelTank |
| M5 Max (LLMCheck index) | Qwen3-235B-A22B | Q4 | 18 (推定) | — | 128GB限界 | LLMCheck |
u/purealgoの自作MLXベンチ。両機128GB/40c、同一プロンプト512トークン上限複数回平均。M5 Neural Acceleratorの実効果。
| モデル | M4 Gen | M5 Gen | Gen向上 | M4 PP | M5 PP | PP向上 |
|---|---|---|---|---|---|---|
| GLM-4.7-Flash-4bit | 90.56 | 98.32 | +8.6% | 174.5 | 204.8 | +17.3% |
| gpt-oss-20b MXFP4-Q8 | 121.61 | 139.34 | +14.6% | 624.0 | 792.3 | +27.0% |
| Qwen3.5-9B-4bit | 90.81 | 105.17 | +15.8% | 241.1 | 333.0 | +38.1% |
| gpt-oss-120b MXFP4-Q8 | 81.47 | 93.11 | +14.3% | 301.5 | 355.1 | +17.8% |
| Qwen3-Coder-Next-4bit | 91.67 | 105.75 | +15.4% | 210.9 | 306.9 | +45.5% |
kamo78実測。連続3分decode・冷却なし。ピーク速度ではなく「throttle後の速度」が実力。
| 環境 | モデル | 温度 | クロック | decode劣化 | 出典 |
|---|---|---|---|---|---|
| M5 Max (MBP薄型筐体) | Qwen3.6 35B (MoE) | 44→98°C | 1620→1525MHz | -13.1% | kamo78 |
| M5 Max (MBP薄型筐体) | Gemma4 31B (Dense) | 43→93°C | 1299→690MHz | -29.8% | kamo78 |
| RTX 5090 (WSL2) | Qwen3.6 35B (MoE) | 45→49°C | 2325MHz固定 | なし(+2.6%) | kamo78 |
| RTX 5090 (WSL2) | Gemma4 31B (Dense) | 44→64°C | 2332MHz固定 | なし | kamo78 |
| モデル | M5 Max | RTX 5090 | 倍率 | prefill 2k |
|---|---|---|---|---|
| qwen3.6 35B MoE Q4 | 58.2 tok/s (sd 0.7%) | 118 tok/s | 2.0x | 1148→2364 |
| gemma4 31B Dense | 21.6 tok/s (sd 4.9%) | ~61 tok/s | 2.8x | 184→2445 |
38万行のコミュニティ実測DBから。M5 Max 40c・gemma-4-31b bf16の例(長ctxでTG急落・バッチで回復)。
| ctx | PP tok/s | TG tok/s | メモリ |
|---|---|---|---|
| 1k | 555.8 | 7.0 | 60.0GB |
| 4k | 687.1 | 7.1 | 61.6GB |
| 32k | 494.0 | 4.0 | 65.2GB |
| 128k | 277.3 | 1.6 | 79.5GB |
| 195k | 191.7 | 1.2 | 89.1GB |
バッチ並列: batch1=7.0 → batch8=27.9 tok/s (3.99x)。bf16は量子化なし故の低速。 → 元データ
| # | モデル | 規模 | 速度 | capability | ライセンス |
|---|---|---|---|---|---|
| 1 | DeepSeek V4 Flash | 284B MoE | 39 tok/s | 47/50 | MIT |
| 2 | Qwen3.8-27B | 27.8B | 29 tok/s (推定) | 46/50 | Apache 2.0 |
| 3 | Inkling-Small | 276B MoE | 22 tok/s | 46/50 | Apache 2.0 |
| 4 | Qwen3-235B-A22B | 235B MoE | 18 tok/s | 46/50 | Apache 2.0 |
| 5 | Qwen 3.6-27B | 27B | 30 tok/s | 44/50 | Apache 2.0 |
| 6 | Laguna S 2.1 | 118B MoE | 26 tok/s | 43/50 | OpenMDW |
| 7 | Muse Glimmer 30B | 30B | 27 tok/s | 42/50 | Apache 2.0 |
| 8 | KAT-Coder-V2.5 | 35B MoE | 52 tok/s | 39/50 | Apache 2.0 |
| 9 | Qwen 3.6-35B-A3B | 35B MoE | 48 tok/s | 38/50 | Light MDW |
| 10 | Nemotron 3.5 Lightning | 30B MoE | 60 tok/s | 36/50 | OpenMDW |
128GBで収まる81モデル中59種。 → LLMCheck詳細