The Great Debate // 検証完了

DGX Spark vs M5 Max
論争の全証拠

「Macの方が速い」と「DGXが13〜45%上」という一見矛盾する実測が両方存在する。一次データを突き合わせて、この論争の真の構造を解剖した。

論争の構造 — 矛盾は錯覚

結論を先に: 両者は別の指標で勝っている。矛盾した数値の原因は①量子化形式の違い(NVFP4/FP8 vs Q4_K_M/Q8)②バッチサイズ(1 vs 32)③ワークロード(単発decode vs 並列スループット)④CUDA/Metalのスタック成熟度。全て一次データで確認済み。
Mac派の根拠

帯域幅 614 vs 273 GB/s(2.25倍)

メモリ帯域はdecode速度の物理的上限を決める。273GB/sのLPDDR5xしか持たないDGX Sparkは、batch=1のDenseモデルdecodeでは原理的にM5 Maxに勝てない。lmsys自身が「帯域が主要ボトルネック」と実証。HN理論派もこの見方。さらにDGX SparkのD-V4-Flash vLLM移植版は<2 t/sという惨敗記録も。

DGX派の根拠

バッチングで20.5→368 tps(18倍)

lmsys実測: Llama 3.1 8B SGLang batch1で7,991 prefill / 20.5 decode → batch32で7,949 / 368 tpsへ線形スケール。CUDAの成熟したスタックが並列処理で効く。RTX 5090は215 tps。M5 Maxにこの水準の並列スループット実測は存在しない(oMLXでbatch8=27.9が最高記録)。

lmsys DGX Spark 一次実測(要約)

条件prefill tpsdecode tps意味
Llama 3.1 8B FP8 / SGLang / batch 17,99120.5単発decodeは帯域の壁で遅い
同上 / batch 327,949368並列では18倍スループット
RTX 5090 (比較)8,519205Sparkの並列効率が上回る場面も
Mac Studio M3 Ultra (比較)10,108215prefill 4倍・decodeも上
speculative decoding (EAGLE3)最大2×ソフトウェアで帯域の壁を緩和

GB10: 20 CPUコア・1 PFLOP FP4・128GB LPDDR5x 273GB/s。GPT-OSS 120B/Llama 70Bは動くが「試作・実験向け、本番向けではない」とlmsys自身が結論。 → 原文

定量比較 総覧

ソース比較対象結論条件の注意
lmsys (2025-10)DGX Spark 単体batch1 decode遅・batch32強いFP8/q4_K_M混在、SGLang+Ollama
presenc.aiDGX vs Mac Studio M5 Max場面によりDGX +13〜45%プロダクション設定・CUDAスタック前提
digitalapplied (2026)DGX vs M5 Max vs RTX 60003者の使い分けマップNVFP4中心の評価
contracollective (2026)M5 Max vs 5090 vs DGXコスト/ワット分析スループット中心的
agentnativedev (Medium)M5 Max vs 4090 vs 2×3090128GB unifiedの利点強調大モデル載ることを重視
GitButler多機種ガントレットMac=コーディング実用可実タスク評価
「DGX +13〜45%」と「M5が2.25倍帯域」が共存する理由: 比較が同じ量子化・同じバッチ・同じスタックで行われていないから。DGX側の数字はNVFP4/FP8+CUDA最適化後、Mac側はGGUF/MLX Q4。量子化形式だけで生成速度は変わる。単純比較は無意味で、「何を載せて・何人で使うか」で判定が反転する。

最終判定 — 条件付き勝者表

勝者: M5 Max

単発decode・大MoEモデル

284B D-V4-Flashを34〜39 tok/sで。122Bを65 tok/s。帯域614GB/s+128GB unifiedが効く。DGXに284Bは2bitで辛うじて、実用速度は出ない。

勝者: DGX Spark

並列スループット・訓練・FP4

batch32で368 tps。CUDA生態系・EAGLE3投機decode・NVFP4。複数人・複数エージェント同時なら圧倒。1 PFLOP FP4でファインチューンも。

勝者: 状況次第

コーディングエージェント

1人1エージェントならM5 Max(帯域・電力・静音)。並列エージェント群ならDGX。@jun_songの$7k vs $4k階層はまさにこの使い分け。

"DGX Spark truly shines when serving smaller models, especially when batching is utilized… best suited for prototyping and experimentation rather than production.— lmsys org, DGX Spark一次レビュー(2025-10-13)
lmsys.org/blog/2025-10-13-nvidia-dgx-spark

コミュニティの空気

X

「Macの方が良い」派が目立つ

@jun_song: ハードウェアガイドで両者を階層分け($4k DGX / $7k M5 Max)。@bridgemindai: DGX GB10の37tpsを見て「Apple税の代替を検討したがM5 Maxの方が速い」。HN理論派: 帯域比でMac優位を主張。ただし投機decodeやCUDA成熟度を挙げるDGX擁護も。

Reddit

「用途で決めろ」が多数派

r/LocalLLaMAのDGXスレでは「1人用ならMac、サーバーならDGX」「訓練するならDGX一択、推論だけならMac」が定番コメント。感情論より実測文化が根付いている。