Reddit投稿履歴はArctic Shift APIで全取得、Xはスニペット照合、YouTubeはチャンネル本体確認。実測を出す者だけを載せた。
最大の発見。2016票のベンチスレを投稿したu/cryingnekoは、実はoMLXの作者本人だった。
2016票の「M5 Max just arrived」スレ(2026-03-11)の投稿者であり、同時にoMLX(Apple Silicon向け高性能MLX推論サーバー)の開発者。r/oMLXでLightning MTP・oQe量子化・カスタムカーネル等を継続リリース。M3 Ultra 512GBでの3大モデル比較実測も投稿。スレ内でmlx_lm.generateの実行ログをそのまま貼る「数字だけ」スタイル。
Redisの作者が2週間で書いた単一Cファイル推論エンジンds4で、DeepSeek V4 Flash(284B MoE)を128GB Macで動かす。M3 Maxでフル速度時に50W、prefill 460 tok/s、KVキャッシュのディスク永続化に対応。HNで本人が直接性能を解説。「q2量子化が意外と機能する」理由も解説。フルモデル(4bit)には256GB Macが必要。
ローカルLLMハードウェアの階層ガイドで最も引用される人物。「~$2k: RTX3090+Qwen3.8-27B / ~$4k: DGX Spark+D-V4-Flash 2.5bit / ~$7k: M5 Max 128GB」。DeepSeek-V4-Flash GA DQが128GB Macに載る瞬間を第一報(2026-07-31)。Qwen3.8-27Bを「Opus-4.6〜4.8の間」と1時間レビュー。SuperDeepseek-V4-Flash(128〜256GB向け最強モデル)も紹介。
Instagram 2.5K+フォロワーのAI系クリエイター。$5,399 M5 Max 128GBでQwen3.6-35B/Gemma4-31Bを実測。「I have never seen speeds this fast」(2026-05-25)。独自の「Bridge Bench」リーダーボードを運営し、DGX Sparkを「Apple税の代替」として検討する内容も。DGX Spark GB10が37tpsというシーンを引用リポスト。
PocketAIHub開発者。M5 Max上のMLXモデル(LTX-2.5、Qwen3.8-27B Abliterated等)を即日PocketAIHubに収録。「DGX Spark日本6.2k円、MBP M5 Max 128GB 2TBが7.4k円」と日本価格の比較も投稿。MLX 4/6/8bit+BF16の4 Quantumリリース。
DeepSeek V4 Flash 0731(ds4.c)をM5 Max 128GBでmuse-glimmer/gemma4と比較。「37.4 tok/s with DSpark speculative decoding、Meta/Googleのオープンモデルの約3倍」。Bitcoin Lightning開発者としても著名。
「老いたIT男」を自称。Raspberry Pi + Hailo10Hから始まりM5 Maxへ。Claude Codeを「ITチーム」として運用し、そのメモリ/プラグイン/サブエージェント体制ごと新Macに移設してベンチ。v1/v2の2連続ベンチ投稿(フィードバック反映でllama-bench標準化・PP速度・MoE追加)。他にr/conspiracy等にも投稿する素人臭くない素人。
cryingnekoスレのコメント欄でM4 Max 128GBのllama-bench結果を公開。Qwen3.5-122B-A10B-4bitが4106トークンpromptで65.85 tok/s(ピークメモリ71.9GB)、32k ctxで54.9 tok/s(76.4GB)。Qwen3-Coder-Next-8bitも87-89GBで動作。128GB機の「何が載るか」を実測で示した決定打。
M4 Max→M5 Max移行時に自作MLXベンチを両機で実行(両方128GB/40c)。GLM-4.7-Flash +8%Gen/+17%PP、gpt-oss-20b +15%/+27%、Qwen3.5-9B +16%/+38%、gpt-oss-120b +14%/+18%、Qwen3-Coder-Next +15%/+45%。M5 Neural Acceleratorの効果を初めて定量化。
コメント欄の宝庫。Dumperandumper: M3 Max 128GBでQwen3.5-122B 5bit 100k ctxを30 tok/s。fanoush: M4 Max 48GBでQwen3.5-27Bを27t/s(4bit)。arthware: 「MLX表示57 tok/sでもprefill込み実効は3 tok/s @8.5k ctx。prefillが時間の94%を食う」— 表示速度の罠を暴いた。
14インチM5 Max 128GB/40c/2TB + oMLX + OpenCode/Claude Codeの組み合わせでシリーズ化。「Gemma4 26B Q5/Q4・Qwen3.5 32B Q4/Q2」を128k ctxで実演、MLX vs GGUF比較、最終判定まで一貫した実測チャンネル。
Execute Automation「Ollama powered by MLX on M5 Max」(Qwen3.5 35B/Gemma4実測: prefill 1851 TG 134)・CloudYeti「Qwen3.6+Ollama: Local Claude Code Alternative」・IndyDevDan「My M5 Max, Gemma4, MLX Local Stack」・Mac AI Lab「128GB Mac最適LLM(97 Reddit返信)」。
mactopテレメトリでMoE/Denseのボトルネックを世界で唯一定量証明。
自作ローカルLLM「akira-papa 1.0」(MLX/GGUF両対応)をリリース。
M5 Max 48GBでgemma4:26b「AI秘書」を実機ベンチ。機密データのローカル完結を実証。
「M5 Max 128GBをワーカーノード化し行列演算ベンチを共有」とされるが、対応する公開投稿・リポジトリなし。
「自前LLMエンジンElfMoon系をM5 Maxで動かしOSS公開」とされるが、ElfMoonという名のエンジン・リポジトリ・投稿なし。
「導入理由・推論性能のアップデートを追う」とされるが、該当する投稿系列なし。