128GB の Mac で Qwen3.8 Flash Next をどう動かすか ─ 3つのランタイムを実測で比べた
- Qwen3.8 Flash Next を 128GB の Mac で動かす 3 つのランタイムを実測で比較した
- llama.cpp はデコードが遅いが実務で完走、mlx-serve はプレフィルとデコードが最も速い、oMLX はキャッシュ処理でエージェントループで壊れる
- mlx-serve は 105GB のモデルが必要でメモリ制限を回避するオプションが必要、llama.cpp は実務で安定して完走するがデコードが遅い
128GB の Mac で Qwen3.8 Flash Next をどう動かすか ─ 3つのランタイムを実測で比べた


