Scraps 最終更新 2026/09/01 10:31

原文著者: @tomohisa /

128GB の Mac で Qwen3.8 Flash Next をどう動かすか ─ 3つのランタイムを実測で比べた

  • #生成AI・LLM
  • #AIエージェント
  • #機械学習

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • Qwen3.8 Flash Next を 128GB の Mac で動かす 3 つのランタイムを実測で比較した
  • llama.cpp はデコードが遅いが実務で完走、mlx-serve はプレフィルとデコードが最も速い、oMLX はキャッシュ処理でエージェントループで壊れる
  • mlx-serve は 105GB のモデルが必要でメモリ制限を回避するオプションが必要、llama.cpp は実務で安定して完走するがデコードが遅い
128GB の Mac で Qwen3.8 Flash Next をどう動かすか ─ 3つのランタイムを実測で比べた

Zenn / 原文を読む