Scraps 最終更新 2026/08/27 19:30

原文著者: @ほーりーふぉっくす /

RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた

  • #バックエンド
  • #クラウド
  • #DevOps・CI/CD

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • Qwen3.8-Flash-NextをRTX 5090とRAM 128GBでllama.cppで動かす設定が公開された
  • -ncmoeパラメータでGPUにエキスパートを配置、CPUスレッド数8が最適、VRAM使用量30.9GBで動作
  • VRAMを最大限に使いながらRAMにエキスパートを逃がすことで推論速度を向上させた設定が有効だった
RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた

Zenn / 原文を読む