RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた
- Qwen3.8-Flash-NextをRTX 5090とRAM 128GBでllama.cppで動かす設定が公開された
- -ncmoeパラメータでGPUにエキスパートを配置、CPUスレッド数8が最適、VRAM使用量30.9GBで動作
- VRAMを最大限に使いながらRAMにエキスパートを逃がすことで推論速度を向上させた設定が有効だった
RTX 5090 + RAM 128GBでQwen3.8-Flash-Nextをllama.cppで動かしてみた


