2×V100 で Qwen3.8-Flash-Next を 256K コンテキスト・約 88 tok/s で動かす:llama.cpp v0.5.0 に加えた最適化
- V100 2枚で Qwen3.8-Flash-Next を 256K コンテキストで 88 tok/s で動かす最適化が行われた
- MTP投機的デコード、QSAの差分プーリング、ホスト側の全走査削減、カーネル起動数の削減
- KVキャッシュの埋め状態では計測値に±2msの変動があるため、ms/stepで判断する必要がある
2×V100 で Qwen3.8-Flash-Next を 256K コンテキスト・約 88 tok/s で動かす:llama.cpp v0.5.0 に加えた最適化 - Qiita


