Scraps 最終更新 2026/09/28 15:00

原文著者: @pentaCoxian /

2×V100 で Qwen3.8-Flash-Next を 256K コンテキスト・約 88 tok/s で動かす:llama.cpp v0.5.0 に加えた最適化

  • #バックエンド
  • #クラウド
  • #DevOps・CI/CD

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • V100 2枚で Qwen3.8-Flash-Next を 256K コンテキストで 88 tok/s で動かす最適化が行われた
  • MTP投機的デコード、QSAの差分プーリング、ホスト側の全走査削減、カーネル起動数の削減
  • KVキャッシュの埋め状態では計測値に±2msの変動があるため、ms/stepで判断する必要がある
2×V100 で Qwen3.8-Flash-Next を 256K コンテキスト・約 88 tok/s で動かす:llama.cpp v0.5.0 に加えた最適化 - Qiita

Qiita / 原文を読む