Scraps 最終更新 2026/09/09 12:30

原文著者: @Miyuki-Yumeno /

RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話

  • #生成AI・LLM
  • #AIエージェント
  • #クラウド

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • RTX 5060 Ti 16GBでQwen3.8 27Bをローカルで動かす実験をした
  • soyaakinohara版の12GBモデルとOllama、vLLM(AWQ)、Cafe llama.cppの比較で実行速度とVRAM使用量の最適化を試みた
  • Ollamaでnum_gpuを66層に指定することで生成速度が8倍になり、VRAMの自動見積もりが保守的すぎる問題が判明した
RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話

Zenn / 原文を読む