RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話
- RTX 5060 Ti 16GBでQwen3.8 27Bをローカルで動かす実験をした
- soyaakinohara版の12GBモデルとOllama、vLLM(AWQ)、Cafe llama.cppの比較で実行速度とVRAM使用量の最適化を試みた
- Ollamaでnum_gpuを66層に指定することで生成速度が8倍になり、VRAMの自動見積もりが保守的すぎる問題が判明した
RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話


