データ量を 4 分の 1 にしても答えが大きく変わらないのはなぜか?LLM の 4bit 量子化の仕組み
- LLMの重みを4bitに量子化しても性能が大きく変わらないのは、外れ値を避けてグループ単位で量子化し、要所を混合精度で残す工夫があるから
- 外れ値は活性値に集中して4bitにしない、グループサイズで巻き添えを防ぐ、埋め込み層など要所を6bitで残す
- 4bitにしたモデルは重みの3分の1まで削減可能だが、外れ値対策と混合精度で性能を維持している
データ量を 4 分の 1 にしても答えが大きく変わらないのはなぜか?LLM の 4bit 量子化の仕組み


