RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる
- FreeTokenはMoEモデルのexpertをホストRAMに置き、必要な分だけGPUにキャッシュする推論エンジン
- MoEのexpertをホストRAMに配置、LRU方式のVRAMキャッシュ、NVFP4/MXFP4カーネルを活用
- VRAMに収まらないMoEモデルを動かす際は性能が発揮されるが、VRAMに収まるモデルでは転送コストで遅くなる
RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる


