Scraps 最終更新 2026/08/22 20:00

原文著者: @ほーりーふぉっくす /

RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる

  • #AIエージェント
  • #生成AI・LLM
  • #機械学習

AIで作成し、掲載基準に基づいて自動選定した要約です。

  • FreeTokenはMoEモデルのexpertをホストRAMに置き、必要な分だけGPUにキャッシュする推論エンジン
  • MoEのexpertをホストRAMに配置、LRU方式のVRAMキャッシュ、NVFP4/MXFP4カーネルを活用
  • VRAMに収まらないMoEモデルを動かす際は性能が発揮されるが、VRAMに収まるモデルでは転送コストで遅くなる
RTX 5090でFreeTokenを試してみた。35Bでは不要、120B級MoEでは話が変わる

Zenn / 原文を読む