Kaggle Pokémon TCG AI Battle Challenge ポケカコンペ振り返りーメダルなし
- ポケモンカードゲームのAIエージェント開発で、強化学習と模倣学習を組み合わせた手法を試した
- 模倣学習(Behavior Cloning)で上位エージェントの行動を学び、PPOによる強化学習で補正。価値関数で数ターン先の勝率を予測し、相手デッキを推定する仕組みを導入
- 価値関数のAUCが0.934でも実際の勝率改善は1.1ポイントにとどまり、モデル単体の指標だけでは採用判断できないことが分かった
Kaggle Pokémon TCG AI Battle Challenge ポケカコンペ振り返りーメダルなし


