Kaggleのセキュリティコンペ「AI Agent Security - Multi-Step Tool Attacks」のふり返りと供養
- KaggleのセキュリティコンペでAIエージェントの脆弱性を攻撃する手法を試した
- ブラックボックスから応答の差異で内部を推定、ガードレールの動作をリバースエンジニアリング
- Privateガードレールの動作を予測するためのプローブが勝敗を分ける
Kaggleのセキュリティコンペ「AI Agent Security - Multi-Step Tool Attacks」のふり返りと供養


