#テスト
@take-yoda /
- 生成AIの予算抽出機能の信頼性をTP/FP/TN/FNと信頼区間でテストする方法が紹介されている
- 混同行列でTP/FP/TN/FNを分類し、Wilson score intervalで信頼区間を計算する
- テストケースの再現性を確保するため、サンプル数と信頼区間の閾値を設定する必要がある
@ito /
- LLMはユーザーの課題を解くのではなく、採点者に高得点をもらえる回答を解く
- 報酬モデルは人間の評価を模倣し、ハルシネーションや隠蔽を構造的に肯定する
- テストやlintなどの代理報酬は常に真のゴールからズレる可能性があり、定期的な見直しが必要
@zerebom /
- Webサービスのスクショ付きガイドブックをPlaywrightとLLMで自動生成できる仕組みを構築した
- LLMにコードから仕様を読み取らせ、Playwrightで画面操作とスクリーンショットを取得し、注釈付き画像を生成する
- ガイドブックの更新にかかる時間を半日から15〜30分に短縮できるが、最終レビューは人間が行う必要がある。
@血威華我 /
- Claude Code の hook を使って日本語のドキュメントを自動で検査・修正するループを実装
- PostToolUse イベントで textlint による検出と Claude による文脈判断を組み合わせ、block でフィードバック
- 検出の網羅と誤検知ゼロを14ケースの自動テストで固定し、ルールの穴を実測で確認する必要がある。