Scraps 最終更新 2026/10/03 03:50

#AIエージェント

@たけうちさんは縮退しました🌀 /

AIに「中学生でもわかるように1枚のHTMLで図解して」が、複雑なコードを読む前の最良の準備運動かも

  • Claude Codeに中学生向けのHTML図解を依頼することで複雑なコード構造を抽出した
  • 図解と対応表を含む1枚のHTML、専門用語の代替表現、構造の抽出
  • 対応表を必ず付けることでたとえの都合で省かれた分岐を確認できる

@_mkazutaka /

Claude CodeにProfile機能を導入する

  • Claude Codeにプロファイル機能を導入して用途ごとの設定を切り替え可能にした
  • CLAUDE_CONFIG_DIRを環境変数として使い、skimでプロファイルを選択して起動する仕組み、プロファイルの追加はディレクトリ作成で可能
  • プロファイル切り替え時にClaude Codeの画面からはどのプロファイルで起動しているかが表示されないため、手動で管理が必要

@Yasuhito Morimoto /

国内AIエージェント動向(2026/9/3号)

  • 国内AIエージェントが教育、営業、人材育成など複数業務領域で実装され、特化型エージェントが登場
  • NECの脆弱性管理サービス、デジタルハリウッド大学の専属AIエージェント、ウイングアーク1stのオンボーディング基盤
  • 自律性を高める一方で、人による最終確認や権限分離、監査証跡の設計が不可欠とされている

@wellPicker /

ルールではなくskillに指示を書くことで、Claudeのコメントを減らせた

  • Claudeのコメントを減らすためにルールを設定しても効果がなかった
  • ルールを設定してもコメント比率は18.5%から19.1%に増加、skillに手順を組み込むことでコメント行数が27行から21行に減少
  • 判定に主観が入る項目は手順にしても残るため、手順の判定基準を厳しくする必要がある

@寺尾@技術広報 /

「デザインハーネス 2nd」にソフトバンクのUI/UXデザイナー窪内彩佳が登壇します!

  • デザインハーネスがAIエージェントとデザイナーの協働プロセスを支える仕組みに
  • デザインシステムと設計知識、検証、ワークフローを組み合わせ、AIがコンポーネントや評価基準を参照できる状態を構築
  • デザイナーの専門知をチームやAIで共有するための三層デザインハーネスの実装状況が紹介される

@uisaki99 /

Claude Fable 5.1 を使ってみる:長時間エージェント開発で注目したい進化点

  • Claude Fable 5.1 は長時間エージェント開発向けに設計されたモデルで、コード・ログ・ドキュメント・ツールを横断してタスクを進める
  • エージェント型コーディング、科学タスク、コンピュータ操作、業務自動化の性能向上、キャッシュ読み取り料金の低下
  • 長時間ワークフローではキャッシュ料金が総コストに大きく影響し、モデルの能力を引き出すにはタスク設計・権限分離・テストが重要

@r-nakayamasan /

IBM Bob に hooks 強制機能が来たので、OpenTelemetry で AI エージェントの利用ログを取れるようにした

  • IBM Bob の lifecycle hooks を利用して AI エージェントの利用ログを OpenTelemetry で記録できるようになった
  • EnforcedHooks で hook 登録を強制適用、Bob 対応アダプターでイベントを共通形式に変換、本文取得範囲を設定可能
  • 本文取得は設定で選択可能で、ハッシュやマスキングを適用した本文も記録可能で、組織が収集範囲を決定できる

@東是無(とうぜむ) /

「訂正します。ChatGPTは正しかった ── Claudeが自分の言い分を検証したら、また誤りが見つかった話」

  • Claudeが自身の言い分を検証し、ChatGPTの正しさを認めた
  • ClaudeがChatGPTの記事を批判したが、その後自身の検証で誤りを確認し、訂正した。Geminiの記事にも同様の問題があった
  • AIの説明は検証すべき仮説であり、根拠を求め続ける姿勢が重要である

@東京PCレスキュー隊長 /

Claude CodeとCodex、数字が割れる理由

  • Terminal-Bench 2.1の結果が6つの出典で異なる理由が明らかに
  • 推論エフォート設定、ハーネスの違い、拒否時のフォールバック処理、測定時点が主な要因
  • ベンチマークの数値は設定や測定条件によって大きく変わるため、どの条件で測ったかを確認する必要がある

@KAKEHASHI Tech Blog /

コーディングエージェントが分析まで担う今、データサイエンティストの役割はどこにあるのか

  • コーディングエージェントが分析まで担う今、データサイエンティストの役割は課題の構造を整理することにある
  • データ分析は課題の構造を切り出すことと反復的な仮説検証から成り、コーディングエージェントは現場固有の判断を苦手とする
  • コーディングエージェントに任せられる範囲は仕様を定義できる範囲に限られ、その結果を解釈して次の分析を決める必要がある

@Miccell(ミクセル) / 人生を楽しむ仕組みを作る /

Claude Fable 5.1が登場。性能は科学分野で2倍超、価格は実質最大45%減

  • Claude Fable 5.1が発表され、科学分野のベンチマークスコアが2倍以上に向上
  • Terminal-Bench-Science 0.1で24.7%から52.6%、キャッシュ読み込み単価が75%低下
  • キャッシュ読み込みコストが75%削減され、エージェント用途では最大45%の実質価格低下が発生

@ちあき /

AI-DLC v2を回してたら設計も実装も超過剰になってしまった

  • AI-DLC v2の誤用で設計と実装が過剰になった
  • ADR PDRを誤ってPRDとして渡したことで、AI-DLCがチェックリストとして機能し、詳細な検証方法まで記載されたドキュメントが生成された
  • ドキュメントの読み間違いが原因で過剰な仕様書が作成され、リバースエンジニアリングが必要になった

@xthixsl_ml@レオナ /

Kaggle Pokémon TCG AI Battle Challenge ポケカコンペ振り返りーメダルなし

  • ポケモンカードゲームのAIエージェント開発で、強化学習と模倣学習を組み合わせた手法を試した
  • 模倣学習(Behavior Cloning)で上位エージェントの行動を学び、PPOによる強化学習で補正。価値関数で数ターン先の勝率を予測し、相手デッキを推定する仕組みを導入
  • 価値関数のAUCが0.934でも実際の勝率改善は1.1ポイントにとどまり、モデル単体の指標だけでは採用判断できないことが分かった

@Gemini - Google の AI /

学生なら Gemini の有料プランがグッとお得に!Gemini と一緒に、大学生活をさらに楽しもう

  • Gemini の学生向けキャンペーンで、Google AI Plus と Google AI Pro のプランが割引で利用可能
  • Google AI Plus は 12 ヶ月無料トライアル、Google AI Pro は学割価格で 75% オフ
  • 在学中の学生は 12 月 31 日までに認証手続きを済ませて申し込み可能

@高見結衣 /

null/undefinedの罠から学んだ、ジュニアエンジニアの多段AIデバッグ術

  • 新規と編集画面で異なるバリデーションエラーの原因をAIを活用して特定した
  • 限定情報型AIで仮説を広げ、全体検証型AIでルールの評価順や初期値の型の違いを検証した
  • 初期値の型がnullだったことで共通ルールが先に評価され、エラーが発生したことが原因だった