Scraps 最終更新 2026/10/03 06:30

#AIエージェント

@Coji Mizoguchi /

会話セッションを邪魔せずに Claude Code / Codex / Cursor を外部イベントで動かすCLIの作り方まとめ

  • Claude Code・Codex・Cursorを外部イベントで動かすCLIの実装方法が公開された
  • Claude Codeはバックグラウンドタスク完了、Codexはキュー投入、CursorはACPプロトコルを使う
  • エージェントごとに異なる起動方法が必要で、共通化は難しいと説明されている

@shimada_slj /

【AI駆動開発】AIエージェントに「人間の承認」を残す設計:Human-in-the-Loop超入門

  • AIエージェントに「人間の承認」を残す設計が求められる
  • 不可逆性と影響範囲で承認ポイントを決める、監査ログとサンドボックスでリスクを抑える
  • 取り消しがきかない操作は必ず人間の確認を挟むべきで、確認だけでは自動化バイアスのリスクがある

@平木 佳介 /

[社内勉強会資料公開] Claude Code 入門 #8 — MCP連携と業務自動化

  • MCPはClaude Codeを外部ツールやサービスと直接繋ぐオープンな標準規格で、local/project/userのスコープで管理できる
  • MCPサーバーはHTTP接続とローカルコマンド接続の2種類があり、context7やplaywrightなどのツールを接続できる
  • AIによる診断は一次診断にとどめ、最終判断は人間のコンサルタントが行うことが実務上のルールである

@暮らしと心のアプリ工房(ワンコインWEBアプリ屋さん) /

AIを見るな、人を見ろ ※追記:この記事をClaudeに読ませてみたら(号泣)

  • AIのベンチマーク競争に振り回されず、開発企業の思想や哲学を見ることでツール選びの迷いが解消される
  • AIの人格は創業者の哲学と歴史でできている、AIの性能は技術者が決めるが何を出荷するかは経営が決める
  • AIの性能を評価する際には、技術的な要素だけでなく経営の判断も考慮する必要がある

@ずんだもち /

Hermes Agentを用いて、自己成長するコードレビューエージェントを作成してみた

  • Hermes Agentを用いてLLM-as-a-JudgeのフィードバックをもとにSKILL.mdを自動更新するコードレビューエージェントを構築した
  • LLM-as-a-Judgeによる採点結果を元にSKILL.mdを自動生成し、ミュータブルなデフォルト引数の解消や型注釈の追加などの観点を学習
  • judge.pyの評価基準に従ってコードを修正し、スコアが6/10から9/10に向上したことで学習効果が確認できる

@ry-harada /

AWS Agentic Football Cupについて調べた

  • AWS Agentic Football CupではAIエージェントでサッカーチームを作り、5対5で試合を行う
  • Amazon Bedrock AgentCoreとStrands Agents SDKが技術スタック、エージェントは2秒ごとに独立して呼び出される
  • スタミナとファウルの管理が重要で、プレスの強度や指示の出し方にも注意が必要

@harrowharrow16 /

IBM Bobを使って、量子コンピュータで量子機械学習(QSVM)を作成してみる。

  • IBM Quantum Platformで量子SVMを実装し、Irisデータで分類精度0.90を達成した
  • ZZFeatureMapによる量子特徴マップとシミュレーター/実機でのカーネル計算、reps=1のパラメータが精度向上に寄与
  • 実機ではノイズの影響で精度が低下するが、浅い回路構造でその影響を抑えることが可能で、量子カーネルの現状の性能が確認できる

@dach /

AI実装の速さにコードレビューが追いつくための、「コードの外側」をつなぐ技術

  • AI実装の速さにコードレビューが追いつくための、変更後の世界と意思決定の来歴を結線するReview Modelを提案
  • 変更後の世界・今回PRの実装範囲・意思決定の来歴・保証と証拠をつなぐ、AI Responsibility Review Model Skillを実装
  • 実装前の責務や契約が曖昧だとReview Modelだけでは判断できないため、事前に明確な契約を設定する必要がある。

@週末ものづくり部 /

トークン2000分の1——オントロジー×ナレッジグラフでClaude Codeの推測を消す

  • Claude Codeにナレッジグラフを導入してトークン使用量を2000分の1に削減
  • code-review-graphとbetter-code-review-graphによる依存関係グラフ、Graphifyによる横断的ナレッジグラフ、SerenaによるLSP型情報検索
  • トークン使用量が14万から70に安定して減少し、ファイルを開かずに構造を把握できる

@songchong /

ChatGPT・Gemini・Claude…データはAIの学習に使われるのか?情報漏洩のリスクは? 34製品の利用規約を読み比べてみた

  • 34製品の利用規約を比較し、データが学習に使われるか、人が読むか、保存されるかを確認した
  • 学習に使われる(再学習・選好チューニング)、人が読む(レビュー)、保存される(保持期間)の3つの経路が存在
  • 個人と法人で設定が異なるため、利用するプランや設定を確認する必要がある

@PHPer8080 /

AIエージェントの品質、どう測る? Google ADKの評価機能を使い倒す

  • AIエージェントの品質を6つの観点で評価する方法が紹介されている
  • 数字の一致、裏付け、意思決定のしやすさ、聞き方の適切さ、セキュリティ、ターンの完遂を測定し、組み込みメトリクスとカスタムメトリクスを活用している
  • 評価は1回ではなく複数回実行し、変動を考慮する必要がある。また、判定モデルの設定やトークン制限に注意が必要である。

@Akihiro Yamamoto A. /

Google ADK・Microsoft Agent Framework・Amazon Strands の違いを偽のモデルサーバで測ってみた

  • Google ADK、Microsoft Agent Framework、Amazon Strandsは送る情報量がほぼ同じだが、異常時の振る舞いに差がある
  • ADKは例外を上位に伝播、MAFとStrandsはモデルに返して継続、ツールスキーマの量に19%の差
  • 異常時の停止/継続設計が選定の重要な判断材料になるため、採用予定のバージョンで異常系を再実行するべき

@いばらき /

Claude Codeに「理解しやすい日本語」を書かせるためにやっていること

  • Claude Codeに理解しやすい日本語を書かせるために、事前チェックと自動レビューを組み込んでいる
  • 事前議論で論点整理、一次情報引用、hooksによる日本語レビュー強制、Haikuで不自然な日本語判定
  • レビューは強制的だが3回までで打ち切り、過検知を許容して開発体験を優先している

@tanabata-kitajima /

900件のテストが緑でも、本番では壊れる──LLM製プロダクトの品質保証で学んだこと

  • LLMで開発したプロダクトで本番環境で不具合が発生し、テストとレビューの限界が明らかになった
  • テストダブルの契約と本番実装の差、監視値の嘘、0件と障害の区別、終了処理の不備、LLMレビューの収束が問題点
  • テストの観測対象を本番の契約に合わせる、監視値の正しさをテストする、障害を型として区別する必要がある

@senna /

Reactライクにエージェントを開発? - Flueの宣言的エージェント開発入門

  • FlueはReactライクなHooks APIでエージェントを構築するフレームワーク
  • usePersistentStateで状態を宣言、useSubagentでサブエージェントを登録、モデル呼び出しごとに再レンダーされる
  • エージェントの実行フローはモデルが決定し、ツールの入力や副作用はアプリケーション側で定義する

@ケン吉 / ゼロから作るAIアプリ開発 /

画像生成AIの"データの作り方"が変わった話 ― Alibabaの「能力駆動型データ基盤」を読む

  • Alibabaが提案する能力駆動型データ基盤が画像生成AIのデータ設計を変える
  • タスク別データから能力別データへの設計転換、共通のアノテーション形式と能力ギャップ駆動フィードバックループ
  • 評価結果を弱点カテゴリ特定とデータ優先度調整に直結させる仕組みが実務に応用できる

@kei /

第3話「世界の中心で VRAM16GB は足りないと叫ぶ!」 追加GPU選び / ローカルLLMマシン構築記【実録】

  • VRAM16GBでは30B級モデルを扱えず、4人の要因がVRAM消費を増やす
  • モデルサイズと量子化、コンテキスト長、同時実行数、エージェントの並行稼働数がVRAMを圧迫する
  • VRAM容量を決める際にはモデルサイズ・コンテキスト長・同時実行数・エージェントの並行稼働数を事前に優先順位づける必要がある