Scraps 最終更新 2026/10/03 12:40

#AIエージェント

@Taste of Tech Topics /

コンテキストエンジニアリングの最新事情— GraphRAGとOKFを実際に動かして整理してみた

  • GraphRAGとOKFの比較検証で、知識グラフの構築と管理の課題が明らかになった
  • GraphRAGは自動抽出でノード分裂とコスト増大、OKFはシステム前提のページ名固定で概念分裂を防ぐ
  • OKFは既存システムの構造を活用するが、関係性の判断は6割未満で人間の修正が必要

@nr-mito /

New Relic アップデート(2026年7月)

  • New RelicがAutopilotとNotebookの一般提供を開始
  • AutopilotはAIエージェントによる障害調査自動化、Notebookは変数による動的データ分析と手順書統合
  • Autopilotは自然言語対話で障害調査を数分で完了、Notebookは変数変更で全チャート一括更新可能

@jqit_suwa /

AIにテストを書かせると、決まって同じ場所が抜ける

  • AIが生成したテスト仕様書は78件のテストケースを自作し、要件の矛盾も指摘したが、規格で測ると平均63.12%の網羅性だった
  • 同値分割(EP)のvalidのみでinvalidを抜ける、境界値分析(BVA)の下限を無視、決定表(DT)の条件を1つずつしか動かさない
  • テストケースの網羅性は基準によって100%から25%まで変化し、同じ文書でも異なる結果になることが分かった

@sasakuna /

敵対的検証をLLMコードレビューで試すと何が起きるのか

  • 敵対的検証に反論役を追加したAdversarial Reviewがコードレビュー精度を3ポイント向上させる
  • Reviewerが問題点を指摘しCriticが証拠付きで反論し合意までやり取りする、AGREE/DISAGREE_EVIDENCE/DISAGREE_CONCERNの3分類
  • トークン消費が4.5倍になるためコストと精度のバランスを考慮する必要がある

@クロスマート Tech Blog /

Claude Codeのメモリ機能で、何を覚えさせて何を覚えさせないか

  • Claude Codeのメモリ機能で、フィードバックや好みを記憶させることで作業効率を向上させる
  • フィードバックタイプの記憶で理由まで記録し、userタイプで使い手の好みを保存する。変化する情報は現状ファイルに集約する
  • 変化する予定や進行状況はメモリに保存せず、常に現状ファイルを確認する必要がある

@平木 佳介 /

[社内勉強会資料公開] Claude Code 入門 #7 — プラグインとマーケットプレイスで一気に拡張する

  • Claude Codeでプラグインを導入して機能を拡張する方法が説明されている
  • プラグインはスキル・サブエージェント・スラッシュコマンドをまとめて配布し、マーケットプレイスからインストールする
  • 導入前に出所・中身・更新状況を確認する習慣がセキュリティ面で重要

@wfukatsu /

【チームによるAI駆動開発の勘所:第7回】AIに、二度、同じ指摘をしない

  • レビュー指摘の資産化率を測る指標を定義し、還元不要の判定基準を示した
  • 資産化率は還元済み件数÷還元対象件数、還元不要には4つの理由コードが設定されている
  • 還元不要の判定にはリーダーの承認が必要で、分母の操作を防ぐための仕組みが導入されている

@ryu-ki /

【AgentCore】Runtime の命名で混乱したのでルールを整理する

  • AgentCore Runtimeの命名ルールをAPI、CLI、CDKから整理した
  • agentRuntimeNameは英字始まり・英数字とアンダースコア・最大48文字、CLIのエージェント名はハーネスプロジェクトで40文字
  • CLIのプロジェクト名は23文字まででアンダースコア不可、CDKのruntimeNameはAPIと同一で変更すると再作成される

@Junji Uehara /

ターミナルを閉じてもClaude Codeが動き続ける理由、supervisorデーモンとAgent viewについて

  • Claude Code に supervisor デーモンが実装され、ターミナルを閉じてもセッションをバックグラウンドで動作可能
  • supervisor デーモンは claude daemon run で起動する独立プロセス、Agent view からセッションの状態確認や操作が可能
  • /config の「← opens agents」をオフにしないと意図せずにセッションをバックグラウンド化する可能性がある

@inoyu-qiita /

お金さえ払えば、Claude Codeは最大2.5倍速くなる──従量課金の「/fast」を調べてみた

  • Claude Codeの/fastはOpusモデルを最大2.5倍速くするが、従量課金で利用料が発生する
  • 同じOpusを高速化する仕組みで、Usage creditsから課金される。会話途中でのONは高コストになる
  • Usage creditsの設定と上限を確認しないと予期せぬ追加料金が発生する

@taku_life /

AIエージェント初心者がポケカの知識を使ってルールベースAIを改善してみた

  • ルールベースAIのパワープロテイン使用判断をポケカ知識で改善した
  • パワープロテインの使用条件に残りHPとサポートカードの使用予定を考慮、scoreの計算を変更
  • 無駄な使用を減らすことで試合の勝率は上がったが、全体的なスコア変化は小さかった

@shogo-h /

semantic-routerとQdrantで、LLMを呼ばずに問い合わせを振り分けてみた

  • semantic-routerとQdrantを組み合わせてLLMを使わずに問い合わせを振り分ける手法を紹介
  • semantic-routerのRoute・encoder・indexの3つの部品と、Qdrantをindexとして使用。スコア閾値による振り分けと、HybridRouterでの密ベクトルとスパースベクトルの併用が特徴
  • LLMを使わずとも問い合わせを高速に振り分け可能だが、正解率はLLMに劣る。スコア閾値の調整と、Qdrantの永続化設定が実務で重要

@tkym /

AIの「中の人」になってみる

  • GitHub Copilot CLIで人間がLLMの役割を務める仕組みを実装した
  • youarellmはOpenAI互換APIを受け取り,人間がメッセージまたはtool callを返す,Chat CompletionsとResponsesの両方を実装
  • ツール定義を減らすことでトークン消費を抑えるが,根拠や範囲の記述は判断に必要

@azubiwa /

AIに数学採点させる!さくらのAI Engineで自動採点できる数学演習アプリを作った

  • 数学の演習アプリでさくらのAI Engineを採点に使っている
  • 求値問題は完全一致、記述問題はキーワード一致とAI採点、プロンプトでTeX表記の柔軟性を設定
  • AI採点ではTeX表記の正確性より答えの意図を重視し、フィードバックで具体的な改善点が得られる

@ryoheiiwamoto /

元ヤフーエンジニア社長が考える、AI時代のエンジニアに必要な3つのスキル

  • AI時代のエンジニアに必要な3つのスキルはAIを使いこなす力、ビジネス戦闘力、人間力
  • AIツールを自分で調べて使いこなす力と、ビジネス的な思考力と人間的な魅力が求められる
  • AIのスキルは誰でも身につけられるため、人間力の差が結果を分ける可能性がある

@hashiryu_ /

【AIエージェント初心者向け】Codex CLI、どこまでやってくれる?Java開発環境をゼロから作ってみた

  • Codex CLIでJava/Spring Boot開発環境を構築し、AIと人間の役割分担を実践
  • AGENTS.mdで作業ルールを設定、プロンプトログとコマンドログを残し、調査→実行→検証の流れで作業
  • AIに任せた作業内容を後から確認できるようにログを残し、重要な変更は人間が直接確認する

@naoshi /

個人レベルにとどまっていたAI活用を、開発フロー全体に広げて手戻りを減らした話

  • AI活用を個人レベルから開発フロー全体に広げて手戻りを減らす開発フローを刷新した
  • リファインメントで不確実性を明らかにし、ドキュメントで認識合わせをし、同期レビューでズレを早期に潰す
  • リファインメント中にAIでモック生成しながら他の論点を先に詰める工夫がリファインメント時間を短縮した