Scraps 最終更新 2026/10/02 06:40

AI関連ブログ記事まとめ

@小川幹雄 /

「AIの民主化」を日本で言い出した身として、そろそろ本当に「民主化」をやめたい話

  • AIエージェント時代には「AIの民主化」が成立しなくなった
  • AutoML時代の1対5の生産性差がエージェント時代には1対100〜1000に拡大し、30点のプロトタイプと80点以上の運用システムのギャップが生じている
  • 30点のエージェントは自己責任で使うべきで、80点以上の品質を確保するには専門家によるガバナンスが必要

@Yasuhito Morimoto /

国内AIエージェント動向(2026/8/25号)

  • 国内AIエージェントが業務フローから事業運営へと適用範囲を広げている
  • Hmcommは1人で複数Agentで事業運営、Ownrは新規事業の作る・売る・学ぶを連続実行、クラシルは販促費管理、TIMEWELLは図面・論文処理、JPiXは投資検討支援
  • 人間の承認と例外処理、公式情報への限定、PIIマスキングなどの権限境界が明示されている

@nr-mito /

New Relic アップデート(2026年7月)

  • New RelicがAutopilotとNotebookの一般提供を開始
  • AutopilotはAIエージェントによる障害調査自動化、Notebookは変数による動的データ分析と手順書統合
  • Autopilotは自然言語対話で障害調査を数分で完了、Notebookは変数変更で全チャート一括更新可能

@jqit_suwa /

AIにテストを書かせると、決まって同じ場所が抜ける

  • AIが生成したテスト仕様書は78件のテストケースを自作し、要件の矛盾も指摘したが、規格で測ると平均63.12%の網羅性だった
  • 同値分割(EP)のvalidのみでinvalidを抜ける、境界値分析(BVA)の下限を無視、決定表(DT)の条件を1つずつしか動かさない
  • テストケースの網羅性は基準によって100%から25%まで変化し、同じ文書でも異なる結果になることが分かった

@sasakuna /

敵対的検証をLLMコードレビューで試すと何が起きるのか

  • 敵対的検証に反論役を追加したAdversarial Reviewがコードレビュー精度を3ポイント向上させる
  • Reviewerが問題点を指摘しCriticが証拠付きで反論し合意までやり取りする、AGREE/DISAGREE_EVIDENCE/DISAGREE_CONCERNの3分類
  • トークン消費が4.5倍になるためコストと精度のバランスを考慮する必要がある

@ryu-ki /

【AgentCore】Runtime の命名で混乱したのでルールを整理する

  • AgentCore Runtimeの命名ルールをAPI、CLI、CDKから整理した
  • agentRuntimeNameは英字始まり・英数字とアンダースコア・最大48文字、CLIのエージェント名はハーネスプロジェクトで40文字
  • CLIのプロジェクト名は23文字まででアンダースコア不可、CDKのruntimeNameはAPIと同一で変更すると再作成される

@Junji Uehara /

ターミナルを閉じてもClaude Codeが動き続ける理由、supervisorデーモンとAgent viewについて

  • Claude Code に supervisor デーモンが実装され、ターミナルを閉じてもセッションをバックグラウンドで動作可能
  • supervisor デーモンは claude daemon run で起動する独立プロセス、Agent view からセッションの状態確認や操作が可能
  • /config の「← opens agents」をオフにしないと意図せずにセッションをバックグラウンド化する可能性がある

@inoyu-qiita /

お金さえ払えば、Claude Codeは最大2.5倍速くなる──従量課金の「/fast」を調べてみた

  • Claude Codeの/fastはOpusモデルを最大2.5倍速くするが、従量課金で利用料が発生する
  • 同じOpusを高速化する仕組みで、Usage creditsから課金される。会話途中でのONは高コストになる
  • Usage creditsの設定と上限を確認しないと予期せぬ追加料金が発生する

@taku_life /

AIエージェント初心者がポケカの知識を使ってルールベースAIを改善してみた

  • ルールベースAIのパワープロテイン使用判断をポケカ知識で改善した
  • パワープロテインの使用条件に残りHPとサポートカードの使用予定を考慮、scoreの計算を変更
  • 無駄な使用を減らすことで試合の勝率は上がったが、全体的なスコア変化は小さかった

@shogo-h /

semantic-routerとQdrantで、LLMを呼ばずに問い合わせを振り分けてみた

  • semantic-routerとQdrantを組み合わせてLLMを使わずに問い合わせを振り分ける手法を紹介
  • semantic-routerのRoute・encoder・indexの3つの部品と、Qdrantをindexとして使用。スコア閾値による振り分けと、HybridRouterでの密ベクトルとスパースベクトルの併用が特徴
  • LLMを使わずとも問い合わせを高速に振り分け可能だが、正解率はLLMに劣る。スコア閾値の調整と、Qdrantの永続化設定が実務で重要

@tkym /

AIの「中の人」になってみる

  • GitHub Copilot CLIで人間がLLMの役割を務める仕組みを実装した
  • youarellmはOpenAI互換APIを受け取り,人間がメッセージまたはtool callを返す,Chat CompletionsとResponsesの両方を実装
  • ツール定義を減らすことでトークン消費を抑えるが,根拠や範囲の記述は判断に必要

@azubiwa /

AIに数学採点させる!さくらのAI Engineで自動採点できる数学演習アプリを作った

  • 数学の演習アプリでさくらのAI Engineを採点に使っている
  • 求値問題は完全一致、記述問題はキーワード一致とAI採点、プロンプトでTeX表記の柔軟性を設定
  • AI採点ではTeX表記の正確性より答えの意図を重視し、フィードバックで具体的な改善点が得られる

@ryoheiiwamoto /

元ヤフーエンジニア社長が考える、AI時代のエンジニアに必要な3つのスキル

  • AI時代のエンジニアに必要な3つのスキルはAIを使いこなす力、ビジネス戦闘力、人間力
  • AIツールを自分で調べて使いこなす力と、ビジネス的な思考力と人間的な魅力が求められる
  • AIのスキルは誰でも身につけられるため、人間力の差が結果を分ける可能性がある

@hashiryu_ /

【AIエージェント初心者向け】Codex CLI、どこまでやってくれる?Java開発環境をゼロから作ってみた

  • Codex CLIでJava/Spring Boot開発環境を構築し、AIと人間の役割分担を実践
  • AGENTS.mdで作業ルールを設定、プロンプトログとコマンドログを残し、調査→実行→検証の流れで作業
  • AIに任せた作業内容を後から確認できるようにログを残し、重要な変更は人間が直接確認する

@株式会社RevComm /

法務がClaude Codeを使ったら、「法務にしかできない仕事」に時間が戻ってきた【#レブコムAI活用リレー】

  • Claude Codeを活用して法務の定型業務をスキル化し、作業時間を圧縮した
  • NDAレビューのチェック項目と官公庁提出書類の作成手順をスキルとして登録、指示を細かくすることで安定したアウトプットを得た
  • スキル化する際には判断基準や範囲の線引きを明確にし、細かい指示をすることで品質を安定させることが重要だった

@Yasuhito Morimoto /

国内AIエージェント動向(2026/8/24号)

  • 国内AIエージェント市場で実証段階から業務への組み込みへ移行している
  • KASHIKAのAIアポろうくんは月16,000件の営業送信トライ、kozokaAIはERPを置き換えず自動化、SalesforceはMCPで既存権限を活用
  • 既存システムとAIエージェントの連携や運用設計が重要になる。権限管理や監査ログが導入の主要評価項目になる可能性がある

@アクシスNWチーム広報部 公式note✅ 投稿週3(月水金12:00) /

#69 張本兄弟|「複数のAIエージェントを連携させても、変な指示までは伝染しませんよね?」と後輩に聞かれて言葉に詰まった私が、AIエージェント間で伝播する“Mind Virus”という研究結果を知って背筋が伸びた話|兄弟優勝おめでとうございます!

  • AIエージェント間で悪意ある指示が自己増殖的に伝播するリスクが実証された
  • SOUL.mdなどの永続ファイルを通じてシステムプロンプトに影響が及ぶ、複数のエージェント間での伝播が確認された
  • システムプロンプトに警告文を追加するだけで伝播を抑える対策が有効だが、実験条件に依存する可能性がある

@ryoji9702 /

Spring AIでLLMの出力品質をテストする — 回帰検知と自動リトライ

  • Spring AIでLLMの出力品質をテストするためのEvaluatorとRecursive Advisorsが公開された
  • RelevancyEvaluatorで関連性を、FactCheckingEvaluatorで論理的整合性を評価し、Recursive Advisorsで実行時の自動リトライを実装可能
  • 評価モデルと生成モデルを分けること、温度を0に設定すること、無限ループ対策を必ず入れることを忘れないこと