Scraps 最終更新 2026/10/02 01:40

#AIエージェント

@Mirai Translate TECH BLOG /

執筆者もレビュアーも AI を使う時代の、技術ブログレビューの設計

  • 技術ブログのレビューをAIと人間で分担する運用を設計した
  • 執筆者のAIレビューで文章品質を担保、編集部は4つの観点のみ確認。指摘の条件に根拠の提示と質問形式を導入
  • AIの指摘は根拠を伴わないと修正要求にならない。確認した項目を記録に残すことで二重チェックを確実にする

@ikedan /

AIのテスト設計、90点未満は差し戻す

  • AIが生成したテスト設計はルールベースの検証では不十分で、多段パイプラインで採点と敵対レビューを組み合わせて品質を確保する
  • 採点器(100点満点で90点未満は差し戻し)と、生成文脈を知らない敵対レビュアーを組み合わせ、調査・観点シート・テストケースの展開を分離する
  • 90点未満のテスト設計は減点理由とともに再生成されるが、敵対レビューで採点器が見逃した欠陥も検出する

@rikachiii /

POPOPO と AI 開発 - 01. POPOPO の AI 開発概要

  • POPOPOのバックエンド開発でDevinを活用し、約289,000行のコードを2.6人チームで管理した
  • Devinによるコード生成とClaude Codeの併用、Firestoreを前提とした設計、統合テストとlintの基盤
  • AI導入後の70%のPRがDevinによるもので、コード量の85%がAIで追加されたが、開発効率の向上にはAI以前の基盤も影響している

@RyoskDara_ /

Agent MetadataでDatabricks Genieの挙動はどう変わるか?

  • Databricks GenieのAgent Metadataのsynonymsに社内略語を記載すると、ユーザーの質問に正しい指標を返せるようになる
  • synonymsに「解約率」と記載すると取引先ベースの指標を、別名に「ACV」と記載すると受注金額の指標を引き当てられる
  • 同じ言葉で複数の指標がある場合はsynonymsを記載しないと意図しない指標が返ってくる可能性がある

@Yasuhito Morimoto /

国内AIエージェント動向(2026/9/25号)

  • 国内AIエージェントが業務システム操作や施策実行まで行う段階へ移行
  • RUFU AIはEC・業務ツール横断操作、ECPRO BRAINは分析から実行・検証まで一体化、GMOグローバルサイン・HDとVESS LabsはAIエージェント間取引の信頼基盤実証
  • AIエージェントの権限管理や監査ログ、人による承認が導入の成否を左右する

@rw21 /

情シス依頼の一次受付をAI Agentに任せるっきゅ!

  • Slackで依頼の一次受付をAIエージェントが行う仕組みを実装した
  • Claude Agent SDKとOpenClawを活用し、キャラクター性をプロンプトに組み込み、フィードバック収集用のツールを導入
  • 非エンジニアも改善に参加できるようにHermesエージェントを活用し、フィードバックを収集して改善サイクルに反映

@ryosuke_ohori /

Jev完全ガイド:GPTやClaudeとは違う「判断するAI」は何を変えるのか!?

  • Jevは文章生成ではなく型付き確率的判断を返すAIモデル
  • 型付き質問とstateを一度の並列処理で評価、Choice/Score/Noulの3種類の質問形式、キャリブレーションされたConfidence値を返す
  • 判断結果の信頼度(Confidence)で自動処理/人間確認のバランスをコードで制御可能

@koki takeishi /

Physical AI、この1年で何が変わった? VLA・世界モデル・小型化をざっくり整理

  • Physical AIのVLA・世界モデル・小型化が進化し、実用化に向けた実装が進んでいる
  • VLAは経験と記憶を活用する仕組みが追加され、世界モデルは行動予測と映像生成を組み合わせる。SmolVLAは4.5億パラメータの小型VLAが登場
  • ロボット学習ではエピソードを残すことで後から振り返りが可能で、データの再現性と比較が重要

@ik-fib /

文章を返さないAI「Jev」を試してみた ── 社内問い合わせのエスカレーション先は判定できるか

  • Jevを用いて社内問い合わせのエスカレーション先を判定する仕組みを実装した
  • Jevは確率やスコアを返す型付き質問に対応、分岐ルールはコードで明示的に設計
  • 分類の確信度が低い問い合わせは自動判定せず人間に回す仕組みが必要

@nanora /

/claude-api prompt-audit で棚卸ししたら、Claude Opus 5.5 化で外れた設定がぞろぞろ出てきた

  • Claude Opus 5.5 にアップグレードしたことで、古いモデル向けの設定が動作しなくなった
  • モデルエイリアスが変更されていて、effort 設定が実際のモデル ID に一致しなかった、CLAUDE.md のパス設定が古いファイルを指していた
  • モデルのバージョン変更時に設定ファイルのモデル ID を確認し、セッション記録から effort 設定の有効性を確認する必要がある

@kinop3 /

【Hike言語】Wasm難読化の自作から初OSS、そして言語開発者の神対応で「クラッシュ防止機能」を即日実装できた話

  • Hike言語でコンパイルしたWasmとJSの難読化でアプリがクラッシュする問題を解決した
  • WasmとJSの境界関数名をコンパイラから出力する--export-symbolsオプションと、難読化ツールで関数名リストを保護する仕組み
  • 難読化でWasm境界が壊れないようにするにはコンパイラから関数名リストを取得し、外部ツールで保護する必要がある

@ennagara128 /

2026年9月25日 今日のQiitaトレンド記事をポッドキャストで聴こう!

  • Qiitaのトレンド記事をAIポッドキャストで毎朝配信するサービスが始まった
  • 毎日朝7時に前日のトレンド記事をAIで読み上げたポッドキャストを更新、通勤中などに聴ける
  • 通勤中などに記事を聴けるようにするためのサービスで、フィードバックを求めている

@AIのある暮らし公式note /

GPT-6 Sol・Luna公開/Claude Opus 5.5登場/声で仕事を頼めるChatGPT/Geminiの新音声モデル/Metaの新AIグラス/YouTubeに会話型編集【週刊AIのニュース 2026年9月25日号】

  • GPT-6 SolとLunaが公開され、API料金が前世代の半額に
  • Solは複雑な仕事を低コストで処理、Lunaは速度と費用を優先、Claude Opus 5.5は性能はFable 5.1並みでコスト4割減
  • API料金の変更により、大量資料処理や繰り返し処理が試しやすくなったが、実際の品質は自身の業務で確認する必要がある

@しばふ /

RAGアプリで国会の侃々諤々を明治時代まで辿ってみた

  • RAGアプリで国会会議録を検索・分析するツールが公開された
  • 国会会議録検索システムAPIと帝国議会会議録検索システムAPIを活用、LLMで論点抽出・要約、Pythonで日付ソートによる機械的集計
  • LLMによる時系列のハルシネーション対策として、日付の前後関係はPython側で機械的に集計している

@koki takeishi /

AI駆動開発でスクラムはどう変わる?短くなるサイクルとレトロの役割

  • AI駆動開発でスクラムのサイクルが短くなり、レトロスペクティブの役割が広がる
  • コード補完やエージェントへの作業委任で作業速度が向上、レビュー待ちや手戻りの負担が増える、スプリントの長さは1か月以内を維持する
  • スプリント内での実装・検証サイクルを頻繁に回し、レトロでAI利用の効果と負担を確認する

@TechCrunch Events /

Shield AI、Waabi、General MotorsがAIシステムの実世界での信頼性確保について語る

  • Shield AI、Waabi、General MotorsがAIシステムの実世界での信頼性確保について語る
  • 高リスク環境でのAIシステムの検証プロセスと、信頼構築のための安全文化、規制対応が中心
  • 実世界でのAI導入には、検証と信頼構築が不可欠で、準備が不十分な状態では導入できないことが示されている

@Dominic-Madori Davis /

Ando、Slackに挑むチームメッセージングアプリをリリース

  • Andoは人間とAIエージェントが共同で作業できるチームメッセージングアプリをリリースした
  • AIエージェントに独自のアイデンティティと受信箱を提供し、会話に自然に参加できる仕組みと、人間が中継者にならないようにする設計
  • 企業がAIエージェントを使う際のコミュニケーション手段としての可能性が示されている