Scraps 最終更新 2026/10/01 18:20

#RAG

@kikuziro /

AgenticRAGの判断をJevにしたら、爆速にはならなかったけど主導権が返ってきた

  • AgenticRAGの判断をJevに置き換えると爆速にはならなかった
  • 判断と次のクエリ作りを1回のLLMリクエストで済ませていたため、Jevに置き換えてもLLM推論回数は変わらず、エージェント起動時間とトークンコスト削減が効いた
  • 質問の型を先に読み切って分岐を書く手間が増すが、判断の主導権を人間側に引き寄せられる

@Takashi_Masumori /

新しい Copilot(Home・Code・Autopilot)と料金体系を整理し、大企業で広く展開する際の課題を考えてみる

  • 新しい Copilot が発表され、ユーザー単位のライセンスと利用量に応じた課金の2本立てに
  • Home、Code、Autopilot が新機能、USL と UBB の2種類の料金体系、Copilot Credits が共通課金単位
  • Cowork や Code の利用は費用対効果が難しく、全従業員への開放は現時点では難しい

@しばふ /

RAGアプリで国会の侃々諤々を明治時代まで辿ってみた

  • RAGアプリで国会会議録を検索・分析するツールが公開された
  • 国会会議録検索システムAPIと帝国議会会議録検索システムAPIを活用、LLMで論点抽出・要約、Pythonで日付ソートによる機械的集計
  • LLMによる時系列のハルシネーション対策として、日付の前後関係はPython側で機械的に集計している

@Kanon Amemiya /

プロンプトエンジニアリング、人間がやらなくてよくない?LLMに自分のプロンプトを直させてみた

  • LLMにプロンプトの最適化を任せることで、プロンプトエンジニアリングの手間を減らす仕組みを構築した
  • タスクLLMとオプティマイザLLMを組み合わせ、誤答分析と指示文の書き直し、few-shot例の入れ替えを繰り返す
  • 評価指標の設計が重要で、正解の定義や誤りの重み付けは人間が行う必要がある

@今岡陵 /

【AI】軽量7Bで透過画像&編集もこなす!Alibabaの次世代画像生成AI「Qwen-Image-2.1」の衝撃

  • AlibabaのQwen-Image-2.1が公開され、透過画像生成と編集が可能になった
  • 7Bのパラメータで透過画像生成と複数参照画像の編集に対応、Qwen3-VL-8Bと組み合わせて使用可能
  • 商用利用には別途ライセンスが必要で、ローカル環境での導入には軽量化の工夫が必要

@kikuziro /

JevでRAG検索の爆速化&コスト削減は実現できるのか検証してみた

  • JevをRAG検索に導入することで、リランク・回答不可判定・門前払いの3箇所で速度とコストを改善できる
  • リランクではCohereを置き換え、回答不可判定ではLLM呼び出しを削減、門前払いでは検索自体をスキップ
  • 回答不可質問が3.7%以上含まれる場合、Jev導入のコスト削減効果が顕著になる

@kataoka_se_sionic /

GPT-Live-1 をPython から使ってみる #1 - 音声AIとコールセンターのこれから

  • GPT-Live-1が音声AIの全二重通信を実現し、自然なリアルタイム会話が可能になった
  • GPT-Live-1は音声入出力を同時に処理し、割り込みや相づちが自然にできる。STORM PlatformのRAGと連携したデモが作成されている
  • GPT-Live-1は現在STORM Platformではサポートされていないが、API経由でRAGを活用できる。実装面での紹介が次回予定されている

@就活の勝者_早稲田大学4年の就活日記 /

就活の資格に生成AIパスポートは効くのか。学生5,500円と、10月試験の申込期限9月30日

  • 生成AIパスポート試験は10月試験までに9月30日まで申込可能で、学生は5,500円で受験できる
  • 試験時間60分、問題数60問、出題は四肢択一と複数選択、シラバスにはRAGやAIエージェントが含まれる
  • 面接でアピールするには資格名だけでなく、生成AIのリスクと使い分けの知識が必要で、無料50問で現在の正答率を確認すべき

@あおたん /

【失敗談】Geminiの急な挙動の変化に振り回された私が実践した、原因と対策の全手順

  • Geminiの急な挙動変化の原因と対策を実務で使える方法で解説している
  • コンテキストの肥大化や確率的生成モデルの特性、画像編集時の範囲指定不足が原因。スレッドの切り替えやプロンプトの構造化、Few-shotプロンプティングが対策
  • スレッドを切り替えることでコンテキスト汚染を防ぎ、プロンプトに具体例を含めることで出力の安定性を高めることができる

@川田涼太 /

2026年エンジニアが押さえておきたいAIの「今」と「これから」

  • 2026年のAI技術は「生成」から「推論・行動」へのシフトが進んでいる
  • エージェント型AIの設計思想が標準化され、LangChainなどのフレームワークが活用され、コストと運用の視点が重要になる
  • AIの得意不得意の差が大きく、実務ではコストと運用の視点が不可欠で、モデルの使い分けが求められる

@Yutaka Kashiwabara /

GPT-6 AstraのPrompt Cacheを実測 — 呼び出し元リージョンを変えてもcache hitを確認

  • GPT-6 AstraのPrompt Cacheが呼び出し元リージョンを変えてもcache hitを確認
  • Prompt Cacheのキャッシュエントリがエンドポイント・リージョン・API・Guardrailsの有無で再利用可能、reasoning.effortは初めて指定した値でcache write、同じ値でcache read
  • クロスリージョンでもcache readが成立し、input単価が90%低下するが、Implicit Prompt Cachingはbest effortでcache hit保証なし

@KenshoTakizawa@ベスト69元ゴルファーのエンジニア /

RAGの精度は「データ」で決まる — Contextual Retrievalを実測したら1位正解率が36%→100%になった

  • Contextual Retrievalを導入すると検索の1位正解率が36%から100%に改善した
  • チャンクの先頭にLLMが文脈を追加して索引化、検索精度向上とトークン削減が同時に実現
  • 検索精度向上は入力トークン数の削減に直結し、APIコストを下げることができる

@ko_koyama_w /

AWS AgentCore Evaluationsを使ってAIエージェントを評価してみた

  • AWS AgentCore EvaluationsでAIエージェントを評価できるマネージドサービスが登場
  • Built-in evaluatorsでResponse Quality・Goal Success Rate・Tool Selection Accuracyなど5つの指標を自動評価、LLM-as-a-Judgeで品質スコア算出
  • Helpfulnessはユーザー視点での役立ち度を評価し、Goal Success Rateは目的達成度を別軸で測るため複数指標で総合評価が必要

@TakanobuSano /

GPT-6 Astra、ARC-AGI-3で99.9%──なぜこれから「プロンプト」より「エージェントアーキテクチャ」が重要になるのか

  • GPT-6 AstraはARC-AGI-3でStandard harnessで62.7%、Provider Adapter harnessで99.9%を達成した
  • Standard harnessは環境を攻略しながらノートを残す仕組み、Provider Adapter harnessはopaque reasoning stateとcompactionを活用する
  • モデルの能力だけでなく、エージェントアーキテクチャの設計が結果に大きく影響する

@uisaki99 /

Claude Fable 5.1 を使ってみる:長時間エージェント開発で注目したい進化点

  • Claude Fable 5.1 は長時間エージェント開発向けに設計されたモデルで、コード・ログ・ドキュメント・ツールを横断してタスクを進める
  • エージェント型コーディング、科学タスク、コンピュータ操作、業務自動化の性能向上、キャッシュ読み取り料金の低下
  • 長時間ワークフローではキャッシュ料金が総コストに大きく影響し、モデルの能力を引き出すにはタスク設計・権限分離・テストが重要

@たこやき /

表記ゆれで埋め込みベクトルの類似度はどれだけ変動するのか 【Amazon Titan Embeddings V2】

  • AWS Bedrockのamazon.titan-embed-text-v2:0で表記ゆれの類似度を検証した
  • アルファベット大小・区切りゆれ、文字種の違い、現場でよく見る表記ゆれ、タイポ・記号ゆれの4カテゴリでcos類似度を計算
  • カタカナや英字の違いで類似度が0.048〜0.088と大きく低下し、空白や記号のゆれはタイポより検索に影響大

@Atsushi Kadowaki /

Google提唱の「SKILL.state」について。プロンプトに型の概念を導入

  • SKILL.stateはAIエージェントに会話履歴を渡さずに構造化された実行状態を明示的に渡す手法を採用
  • 構造化データ(State)と固定スキル指示、最新観測結果を3つだけ渡す。過去の履歴は一切使わず、JSONパッチで状態を更新
  • 長時間タスクでも精度を維持し、トークン消費を大幅に削減できる。ノイズが混入しても状態更新時にフィルタされる

@週末ものづくり部 /

トークン2000分の1——オントロジー×ナレッジグラフでClaude Codeの推測を消す

  • Claude Codeにナレッジグラフを導入してトークン使用量を2000分の1に削減
  • code-review-graphとbetter-code-review-graphによる依存関係グラフ、Graphifyによる横断的ナレッジグラフ、SerenaによるLSP型情報検索
  • トークン使用量が14万から70に安定して減少し、ファイルを開かずに構造を把握できる

@ケン吉 / ゼロから作るAIアプリ開発 /

画像生成AIの"データの作り方"が変わった話 ― Alibabaの「能力駆動型データ基盤」を読む

  • Alibabaが提案する能力駆動型データ基盤が画像生成AIのデータ設計を変える
  • タスク別データから能力別データへの設計転換、共通のアノテーション形式と能力ギャップ駆動フィードバックループ
  • 評価結果を弱点カテゴリ特定とデータ優先度調整に直結させる仕組みが実務に応用できる