@kikuziro / 1日前 AgenticRAGの判断をJevにしたら、爆速にはならなかったけど主導権が返ってきた AgenticRAGの判断をJevに置き換えると爆速にはならなかった判断と次のクエリ作りを1回のLLMリクエストで済ませていたため、Jevに置き換えてもLLM推論回数は変わらず、エージェント起動時間とトークンコスト削減が効いた質問の型を先に読み切って分岐を書く手間が増すが、判断の主導権を人間側に引き寄せられる #生成AI・LLM#AIエージェント#RAG
@Takashi_Masumori / 5日前 新しい Copilot(Home・Code・Autopilot)と料金体系を整理し、大企業で広く展開する際の課題を考えてみる 新しい Copilot が発表され、ユーザー単位のライセンスと利用量に応じた課金の2本立てにHome、Code、Autopilot が新機能、USL と UBB の2種類の料金体系、Copilot Credits が共通課金単位Cowork や Code の利用は費用対効果が難しく、全従業員への開放は現時点では難しい #生成AI・LLM#AIエージェント#RAG
@しばふ / 6日前 RAGアプリで国会の侃々諤々を明治時代まで辿ってみた RAGアプリで国会会議録を検索・分析するツールが公開された国会会議録検索システムAPIと帝国議会会議録検索システムAPIを活用、LLMで論点抽出・要約、Pythonで日付ソートによる機械的集計LLMによる時系列のハルシネーション対策として、日付の前後関係はPython側で機械的に集計している #RAG#AIエージェント#クラウド
@toshipon / 8日前 競馬の論文 100 本を Jev で仕分けて、LLM と速度とコストを比べた JevはLLMより3倍速く、同じ論文を仕分けても判定がほぼ変わらなかったJevはyes/no・択一・段階評価の答えを確率つきで返すモデル、Llama 3.3 70Bは通常のLLM、15本の計測で中央値で3倍速いJevのコストはLLMより少し高いが、100本程度なら数セントの差で済む #生成AI・LLM#AIエージェント#RAG
@Kanon Amemiya / 9日前 プロンプトエンジニアリング、人間がやらなくてよくない?LLMに自分のプロンプトを直させてみた LLMにプロンプトの最適化を任せることで、プロンプトエンジニアリングの手間を減らす仕組みを構築したタスクLLMとオプティマイザLLMを組み合わせ、誤答分析と指示文の書き直し、few-shot例の入れ替えを繰り返す評価指標の設計が重要で、正解の定義や誤りの重み付けは人間が行う必要がある #生成AI・LLM#AIエージェント#RAG
@今岡陵 / 10日前 【AI】軽量7Bで透過画像&編集もこなす!Alibabaの次世代画像生成AI「Qwen-Image-2.1」の衝撃 AlibabaのQwen-Image-2.1が公開され、透過画像生成と編集が可能になった7Bのパラメータで透過画像生成と複数参照画像の編集に対応、Qwen3-VL-8Bと組み合わせて使用可能商用利用には別途ライセンスが必要で、ローカル環境での導入には軽量化の工夫が必要 #生成AI・LLM#AIエージェント#RAG
@kikuziro / 10日前 JevでRAG検索の爆速化&コスト削減は実現できるのか検証してみた JevをRAG検索に導入することで、リランク・回答不可判定・門前払いの3箇所で速度とコストを改善できるリランクではCohereを置き換え、回答不可判定ではLLM呼び出しを削減、門前払いでは検索自体をスキップ回答不可質問が3.7%以上含まれる場合、Jev導入のコスト削減効果が顕著になる #AIエージェント#RAG#DevOps・CI/CD
@kataoka_se_sionic / 17日前 GPT-Live-1 をPython から使ってみる #1 - 音声AIとコールセンターのこれから GPT-Live-1が音声AIの全二重通信を実現し、自然なリアルタイム会話が可能になったGPT-Live-1は音声入出力を同時に処理し、割り込みや相づちが自然にできる。STORM PlatformのRAGと連携したデモが作成されているGPT-Live-1は現在STORM Platformではサポートされていないが、API経由でRAGを活用できる。実装面での紹介が次回予定されている #生成AI・LLM#AIエージェント#RAG
@就活の勝者_早稲田大学4年の就活日記 / 18日前 就活の資格に生成AIパスポートは効くのか。学生5,500円と、10月試験の申込期限9月30日 生成AIパスポート試験は10月試験までに9月30日まで申込可能で、学生は5,500円で受験できる試験時間60分、問題数60問、出題は四肢択一と複数選択、シラバスにはRAGやAIエージェントが含まれる面接でアピールするには資格名だけでなく、生成AIのリスクと使い分けの知識が必要で、無料50問で現在の正答率を確認すべき #生成AI・LLM#AIエージェント#RAG
@あおたん / 21日前 【失敗談】Geminiの急な挙動の変化に振り回された私が実践した、原因と対策の全手順 Geminiの急な挙動変化の原因と対策を実務で使える方法で解説しているコンテキストの肥大化や確率的生成モデルの特性、画像編集時の範囲指定不足が原因。スレッドの切り替えやプロンプトの構造化、Few-shotプロンプティングが対策スレッドを切り替えることでコンテキスト汚染を防ぎ、プロンプトに具体例を含めることで出力の安定性を高めることができる #生成AI・LLM#AIエージェント#RAG
@川田涼太 / 21日前 2026年エンジニアが押さえておきたいAIの「今」と「これから」 2026年のAI技術は「生成」から「推論・行動」へのシフトが進んでいるエージェント型AIの設計思想が標準化され、LangChainなどのフレームワークが活用され、コストと運用の視点が重要になるAIの得意不得意の差が大きく、実務ではコストと運用の視点が不可欠で、モデルの使い分けが求められる #生成AI・LLM#AIエージェント#RAG
@Yutaka Kashiwabara / 21日前 GPT-6 AstraのPrompt Cacheを実測 — 呼び出し元リージョンを変えてもcache hitを確認 GPT-6 AstraのPrompt Cacheが呼び出し元リージョンを変えてもcache hitを確認Prompt Cacheのキャッシュエントリがエンドポイント・リージョン・API・Guardrailsの有無で再利用可能、reasoning.effortは初めて指定した値でcache write、同じ値でcache readクロスリージョンでもcache readが成立し、input単価が90%低下するが、Implicit Prompt Cachingはbest effortでcache hit保証なし #生成AI・LLM#AIエージェント#RAG
@KenshoTakizawa@ベスト69元ゴルファーのエンジニア / 22日前 RAGの精度は「データ」で決まる — Contextual Retrievalを実測したら1位正解率が36%→100%になった Contextual Retrievalを導入すると検索の1位正解率が36%から100%に改善したチャンクの先頭にLLMが文脈を追加して索引化、検索精度向上とトークン削減が同時に実現検索精度向上は入力トークン数の削減に直結し、APIコストを下げることができる #生成AI・LLM#RAG#AIエージェント
@ko_koyama_w / 22日前 AWS AgentCore Evaluationsを使ってAIエージェントを評価してみた AWS AgentCore EvaluationsでAIエージェントを評価できるマネージドサービスが登場Built-in evaluatorsでResponse Quality・Goal Success Rate・Tool Selection Accuracyなど5つの指標を自動評価、LLM-as-a-Judgeで品質スコア算出Helpfulnessはユーザー視点での役立ち度を評価し、Goal Success Rateは目的達成度を別軸で測るため複数指標で総合評価が必要 #AIエージェント#RAG#機械学習
@TakanobuSano / 27日前 GPT-6 Astra、ARC-AGI-3で99.9%──なぜこれから「プロンプト」より「エージェントアーキテクチャ」が重要になるのか GPT-6 AstraはARC-AGI-3でStandard harnessで62.7%、Provider Adapter harnessで99.9%を達成したStandard harnessは環境を攻略しながらノートを残す仕組み、Provider Adapter harnessはopaque reasoning stateとcompactionを活用するモデルの能力だけでなく、エージェントアーキテクチャの設計が結果に大きく影響する #生成AI・LLM#AIエージェント#RAG
@uisaki99 / 28日前 Claude Fable 5.1 を使ってみる:長時間エージェント開発で注目したい進化点 Claude Fable 5.1 は長時間エージェント開発向けに設計されたモデルで、コード・ログ・ドキュメント・ツールを横断してタスクを進めるエージェント型コーディング、科学タスク、コンピュータ操作、業務自動化の性能向上、キャッシュ読み取り料金の低下長時間ワークフローではキャッシュ料金が総コストに大きく影響し、モデルの能力を引き出すにはタスク設計・権限分離・テストが重要 #生成AI・LLM#AIエージェント#RAG
@たこやき / 29日前 表記ゆれで埋め込みベクトルの類似度はどれだけ変動するのか 【Amazon Titan Embeddings V2】 AWS Bedrockのamazon.titan-embed-text-v2:0で表記ゆれの類似度を検証したアルファベット大小・区切りゆれ、文字種の違い、現場でよく見る表記ゆれ、タイポ・記号ゆれの4カテゴリでcos類似度を計算カタカナや英字の違いで類似度が0.048〜0.088と大きく低下し、空白や記号のゆれはタイポより検索に影響大 #生成AI・LLM#RAG#機械学習
@Atsushi Kadowaki / 30日前 Google提唱の「SKILL.state」について。プロンプトに型の概念を導入 SKILL.stateはAIエージェントに会話履歴を渡さずに構造化された実行状態を明示的に渡す手法を採用構造化データ(State)と固定スキル指示、最新観測結果を3つだけ渡す。過去の履歴は一切使わず、JSONパッチで状態を更新長時間タスクでも精度を維持し、トークン消費を大幅に削減できる。ノイズが混入しても状態更新時にフィルタされる #AIエージェント#生成AI・LLM#RAG
@週末ものづくり部 / 30日前 トークン2000分の1——オントロジー×ナレッジグラフでClaude Codeの推測を消す Claude Codeにナレッジグラフを導入してトークン使用量を2000分の1に削減code-review-graphとbetter-code-review-graphによる依存関係グラフ、Graphifyによる横断的ナレッジグラフ、SerenaによるLSP型情報検索トークン使用量が14万から70に安定して減少し、ファイルを開かずに構造を把握できる #AIエージェント#RAG#機械学習
@ケン吉 / ゼロから作るAIアプリ開発 / 30日前 画像生成AIの"データの作り方"が変わった話 ― Alibabaの「能力駆動型データ基盤」を読む Alibabaが提案する能力駆動型データ基盤が画像生成AIのデータ設計を変えるタスク別データから能力別データへの設計転換、共通のアノテーション形式と能力ギャップ駆動フィードバックループ評価結果を弱点カテゴリ特定とデータ優先度調整に直結させる仕組みが実務に応用できる #生成AI・LLM#AIエージェント#RAG