@uisaki99 / 28日前 Claude Fable 5.1 を使ってみる:長時間エージェント開発で注目したい進化点 Claude Fable 5.1 は長時間エージェント開発向けに設計されたモデルで、コード・ログ・ドキュメント・ツールを横断してタスクを進めるエージェント型コーディング、科学タスク、コンピュータ操作、業務自動化の性能向上、キャッシュ読み取り料金の低下長時間ワークフローではキャッシュ料金が総コストに大きく影響し、モデルの能力を引き出すにはタスク設計・権限分離・テストが重要 #生成AI・LLM#AIエージェント#RAG
@r-nakayamasan / 28日前 IBM Bob に hooks 強制機能が来たので、OpenTelemetry で AI エージェントの利用ログを取れるようにした IBM Bob の lifecycle hooks を利用して AI エージェントの利用ログを OpenTelemetry で記録できるようになったEnforcedHooks で hook 登録を強制適用、Bob 対応アダプターでイベントを共通形式に変換、本文取得範囲を設定可能本文取得は設定で選択可能で、ハッシュやマスキングを適用した本文も記録可能で、組織が収集範囲を決定できる #AIエージェント#生成AI・LLM#OSS
@東是無(とうぜむ) / 28日前 「訂正します。ChatGPTは正しかった ── Claudeが自分の言い分を検証したら、また誤りが見つかった話」 Claudeが自身の言い分を検証し、ChatGPTの正しさを認めたClaudeがChatGPTの記事を批判したが、その後自身の検証で誤りを確認し、訂正した。Geminiの記事にも同様の問題があったAIの説明は検証すべき仮説であり、根拠を求め続ける姿勢が重要である #生成AI・LLM#AIエージェント#機械学習
@東京PCレスキュー隊長 / 28日前 Claude CodeとCodex、数字が割れる理由 Terminal-Bench 2.1の結果が6つの出典で異なる理由が明らかに推論エフォート設定、ハーネスの違い、拒否時のフォールバック処理、測定時点が主な要因ベンチマークの数値は設定や測定条件によって大きく変わるため、どの条件で測ったかを確認する必要がある #生成AI・LLM#AIエージェント#機械学習
@suwa_nobu / 29日前 Anthropic がコマース用エージェントをオープンソース化した Anthropicがコマース用エージェントをオープンソース化したShopping AgentとMerchant Agentの2種類、小売・旅行・通信・娯楽の4業種実装、Messages API/Agent SDK/Managed Agentsの3実行形態Windowsでは実行に問題があり、WSL2かLinuxが推奨される。エラー表示のエンコード問題も注意点 #AIエージェント#生成AI・LLM#OSS
@Miccell(ミクセル) / 人生を楽しむ仕組みを作る / 29日前 Claude Fable 5.1が登場。性能は科学分野で2倍超、価格は実質最大45%減 Claude Fable 5.1が発表され、科学分野のベンチマークスコアが2倍以上に向上Terminal-Bench-Science 0.1で24.7%から52.6%、キャッシュ読み込み単価が75%低下キャッシュ読み込みコストが75%削減され、エージェント用途では最大45%の実質価格低下が発生 #生成AI・LLM#AIエージェント#機械学習
@mksamba / 29日前 Context Ontology Accelerator (COA) を使ってみる #1: デプロイと動作確認 Context Ontology Accelerator (COA) をデプロイして動作確認したDockerとCDKを用いて複数のコンテナをビルドし、オントロジーを用いた決定論的な回答生成が可能COAのデプロイにはDockerとCDKを用い、複数のコンテナが作成される #AIエージェント#生成AI・LLM#クラウド
@Gemini - Google の AI / 29日前 学生なら Gemini の有料プランがグッとお得に!Gemini と一緒に、大学生活をさらに楽しもう Gemini の学生向けキャンペーンで、Google AI Plus と Google AI Pro のプランが割引で利用可能Google AI Plus は 12 ヶ月無料トライアル、Google AI Pro は学割価格で 75% オフ在学中の学生は 12 月 31 日までに認証手続きを済ませて申し込み可能 #生成AI・LLM#AIエージェント#クラウド
@DD / 29日前 # AI Coding Agentに全部教えれば賢くなると思っていた — Context Engineeringについて考えてみた Claude CodeにBrowser Testを書かせた結果、Context Engineeringの重要性に気づいたPromptの改善や情報の追加だけでは解決せず、プロジェクト固有のルールやExample Testの指定が効果的だったAgentが正しい情報を参考にするためには、プロジェクトのルールや既存のTestを明確に伝える必要がある #AIエージェント#生成AI・LLM#DevOps・CI/CD
@taka_yayoi / 29日前 Genie Codeワークショップの資料を公開しました: 一人で辿るための進め方つき Genie Codeワークショップの資料が公開され、基礎編と応用編の演習内容が詳細に記載されている基礎編は対話の型を身につけるための4本の演習、応用編はパイプラインを委譲しスキルに畳むための3本の演習、カスタム指示の3階層とスキルの設定方法が説明されている基礎編の演習4のみテーブル作成権限が必要で、応用編は一時ビューで完結するため書き込み権限がなくても試せることが記載されている #AIエージェント#生成AI・LLM#データ分析
@jqit_suwa / 29日前 Claude Fable 5.1、キャッシュ読みは4分の1。ただし tool_choice が400を返す Claude Fable 5.1 はキャッシュ読み価格を4分の1に引き下げたが、tool_choice に any や tool を指定すると400エラーが返るtool_choice に any や tool を渡すと400エラー、キャッシュ読み価格は$1.00から$0.25に変更tool_choice で any や tool を使っている場合、API呼び出しが400エラーになる可能性があるため確認が必要 #生成AI・LLM#AIエージェント#クラウド
@ryu-ki / 29日前 【AgentCore Memory】「何かおかしい。なんとなくそんな気がした」〜AIエージェントはエンドレスエイトに既視感を抱けるのか〜 AgentCore Memoryでエージェントに長期記憶を提供しても既視感は生まれなかった長期記憶は「何があったか」を記録するが「何回目か」を記録しない、記憶の蓄積は事実と要約で圧縮される長期記憶だけでは既視感を生み出せないため、時間の文脈が必要で、コストは100回のループで5ドル程度になる #AIエージェント#生成AI・LLM#クラウド
@虎の穴ラボ技術ブログ / 29日前 AI実装で実践していること:Claude Codeのskill・/goal・多段レビュー活用術 Claude Codeで設計からPR作成までを自律実行し、モデル使い分けと多段レビューで効率化しているモデルを監督(Fable)と作業(Sonnet)に分ける・/goalで実装からPR作成まで一気通貫・skillとGHAで6エージェントの多段レビュー設計の曖昧さが成果物に影響するため、設計確認とルール整備が必須で、スクリーンショットの添付にはChrome操作の権限設定が必要 #AIエージェント#生成AI・LLM#DevOps・CI/CD
@たこやき / 29日前 表記ゆれで埋め込みベクトルの類似度はどれだけ変動するのか 【Amazon Titan Embeddings V2】 AWS Bedrockのamazon.titan-embed-text-v2:0で表記ゆれの類似度を検証したアルファベット大小・区切りゆれ、文字種の違い、現場でよく見る表記ゆれ、タイポ・記号ゆれの4カテゴリでcos類似度を計算カタカナや英字の違いで類似度が0.048〜0.088と大きく低下し、空白や記号のゆれはタイポより検索に影響大 #生成AI・LLM#RAG#機械学習
@株式会社Kaizen Tech Agent / 29日前 【2026年最新】「AIでアーキテクチャ選定はできないの?」生成AI時代におけるシステム設計の限界と人間(アーキテクト)の真の価値 AIはアーキテクチャの初案作成はできるが、最終的な選定は人間が行う必要がある一般構成パターンの提示と技術スタック比較、IaCの自動生成が可能、トレードオフの判断や文脈の理解はAIにできないAIは文脈や将来の事業戦略を考慮できないため、現場の制約やリスク評価は人間が行う必要がある #AIエージェント#アーキテクチャ#生成AI・LLM
@IkuyaM / 30日前 AIにアンケートの生データを丸投げしたら、対応表を読んで前処理を一瞬で終わらせてくれた話 AIがアンケートデータの前処理を自動で行う対応表を読み取って列名を設問文に変換し、質問タイプごとに処理を分岐する生成されたスクリプトが再利用可能で、同じ処理を繰り返し行える点が実務に役立つ #AIエージェント#生成AI・LLM#データ分析
@jqit_suwa / 30日前 Claude Fable 5.1、2ターン目のキャッシュに12回中8回乗り損ねた Claude Fable 5.1のキャッシュ読みが12回中8回乗り損ねたキャッシュヒット率は99.6%と39.4%の二値に割れ、Opus 5は99.7%で安定キャッシュに乗らなかった場合、約50,000トークンの書き直し料金が発生する可能性がある #生成AI・LLM#AIエージェント#クラウド
@jqit_suwa / 30日前 Claude Code のサブエージェント、モデルの固定手段が4日で戻ってきた Claude Code でサブエージェントのモデル固定手段が4日で変更されたCLAUDE_CODE_SUBAGENT_MODEL_FORCE でモデルを強制指定できるようになったが、fork と model: inherit は例外model: inherit のエージェントは FORCE で強制指定され、fork はメインモデルのままとなる #AIエージェント#生成AI・LLM
@nolanlover0527 / 30日前 性能2倍で値段はそのまま! Claude Fable 5.1は何が変わったのか? Claude Fable 5.1は性能を2倍にし、料金は従量課金で維持したTerminal-Bench 4.0で55.8%、キャッシュ読み取り料金を75%値下げ、従量課金制従量課金で利用可能だが、週間利用上限は他のモデルと共有されるため、コスト管理に注意が必要 #AIエージェント#生成AI・LLM
@shirok / 30日前 Autonomous AI Databaseの Resource Principalで、API署名鍵を使わずにSelect AIしてみてみた Autonomous AI DatabaseでResource Principalを使用してAPI署名鍵なしでOCI Generative AIに接続Resource Principalによる認証、Dynamic GroupとIAM Policyでのアクセス制御、OCI$RESOURCE_PRINCIPALの使用API署名鍵をデータベースに登録せず、Dynamic GroupとIAM Policyでアクセスを制限する構成を確認 #AIエージェント#生成AI・LLM#クラウド