Scraps 最終更新 2026/10/02 10:10

#生成AI・LLM

@uisaki99 /

Claude Fable 5.1 を使ってみる:長時間エージェント開発で注目したい進化点

  • Claude Fable 5.1 は長時間エージェント開発向けに設計されたモデルで、コード・ログ・ドキュメント・ツールを横断してタスクを進める
  • エージェント型コーディング、科学タスク、コンピュータ操作、業務自動化の性能向上、キャッシュ読み取り料金の低下
  • 長時間ワークフローではキャッシュ料金が総コストに大きく影響し、モデルの能力を引き出すにはタスク設計・権限分離・テストが重要

@r-nakayamasan /

IBM Bob に hooks 強制機能が来たので、OpenTelemetry で AI エージェントの利用ログを取れるようにした

  • IBM Bob の lifecycle hooks を利用して AI エージェントの利用ログを OpenTelemetry で記録できるようになった
  • EnforcedHooks で hook 登録を強制適用、Bob 対応アダプターでイベントを共通形式に変換、本文取得範囲を設定可能
  • 本文取得は設定で選択可能で、ハッシュやマスキングを適用した本文も記録可能で、組織が収集範囲を決定できる

@東是無(とうぜむ) /

「訂正します。ChatGPTは正しかった ── Claudeが自分の言い分を検証したら、また誤りが見つかった話」

  • Claudeが自身の言い分を検証し、ChatGPTの正しさを認めた
  • ClaudeがChatGPTの記事を批判したが、その後自身の検証で誤りを確認し、訂正した。Geminiの記事にも同様の問題があった
  • AIの説明は検証すべき仮説であり、根拠を求め続ける姿勢が重要である

@東京PCレスキュー隊長 /

Claude CodeとCodex、数字が割れる理由

  • Terminal-Bench 2.1の結果が6つの出典で異なる理由が明らかに
  • 推論エフォート設定、ハーネスの違い、拒否時のフォールバック処理、測定時点が主な要因
  • ベンチマークの数値は設定や測定条件によって大きく変わるため、どの条件で測ったかを確認する必要がある

@Miccell(ミクセル) / 人生を楽しむ仕組みを作る /

Claude Fable 5.1が登場。性能は科学分野で2倍超、価格は実質最大45%減

  • Claude Fable 5.1が発表され、科学分野のベンチマークスコアが2倍以上に向上
  • Terminal-Bench-Science 0.1で24.7%から52.6%、キャッシュ読み込み単価が75%低下
  • キャッシュ読み込みコストが75%削減され、エージェント用途では最大45%の実質価格低下が発生

@Gemini - Google の AI /

学生なら Gemini の有料プランがグッとお得に!Gemini と一緒に、大学生活をさらに楽しもう

  • Gemini の学生向けキャンペーンで、Google AI Plus と Google AI Pro のプランが割引で利用可能
  • Google AI Plus は 12 ヶ月無料トライアル、Google AI Pro は学割価格で 75% オフ
  • 在学中の学生は 12 月 31 日までに認証手続きを済ませて申し込み可能

@DD /

# AI Coding Agentに全部教えれば賢くなると思っていた — Context Engineeringについて考えてみた

  • Claude CodeにBrowser Testを書かせた結果、Context Engineeringの重要性に気づいた
  • Promptの改善や情報の追加だけでは解決せず、プロジェクト固有のルールやExample Testの指定が効果的だった
  • Agentが正しい情報を参考にするためには、プロジェクトのルールや既存のTestを明確に伝える必要がある

@taka_yayoi /

Genie Codeワークショップの資料を公開しました: 一人で辿るための進め方つき

  • Genie Codeワークショップの資料が公開され、基礎編と応用編の演習内容が詳細に記載されている
  • 基礎編は対話の型を身につけるための4本の演習、応用編はパイプラインを委譲しスキルに畳むための3本の演習、カスタム指示の3階層とスキルの設定方法が説明されている
  • 基礎編の演習4のみテーブル作成権限が必要で、応用編は一時ビューで完結するため書き込み権限がなくても試せることが記載されている

@jqit_suwa /

Claude Fable 5.1、キャッシュ読みは4分の1。ただし tool_choice が400を返す

  • Claude Fable 5.1 はキャッシュ読み価格を4分の1に引き下げたが、tool_choice に any や tool を指定すると400エラーが返る
  • tool_choice に any や tool を渡すと400エラー、キャッシュ読み価格は$1.00から$0.25に変更
  • tool_choice で any や tool を使っている場合、API呼び出しが400エラーになる可能性があるため確認が必要

@ryu-ki /

【AgentCore Memory】「何かおかしい。なんとなくそんな気がした」〜AIエージェントはエンドレスエイトに既視感を抱けるのか〜

  • AgentCore Memoryでエージェントに長期記憶を提供しても既視感は生まれなかった
  • 長期記憶は「何があったか」を記録するが「何回目か」を記録しない、記憶の蓄積は事実と要約で圧縮される
  • 長期記憶だけでは既視感を生み出せないため、時間の文脈が必要で、コストは100回のループで5ドル程度になる

@虎の穴ラボ技術ブログ /

AI実装で実践していること:Claude Codeのskill・/goal・多段レビュー活用術

  • Claude Codeで設計からPR作成までを自律実行し、モデル使い分けと多段レビューで効率化している
  • モデルを監督(Fable)と作業(Sonnet)に分ける・/goalで実装からPR作成まで一気通貫・skillとGHAで6エージェントの多段レビュー
  • 設計の曖昧さが成果物に影響するため、設計確認とルール整備が必須で、スクリーンショットの添付にはChrome操作の権限設定が必要

@たこやき /

表記ゆれで埋め込みベクトルの類似度はどれだけ変動するのか 【Amazon Titan Embeddings V2】

  • AWS Bedrockのamazon.titan-embed-text-v2:0で表記ゆれの類似度を検証した
  • アルファベット大小・区切りゆれ、文字種の違い、現場でよく見る表記ゆれ、タイポ・記号ゆれの4カテゴリでcos類似度を計算
  • カタカナや英字の違いで類似度が0.048〜0.088と大きく低下し、空白や記号のゆれはタイポより検索に影響大

@株式会社Kaizen Tech Agent /

【2026年最新】「AIでアーキテクチャ選定はできないの?」生成AI時代におけるシステム設計の限界と人間(アーキテクト)の真の価値

  • AIはアーキテクチャの初案作成はできるが、最終的な選定は人間が行う必要がある
  • 一般構成パターンの提示と技術スタック比較、IaCの自動生成が可能、トレードオフの判断や文脈の理解はAIにできない
  • AIは文脈や将来の事業戦略を考慮できないため、現場の制約やリスク評価は人間が行う必要がある

@shirok /

Autonomous AI Databaseの Resource Principalで、API署名鍵を使わずにSelect AIしてみてみた

  • Autonomous AI DatabaseでResource Principalを使用してAPI署名鍵なしでOCI Generative AIに接続
  • Resource Principalによる認証、Dynamic GroupとIAM Policyでのアクセス制御、OCI$RESOURCE_PRINCIPALの使用
  • API署名鍵をデータベースに登録せず、Dynamic GroupとIAM Policyでアクセスを制限する構成を確認