Scraps 最終更新 2026/10/02 11:40

#生成AI・LLM

@kei /

第3話「世界の中心で VRAM16GB は足りないと叫ぶ!」 追加GPU選び / ローカルLLMマシン構築記【実録】

  • VRAM16GBでは30B級モデルを扱えず、4人の要因がVRAM消費を増やす
  • モデルサイズと量子化、コンテキスト長、同時実行数、エージェントの並行稼働数がVRAMを圧迫する
  • VRAM容量を決める際にはモデルサイズ・コンテキスト長・同時実行数・エージェントの並行稼働数を事前に優先順位づける必要がある

@asahide /

Google Cloud の Data Agent Kit を Claude Code から使ってみた

  • Claude Code に Google Cloud の Data Agent Kit を導入し、BigQuery へのアクセスが可能になった
  • スキルのスクリプトが MCP Toolbox を起動し、認証は環境変数で設定、キットありでクエリ実行が可能
  • 依頼文に BigQuery を明記しないとスキルが使われず、実行手段がない環境では結果が出せない

@TienTT /

[生成AI Vol.4] ClaudeとGitHub Projectsを連携させて、PMを"クリック地獄"から解放する

  • ClaudeとGitHub Projectsを連携させてタスク管理を自動化する方法が紹介された
  • MCPサーバー経由でGitHub Projectsに接続し、タスク一覧を自然言語で一括登録・更新できる
  • Classic PATを使う場合、個人アカウントのProjectsにアクセスする際はリポジトリ単位のアクセス制限ができない点に注意が必要

@余裕が欲しいよっちゃん /

Microsoft AB-900, AB-730 を取得するまで🎓

  • AB-900はAIエージェントのデータガバナンスとアクセス制御、AB-730はプロンプト設計とビジネスプロセスのAI化が主な試験範囲
  • AB-900はMicrosoft PurviewとEntra IDの設定、AB-730はCopilot Studioとプロンプトエンジニアリングの操作手順
  • AB-900の試験では管理ポータルのメニュー構造を把握するための実機操作が必須、AB-730ではプロンプトの保存・共有機能の違いを理解する必要がある

@Sin9_Ha /

OCI Generative AIでGeminiもgpt-ossも呼べたので、7モデルの日本語力を比べてみた

  • 大阪リージョンでGemini 2.5 Pro/Flash、gpt-oss-120b/20b、Cohere Command A、Llama 4が利用可能
  • 日本語の「破天荒」テストでGemini 2.5 Flash/Pro、Cohere Command A、Llama 4が正解、gpt-oss-120bは語源を誤って補足
  • thinkingモデルはmaxTokensを消費しすぎると本文がゼロになる、課金は1文字単位でGemini/gpt-ossはトークン単位の混在がある

@YAMANEKO /

AI時代の防御はどう変わる?HITCON 2026で広がった脅威の見方――HITCON 2026レポート

  • HITCON 2026でAIを活用した脅威検知の新手法が紹介された
  • ファイル名や配置場所の構造的意味をAIで分析、認証ログのアカウントとホストの関係をグラフ化してAIに渡す
  • AIに与える情報の範囲や見せ方を工夫することで脅威検知の精度が向上する

@きむそん /

個人向け Coding Agent サブスクリプションのコストパフォーマンス比較

  • OpenAIのサブスクリプションがFable級・Opus級・Sonnet級モデルで最もコストパフォーマンスが良い
  • Fable級はGPT-5.6 SolとClaude Fable 5、Opus級はGPT-5.6 TerraとClaude Opus 5、Sonnet級はGPT-5.6 LunaとDeepSeek V4 Flashの比較
  • OpenAIの月額100ドルプランで約3.0–3.2Bトークンの利用枠があり、Claude Max 5xは約0.88Bトークンにとどまるため、利用枠の差が顕著

@深津 貴之 (fladdict) /

Uberに見るAIエージェントの運用コストをいかに減らすか?

  • UberはAIエージェントのコストを削減するためにモデル選定やコンテキスト圧縮、ツールの動的ロードを実施している
  • モデルはタスクごとに最適解を選定し、コンテキストを自動圧縮し、MCPツールをGateway経由で動的ロードする
  • コンテキストの初期共有がコストの大きな要因となるため、事前準備を効率化する設計が重要である

@Yasuhito Morimoto /

国内AIエージェント動向(2026/8/31号)

  • KandaQuantumが1,285体を統制する量子インスパイアド型「Fuga」をクローズド提供、コンヴァノが医療機関特化型AIエージェント「AXON」を提供開始
  • Fugaは水平通信の可否を計画段階で宣言し、成果物をコミット経由で回収する設計、AXONは診療時の会話からSOAP形式のカルテ下書きを作る機能を含む
  • Fugaのコスト指標は同社の仮定に基づくため、第三者検証や再現条件の開示が重要、AXONの診療報酬関連機能は医師が最終確認が必要

@Taste of Tech Topics /

AWSの Moca で AgentCore ベースのマルチエージェント・オーケストレーションを学ぶ

  • AWSのMocaでAgentCoreベースのマルチエージェントがどのように動作するかが説明されている
  • AgentCore Runtimeでサブエージェントを同じプロセス内に生成し、AgentCore GatewayでToolを連携する仕組み
  • Taskの状態はRuntimeプロセス内に保持されるため、長時間のワークフローには永続化処理が必要

@tomohisa /

128GB の Mac で Qwen3.8 Flash Next をどう動かすか ─ 3つのランタイムを実測で比べた

  • Qwen3.8 Flash Next を 128GB の Mac で動かす 3 つのランタイムを実測で比較した
  • llama.cpp はデコードが遅いが実務で完走、mlx-serve はプレフィルとデコードが最も速い、oMLX はキャッシュ処理でエージェントループで壊れる
  • mlx-serve は 105GB のモデルが必要でメモリ制限を回避するオプションが必要、llama.cpp は実務で安定して完走するがデコードが遅い

@YIS_HOSHI /

AIコードレビュー、エージェントを増やしても見落としたバグが一文を足すと見つかった

  • AIコードレビューで見落としたバグが指示文に一文を足すと見つかった
  • 観点ありの5体と観点なしの5体、単独の構成で検証。並行性への言及がないとバグが見逃される
  • 「問題なし」のレポートには確かめた範囲を記載する必要があり、指示文に並行性の確認を明記すべき

@yukegineer /

Claude Codeのサブエージェントを作ってみて分かったこと

  • Claude Codeでサブエージェントを作成し、実装とレビューのフローを試した
  • 実装用のjava-developerとレビュー用のjava-reviewerをカスタムサブエージェントとして作成、サブエージェント同士は直接やり取りできない
  • サブエージェントの進行管理はメインスレッド側で行う必要があり、オーケストレーション設計が重要

@nolanlover0527 /

LLMが「1+1」を計算するとき、中で何が起きているのか

  • LLMは数字をトークンとして処理し、複数の経路で近似と精密計算を組み合わせて答えを出す
  • トークン化された入力は埋め込みベクトルに変換され、アテンションで関係性を計算。36+59では大まかな見積もりと下1桁の精密計算の2経路が使われる
  • 正確な計算が必要な場面ではLLM単体ではなく計算ツールを併用するべきで、モデル自身の説明と実際の計算過程が一致しない可能性がある。

@coolkid|生成AI活用・業務効率化ラボ /

【現役SEが解説】生成AIを「チャットのおもちゃ」で終わらせないための活用基礎と3つの原則

  • 生成AIを実務で活用するための3つの基本原則が提示された
  • 80点+20点の法則、プロンプトの4大要素固定化、スクリプトとの連携が中心
  • AIに完璧な結果を求めるのではなく、80点のドラフト作成に割り切ることが重要