@Coji Mizoguchi / 31日前 会話セッションを邪魔せずに Claude Code / Codex / Cursor を外部イベントで動かすCLIの作り方まとめ Claude Code・Codex・Cursorを外部イベントで動かすCLIの実装方法が公開されたClaude Codeはバックグラウンドタスク完了、Codexはキュー投入、CursorはACPプロトコルを使うエージェントごとに異なる起動方法が必要で、共通化は難しいと説明されている #バックエンド#DevOps・CI/CD#AIエージェント
@t.toda / 31日前 無音で文字起こしすると「ご視聴ありがとうございました」になる理由を検証 Whisperは無音時に「ご視聴ありがとうございました」と出力する訓練データの感謝フレーズに引き込まれる、デコーダLMの高頻度系列が原因no_speech_probとavg_logprobの条件で抑制が効かないため、パラメータ調整では対応できない #生成AI・LLM#AIエージェント#機械学習
@shimada_slj / 31日前 【AI駆動開発】AIエージェントに「人間の承認」を残す設計:Human-in-the-Loop超入門 AIエージェントに「人間の承認」を残す設計が求められる不可逆性と影響範囲で承認ポイントを決める、監査ログとサンドボックスでリスクを抑える取り消しがきかない操作は必ず人間の確認を挟むべきで、確認だけでは自動化バイアスのリスクがある #AIエージェント#採用#マネジメント
@平木 佳介 / 31日前 [社内勉強会資料公開] Claude Code 入門 #8 — MCP連携と業務自動化 MCPはClaude Codeを外部ツールやサービスと直接繋ぐオープンな標準規格で、local/project/userのスコープで管理できるMCPサーバーはHTTP接続とローカルコマンド接続の2種類があり、context7やplaywrightなどのツールを接続できるAIによる診断は一次診断にとどめ、最終判断は人間のコンサルタントが行うことが実務上のルールである #AIエージェント#生成AI・LLM#クラウド
@暮らしと心のアプリ工房(ワンコインWEBアプリ屋さん) / 31日前 AIを見るな、人を見ろ ※追記:この記事をClaudeに読ませてみたら(号泣) AIのベンチマーク競争に振り回されず、開発企業の思想や哲学を見ることでツール選びの迷いが解消されるAIの人格は創業者の哲学と歴史でできている、AIの性能は技術者が決めるが何を出荷するかは経営が決めるAIの性能を評価する際には、技術的な要素だけでなく経営の判断も考慮する必要がある #AIエージェント#生成AI・LLM#機械学習
@ずんだもち / 31日前 Hermes Agentを用いて、自己成長するコードレビューエージェントを作成してみた Hermes Agentを用いてLLM-as-a-JudgeのフィードバックをもとにSKILL.mdを自動更新するコードレビューエージェントを構築したLLM-as-a-Judgeによる採点結果を元にSKILL.mdを自動生成し、ミュータブルなデフォルト引数の解消や型注釈の追加などの観点を学習judge.pyの評価基準に従ってコードを修正し、スコアが6/10から9/10に向上したことで学習効果が確認できる #AIエージェント#生成AI・LLM#DevOps・CI/CD
@jqit_suwa / 31日前 Claude Code でモデルを切り替えると、そのターンだけ書き直しが287倍 Claude Codeでモデルを切り替えると書き直しが287倍になるモデル切り替えたターンの書き直しが197→56,584トークン、戻すときは67トークンモデル切り替えるとキャッシュが失われるが、戻すときはコストが安い #AIエージェント#生成AI・LLM#クラウド
@ry-harada / 31日前 AWS Agentic Football Cupについて調べた AWS Agentic Football CupではAIエージェントでサッカーチームを作り、5対5で試合を行うAmazon Bedrock AgentCoreとStrands Agents SDKが技術スタック、エージェントは2秒ごとに独立して呼び出されるスタミナとファウルの管理が重要で、プレスの強度や指示の出し方にも注意が必要 #AIエージェント#生成AI・LLM#クラウド
@harrowharrow16 / 31日前 IBM Bobを使って、量子コンピュータで量子機械学習(QSVM)を作成してみる。 IBM Quantum Platformで量子SVMを実装し、Irisデータで分類精度0.90を達成したZZFeatureMapによる量子特徴マップとシミュレーター/実機でのカーネル計算、reps=1のパラメータが精度向上に寄与実機ではノイズの影響で精度が低下するが、浅い回路構造でその影響を抑えることが可能で、量子カーネルの現状の性能が確認できる #AIエージェント#機械学習#インフラ
@dach / 31日前 AI実装の速さにコードレビューが追いつくための、「コードの外側」をつなぐ技術 AI実装の速さにコードレビューが追いつくための、変更後の世界と意思決定の来歴を結線するReview Modelを提案変更後の世界・今回PRの実装範囲・意思決定の来歴・保証と証拠をつなぐ、AI Responsibility Review Model Skillを実装実装前の責務や契約が曖昧だとReview Modelだけでは判断できないため、事前に明確な契約を設定する必要がある。 #AIエージェント#DevOps・CI/CD#アーキテクチャ
@週末ものづくり部 / 31日前 トークン2000分の1——オントロジー×ナレッジグラフでClaude Codeの推測を消す Claude Codeにナレッジグラフを導入してトークン使用量を2000分の1に削減code-review-graphとbetter-code-review-graphによる依存関係グラフ、Graphifyによる横断的ナレッジグラフ、SerenaによるLSP型情報検索トークン使用量が14万から70に安定して減少し、ファイルを開かずに構造を把握できる #AIエージェント#RAG#機械学習
@songchong / 32日前 ChatGPT・Gemini・Claude…データはAIの学習に使われるのか?情報漏洩のリスクは? 34製品の利用規約を読み比べてみた 34製品の利用規約を比較し、データが学習に使われるか、人が読むか、保存されるかを確認した学習に使われる(再学習・選好チューニング)、人が読む(レビュー)、保存される(保持期間)の3つの経路が存在個人と法人で設定が異なるため、利用するプランや設定を確認する必要がある #生成AI・LLM#AIエージェント#クラウド
@PHPer8080 / 32日前 AIエージェントの品質、どう測る? Google ADKの評価機能を使い倒す AIエージェントの品質を6つの観点で評価する方法が紹介されている数字の一致、裏付け、意思決定のしやすさ、聞き方の適切さ、セキュリティ、ターンの完遂を測定し、組み込みメトリクスとカスタムメトリクスを活用している評価は1回ではなく複数回実行し、変動を考慮する必要がある。また、判定モデルの設定やトークン制限に注意が必要である。 #AIエージェント#生成AI・LLM#DevOps・CI/CD
@Akihiro Yamamoto A. / 32日前 Google ADK・Microsoft Agent Framework・Amazon Strands の違いを偽のモデルサーバで測ってみた Google ADK、Microsoft Agent Framework、Amazon Strandsは送る情報量がほぼ同じだが、異常時の振る舞いに差があるADKは例外を上位に伝播、MAFとStrandsはモデルに返して継続、ツールスキーマの量に19%の差異常時の停止/継続設計が選定の重要な判断材料になるため、採用予定のバージョンで異常系を再実行するべき #AIエージェント#生成AI・LLM#インフラ
@いばらき / 32日前 Claude Codeに「理解しやすい日本語」を書かせるためにやっていること Claude Codeに理解しやすい日本語を書かせるために、事前チェックと自動レビューを組み込んでいる事前議論で論点整理、一次情報引用、hooksによる日本語レビュー強制、Haikuで不自然な日本語判定レビューは強制的だが3回までで打ち切り、過検知を許容して開発体験を優先している #AIエージェント#生成AI・LLM#バイブコーディング
@tanabata-kitajima / 32日前 900件のテストが緑でも、本番では壊れる──LLM製プロダクトの品質保証で学んだこと LLMで開発したプロダクトで本番環境で不具合が発生し、テストとレビューの限界が明らかになったテストダブルの契約と本番実装の差、監視値の嘘、0件と障害の区別、終了処理の不備、LLMレビューの収束が問題点テストの観測対象を本番の契約に合わせる、監視値の正しさをテストする、障害を型として区別する必要がある #生成AI・LLM#AIエージェント#テスト
@senna / 32日前 Reactライクにエージェントを開発? - Flueの宣言的エージェント開発入門 FlueはReactライクなHooks APIでエージェントを構築するフレームワークusePersistentStateで状態を宣言、useSubagentでサブエージェントを登録、モデル呼び出しごとに再レンダーされるエージェントの実行フローはモデルが決定し、ツールの入力や副作用はアプリケーション側で定義する #AIエージェント#生成AI・LLM#フロントエンド
@news_it_enj / 32日前 AI駆動開発ライフサイクル(AI-DLC)の日本語版Skill Builderが公開されたので体験してみた AI-DLCの日本語版スキルビルダーがAWSで公開されたAI-DLCの原則、ワークフロー、7つのベストプラクティスが含まれる。40問テストで80%以上正解が必要AWS Builder IDが必要で、テストは同じ問題ではなく一部異なる問題が出る #AIエージェント#クラウド#DevOps・CI/CD
@ケン吉 / ゼロから作るAIアプリ開発 / 32日前 画像生成AIの"データの作り方"が変わった話 ― Alibabaの「能力駆動型データ基盤」を読む Alibabaが提案する能力駆動型データ基盤が画像生成AIのデータ設計を変えるタスク別データから能力別データへの設計転換、共通のアノテーション形式と能力ギャップ駆動フィードバックループ評価結果を弱点カテゴリ特定とデータ優先度調整に直結させる仕組みが実務に応用できる #生成AI・LLM#AIエージェント#RAG
@kei / 32日前 第3話「世界の中心で VRAM16GB は足りないと叫ぶ!」 追加GPU選び / ローカルLLMマシン構築記【実録】 VRAM16GBでは30B級モデルを扱えず、4人の要因がVRAM消費を増やすモデルサイズと量子化、コンテキスト長、同時実行数、エージェントの並行稼働数がVRAMを圧迫するVRAM容量を決める際にはモデルサイズ・コンテキスト長・同時実行数・エージェントの並行稼働数を事前に優先順位づける必要がある #生成AI・LLM#AIエージェント#機械学習