Scraps 最終更新 2026/10/02 09:01

#AIエージェント

@Phung Dinh Son /

Markdownは新しい攻撃ベクトルになった — AIエージェント時代の間接プロンプトインジェクション入門

  • プロンプトインジェクションはLLMの構造的制約であり、間接インジェクションが特に危険
  • プロンプトインジェクションの2種類(直接・間接)、Lethal Trifecta(プライベートデータ・信頼不能コンテンツ・外部通信の3要素)
  • プライベートデータへのアクセスを最小限にし、信頼不能コンテンツを厳しくチェックし、外部通信を制限する対策が有効

@エイトハンドレッド TECH BLOG /

【AIに任せて失敗した③】「見れば分かる」を自動判定させようとして、設計から作り直した

  • Excel帳票の項目種別を罫線や塗りで自動判定しようと試みたが失敗した
  • 罫線の太さ・線種・セルの塗りを基準に判定したが、データに一貫したルールがなかった
  • 自動生成結果を人が確定させる形に変更することで作業時間を当初の想定に収めた

@GitHub OSS /

alphaXiv/OpenResearch

  • OpenResearchが研究エージェントと自動研究のためのローカルファーストワークスペースを提供する
  • Claude CodeやOpenCodeなどのモデルを研究エージェントに変換し、gitワークツリーで独立したセッションを実行できる、ローカルSQLiteストアとCLIコマンドを備える
  • プロジェクトや実行はローカルに保持され、コードの公開は必要なく、使用状況の分析はオプトアウト可能で個人情報は含まれない

@GitHub OSS /

BrowserSkill

  • BrowserSkillはAIエージェントにブラウザ操作を安全に実行させるためのツールを提供する
  • bsk CLIとブラウザ拡張機能で構成され、タブの貸し出しと人間の介入をサポートする
  • タブの貸し出しは明示的で、タスク終了後に返却する必要があり、他のブラウザ操作に干渉しない

@GitHub OSS /

Agent Skills:AIコーディングエージェントの生産性スキルセット

  • AIエージェント向けの25のスキルセットが公開され、開発プロセスを構造化する
  • /specや/testなどの9つのスラッシュコマンド、テスト駆動開発やセキュリティチェックリストが含まれる
  • /buildで自動化されたプロセスを実行する際、テストは必須で失敗時に停止する

@Tamura Satoru /

AIペルソナはユーザーの代わりになるのか? 論文3本から探る、できること・できないこと

  • LLMはUIの問題候補を挙げたり、人間と重なる定性的な論点を出したりできる
  • Duan et al.はGPT-4でUIガイドライン違反を検出、Hwang and KangはAIペルソナで定性的テーマを抽出、Kuric et al.はGPTのクリック行動を実ユーザーと比較
  • LLMの出力は実ユーザーの反応そのものではなく、仮説や予測として扱う必要がある

@yushibats /

話題のJevとは?文章を書かずに判断だけを返すAIモデルをざっくり解説

  • Jevは文章を生成せず、選択肢ごとの確率と確信度を返すAIモデル
  • 選択肢から1つ選ぶChoice、段階評価のScore、Yes/NoのNoulの3種類の問いに対応。確信度で処理を分岐可能
  • 確信度が0.9以上なら自動処理、0.5以上なら人間確認、それ以下なら人が振り分け。計算や日付比較は不得意と明記

@aidasquid /

2026年版 LLM勢力図&モデルまとめ

  • 2026年現在のLLM勢力図と主要モデルの特徴がまとめられている
  • ChatGPT、Claude、Gemini、DeepSeek、Qwen、Moonshot、Liquid AI、xLSTM、Jevなどのモデルと、Transformerの代替アーキテクチャが紹介されている
  • LLMの性能やアーキテクチャの選択が開発戦略に直接影響するため、モデルの特徴を理解することが重要

@Yasuhito Morimoto /

国内AIエージェント動向(2026/9/18号)

  • 国内のAIエージェント導入が業務実装、ナレッジ整備、運用定着へと移行している
  • 住友電装の監査AI、介入AI、レビューAI、アビームとNotionのAgent OS、TinyFishの自律Web操作
  • AIエージェント導入の競争軸がモデル性能から業務実装、ナレッジ整備、運用定着、効果検証へ移行している

@ryo-ume /

AIが読んでいるもの、書いているもの ― トークンの話

  • AIエージェントのトークン使用量を節約する方法が説明されている
  • トークンはAIが文章を処理する単位で、入力と出力の両方に影響する。読ませすぎない、考えさせすぎない、出力させすぎない、やり直させないの4つのポイントが挙げられている
  • AIに必要な情報に集中させることが重要で、不要な情報や処理を減らすことでトークンを節約できる

@watany /

Jevでハーネスエンジニアリング

  • JevはSystem One Modelとして、LLMと異なる高速で低コストな判断APIとして登場
  • System One Model、inputがGPT 5.6 Lunaより約八割引きの安さ、outputは無料、汎用分類機としての用途
  • Vercel版のAPIは無料ユーザでは使えないため、ProプランにアップグレードするかAI Creditにチャージする必要がある

@坂本 /

今話題のJevを試したら最高だった

  • JevにAIエージェントの操作承認を置き換えることで、精度を維持しながらコストと速度を改善
  • Jevは構造化された判断を返すモデルで、choice形式でallowとescalateの二択を返す。従来モデルはgpt-5.6-lunaを使用
  • Jevのコストは従来の約1/10、判定時間は約1/13で、正解率は100%。プライバシーポリシーと利用規約の確認が必要

@Tim De Chant /

Khosla-backed Mazama Energy just raised $135M to drill deeper into super-hot-rock geothermal

  • Mazama Energyが1億3500万ドルを調達し、超高温岩に水平井を掘る技術を開発中
  • 超高温岩に15,000フィートまで掘り進め、750度の高温で超臨界流体を生成する技術と、15メガワットの発電を1井で可能にする技術
  • Oregonのサイトで10ギガワットの発電が可能で、2030年までに200メガワットを発電する予定