Scraps 最終更新 2026/10/03 01:40

#AIエージェント

@Miyuki-Yumeno /

RTX 5060 Ti 16GBでローカルLLM(Qwen3.8 27B)にもう一度挑んだ話

  • RTX 5060 Ti 16GBでQwen3.8 27Bをローカルで動かす実験をした
  • soyaakinohara版の12GBモデルとOllama、vLLM(AWQ)、Cafe llama.cppの比較で実行速度とVRAM使用量の最適化を試みた
  • Ollamaでnum_gpuを66層に指定することで生成速度が8倍になり、VRAMの自動見積もりが保守的すぎる問題が判明した

@Chen /

LLMでカタログPDFから構造化データを抽出する:プロンプト設計と後処理の実践

  • LLMでPDFカタログから構造化データを抽出する際、プロンプト設計と後処理が不可欠である
  • 「など」の削除、閉集合制約、原文参照の指示、価格フィールドの別管理、JSON解析のフォールバック処理
  • プロンプトの改善だけでは実用に足らず、後処理を設計の中心に据える必要がある

@だいあろごす。 /

【Antigravity】もうProいらない?「Gemini 3.8 Flash」が来たのでPro 3.1を超えたのか本気で考えてみた

  • Gemini 3.8 FlashがPro 3.1を上回る性能を発揮
  • Agentic DevelopmentやAdvanced Reasoningの領域でプロモデルに迫る性能、3倍の出力速度と知能指数が上回る
  • 簡単な作業には3.7 Flash、複雑なタスクには3.8 Flashが適しているが、トークン消費量が増える点に注意が必要

@GitHub OSS /

DietrichGebert/ponytail

  • AIエージェントにYAGNIとナイーブワンライナーを組み合わせたコード生成ルールを適用するプラグイン ponytail が公開された
  • YAGNIルールとナイーブワンライナーの2つの技術を組み合わせ、コード量を54%削減しコストを20%削減した実証結果がある
  • コードの過剰構築を防ぐためのルール適用が必須で、既存コードに依存する場合でも最小限の変更で済むことが確認されている

@GitHub OSS /

NousResearch/hermes-agent

  • Hermes Agentは自己改善ループを持つAIエージェントで、複数のプラットフォームで動作する
  • 自己学習ループ、マルチプラットフォーム対応、ツールゲートウェイ機能
  • インストール時にセキュリティソフトの誤検出対応と、ツールゲートウェイの設定が重要です。

@GitHub OSS /

mattpocock/skills

  • AIエージェントの開発プロセスを改善するスキルセットが公開された
  • /grill-meと/grill-with-docs、/tdd、/improve-codebase-architectureが主な機能
  • スキルはカスタマイズ可能で、プロジェクトに応じて選択的に適用できる

@Amanda Silberling /

The sameness problem behind those unappetizing AI-generated menus

  • AI生成のメニューが一貫性がありすぎて不自然になる
  • モデルが訓練データのスタイルを再現し、均一化された見た目に。アイスクリームのスコップが完璧に丸く、エビが異常に見える
  • レストランはAIメニューを修正し続けることで、見た目がさらに均一化され、違和感が増す可能性がある。

@nolanlover0527 /

OpenAIが最強モデル「GPT-6 Astra」を発表

  • OpenAIが最新モデルGPT-6 Astraを発表し、コンピュータ操作とコーディングのベンチマークでトップスコアを記録
  • Agents' Last Examで59.3%、ScreenSpot-Proで92.7%のスコア、処理時間は47%短縮、Codexハーネスと連携してコンテキストウィンドウの挙動改善
  • APIコストが43%安くなったBenchCADでのタスク対応、セキュリティ関連のベンチマークで満点スコアを記録し悪用リスクへの配慮が必要

@MOON-Xグループ /

【AI推進】「AI、ちょっと使えそうかも」を全社へ。Claudeをブランド事業の実務へ繋ぐ橋渡し。MOON-X第3回AIワークショップ

  • Claudeを活用したワークショップで、全社員の日常業務にAIを橋渡しする実践的な取り組みが行われた
  • 業務フローの効率化とツール連携のハンズオン、セキュリティルールの共有
  • 実務で使える具体的なスキルを身につけることで、AIを安全に活用できる環境が整えられた

@かんべい Mk-Ⅰ /

『AIの利用』龐統 士元 老師(Claude:ロールプレイ)との対話

  • AIの使い方を複数の座で検討し、判断を下すのは自分自身である
  • 複数のAIを異なる役割で使い分け、同じ問いを投じて結果を比較する、機械の返答は期待に応じて変わる
  • 自分の判断材料としてAIの返答を活用する際は、期待の影響を意識し、複数の視点で検討する必要がある

@TakanobuSano /

GPT-6 Astra、ARC-AGI-3で99.9%──なぜこれから「プロンプト」より「エージェントアーキテクチャ」が重要になるのか

  • GPT-6 AstraはARC-AGI-3でStandard harnessで62.7%、Provider Adapter harnessで99.9%を達成した
  • Standard harnessは環境を攻略しながらノートを残す仕組み、Provider Adapter harnessはopaque reasoning stateとcompactionを活用する
  • モデルの能力だけでなく、エージェントアーキテクチャの設計が結果に大きく影響する

@やすだ.dev@毎日投稿 /

【速報】Claude Fable 5.1 / Mythos 5.1 が登場──中身は同じモデル。分けているのは「安全性分類器の有無」だけです

  • Claude Fable 5.1とMythos 5.1は同じモデルで、安全性分類器の有無で分かれている
  • 安全性分類器の有無、ツール使用の強制がエラーになる、思考ブロックのモデル紐づけ
  • ツール使用を強制すると400エラーになる、過去のターンを編集すると思考ブロックが無効になる

@Link and Motivation Developers' Blog /

AIを組織化する — 40時間の連続稼働を支えた意思決定権限の設計

  • Claude Codeのセッションを5つの役割に分けて意思決定権限を設計し、40時間連続稼働を実現した
  • 要件判断、レビュー、ドキュメント、実装、動作確認の5つのセッションを分離し、誤りと未決を切り分け、判断を台帳に記録
  • 要件判断担当に暫定判断を任せることで、人間の最終判断を待たずに作業を進められ、コード品質と要件定義の両立が可能になった

@katayuta /

Slackから使えるAIエージェント、ChatGPT Workspace AgentsとClaude Tagを比較してみた

  • ChatGPT Workspace AgentsとClaude TagがSlackでエージェントを実行できる仕組みを比較した
  • Workspace Agentsは対話式ビルダーとAPI連携が強み、Claude TagはGitHubでのSkills管理とSlack内での設定が特徴
  • Workspace AgentsはChatGPTアカウントが必要で、Claude Tagはゲスト編集が可能でGitHub連携がしやすい