@伊賀 裕展 / 27日前 AWS の Context Ontology Accelerator を試してみた AWSが公開したContext Ontology Acceleratorは、オントロジーを用いてAIエージェントのデータ理解を補完するツールオントロジーの構築にはLLMと人間のレビューを組み合わせ、RDF/OWL形式で定義し、SPARQLでクエリ可能生成されたオントロジーはLLMの推測が混ざるため、人間のレビューによる定義の確認が必須 #AIエージェント#生成AI・LLM#機械学習
@だいあろごす。 / 27日前 【Antigravity】もうProいらない?「Gemini 3.8 Flash」が来たのでPro 3.1を超えたのか本気で考えてみた Gemini 3.8 FlashがPro 3.1を上回る性能を発揮Agentic DevelopmentやAdvanced Reasoningの領域でプロモデルに迫る性能、3倍の出力速度と知能指数が上回る簡単な作業には3.7 Flash、複雑なタスクには3.8 Flashが適しているが、トークン消費量が増える点に注意が必要 #生成AI・LLM#AIエージェント#機械学習
@nolanlover0527 / 27日前 OpenAIが最強モデル「GPT-6 Astra」を発表 OpenAIが最新モデルGPT-6 Astraを発表し、コンピュータ操作とコーディングのベンチマークでトップスコアを記録Agents' Last Examで59.3%、ScreenSpot-Proで92.7%のスコア、処理時間は47%短縮、Codexハーネスと連携してコンテキストウィンドウの挙動改善APIコストが43%安くなったBenchCADでのタスク対応、セキュリティ関連のベンチマークで満点スコアを記録し悪用リスクへの配慮が必要 #生成AI・LLM#AIエージェント#機械学習
@furukawa / 27日前 AIは"未経験ほど"効く。でも"未経験ほど"騙される AIは未経験者にとって効果的だが、誤りを実データで検証する必要がある型(過去事例)で当たり付けを速くする × 実データ検証で正しさを確保する、AIと人間の役割分担KBは当たり付けに使うが、確定は実データで行い、古い型の誤診を防ぐ #生成AI・LLM#AIエージェント#機械学習
@Yasuhito Morimoto / 28日前 国内AIエージェント動向(2026/9/3号) 国内AIエージェントが教育、営業、人材育成など複数業務領域で実装され、特化型エージェントが登場NECの脆弱性管理サービス、デジタルハリウッド大学の専属AIエージェント、ウイングアーク1stのオンボーディング基盤自律性を高める一方で、人による最終確認や権限分離、監査証跡の設計が不可欠とされている #AIエージェント#機械学習#インフラ
@東是無(とうぜむ) / 28日前 「訂正します。ChatGPTは正しかった ── Claudeが自分の言い分を検証したら、また誤りが見つかった話」 Claudeが自身の言い分を検証し、ChatGPTの正しさを認めたClaudeがChatGPTの記事を批判したが、その後自身の検証で誤りを確認し、訂正した。Geminiの記事にも同様の問題があったAIの説明は検証すべき仮説であり、根拠を求め続ける姿勢が重要である #生成AI・LLM#AIエージェント#機械学習
@rino_yume / 28日前 LSTMからハイブリッドへ:降雨流出解析プロトタイプ作成 Step 4 物理モデル出力をXGBoost / LSTMで後処理する 物理モデル出力をXGBoostとLSTMで後処理する手法を実装したXGBoostは現在時刻の特徴量から残差を補正、LSTMは過去時系列から補正する実務適用には実流域データでの検証と水収支評価が必要 #機械学習#バックエンド#DevOps・CI/CD
@東京PCレスキュー隊長 / 28日前 Claude CodeとCodex、数字が割れる理由 Terminal-Bench 2.1の結果が6つの出典で異なる理由が明らかに推論エフォート設定、ハーネスの違い、拒否時のフォールバック処理、測定時点が主な要因ベンチマークの数値は設定や測定条件によって大きく変わるため、どの条件で測ったかを確認する必要がある #生成AI・LLM#AIエージェント#機械学習
@Miccell(ミクセル) / 人生を楽しむ仕組みを作る / 29日前 Claude Fable 5.1が登場。性能は科学分野で2倍超、価格は実質最大45%減 Claude Fable 5.1が発表され、科学分野のベンチマークスコアが2倍以上に向上Terminal-Bench-Science 0.1で24.7%から52.6%、キャッシュ読み込み単価が75%低下キャッシュ読み込みコストが75%削減され、エージェント用途では最大45%の実質価格低下が発生 #生成AI・LLM#AIエージェント#機械学習
@xthixsl_ml@レオナ / 29日前 Kaggle Pokémon TCG AI Battle Challenge ポケカコンペ振り返りーメダルなし ポケモンカードゲームのAIエージェント開発で、強化学習と模倣学習を組み合わせた手法を試した模倣学習(Behavior Cloning)で上位エージェントの行動を学び、PPOによる強化学習で補正。価値関数で数ターン先の勝率を予測し、相手デッキを推定する仕組みを導入価値関数のAUCが0.934でも実際の勝率改善は1.1ポイントにとどまり、モデル単体の指標だけでは採用判断できないことが分かった #AIエージェント#機械学習#DevOps・CI/CD
@小川幹雄 / 29日前 AIエージェント時代にデータサイエンティストは生き残れるのか データサイエンティストの職種は中身を総取り替えされ、AIエージェント時代に生き残るためには数学的・ソフトウェア工学的スキルが必須になるAIコーディングで定石をなぞる仕事が自動化され、数学的知識とソフトウェアエンジニアリングスキルが価値を生む。協会のスキルチェックリストで価値創造力と融合スキル群が新設データサイエンティストとしての価値は数学的・ソフトウェア工学的スキルの両輪に依存し、中途半端な知識では競争力を維持できない #AIエージェント#機械学習#データ分析
@Yasuhito Morimoto / 29日前 国内AIエージェント動向(2026/9/2号) 国内AIエージェントが業務の実行・継続監視・システム反映へと適用範囲を広げたSFA・CDP・業務システムとの接続、MCP標準連携、人による承認と最終確認、導入後の定着支援が共通点β版やPoCを含む段階的な提供が多く、権限管理、監査性、例外処理、定量KPIの開示が普及の焦点になる #AIエージェント#機械学習#クラウド
@たこやき / 29日前 表記ゆれで埋め込みベクトルの類似度はどれだけ変動するのか 【Amazon Titan Embeddings V2】 AWS Bedrockのamazon.titan-embed-text-v2:0で表記ゆれの類似度を検証したアルファベット大小・区切りゆれ、文字種の違い、現場でよく見る表記ゆれ、タイポ・記号ゆれの4カテゴリでcos類似度を計算カタカナや英字の違いで類似度が0.048〜0.088と大きく低下し、空白や記号のゆれはタイポより検索に影響大 #生成AI・LLM#RAG#機械学習
@maskot1977 / 30日前 耳で聞く!Python で学ぶ マクロ経済学 入門 7 Pythonでゼロ金利政策の経済モデルをシミュレーションし、財政政策の効果を可視化したISLMモデルとZLB(ゼロ金利制約)を用いて金利と国民所得の関係を数値解析、財政乗数の変化を確認ゼロ金利下では政府支出の効果が顕著に上がり、クラウディングアウトが発生しないことが実証された #機械学習#バックエンド#クラウド
@しんや / 30日前 What's New in Sigma - 2026年08月28日のSigma Computing関連リリース情報まとめ Sigma Assistantが全データソースを検索できるようになったAll sourcesモードでユーザーがアクセス権を持つ全ソースを対象に、Specific sourcesで管理者が登録したソースのみを対象に選択可能All sources選択時はデータアクセス権を尊重し、データモデル整備が回答精度に影響するため整備のROI向上が期待できる #AIエージェント#生成AI・LLM#機械学習
@林 宏正 / 30日前 Weekly Google Cloud アップデート情報 - 2026年9月1日 Google CloudでGemini EnterpriseのデータストアとAI開発者ツールがリリースされたD&B Commercial GraphデータストアとCloud Monitoring可観測性のメトリクス拡張、Gemini Enterprise Agent PlatformにxAIs Grok 4.6とGLM 5.2が追加されたAI開発者ツールの利用にはCloud Billingアカウントのリンクが必要で、エマージングマーケット版は限定的な利用条件がある #クラウド#AIエージェント#機械学習
@y.takayama / 30日前 【Nishika 論文サク読み 第24回】DiaScriber DiaScriberは話者ダイアライゼーションと文字起こしを1モデルで行うMSASRモデルQwen3-ASR由来の音声エンコーダとQwen3.5-Omniの23B MoEを組み合わせ、85,000時間の学習データを使用公開5セットでは3セットでMOSSに負けていることが判明し、モデルサイズだけでは性能が確保できないことが示されている #生成AI・LLM#機械学習#AIエージェント
@monokaai / 30日前 AI開発でいつ、どこまでコードを理解するか AI開発では影響度と戻しやすさを基準にコードの理解度を調整する失敗時の影響が大きい・戻しにくい変更は重点確認、テストで決定論的に制御可能なら後回し可能テストケースの整備で実装者の仕様理解を確保し、行レベルの理解は後回しにできる #AIエージェント#機械学習#DevOps・CI/CD
@t.toda / 30日前 無音で文字起こしすると「ご視聴ありがとうございました」になる理由を検証 Whisperは無音時に「ご視聴ありがとうございました」と出力する訓練データの感謝フレーズに引き込まれる、デコーダLMの高頻度系列が原因no_speech_probとavg_logprobの条件で抑制が効かないため、パラメータ調整では対応できない #生成AI・LLM#AIエージェント#機械学習
@暮らしと心のアプリ工房(ワンコインWEBアプリ屋さん) / 30日前 AIを見るな、人を見ろ ※追記:この記事をClaudeに読ませてみたら(号泣) AIのベンチマーク競争に振り回されず、開発企業の思想や哲学を見ることでツール選びの迷いが解消されるAIの人格は創業者の哲学と歴史でできている、AIの性能は技術者が決めるが何を出荷するかは経営が決めるAIの性能を評価する際には、技術的な要素だけでなく経営の判断も考慮する必要がある #AIエージェント#生成AI・LLM#機械学習