Scraps 最終更新 2026/10/01 21:40

#機械学習

@HELLO_CYBERNETICS /

Jevを、自然言語で分類基準を渡せる識別モデルとして使う

  • Jevは自然言語で分類基準を指定できる識別モデルとして使える
  • 質問と候補の説明を変えることで配送担当や実験報告書の分類が可能、確率出力で自動処理と人手確認の切り分けが可能
  • 分類基準の説明が曖昧だと誤判定のリスクがあるため、具体的な条件を明記する必要がある

@Yasuhito Morimoto /

国内AIエージェント動向(2026/9/19号)

  • 国内企業がAIエージェントの実装に向け、業務知識やデータの整備、権限管理、復旧機能を一体で設計している
  • KDDIの開発支援、ヘッドウォータースの業務知識整備、ジオコードの承認付きWeb改善、Cohesityの保護・復旧機能
  • 業務知識の更新責任や実行権限の設計、復旧手順の明確化が運用負担を減らす鍵となる

@Isaka-code /

Jevはどこで使うべきか? LLM・機械学習・ルールベースとの使い分け

  • Jevはテキスト入力に対して事前に定義された選択肢やスコアを返す決定モデル
  • ルールベースと古典的機械学習、LLMと比較して入力がテキストで出力候補が事前に決められる場合に適する
  • 教師データが十分でない場合や高速・低コストな処理が必要なときにJevが選択肢になる

@Russell Brandom /

世界モデル企業は多くの秘密を保持している

  • 世界モデル企業は多くの技術を秘匿しており、商業化の具体的な計画を公表していない
  • AMI LabsとWorld Labsが空間知能の自動化に焦点を当て、製品計画やタイムラインを非公開にしている。また、サプライヤーも具体的な用途を知らない
  • 企業は資金調達の容易さを活かして競合の発見を遅らせるために情報を隠している

@Tim Fernholz /

ChatGPTの共同発明者が開発した新しいAIモデルが開発者に注目されている

  • ChatGPTの共同発明者が開発した新しいAIモデルが開発者に注目されている
  • 確率を出力するTransformerベースのモデルで、LLMとは異なるアプローチを取る。コストと速度に優れ、 hallucination が起こらない
  • LLMの代替や補完としての利用が可能で、ソフトウェア自動化に適している。開発者はこのモデルをより安く正確に利用できると評価している

@Theresa Loconsolo /

Dario Amodeiと他のAIリーダーは「フロントラインをペースする」を望むが…どうやって?

  • Dario AmodeiがAI開発の進捗を「ペースする」プランを発表した
  • 独立した安全評価者と民主主義国のAIラボ間の協調が中心。NvidiaのJensen Huangから批判を受けている
  • AI開発の進捗を制御するための枠組みが議論されている。業界の支持と批判の両方が存在する

@はこいぬ /

ローカルJevの可能性検証

  • Gemmaをベースにした3つの構成でJev風の判断モデルを実装し、日本語の3択分類タスクで比較した
  • 案Aはトークンスコアから確率を計算、案Bは分類ヘッドを追加、案Cは共有採点ヘッドで候補を評価
  • LoRAによる追加学習で正答率が8割を超え、生成不要の構成でも高速な推論が可能だった

@harupython /

LLMの代わりになる? 文章を生成しないAI「Jev」を日本語で試してみた

  • 文章を生成しないAI「Jev」は、判断と確率を返すモデルで、LLMとは異なる出力方式を持つ
  • Choice・Score・Noulの3種類の返り値形式、LLMのStructured Outputsとの出力方式の違い
  • Jevは文章生成せず判断と確率を返すため、処理に応じた使い分けが重要で、実際の性能は入力内容に依存する

@dahatake /

AI コーディングエージェントの1タスクが8時間かかる理由を、45日分のセッション履歴から測ってみた

  • AIコーディングエージェントの1タスクが8時間かかる理由は、文脈の積み上げと指示の不備が主因
  • コンテキストサイズが100kトークンを超えると遅延が10倍に、検証スキルのロード不足と指示の無限スコープが原因
  • 指示に完了条件と時間上限を明記しないと1指示で200回以上のモデル呼び出しと400分以上の時間がかかる

@Phung Dinh Son /

Markdownは新しい攻撃ベクトルになった — AIエージェント時代の間接プロンプトインジェクション入門

  • プロンプトインジェクションはLLMの構造的制約であり、間接インジェクションが特に危険
  • プロンプトインジェクションの2種類(直接・間接)、Lethal Trifecta(プライベートデータ・信頼不能コンテンツ・外部通信の3要素)
  • プライベートデータへのアクセスを最小限にし、信頼不能コンテンツを厳しくチェックし、外部通信を制限する対策が有効

@Tamura Satoru /

AIペルソナはユーザーの代わりになるのか? 論文3本から探る、できること・できないこと

  • LLMはUIの問題候補を挙げたり、人間と重なる定性的な論点を出したりできる
  • Duan et al.はGPT-4でUIガイドライン違反を検出、Hwang and KangはAIペルソナで定性的テーマを抽出、Kuric et al.はGPTのクリック行動を実ユーザーと比較
  • LLMの出力は実ユーザーの反応そのものではなく、仮説や予測として扱う必要がある

@yushibats /

話題のJevとは?文章を書かずに判断だけを返すAIモデルをざっくり解説

  • Jevは文章を生成せず、選択肢ごとの確率と確信度を返すAIモデル
  • 選択肢から1つ選ぶChoice、段階評価のScore、Yes/NoのNoulの3種類の問いに対応。確信度で処理を分岐可能
  • 確信度が0.9以上なら自動処理、0.5以上なら人間確認、それ以下なら人が振り分け。計算や日付比較は不得意と明記

@aidasquid /

2026年版 LLM勢力図&モデルまとめ

  • 2026年現在のLLM勢力図と主要モデルの特徴がまとめられている
  • ChatGPT、Claude、Gemini、DeepSeek、Qwen、Moonshot、Liquid AI、xLSTM、Jevなどのモデルと、Transformerの代替アーキテクチャが紹介されている
  • LLMの性能やアーキテクチャの選択が開発戦略に直接影響するため、モデルの特徴を理解することが重要

@Yasuhito Morimoto /

国内AIエージェント動向(2026/9/18号)

  • 国内のAIエージェント導入が業務実装、ナレッジ整備、運用定着へと移行している
  • 住友電装の監査AI、介入AI、レビューAI、アビームとNotionのAgent OS、TinyFishの自律Web操作
  • AIエージェント導入の競争軸がモデル性能から業務実装、ナレッジ整備、運用定着、効果検証へ移行している

@はたはた /

LightGBM Rankerを深掘りする:LambdaRankの仕組みと予測の中身

  • LightGBM RankerでLambdaRankを使うと、候補間の順位を入れ替えることでNDCGを最適化する
  • LambdaRankはrelevanceの差に基づくΔNDCGを計算し、gain/splitで特徴量の分岐を決定する、グループ指定を誤ると順位学習が妨げられる
  • グループ指定を誤ると別クエリのアイテムが比較対象となり、NDCG@5が4.6ポイント悪化する可能性がある