最終更新 2026/09/04 20:40
ランキング
AIニュース
AIブログ
開発
組織・キャリア
企業テックブログ
すべて
原文著者: @東京PCレスキュー隊長 /
28日前
Claude CodeとCodex、数字が割れる理由
#生成AI・LLM
#AIエージェント
#機械学習
AIで作成し、掲載基準に基づいて自動選定した要約です。
Terminal-Bench 2.1の結果が6つの出典で異なる理由が明らかに
推論エフォート設定、ハーネスの違い、拒否時のフォールバック処理、測定時点が主な要因
ベンチマークの数値は設定や測定条件によって大きく変わるため、どの条件で測ったかを確認する必要がある
Claude CodeとCodex、数字が割れる理由|東京PCレスキュー隊長
note / 原文を読む
同じカテゴリの記事
バークレイズがClaudeを拡大導入し、運用改善と顧客体験向上を実現
@Anthropic / 10時間前 / バークレイズがアンソロピックのClaudeを拡大導入し、運用改善と顧客体験向上を実現
Google、Gemini 4 Argonをリリース。最も強力なモデルと称される
@Lucas Ropek / 10時間前 / GoogleがGemini 4 Argonをリリースし、最も強力なモデルと称している
GoogleのAIがインフルエンザの入院予測で1位
@Zahra Shamsi / 12時間前 / GoogleのAIがインフルエンザの入院予測で最優秀を獲得した