TLDR AIコミュニティ·2026年5月5日 09:00·約1分
モデル・ハネス・フィット:最先端 AI が特定ツールに最適化されている実態
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
まず要点
バスタマンテ氏は、Codex CLI や Claude Code などの CLI ツールを分析し、最先端研究所が学習済みモデルの重みに特定のツールの名前やスキーマ、プロンプト構造を組み込んでいると指摘。Terminal-Bench 2.0 のデータは、同じモデルでも使用するハネス(評価枠組み)を変えるだけでスコアが大きく変動することを示している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ブスタマンテは Codex CLI、Claude Code、GitHub Copilot CLI を分解分析し、最先端研究所が特定のハルネスに対してポストトレーニングモデルを構築していることを示しています。これにより、ツール名、スキーマ、引用タグ、メモリ儀礼、システムプロンプト構造などが重み(weights)に組み込まれています。Terminal-Bench 2.0 のデータがこの仮説を裏付けています:Claude Opus 4.6 は ForgeCode で 79.8%、Capy では 75.3% を記録しました。また、ハルネスを変更しただけで Cursor は「上位 30 位から上位 5 位」に躍進しています。一方、OpenAI モデルはデフォルトでパッチベースのファイル編集を採用し、Anthropic モデルは文字列置換を使用します。これらの不一致が推論トークンの損失を引き起こしています。
この記事をシェア
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み