Apple ML、ツール呼び出し能力の蒸留を最適化する「PROOF-Gen」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
現在のツール呼び出し機能の蒸留は教師モデル生成の軌道データをフィルタリングする「生成・フィルタ」方式を採用しているが、これでは失敗事例から信号を得られず、同じ困難なシナリオが常に残存する。
AI深層分析を開く2026年8月27日 02:02
AI深層分析
キーポイント
既存の蒸留パイプラインの構造的欠陥
現在のツール呼び出し機能の蒸留は教師モデル生成の軌道データをフィルタリングする「生成・フィルタ」方式を採用しているが、これでは失敗事例から信号を得られず、同じ困難なシナリオが常に残存する。
高頻度の失敗とニアミス問題
τ 2-bench における教師モデルの試行で57%が失敗しており、そのうち3分の2はツール呼び出し自体は正しいものの実行結果が元に戻されるような「ニアミス」である。
最適化データへの転換の必要性
毎日または毎週の実行サイクルで最前線の教師モデルコストを支払い続ける現状に対し、単なるフィルタリングではなくデータを最適化するアプローチが求められている。
重要な引用
Post-training pipelines that drive shipped tool-calling agents re-run this stage on a daily or weekly cadence, paying the frontier-teacher cost each cycle
the mechanism is generate-and-filter (keep the teacher's passing trajectories, discard the rest) and each cycle leaves behind the same hard scenarios because failures supply no signal
On τ 2-bench, 57% of teacher trials fail, two-thirds of them near-misses
編集コメントを表示
編集コメント
既存の蒸留手法が抱える「失敗からの学習不能」という根本的な課題を指摘しており、実用化されたエージェント開発における重要な転換点を示唆している。特にニアミス事例の扱いに関する分析は、今後のデータ設計において重要な示唆を与える内容である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ツール呼び出し機能を展開可能なモデルに転移(ディストillation)する際、教師モデルが生成した軌跡データを用いた教師あり微調整は、標準的な第一段階として定着しています。実際に製品化されたツール呼び出しエージェントのポストトレーニングパイプラインでは、この工程を毎日または毎週繰り返し実行しており、その都度最先端の教師モデルのコストが発生します。しかし、その仕組みは「生成してフィルタリングする」アプローチに留まっており、「教師が成功した軌跡のみを保持し、他を破棄する」という単純なロジックです。そのため、各サイクルで同じ難易度のシナリオが残ったままとなり、失敗事例からは学習に必要な信号が得られないという根本的な課題があります。
τ 2-bench の評価結果では、教師モデルの試行のうち57%が失敗に終わりました。そのうち約3分の2は「ニアミス」であり、ツール呼び出し自体は正しく実行されたものの、最終的なタスク達成には至らなかったケースが大半です。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み