動画記事 · AI Engineer
検索境界でユーザー信号が消失 - StarlightSearch の Sonam Pankaj氏
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
検索境界で失われる学習信号を解決し、評価結果をリアルタイムの検索優先度に変換する「Utility Score」による自己改善型エージェントアーキテクチャを提案。
検索境界を越えろ:AI エージェントが「失敗」から学ぶための新戦略
現在の AI エージェントは、推論やツール呼び出しには長けていますが、「失敗から学習する」という重要なループが欠落しています。その結果、多くのエージェントは同じ検索ミスを繰り返し、実運用での成功率は依然として低いままです。スターライト・サーチの CEO、ソナム・パンカジ氏(注:文字起こしより)は、過去の成功と失敗を評価指標に組み込んだ「ユーティリティスコア」という新アプローチ「Agent RX」を発表しました。
この手法は、モデルの再トレーニングや手動プロンプト修正を不要とし、実行中のタスク履歴から即座に推論ルールを更新するランタイム層を実現します。これにより、AI エージェントは静的な検索システムを超え、自律的に進化する「成果指向型」の知能へと進化します。
現在の AI エージェントが抱える「学習ループ」の欠如
AI エージェントの本質は、LLM(大規模言語モデル)を用いて推論し、ツールを呼び出し、現実世界と相互作用しながらタスクを完了させることにあります。しかし、Gartner のレポートや McKinsey の 2025 年報告書が示す通り、実装される AI エージェントの 85% が失敗しています。その主な原因は、検索プロセスが「静的」である点にあります。
現在の RAG(検索拡張生成)システムでは、評価(Evals)の結果が検索プロセスにフィードバックされません。エージェントは過去の失敗や成功の理由を記憶として活用できず、同じミスを繰り返すことになります。
「私たちは間違ったものを最適化してしまいました。エージェントのメモリに多額を払っていますが、これはおそらく欠陥があり、正しくない回答をより速く安く見せることに注力しましたが、検索の学習を促すのを忘れていました。」
多くのシステムが「ユーザーの好み」や「会話履歴」を保存するだけに留まる中、評価と実行の間に欠落した層が存在します。観測機能で収集されたすべてのトレース(ツール呼び出し、例外、LM の完了など)は、最終的な合格・不合格というダッシュボード上の数字として消えてしまいます。エンジニアが手動でプロンプトを修正し、モデルをファインチューニングするまで、エージェントは学習できないのです。
ユーティリティスコア:意味的類似度を超えた「有用性」の定義
この課題を解決するために提案されたのが、「ユーティリティスコア」という概念です。従来のメモリシステムが単なる「意味的類似性(埋め込みベクトルの近さ)」に基づいて検索を行っていたのに対し、ユーティリティスコアは過去のタスク実行における有用性や成果に基づいて記憶の優先度を動的に決定します。
これは単なる事実や統計データの保存ではなく、「推論」としてのメモリを扱うアプローチです。例えば、カスタマーサポートボットが返金処理を行う際、単に「ユーザーはダークテーマを好む」という情報を検索するのではなく、「返金前に決済状況を確認し、二重払いを防ぐ必要がある」という文脈と歴史に基づいて行動します。
記憶はタスクの結果に応じて更新され、過去の失敗(例:特定の列名が使用不可だった)や成功(例:特定のクエリで有効な検索パターン)が、将来の推論ルールとして組み込まれていきます。これにより、エージェントは「何を知っているか」だけでなく、「何が役に立ったか」を学習し続けることができます。
Agent RX:再トレーニング不要の実行時学習(Runtime Learning)
提案された新しいアーキテクチャ「Agent RX」は、大規模言語エージェントが再トレーニングやファインチューニング、手動のプロンプトエンジニアリングを行わずに、経験から改善できるランタイム層です。
これはコンパイル時の最適化とは異なり、実行中(ランタイム)に教訓を反映させます。キーワード検索ではなく、現在のタスクとの意味的類似性に基づいて検索を行い、その記憶が歴史的に役立ったか否かで再ランク付けを行います。
実証実験での成果
ベンチマークテストでは、このアプローチの有効性が示されました。
- スキル組み込みなし: パフォーマンスは 66% から 76% に向上。
- スキル組み込みあり(10 件の記憶蓄積後): パフォーマンスが 80% に到達。
- AgentBench(推論・計画能力テスト): ベースラインの 35.7% から、本手法では 47.5% を達成。他のメモリシステムと比較しても、洗練された結果メモリシステムは 61.3% のスコアを記録しました。
これは、静的な Q&A ではなく、拡張された多段ワークフローやツール使用能力において、エージェントが自律的に推論と計画を改善できることを意味します。
デモで見る「失敗からの学習」:SQL エージェントの進化
実際のデモでは、製品検索を行う SQL エージェントの挙動が示されました。初期段階では、データベースに「ゲーミングマウス」という項目がないため、エージェントは「見つかりませんでした」と報告します。
しかし、Agent RX を通じて失敗のトレースが蓄積されると、システムは自動的に学習を開始します。「ワイヤレスマウス」が存在し、それが「ゲーミングマウス」のカテゴリに含まれる可能性があると推論するようになります。数回の試行とフィードバックの後、エージェントは検索クエリを調整し、関連製品を正しく見つけることができました。
「既存のプロンプトを変更せずに、実際には更新され、エージェントが多く参照する項目をスキルとして定着させることができます。」
このプロセスでは、ツール呼び出しの軌跡が変化し、本番環境でも改善が継続されます。記憶は「推論」として扱われ、過去の失敗が将来の成功へと変換されるのです。
課題と今後の展望
もちろん、このアプローチには限界もあります。初期段階での「コールドスタート問題」(十分なレビューが蓄積されるまで純粋な意味検索しか行えない)や、「ユーティリティドリフト」(類似した記憶が誤って蘇る可能性)、ノイジーなラベルによるスコアへの影響などが挙げられます。また、再ランク付けの精度を調整する「lambda」というハイパーパラメータの設定も重要です。
しかし、これらの課題に対処しつつ、Agent RX は AI エージェントの実用化における最大のボトルネックである「学習と適応」の欠如を解決する可能性を秘めています。企業レベルでの導入において、手動チューニングの負荷を減らし、自律的な改善サイクルを実現する新たな基準となるでしょう。
まとめ
AI エージェントが真に実用化されるためには、静的な検索システムから脱却し、「失敗」を貴重な学習データとして活用できる仕組みが必要です。ユーティリティスコアと Agent RX は、モデルの再トレーニングなしで実行中に継続的に学習・改善を行う道筋を示しており、これが次世代 AI エージェントの標準的な姿へと進化させる鍵となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。