読み込み中…
読み込み中…
現在の AI エージェントは検索プロセスが静的であり、失敗から学習できないことが主な課題である。この動画では、過去の成果や失敗を考慮した「ユーティリティスコア」を採用し、検索結果の再ランク付けを行う新しいアプローチ「Agent RX」を紹介する。これにより、モデルの再トレーニングや手動プロンプト修正なしに、実行中のタスクで継続的に学習・改善が可能となる。実証実験では、従来の手法よりも高い成功率を示し、エージェントの成果指向性を大幅に向上させることを示した。
RAG の限界を超えた「学習型検索」の実装例として、開発者にとって非常に示唆に富む内容です。実演部分で具体的な挙動の変化が確認できるため、実践的な導入を検討する際に必見の動画です。
現在の RAG システムは静的であり、評価(Evals)の結果が検索プロセスにフィードバックされないため、エージェントは同じ失敗を繰り返す。
単なる意味的類似度ではなく、過去のタスク実行における有用性や成果に基づいて記憶の優先度を動的に決定するスコアリング手法。
モデルの再トレーニングやプロンプト修正を不要とし、実行中のタスク履歴から即座に推論ルールを更新するランタイム層の実装。
このアプローチは、AI エージェントの実用化における最大のボトルネックである「学習と適応」の欠如を解決し、運用コストを抑えつつ性能を向上させる可能性を秘めている。企業レベルでの AI エージェント導入において、手動チューニングの負荷を減らし、自律的な改善サイクルを実現する新たな基準となるだろう。
現在の AI エージェントは、推論やツール呼び出しには長けていますが、「失敗から学習する」という重要なループが欠落しています。その結果、多くのエージェントは同じ検索ミスを繰り返し、実運用での成功率は依然として低いままです。スターライト・サーチの CEO、ソナム・パンカジ氏(注:文字起こしより)は、過去の成功と失敗を評価指標に組み込んだ「ユーティリティスコア」という新アプローチ「Agent RX」を発表しました。
この手法は、モデルの再トレーニングや手動プロンプト修正を不要とし、実行中のタスク履歴から即座に推論ルールを更新するランタイム層を実現します。これにより、AI エージェントは静的な検索システムを超え、自律的に進化する「成果指向型」の知能へと進化します。
AI エージェントの本質は、LLM(大規模言語モデル)を用いて推論し、ツールを呼び出し、現実世界と相互作用しながらタスクを完了させることにあります。しかし、Gartner のレポートや McKinsey の 2025 年報告書が示す通り、実装される AI エージェントの 85% が失敗しています。その主な原因は、検索プロセスが「静的」である点にあります。
現在の RAG(検索拡張生成)システムでは、評価(Evals)の結果が検索プロセスにフィードバックされません。エージェントは過去の失敗や成功の理由を記憶として活用できず、同じミスを繰り返すことになります。
「私たちは間違ったものを最適化してしまいました。エージェントのメモリに多額を払っていますが、これはおそらく欠陥があり、正しくない回答をより速く安く見せることに注力しましたが、検索の学習を促すのを忘れていました。」
多くのシステムが「ユーザーの好み」や「会話履歴」を保存するだけに留まる中、評価と実行の間に欠落した層が存在します。観測機能で収集されたすべてのトレース(ツール呼び出し、例外、LM の完了など)は、最終的な合格・不合格というダッシュボード上の数字として消えてしまいます。エンジニアが手動でプロンプトを修正し、モデルをファインチューニングするまで、エージェントは学習できないのです。
この課題を解決するために提案されたのが、「ユーティリティスコア」という概念です。従来のメモリシステムが単なる「意味的類似性(埋め込みベクトルの近さ)」に基づいて検索を行っていたのに対し、ユーティリティスコアは過去のタスク実行における有用性や成果に基づいて記憶の優先度を動的に決定します。
これは単なる事実や統計データの保存ではなく、「推論」としてのメモリを扱うアプローチです。例えば、カスタマーサポートボットが返金処理を行う際、単に「ユーザーはダークテーマを好む」という情報を検索するのではなく、「返金前に決済状況を確認し、二重払いを防ぐ必要がある」という文脈と歴史に基づいて行動します。
記憶はタスクの結果に応じて更新され、過去の失敗(例:特定の列名が使用不可だった)や成功(例:特定のクエリで有効な検索パターン)が、将来の推論ルールとして組み込まれていきます。これにより、エージェントは「何を知っているか」だけでなく、「何が役に立ったか」を学習し続けることができます。
提案された新しいアーキテクチャ「Agent RX」は、大規模言語エージェントが再トレーニングやファインチューニング、手動のプロンプトエンジニアリングを行わずに、経験から改善できるランタイム層です。
これはコンパイル時の最適化とは異なり、実行中(ランタイム)に教訓を反映させます。キーワード検索ではなく、現在のタスクとの意味的類似性に基づいて検索を行い、その記憶が歴史的に役立ったか否かで再ランク付けを行います。
ベンチマークテストでは、このアプローチの有効性が示されました。
これは、静的な Q&A ではなく、拡張された多段ワークフローやツール使用能力において、エージェントが自律的に推論と計画を改善できることを意味します。
実際のデモでは、製品検索を行う SQL エージェントの挙動が示されました。初期段階では、データベースに「ゲーミングマウス」という項目がないため、エージェントは「見つかりませんでした」と報告します。
しかし、Agent RX を通じて失敗のトレースが蓄積されると、システムは自動的に学習を開始します。「ワイヤレスマウス」が存在し、それが「ゲーミングマウス」のカテゴリに含まれる可能性があると推論するようになります。数回の試行とフィードバックの後、エージェントは検索クエリを調整し、関連製品を正しく見つけることができました。
「既存のプロンプトを変更せずに、実際には更新され、エージェントが多く参照する項目をスキルとして定着させることができます。」
このプロセスでは、ツール呼び出しの軌跡が変化し、本番環境でも改善が継続されます。記憶は「推論」として扱われ、過去の失敗が将来の成功へと変換されるのです。
もちろん、このアプローチには限界もあります。初期段階での「コールドスタート問題」(十分なレビューが蓄積されるまで純粋な意味検索しか行えない)や、「ユーティリティドリフト」(類似した記憶が誤って蘇る可能性)、ノイジーなラベルによるスコアへの影響などが挙げられます。また、再ランク付けの精度を調整する「lambda」というハイパーパラメータの設定も重要です。
しかし、これらの課題に対処しつつ、Agent RX は AI エージェントの実用化における最大のボトルネックである「学習と適応」の欠如を解決する可能性を秘めています。企業レベルでの導入において、手動チューニングの負荷を減らし、自律的な改善サイクルを実現する新たな基準となるでしょう。
AI エージェントが真に実用化されるためには、静的な検索システムから脱却し、「失敗」を貴重な学習データとして活用できる仕組みが必要です。ユーティリティスコアと Agent RX は、モデルの再トレーニングなしで実行中に継続的に学習・改善を行う道筋を示しており、これが次世代 AI エージェントの標準的な姿へと進化させる鍵となるでしょう。
この記事はAIが動画の内容を記事化したものです。正確な発言は動画および文字起こしをご確認ください。