動画記事 · AI Engineer
Uber、マルチモーダルエージェントのスケール型クローズドループ評価を構築
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Uber はマルチモーダルエージェントを用いたクローズドループ評価システムにより、食品写真の品質向上と信頼性の維持を両立する実証例を示した。
Uber Eats が構築した「信頼とスケール」を両立させる AI エージェントの運用体系
Uber Eats は年間 900 億ドル規模の市場で、小規模店舗が抱える写真品質の課題に対し、AI エージェントによる画像編集ソリューションを実装しました。このシステムは単なる画像生成ツールではなく、画像理解から編集、QA(品質保証)に至るまでの全工程に評価ループを設け、人間のラベルデータと継続的に整合性を保ちながら自動調整を行う「クローズドループ」構造を採用しています。
市場の課題:「本物らしさ」と「AI 生成の不自然さ」の狭間で
Uber Eats のデリバリーマーケットプレイスは現在、年間 900 億ドル規模で成長を続けており、10,000 の都市で運営されています。ユーザー体験において視覚コンテンツは極めて重要であり、写真が顧客が店舗やメニューをクリックする最初の判断材料となります。
しかし、市場には深刻な課題が存在します。小規模な個人経営の店舗では、プロによる撮影コストや時間、ノウハウの欠如により、写真の品質が低下しているケースが多発しています。一方、ユーザーは「本物らしさ」を求めつつも、AI 生成特有の不自然さやハルシネーション(幻覚)に対する不信感を持っています。
「消費者に AI 生成のような不自然な料理写真を表示させてしまうのは避けなければなりません。私たちは『本物の写真』と『AI の加工』の狭間で針を縫うようなバランス感覚が求められています。」
この課題に対し、Uber は以下の原則を掲げています。
- 忠実性の保持: 元の画像や店舗のブランド性を損なわないこと。
- 選択的な品質向上: 必要な場合のみ編集を行い、市場全体の多様性を維持すること。
- 安全なリリースと継続学習: システム全体でリスクを管理し、常に変化するデータに適応すること。
マルチモーダル評価パイプライン:エージェントによるエンドツーエンドの制御
この課題解決のために Uber が設計したのは、画像理解、ルーティング、編集、QA の各段階に AI エージェントを配置したマルチモーダルな評価パイプラインです。単一のモデルではなく、役割分担された複数のエージェントが連携して動作します。
- 画像理解とルーティング: まず、LLM(大規模言語モデル)が画像の内容を記述し、構造化データとして出力します。この情報をもとに「ルーター」が判断し、「編集が必要か」「そのまま公開するか」を決定します。
- 画像編集と自己修正: 編集が必要な場合、画像編集エージェントが処理を行います。ただし、ここで一度 QA エージェントによるチェックが入り、不自然さや誤りがあればフィードバックループに入り、自己修正を試みます。一定回数試しても改善しない場合は公開されません。
- 最終 QA とログ管理: すべての工程を通過した画像は最終 QA を経てメニューに公開されます。
このシステムの特徴は、すべてのエージェントの動作ログが「フラットな JSON 構造」で一元管理されている点です。これにより、エンジニアだけでなく非技術系の製品担当者も特定のケースを深掘りしたり、集計データを分析してシステム全体を最適化したりすることが可能になります。
「ログ管理から始めなければ、何を最適化すべきか分かりません。自己学習ループを構築するためにも、まずは可視化可能なログが不可欠です。」
クローズドループと自動調整:ドリフト検知による「生きている」モデル
オフラインで訓練されたモデルは、実社会のデータ分布(プロダクション上のドリフト)の変化に対応できなくなるリスクがあります。Uber はこれを防ぐため、「診断エージェント」と「自動調整パイプライン」を組み合わせたクローズドループ構造を構築しました。
1. 人間のラベルデータをゴールドスタンダードに
モデルの初期訓練や評価には、多様な地域・料理・品質レベルの画像を人間が客観的なガイドラインに基づいてラベル付けしたデータセットを使用します。これを「真実(ゴールドスタンダード)」とし、モデルの出力と比較して調整を行います。
2. ドリフト検知と診断
プロダクション環境では定期的にデータをサンプリングし、人間のラベル結果とエージェントの出力を比較します。ミスマッチが発生した場合、「診断エージェント」が問題の発生箇所を特定し、原因(プロンプトの不備や設定のズレなど)を分析します。
3. 自動チューニング
診断結果に基づき、システムは自動的にプロンプトやパラメータを再調整するパイプラインを起動します。このプロセスには人間の介入を必要とせず、構成(コンフィグ)駆動で完結します。調整後のモデルは再びゴールドスタンダードでベンチマークされ、基準を満たせば自動的にリリースされます。
「静的なモデル一つではなく、常に変化するデータに対してプロンプトや設定を自動で再調整する仕組みこそが、システムを『生きた状態』に保つ鍵です。」
信頼性の担保:多重 QA ガートと厳格なガードレール
AI 生成特有の「不自然さ」や「ハルシネーション」を防ぐため、Uber は単一のチェックポイントではなく、スイスチーズモデル(複数の欠陥が重なって初めて事故が起きるという概念)を応用した多重 QA ガートを設けています。
特にルーティング段階では、「 recall(再現率)」を最優先の指標としています。不良画像がシステムをすり抜けるリスクは許容できません。例えば、高品質な画像を誤って編集対象として選んでしまうと、計算コストが無駄になるだけでなく、かえって画質を劣化させるリスクがあります。
また、「忠実性(faithfulness)」の観点からは、画像とテキスト記述の整合性を厳格にチェックします。例えば、画像に 6 個のチキンウィングが写っているのに、テキストには「8 個」と記載されている場合、編集エージェントが誤って 2 個を追加して生成してしまうハルシネーションを防ぐためのガードレールが機能しています。
まとめ:エンタープライズ AI の新基準へ
Uber Eats の事例は、単に機能を実装する段階から、「信頼性とスケーラビリティを両立させる運用体系」へと AI エージェント開発の重心が移ったことを示しています。人間のフィードバックと自動調整を組み合わせたクローズドループ構造は、生成 AI を社会実装する際の品質保証における標準的なベストプラクティスとして、他社にも大きな影響を与える可能性があります。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。