読み込み中…
読み込み中…
Uber Eats は年間 900 億ドル規模の市場で、小規模店舗の写真品質不足という課題に対し、AI エージェントによる画像編集ソリューションを構築しました。このシステムは、画像理解・ルーティング・編集・QA の各段階で評価ループを設け、人間のラベルデータと継続的に整合性を保ちながら自動調整を行います。特に重要なのは、生成 AI 特有の「不自然さ」や「ハルシネーション」を防ぐための厳格なガードレールと、プロダクション上のドリフトを検知して自己修復する診断エージェントの仕組みです。これにより、市場全体の品質を向上させつつ、ブランドの独自性と消費者の信頼を損なわないバランスを実現しています。
AI エージェントの実運用における「評価(Evals)」と「継続的学習」の重要性を具体的に示した貴重な事例です。開発者やアーキテクトにとって、プロダクション環境での AI システムをどう設計・維持すべきかの具体的な指針が得られます。
画像理解・ルーティング・編集・QA の各段階でエージェントを配置し、フラットなログ構造で可視化・最適化するエンドツーエンドのシステム。
プロダクション上のデータドリフトを検知する診断エージェントが、ミスマッチを解析し、プロンプトや設定を自動的に再調整してモデルを鮮明に保つ。
AI 生成特有の不自然さやハルシネーションを防ぐため、厳格なガードレールとスイスチーズモデルによる多重 QA ガートを設ける。
このアプローチは、エンタープライズレベルの AI エージェント開発において、単なる機能実装から「信頼性とスケーラビリティを両立させる運用体系」への転換を示しています。特に、人間のフィードバックと自動調整を組み合わせたクローズドループ構造は、生成 AI の実社会導入における品質保証の標準的なベストプラクティスとして他社にも影響を与える可能性があります。
Uber Eats は年間 900 億ドル規模の市場で、小規模店舗が抱える写真品質の課題に対し、AI エージェントによる画像編集ソリューションを実装しました。このシステムは単なる画像生成ツールではなく、画像理解から編集、QA(品質保証)に至るまでの全工程に評価ループを設け、人間のラベルデータと継続的に整合性を保ちながら自動調整を行う「クローズドループ」構造を採用しています。
Uber Eats のデリバリーマーケットプレイスは現在、年間 900 億ドル規模で成長を続けており、10,000 の都市で運営されています。ユーザー体験において視覚コンテンツは極めて重要であり、写真が顧客が店舗やメニューをクリックする最初の判断材料となります。
しかし、市場には深刻な課題が存在します。小規模な個人経営の店舗では、プロによる撮影コストや時間、ノウハウの欠如により、写真の品質が低下しているケースが多発しています。一方、ユーザーは「本物らしさ」を求めつつも、AI 生成特有の不自然さやハルシネーション(幻覚)に対する不信感を持っています。
「消費者に AI 生成のような不自然な料理写真を表示させてしまうのは避けなければなりません。私たちは『本物の写真』と『AI の加工』の狭間で針を縫うようなバランス感覚が求められています。」
この課題に対し、Uber は以下の原則を掲げています。
この課題解決のために Uber が設計したのは、画像理解、ルーティング、編集、QA の各段階に AI エージェントを配置したマルチモーダルな評価パイプラインです。単一のモデルではなく、役割分担された複数のエージェントが連携して動作します。
このシステムの特徴は、すべてのエージェントの動作ログが「フラットな JSON 構造」で一元管理されている点です。これにより、エンジニアだけでなく非技術系の製品担当者も特定のケースを深掘りしたり、集計データを分析してシステム全体を最適化したりすることが可能になります。
「ログ管理から始めなければ、何を最適化すべきか分かりません。自己学習ループを構築するためにも、まずは可視化可能なログが不可欠です。」
オフラインで訓練されたモデルは、実社会のデータ分布(プロダクション上のドリフト)の変化に対応できなくなるリスクがあります。Uber はこれを防ぐため、「診断エージェント」と「自動調整パイプライン」を組み合わせたクローズドループ構造を構築しました。
1. 人間のラベルデータをゴールドスタンダードに
モデルの初期訓練や評価には、多様な地域・料理・品質レベルの画像を人間が客観的なガイドラインに基づいてラベル付けしたデータセットを使用します。これを「真実(ゴールドスタンダード)」とし、モデルの出力と比較して調整を行います。
2. ドリフト検知と診断
プロダクション環境では定期的にデータをサンプリングし、人間のラベル結果とエージェントの出力を比較します。ミスマッチが発生した場合、「診断エージェント」が問題の発生箇所を特定し、原因(プロンプトの不備や設定のズレなど)を分析します。
3. 自動チューニング
診断結果に基づき、システムは自動的にプロンプトやパラメータを再調整するパイプラインを起動します。このプロセスには人間の介入を必要とせず、構成(コンフィグ)駆動で完結します。調整後のモデルは再びゴールドスタンダードでベンチマークされ、基準を満たせば自動的にリリースされます。
「静的なモデル一つではなく、常に変化するデータに対してプロンプトや設定を自動で再調整する仕組みこそが、システムを『生きた状態』に保つ鍵です。」
AI 生成特有の「不自然さ」や「ハルシネーション」を防ぐため、Uber は単一のチェックポイントではなく、スイスチーズモデル(複数の欠陥が重なって初めて事故が起きるという概念)を応用した多重 QA ガートを設けています。
特にルーティング段階では、「 recall(再現率)」を最優先の指標としています。不良画像がシステムをすり抜けるリスクは許容できません。例えば、高品質な画像を誤って編集対象として選んでしまうと、計算コストが無駄になるだけでなく、かえって画質を劣化させるリスクがあります。
また、「忠実性(faithfulness)」の観点からは、画像とテキスト記述の整合性を厳格にチェックします。例えば、画像に 6 個のチキンウィングが写っているのに、テキストには「8 個」と記載されている場合、編集エージェントが誤って 2 個を追加して生成してしまうハルシネーションを防ぐためのガードレールが機能しています。
Uber Eats の事例は、単に機能を実装する段階から、「信頼性とスケーラビリティを両立させる運用体系」へと AI エージェント開発の重心が移ったことを示しています。人間のフィードバックと自動調整を組み合わせたクローズドループ構造は、生成 AI を社会実装する際の品質保証における標準的なベストプラクティスとして、他社にも大きな影響を与える可能性があります。
この記事はAIが動画の内容を記事化したものです。正確な発言は動画および文字起こしをご確認ください。