動画記事 · AI Engineer
次世代コマース向け多モーダル協働エージェント、Google DeepMind が発表
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google DeepMind は、曖昧な意図を持つユーザーに対し、多モーダル入力と協働戦略を用いて目標達成を支援する次世代コマースエージェントの枠組みを発表した。
Google DeepMind が提唱する「次世代コマース AI」:曖昧なユーザーの意図を共創で叶える 3 つのフェーズ
Google DeepMind は、従来の検索ラッパー型エージェントが抱える「ユーザーの曖昧な意図への対応不足」という課題に対し、多モーダル協働エージェントという新たな枠組みを発表しました。これは単なる情報検索ツールではなく、ユーザーの感情や視覚的なヒントから制約を抽出し、共創を通じて最適な解決策へと導くパートナーとしての AI の進化を示すものです。
従来の「検索ラッパー」の限界と「曖昧な意図」への対応
現在、多くの AI エージェントはユーザーが明確なキーワードを持っており、何を求めているかを正確に理解していることを前提としています。しかし、実際のショッピングや購入意向においては、ユーザーは「なんとなくいい感じのものを探したい」といった曖昧な感覚(fuzzy intent)を持っていることがほとんどです。
「ユーザーはすでに正しい語彙を持っていて、明確な意図を持っていると仮定するのは現実的ではありません。むしろ、彼らは『 vibe 』や『雰囲気』を求めており、エージェントが手取り足取り導く必要があります」
この「表現のギャップ(articulation gap)」を埋めるため、DeepMind は AI がユーザーと共に好みを特定し、可能性を示しながら最終的な推奨へと導くプロセスを設計しました。これはコマースに限らず、金融や教育など他の分野でも応用可能な汎用的なアプローチです。
フェーズ 1:発見フェーズで「信頼スコア付き」の作業状態を構築する
対話が始まると同時に、AI は「発見フェーズ(Discovery Phase)」に入ります。ここでは、過去の会話履歴、ユーザーが提供した参考画像やリンク、個人的な文脈など、あらゆるコンテキスト情報を収集します。
重要なのは、単に情報を集めるだけでなく、それを構造化して「作業状態(Working State)」として構築することです。これには以下の要素が含まれます:
- 硬軟両方の制約の抽出: ユーザーが明確に述べた予算やサイズといった「ハード制約」と、参考画像から推測されるデザインスタイルのような「ソフト制約」を区別します。
- 信頼スコア(Confidence Score)の付与: 参考画像など多モーダル入力から抽出した情報について、AI がどれほど確信を持っているかを数値化します。これにより、曖昧な情報を過信せず、必要な確認を適切に行う判断基準となります。
- 未知の変数の特定と優先順位付け: 結果を出すためにまだ足りない情報(例:部屋の幅や特定の素材の好み)を特定し、どの質問が最も多くの情報を得られるか(情報獲得量の最大化)を計算して優先度を決定します。例えば、「商品のサイズが部屋に合わない」リスクを避けるため、まずは部屋の寸法を聞くことが最善の手順であると判断します。
このプロセスでは、AI が「何を知らないか」を正確に把握し、ユーザーに対して最も効果的な次の一歩を提案する戦略を立てます。
フェーズ 2:多モーダルによる意図引き出しと背景処理
発見フェーズで不足している情報を特定すると、「調査フェーズ(Research Phase)」に入ります。ここで重要となるのが、テキストベースの質問が不十分な場合における多モーダルなアプローチです。
ユーザーは言葉で自分の好みを説明するのが苦手な場合があります。そこで AI は、視覚的なインスピレーションボードや比較表を活用して、共通言語を築きながら好みを引き出します。
「テキストでの対話だけでは限界があります。AI が視覚的なリファレンスやインスピレーションボードを使って『これとこれ、どちらが好きですか?』と問いかけることで、ユーザーは自分の好みをより明確に認識できます」
このフェーズでは、以下の 2 つの役割が同時に果たされます:
- 対話の最適化: ユーザーに負担をかけずに、視覚的な選択肢を通じて嗜好を特定する。これは「見せる・尋ねる」アプローチの典型です。
- 背景での重労働(Heavy Lifting): ユーザーが説明する必要のない部分で、AI がバックグラウンドで商品カタログとの照合、トレードオフの分析、情報の要約を行い、ユーザーに提示するべき候補を整理します。これにより、ユーザーは複雑な比較作業から解放され、意思決定に集中できます。
フェーズ 3:クエリに応じた「適応型回答」で意思決定を支援
最終段階である「適応フェーズ(Adaptive Phase)」では、AI はユーザーの状況やクエリの性質に応じて、回答の形式を柔軟に変化させます。多くのシステムが失敗するのは、一律にテキストだけの回答を提供してしまう点にあります。
DeepMind のアプローチでは、以下のようにより効果的なフォーマットを選択します:
- リスト形式: 単純な商品一覧が必要な場合。
- 比較テーブル: 複数の商品の仕様や価格を対比させたい場合。
- 視覚ボード: デザインの雰囲気やレイアウトを直感的に理解したい場合。
「AI は、ユーザーが求めている答えを見つけるために、よりスマートなプレゼンテーションスキルを発揮する必要があります。テキストだけでなく、視覚情報や構造化されたデータを組み合わせて提示することで、意思決定を加速させます」
この「適応型回答」により、ユーザーは情報を直感的に理解し、購入やアクションへの移行がスムーズに行われます。
まとめ:AI エージェントの進化と実用性の向上
Google DeepMind が提案するこのフレームワークは、AI エージェントを単なる検索ツールから、ユーザーの曖昧なニーズを理解し共創するパートナーへと進化させるものです。特にコマース分野において、対話型 AI の実用性とコンバージョン率の向上に大きく寄与する可能性を秘めています。
開発者にとっては、「見せる・尋ねる」アプローチの標準化や、各工程における自動評価(Auto Rater)の重要性が示唆されており、今後の AI 開発の重要な指針となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。