動画記事 · AI Engineer
ウェブ MCP でユーザー操作を簡素化:Google のタラ・アギマン氏が語るエージェント対応ウェブの未来
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google が提案する「Web MCP」は、AI エージェントがウェブサイトをスクレイピングするのではなく、構造化されたツールとして定義し、ユーザー操作を簡素化する次世代のウェブ標準である。
AI エージェントの「USB-C」が来る:Google が提案する Web MCP でウェブ操作が劇的に変わる
現在の AI エージェントは、ウェブサイト上でタスクを実行する際、膨大なトークン消費を伴う非効率なスクレイピングや、脆い DOM 解析に依存しています。Google Chrome チームのタラ・アギマン氏は、この課題を解決する新規格「Web MCP(Model Context Protocol)」を発表しました。これはウェブサイトを AI 向けの標準化されたツールとして定義し、エージェントが意図を正確に理解して信頼性の高い操作を実現するための基盤となります。
従来のエージェント操作が抱える「脆さ」とコスト
過去数十年間、私たちは人間のためにウェブを最適化してきました。しかし今や、ウェブを利用するのは人間だけではありません。AI エージェントもまた、チケット購入や予約といったタスクを代行する存在として台頭しています。しかし、私たちが構築したサイト上で AI が単純なアクションを実行するには、あまりにも過酷なプロセスが求められています。
例えば、「アフロビーツ・フェスティバルのチケットを 2 枚購入したい」というプロンプトに対し、従来の AI エージェントは以下のような複雑な手順を踏む必要があります。
- DOM の全体走査: HTML を読み込み、ページ構造を理解する。
- アクセシビリティツリーの参照: 視覚的な要素だけでなく、構造的な意味も解析する。
- スクリーンショットの取得と分析: 画面を画像として捉え、どこをクリックすべきかを推測する。
- 位置情報の特定: スクロール量や横方向の距離を計算し、正確な座標を導き出す。
このプロセスは非常に長く、かつ脆いものです。広告が読み込まれてコンテンツが押し下げられたり、一瞬のレイアウト崩れで正しい要素をクリックできなくなったりするリスクがあります。また、これらすべての分析に要するトークン数は膨大であり、コストと速度の面で実用化の大きな障壁となっています。
「あなたがウェブの基盤を改善することで多くのことができます。つまり、すべての人が利用可能なサイトを作ることは、デフォルトで AI エージェントにもアクセス可能にするということです。」
タラ氏は、セマンティック HTML の改善やアクセシビリティ基準の強化など、従来の UX 向上策自体が「エージェント対応」の半分を解決すると指摘します。しかし、それだけでは不十分です。
Web MCP は「AI エージェントの USB-C」として機能する
Web MCP は、ウェブサイトの機能を構造化されたツールとして定義する規格です。これを「AI エージェントの USB-C」と例えるのは、エージェントが勝手にウェブサイトの機能を推測する必要がなくなるからです。
USB-C が異なる機器間で標準的な接続を可能にするように、Web MCP はウェブサイト側に明確なツールリストを提供します。これにより、AI エージェントは以下の利点を得ます。
- 互換性の向上: 各サイトごとに独自の推論プロセスを必要とせず、標準化されたインターフェースで動作する。
- 信頼性の確保: サイトの構造や広告の影響を受けず、定義されたアクションを確実に実行できる。
- 効率化: 画像解析や DOM の全走査が不要となり、トークン消費を劇的に削減できる。
デモで見る:迷路ゲームとチケット購入の実践
Web MCP がどのように機能するかは、デモンストレーションを通じて明確になります。Google Chrome DevRel チームが開発した「迷路脱出ゲーム」では、AI エージェント(Gemini)が Web MCP を介して操作を行います。
初期状態のページには「スタート迷路ゲーム」という 1 つのツールしか登録されていません。しかし、ゲームが始まると同時に、北・南・東・西への移動やアイテムの取得など、多数のツールが動的に追加されます。AI はプロンプト(例:「下と右に進んでください」)を受け取ると、それを方向に変換し、登録された「移動」ツールを呼び出します。
「AI エージェントは、必要なと判断するまで同じツール呼び出しを繰り返すことができます。つまり、迷路を完成させるために、利用可能なすべてのツールを使いこなして動き回り続けるのです。」
より複雑なシナリオである「チケット購入デモ」では、Web MCP の真価が発揮されます。
- 検索: 「サマー・ヴァイブス・フェスティバルの VIP チケットを 2 枚」という指示に対し、AI は該当するコンサートを特定するツールを呼び出します。
- ページ遷移: コンサート ID を取得し、詳細ページへ移動するツールを実行します。
- 購入実行: 新しいページで「チケット購入」ツールが利用可能になり、数量とセクション名を指定して即座に決済処理を行います。
この過程では、AI がツールを呼び出すたびに UI が同期され、ユーザーは「VIP 選択」「数量指定」「決済完了」という一連の流れをリアルタイムで確認できます。これにより、複雑な予約や購入プロセスが自然言語の指示だけで完結するようになります。
実装アプローチ:宣言型と命令型の 2 つの道
Web MCP の実装には、開発者のニーズに応じて 2 つのアプローチが提案されています。
1. 宣言的 API(HTML 形式)
通常の HTML フォームに属性を追加するだけで動作します。ツール名や説明を記述し、ブラウザが自動的に JSON スキーマを生成してエージェントに提供します。これにより、フォームフィールドをパラメータとして扱えるようになり、開発コストを抑えつつ標準的な操作を実現できます。
2. 命令的 API(動的登録)
より複雑な UI フローや多段階のプロセスには、JavaScript を用いてツールを手動で登録する命令的アプローチが適しています。register_tool 関数を用いて独自のスchemas を定義し、実行ブロックで実際のロジック(バリデーション、DOM 操作など)を記述します。
「宣言型 API は標準的なフォーム要素に最適ですが、複雑な UI フローや多段階の処理には命令的 API が最も使用されるでしょう。」
MCP との違いと今後の展望
nWeb MCP は、サーバーサイド接続を扱う従来の「MCP(Model Context Protocol)」とは異なります。Web MCP は MCP に着想を得ていますが、特にブラウザ内のクライアント側機能に特化しています。つまり、JavaScript が Java からインスパイアされたように、Web MCP は MCP のツール部分を実装したものであり、ブラウザウィンドウを開いた状態でエージェントが直接対話する仕組みです。
現在、Web MCP は Chrome バージョン 146 以降で実験的プレビュー段階にあります。開発者は Chrome Canary を使用し、モデルコンテキストツールインスペクター拡張機能をインストールすることで、自社のサイトでのテストを開始できます。
「AI エージェントはすでにウェブを利用しています。しかし、トークンが多く脆いスクレイピングプロセスに満足する必要はありません。Web MCP ツールを使用して、すべてのウェブサイトエージェント向けの高性能 API に変えることができます。」
Web MCP が普及すれば、開発者は「エージェント対応」を意識した UI/UX 設計を求められるようになり、AI と人間の協働ワークフローが再定義されるでしょう。複雑なタスクの自動化が現実的なものとなり、ウェブ体験そのものが進化していくはずです。
まだ初期段階ですが、フィードバックを求めながら急速に発展しているこの規格。ぜひ Chrome Canary で試してみて、未来のウェブ操作を体感してみてください。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。