動画記事 · AI Engineer
ウェブ自動化の闇:人間同様にサイトを使うエージェントを教える
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
ウェブ自動化エージェントが人間同様に振る舞うための、CLIとChrome DevToolsプロトコルを用いた「メタゲグラデーション」アプローチとその実装手法を解説する。
ウェブ自動化の闇:AI エージェントを人間同様に動かすための実戦フレームワーク
「ウェブ自動化の闇」と聞くと、違法行為やハッキングを連想するかもしれませんが、ここで語るべきはむしろ逆です。AI エージェントが、人間のようにブラウザを操作し、Cloudflare の防御やボット検知システムを突破して複雑なタスクを完遂させるための、極めて実用的で強力なフレームワークについて語ります。
従来の AI エージェントは、ウェブサイトの「壁」に直面すると行き詰まっていました。しかし、この新しいアプローチでは、AI が人間と区別されないようブラウザを直接制御し、既存の Web UI を「ユニバーサル API」として活用することで、開発コストを劇的に下げつつスケーラビリティを向上させることが可能になります。
CLI と MCP の決定的な違い:速度とコストで勝つ
まず、AI エージェントに与えるべきツールについて考え直しましょう。多くの人が「MCP(Model Context Protocol)サーバー」を使うことを想定しがちですが、この話の核心はCLI(コマンドラインインターフェース)、つまりシェルベースのツールの使用にあります。
能力自体で見れば、CLI と MCP の両者が同じタスクを成功させる確率は約 83% と同等です。しかし、再利用性、速度、そしてコストにおいて CLI は MCP を圧倒します。
「CLI シーケンスは一度プログラムすれば、モデルを介さずに千回実行できます。一方、MCP は各ステップごとにモデルに問い合わせてしまいます。」
この違いがもたらす結果は歴然としています。ある研究では、同じタスクを実行する際、MCP は 71 回のラウンドトリップと 8 分を要しましたが、CLI はわずか 7 回のターンで 1 分未満で完了しました。さらに驚くべきことに、トークンコストにおいて CLI は MCP よりも最大 75 倍安価になることが報告されています。
つまり、AI エージェントに「人間のような動作」をさせるためには、重厚なサーバー構造よりも、軽量で高速な CLI ツールが不可欠なのです。
Chrome DevTools プロトコル:人間と見分けられない操作経路
では、どのようにして AI に人間同様の操作性を持たせるのか?答えはChrome DevTools Protocol(CDP)にあります。これは、ブラウザの開発者ツール(F12 キーを押した際に表示されるパネル)がブラウザを制御するのと同じプロトコルです。
「CDP を通じてブラウザを操作すれば、AI のクリックやキー入力は、人間のそれと全く同じ経路を Chrome 内部で通過します。Google や Cloudflare が見ても、人間か AI か区別できません。」
この「Chrome Agent」というツールを使うことで、エージェントは CDP を介してブラウザを直接制御できます。CDP は膨大なドメイン(57 ドメイン)とメソッドを持っていますが、人間の動作を模倣するために必要なのはごく一部です。
これを「デジタルな五感」に例えると理解しやすくなります:
- 視覚:DOM の構造やアクセシビリティツリーから情報を取得、あるいはスクリーンショットでピクセルレベルの情報を得る。
- 聴覚:ネットワークトラフィックやコンソールログ、システムログを監視する。
- 操作:クリック、入力、ナビゲーションを実行する。
このようにして、AI は人間がブラウザ上で行うすべての動作を忠実に再現できるのです。
メタゲグラデーション:ページが抵抗するほど強くなる戦略
ここで重要なのが、ページがボットを検知して抵抗してきた際の対応策です。単一の手法で全てを解決しようとするのではなく、「メタゲグラデーション(Meta-Gradation)」と呼ばれる階段状の戦略を採用します。
これは、ページの防御レベルに応じて技術的アプローチを段階的に強化するループです。以下の 3 つの段(ラング)があります。
ランク 1:合成クリック(Synthetic Click)
まずは最も安価で簡単な方法から始めます。ページが露出している API を利用し、JavaScript でクリックを実行します。これは瞬時に完了し、コストもゼロです。Outlook のメール送信のように、防御の薄いサイトであればこれで十分です。
ランク 2:信頼された入力(Trusted Input)
もし合成クリックが「無視」されて反応しない場合、ページはボットを検知しています。この時、CDP の入力ドメインを使用して、実際のマウス操作と同じ経路でクリックを行います。これにより、イベントに「信頼済み」というスタンプが付与され、ページはこれを人間の操作とみなして受け入れます。
ランク 3:人間模倣(Human Imitation)
それでもダメな場合、ページは高度なボット検知を行っています。ここでは、実際のマウスパスの遅延や揺らぎ(ジッター)、そして視覚認識を伴う人間のような挙動が必要になります。
「ページが抵抗する度合いに応じて、合成クリックから本物のマウス操作、さらに視覚認識を伴う人間模倣へと段階的に技術レベルを上げます。必要最低限のランクで動くのが鉄則です。」
この「ループ・オン・ラダー」戦略により、AI は状況に応じて最適な手法を選択し、自動化の信頼性を最大化します。
Sense-Act-Verify ループ:失敗しないための検証プロセス
この階梯を登るためには、Sense(検知)- Act(行動)- Verify(検証)というループを回すことが不可欠です。
- Sense: DOM、アクセシビリティツリー、スクリーンショットなどを通じてページの状態を検知する。
- Act: クリックや入力などのアクションを実行する。
- Verify: アクションの結果を検証します。ここで重要なのは、クリック自体の成功を信じるのではなく、ネットワークトラフィックの変化や画面の更新など、別のチャネルで結果を確認することです。
このループを回し続けることで、AI はページが何を求めているかを学習し、防御を突破する道筋を見つけ出します。一度成功したパスはコードとして記録され、二度と同じ失敗を繰り返さないようにします。
実例:Cloudflare Turnstile の完全自動化
このフレームワークの真価が発揮されるのは、Cloudflare Turnstile のような高度な防御システムです。Turnstile は、シャドウルート(Shadow DOM)やクロスオリジン iframe に隠されたチェックボックスを備えており、通常の要素選択ではクリックできません。
しかし、この新しいアプローチでは、以下の手順で突破します:
- ブラウザ上で iframe の位置とチェックボックスの座標を計算する。
- その座標に対して「信頼された」クリック(ランク 2)を実行する。
- Chrome が自動的にイベントを処理し、チェックボックスがオンになる。
これには人間の介入は一切必要ありません。AI エージェントが視覚情報と座標計算を組み合わせて、防御の隙間を正確に突くのです。
まとめ:Web UI を「ユニバーサル API」として活用する未来
このアプローチは、API への依存や管理者権限の取得といった従来の制約を取り払います。既存の Web UI そのものを「パーミッションレスな API」として扱うことで、エンタープライズ環境でも即座に業務自動化を実現できます。
AI エージェントが人間同様にブラウザを操作する時代はもうすぐ到来します。それは単なる自動化ではなく、人間の知性を拡張し、複雑なデジタル世界を自由に行き来するための新たなツールなのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。