読み込み中…
読み込み中…
現在の AI エージェントは個々の操作(クリックや入力)は得意だが、異なるシステム間のシームレスな連携や、検証手段が不明確な業務では信頼性が低いという課題がある。この課題を解決するため、Amazon AGI Lab は人間のように画面のレンダリング状態や会話の内容をリアルタイムで知覚する「Perception Agents」の概念を提唱した。同氏は、視覚的な確認機能と設計仕様に基づいた自動検証機能を備えたオープンソースツール(Annotation と Verification)を公開し、開発者への協力を呼びかけた。
AI エージェントの実用化において最も懸念される「信頼性の欠如」に対し、人間の認知プロセスに倣った解決策を提示した非常に示唆に富む講演です。開発者にとって即座に試せるオープンソースツールが提供されている点も注目すべき価値があります。
個々の操作は自動化できるが、システム間の連携や検証不可能な業務では信頼性が低く、エンドツーエンドで成功しない。
画面のレンダリング状態や会話内容をリアルタイムで知覚し、人間のように状況に応じて反応・調整する次世代エージェント。
画面要素を指定して指示を出す「Annotation」ツールと、デザイン仕様に基づき自動検証を行う「Verification」機能を公開した。
この発表は、AI エージェントの進化を「ツール実行」から「状況知覚・理解」へと転換させる重要なマイルストーンとなる。特に、API が存在しないレガシーシステムや人間同士の複雑な協業プロセスにおける自動化の可能性を開き、実務レベルでの信頼性向上に寄与する。
現在の AI エージェントは、ボタンをクリックしたりフォームに入力したりといった単独の操作は得意ですが、複数のシステムにまたがる業務や、結果を検証するのが難しいタスクでは依然として信頼性が低いという課題を抱えています。この「作業の隙間」を埋めるために、Amazon AGI Lab は人間のように画面の状態や会話の流れをリアルタイムで知覚する次世代エージェント「Perception Agents(知覚型エージェント)」の概念を提唱しました。
一年前まで、AI エージェントにとって最大の難問は「見たことのない画面からボタンを見つけ、クリックすること」でした。現在はブラウザやデスクトップアプリを駆使できるようになりましたが、アンジェ・バース氏は「クリック自体は実は簡単な部分だった」と指摘します。真の課題は、その先にある「実際の業務」です。
例えば、新入社員の入社手続きを考えてみましょう。アカウント作成、Slack への招待、同僚との紹介予約、ラップトップの発注など、これらは通常 5 つ以上の異なるシステムにまたがります。現在の AI エージェントは個々のステップを自動化することはできますが、これらのシステム間の「隙間」にある業務全体をエンドツーエンドで成功させることは依然として困難です。
「私たちはコンピュータを使ってコンピュータを使う方法を教えました。クリック、スクロール、入力、API 呼び出しといった基本動作は確立されましたが、それらを繋ぎ合わせた時の信頼性にはまだ課題があります。」
バース氏は、現在のエージェントの成功率を「60〜80%」と推測します。一見高い数字に見えますが、重要な業務で 4 回に 1 回はデータベースを削除するようなミスがあれば、誰もそのエージェントを使い続けることはできません。信頼性を高めるには「9 の 9(99.999...)」レベルの精度が必要であり、そのためには結果を検証できる仕組みが不可欠です。
なぜ AI エージェントはコード生成においては驚異的な信頼性を獲得できたのでしょうか。答えはシンプルです。「コードは検証可能だから」です。AI が書いたコードを実行してテストすれば、すぐに正誤がわかります。この「検証可能性」こそが、開発者が AI の出力を盲信し、レビューの手間を減らすことにつながりました。
しかし、知識労働の多くはそうではありません。レポートが正しい場所に届いたか?デザインはブランドガイドラインに合っているか?意図した内容が伝わったか?これらには自動で実行できる「ユニットテスト」が存在しません。多くの業務は、日常使用する複数のアプリケーションの「隙間」で行われるため、結果を検証する手段が欠如しているのです。
この課題を解決するためにバース氏が提唱するのが、人間同士の協業プロセスに倣った「Perception Agents(知覚型エージェント)」です。人間は異なるシステム間でも、画面を見ながら話し合い、状況に応じて瞬時に反応して問題を解決します。
現在の AI エージェントはアクションを起こした後に結果を確認せず、次のステップへ移ってしまう傾向があります。一方、Perception Agent は以下のような特徴を持ちます。
Amazon AGI Lab は、この概念を実現するための基盤として、2 つのオープンソースツールを公開しました。
これは Chrome 拡張機能として提供されており、画面の要素を選択して AI に指示を出すためのものです。ユーザーは画面上の特定の領域やテキストをクリックし、「ここを赤くして」「フォントサイズを倍にして」といった指示を与えるだけで、AI はその位置情報やスタイル情報を正確にキャプチャします。これにより、曖昧な説明によるやり取りがなくなり、AI がユーザーと同じ画面を見て同じ理解を持つことが可能になります。
このツールは、AI が行った作業を自動的に検証するためのものです。デザイン仕様書(MD ファイルなど)に基づき、以下の 2 つの観点からチェックを行います。
検証結果はレポートとして出力され、どのテストに合格し、どこで失敗したかが明確になります。これにより、深夜に手動で確認作業を行う必要がなくなり、開発者は AI の成果をより信頼して活用できるようになります。
Perception Agents は、AI エージェントの進化を単なる「ツールの実行」から「状況の知覚と理解」へと転換させる重要なマイルストーンです。API が存在しないレガシーシステムや、人間同士の複雑な協業プロセスにおける自動化の可能性を開き、実務レベルでの信頼性向上に大きく寄与するでしょう。今後は、この「視覚的な知覚」と「自動検証」の組み合わせが、AI エージェントをオフィスワークの不可欠なパートナーへと押し上げる鍵となるはずです。
この記事はAIが動画の内容を記事化したものです。正確な発言は動画および文字起こしをご確認ください。