動画記事 · AI Engineer
Amazon AGI Lab のアンジェ・バース氏、Perception Agents を語る
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Amazon AGI Lab は、従来のツール実行型エージェントの限界を克服し、画面や会話をリアルタイムで知覚・理解する「Perception Agents」の概念とオープンソース基盤を発表した。
AI エージェントの「信頼性」を革命する:Amazon AGI Lab が提唱する「Perception Agents」とは
現在の AI エージェントは、ボタンをクリックしたりフォームに入力したりといった単独の操作は得意ですが、複数のシステムにまたがる業務や、結果を検証するのが難しいタスクでは依然として信頼性が低いという課題を抱えています。この「作業の隙間」を埋めるために、Amazon AGI Lab は人間のように画面の状態や会話の流れをリアルタイムで知覚する次世代エージェント「Perception Agents(知覚型エージェント)」の概念を提唱しました。
現在の AI エージェントが直面する「信頼性の壁」
一年前まで、AI エージェントにとって最大の難問は「見たことのない画面からボタンを見つけ、クリックすること」でした。現在はブラウザやデスクトップアプリを駆使できるようになりましたが、アンジェ・バース氏は「クリック自体は実は簡単な部分だった」と指摘します。真の課題は、その先にある「実際の業務」です。
例えば、新入社員の入社手続きを考えてみましょう。アカウント作成、Slack への招待、同僚との紹介予約、ラップトップの発注など、これらは通常 5 つ以上の異なるシステムにまたがります。現在の AI エージェントは個々のステップを自動化することはできますが、これらのシステム間の「隙間」にある業務全体をエンドツーエンドで成功させることは依然として困難です。
「私たちはコンピュータを使ってコンピュータを使う方法を教えました。クリック、スクロール、入力、API 呼び出しといった基本動作は確立されましたが、それらを繋ぎ合わせた時の信頼性にはまだ課題があります。」
バース氏は、現在のエージェントの成功率を「60〜80%」と推測します。一見高い数字に見えますが、重要な業務で 4 回に 1 回はデータベースを削除するようなミスがあれば、誰もそのエージェントを使い続けることはできません。信頼性を高めるには「9 の 9(99.999...)」レベルの精度が必要であり、そのためには結果を検証できる仕組みが不可欠です。
なぜコーディングは成功し、一般業務は難しいのか?
なぜ AI エージェントはコード生成においては驚異的な信頼性を獲得できたのでしょうか。答えはシンプルです。「コードは検証可能だから」です。AI が書いたコードを実行してテストすれば、すぐに正誤がわかります。この「検証可能性」こそが、開発者が AI の出力を盲信し、レビューの手間を減らすことにつながりました。
しかし、知識労働の多くはそうではありません。レポートが正しい場所に届いたか?デザインはブランドガイドラインに合っているか?意図した内容が伝わったか?これらには自動で実行できる「ユニットテスト」が存在しません。多くの業務は、日常使用する複数のアプリケーションの「隙間」で行われるため、結果を検証する手段が欠如しているのです。
人間のように「知覚」する次世代エージェント:Perception Agents
この課題を解決するためにバース氏が提唱するのが、人間同士の協業プロセスに倣った「Perception Agents(知覚型エージェント)」です。人間は異なるシステム間でも、画面を見ながら話し合い、状況に応じて瞬時に反応して問題を解決します。
現在の AI エージェントはアクションを起こした後に結果を確認せず、次のステップへ移ってしまう傾向があります。一方、Perception Agent は以下のような特徴を持ちます。
- リアルタイムな知覚: 背後のコードをスクレイピングするのではなく、人間が実際に目にする「レンダリングされた画面」の状態(レイアウト、変更点など)をリアルタイムで読み取ります。
- 双方向の対話と反応: プロンプトを送って待つという従来のチャットボットのやり取りではなく、ユーザーが作業している最中に状況を感知し、即座に提案や支援を行います。待ち時間がありません。
- 視覚的な指示への対応: 長い文章で指示を出す代わりに、画面の要素を指差して「ここを赤くして」「このセクションのフォントサイズを倍にして」といった具体的な視覚的シグナルを受け取ります。これにより、テキストによる誤解がなくなり、より正確な作業が可能になります。
開発者が使えるオープンソース基盤:Annotation と Verification
Amazon AGI Lab は、この概念を実現するための基盤として、2 つのオープンソースツールを公開しました。
1. Annotation(注釈付け)ツール
これは Chrome 拡張機能として提供されており、画面の要素を選択して AI に指示を出すためのものです。ユーザーは画面上の特定の領域やテキストをクリックし、「ここを赤くして」「フォントサイズを倍にして」といった指示を与えるだけで、AI はその位置情報やスタイル情報を正確にキャプチャします。これにより、曖昧な説明によるやり取りがなくなり、AI がユーザーと同じ画面を見て同じ理解を持つことが可能になります。
2. Verification(検証)機能
このツールは、AI が行った作業を自動的に検証するためのものです。デザイン仕様書(MD ファイルなど)に基づき、以下の 2 つの観点からチェックを行います。
- ビジュアルチェック: デザインルールに合致しているか、ブランドガイドラインに従っているか、レイアウトが正しいかなどを確認します。
- ユーザーフローの検証: 実際のユーザーのようにアプリを操作し(タスクの追加や削除など)、期待通りの動作が行われるかをシミュレーションします。
検証結果はレポートとして出力され、どのテストに合格し、どこで失敗したかが明確になります。これにより、深夜に手動で確認作業を行う必要がなくなり、開発者は AI の成果をより信頼して活用できるようになります。
まとめ:「操作」から「理解」への転換点
Perception Agents は、AI エージェントの進化を単なる「ツールの実行」から「状況の知覚と理解」へと転換させる重要なマイルストーンです。API が存在しないレガシーシステムや、人間同士の複雑な協業プロセスにおける自動化の可能性を開き、実務レベルでの信頼性向上に大きく寄与するでしょう。今後は、この「視覚的な知覚」と「自動検証」の組み合わせが、AI エージェントをオフィスワークの不可欠なパートナーへと押し上げる鍵となるはずです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。