動画記事 · AI Engineer
Computer-Use 2.0:エージェントがマルチカーソル対応へ
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Cua は、マルチカーソル対応や OS 非侵襲型の背景制御を実現する「Quad Driver」、GUI エージェントの信頼性を検証する「KuaBench」、および RL 訓練コストを削減するインフラ戦略を紹介し、AI エージェントの実用化への道筋を示した。
AI エージェントの未来は「画面乗っ取り」から「OS 背景動作」へ:Cua が語るマルチカーソルとコスト最適化の真実
AI エージェントが単なるチャットボットを超え、実際の OS を操作して複雑な業務を完遂する段階へと進化しようとしています。その鍵となるのが、従来の画面乗っ取り型ではなく、OS の背景で静かに動作しマルチカーソル制御を実現する新技術「Quad Driver」と、AI の実用性を厳しく問う評価基準「KuaBench」です。
Cua(クア)の創業者らが明らかにしたこれらの技術は、開発者体験の劇的な向上と、大規模学習におけるコスト構造の根本的な最適化を約束するものであり、AI エージェントの実用化スピードに大きな弾みをつけるでしょう。
画面を乗っ取らない「Quad Driver」がもたらす新時代
従来のコンピュータ使用型エージェント(Computer-Use Agent)は、人間の操作のようにマウスカーソルを動かし、画面上の要素をクリックする「1.0」の方式に依存していました。この手法では、AI が画面全体を占有してしまうため、開発者が同時に作業することができず、安定性にも課題がありました。
これに対し、Cua は 2 ヶ月前に公開したオープンソースプロジェクト「Quad Driver」でパラダイムシフトを起こしました。これは OS の背景で動作し、ユーザーの操作を妨げないドライバーです。
「エージェントが画面を乗っ取るのではなく、OS の裏側で『暗黒の魔法』のような仕組みを使って制御します」
Quad Driver は、Mac、Windows、Linux という 3 つの主要プラットフォームすべてに対応しています。これは業界初の試みであり、AI エージェントがどの OS でも一貫して動作する基盤を提供します。
この技術の核心は、エージェントが「何を見ているか」と「どう操作するか」を分離している点にあります。Quad Driver は、アクセシビリティツリー(OS が提供する構造化データ)とスクリーンショットの両方を取得し、AI に提供します。AI はまず、高速なアクセシビリティツリーを使って操作を試み、失敗した場合にのみ、ピクセルレベルでのクリックという「最後の手段」を背景で実行します。
この仕組みにより、マルチカーソル対応が可能になりました。複数の AI エージェントが同時に異なるウィンドウや画面領域を操作しても干渉せず、開発者は自分の作業を続けながら AI に任せることが可能になります。また、OS のアップデートやバージョンアップによる互換性崩壊を防ぐため、Cua は 8 つの異なるアプリケーションハーンネス(テスト環境)を用意し、継続的な検証を行っています。
KuaBench が示す「AI エージェント」の現実と限界
新しいドライバーが手に入っても、「その AI を本当に信頼できるのか」という問いは残ります。Cua の CTO、Dylan 氏は、この信頼性を数値化するために評価フレームワーク「KuaBench」を構築しました。
KuaBench は、Terminal Bench や Harbor といった既存のベンチマークとは異なり、GUI(グラフィカルユーザーインターフェース)上の操作に特化した評価ツールです。タスクは以下の 3 つの要素で構成されます。
- Setup: マシンを初期状態にセットアップする関数
- Oracle: タスクの正解となる「黄金軌道」を提供する GUI 動作
- Evaluator: エージェントが環境を正しく操作したかを確認する評価関数
特に注目すべきは、電気設計(Electrical Engineering)タスクに特化した「KuaBench Kyad」です。Snorkel AI とのコラボレーションにより、専門家のソフトウェアと回路シミュレーターを用いた 25 の複雑なタスクで検証が行われました。
その結果は、AI エージェントの現状を如実に示すものでした。
「最上位のモデルでも、25 タスク中 6 つしか完全パスできませんでした。しかも、成功したのは既存の回路図を編集するタスクのみです」
空白の状態から回路図を作成するタスクでは、成功率は0%でした。また、全モデルを通じて最高でも30% の報酬(成功率)に達したモデルはなく、現在の AI エージェントが複雑な創造的作業においてまだ未熟であることが浮き彫りになりました。
しかし、Quad Driver を導入することで状況は一変します。KuaBench Basic データセットで 4K 解像度をテストした場合、従来のツールを使用していた際の成功率 62% が、Quad Driver を使用することで80%に跳ね上がりました。これは、AI が画面全体ではなく「ウィンドウ単位」で操作に集中できるため、必要なトークン数を 34% も削減しながら精度を向上させた結果です。
GPU のアイドル時間をゼロにするコスト最適化戦略
大規模な強化学習(RL)訓練において、最も無駄になっているのは「GPU がアイドル状態にある時間」です。Cua のインフラ責任者、Robert 氏は、この課題に対する具体的な解決策を提示しました。
従来の RL 訓練では、タスク完了後に次の環境を起動するまでの間、GPU は待機状態(アイドル)になります。特にコンピュータ使用型エージェントの場合、40GB 規模の複雑な環境を起動するには時間がかかるため、この待ち時間がコストの増大に直結します。
Robert 氏が提案するのは、需要ベースの自動スケーリングとサンドボックス管理です。
「GPU のアイドル時間を最小化し、必要な分だけリソースを動的に割り当てることで、コストを劇的に削減できます」
具体的には、GPU クラスターが現在必要とするサンドボックスの数に応じて、自動的にプールサイズを拡張・縮小する仕組みを採用しています。事前に「ウォームプール(予備のリソース)」の規模を決める必要はなく、トレーニング中の需要変化に合わせて柔軟に対応します。
これにより、GPU の稼働率が最大化され、従来の方法に比べて2〜4 倍のコスト削減が可能になります。大規模な RL 訓練を行う企業にとって、これは即座に適用可能な重要な知見です。
まとめ:信頼性とコスト効率こそが実用化の鍵
Cua の発表は、AI エージェントが「チャットボット」から「自律的な業務自動化ツール」へと進化するための具体的な道筋を示した点で画期的です。Quad Driver によるマルチカーソルとクロスプラットフォーム対応、KuaBench による厳格な信頼性検証、そして GPU コストの最適化戦略は、それぞれが独立した技術ではなく、相互に補完し合って実用化を加速させる要素となっています。
AI エージェントの実用化において、単なる「できること」の増加だけでなく、「いかに安定的に」「いかに低コストで」実行できるかが問われる時代へと移行しました。この基盤技術が業界全体に普及すれば、開発者体験は劇的に向上し、複雑な業務自動化の現実化がさらに近づくでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。