Simular の AI エージェント「Sai」が OSWorld 2.0 で GPT-5.6 Sol を上回る
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The New Stack AI
Simular が開発した AI エージェント「Sai」が、OSWorld 2.0 ベンチマークで 73% の成功率を達成し、主要競合モデルを上回る性能とコスト効率を実現したことを発表した。
AI深層分析を開く2026年8月28日 01:37
AI深層分析
キーポイント
ベンチマークでの新記録達成
Simular が開発したエージェント「Sai」は、OSWorld 2.0 の 108 タスクで 73% の成功率を記録し、GPT-5.6 Sol や Opus 5 を上回る SOTA 性能を示した。
コスト対効果の最適化
同社によると、Sai は主要競合モデルと比較して約 2/3 のコストで同等以上の成果を達成しており、実務利用における経済的実現性を強調している。
神経記号型アプローチの採用
Simular はニューラルネットワークの柔軟性と記号的コードの精度を組み合わせた「神経記号法」を採用し、一度解決したタスクを再利用可能なコードとして保存することでコスト削減を図っている。
OSWorld 2.0 のタスク特性と評価基準
OSWorld 2.0 は分単位ではなく時間単位で測定され、複数のデータソースからの推論や動的な環境変化への対応など、実生活に即した複雑な課題を扱う。
Sai の効率化技術と成果
Sai はニューロ記号計画により純粋モデルより約1.5倍少ないモデル呼び出しでタスクを処理し、適応的要約やコードによる計画実行を通じてメモリ効率を向上させている。
重要な引用
"Posterity will find it ludicrous that people are still building models that way right now."
"Sai's optimal cost-outcome tradeoff on OSWorld 2.0 is one step toward a future where we don't need to settle for exorbitant prices to get the job done."
"It's not uncommon for companies or organizations to publish benchmark results on their websites first (see Anthropic and OpenAI). We are in the process of submitting to the OSWorld 2.0 leaderboard, and also uploading our trajectories to Hugging Face."
"Sai treats a repetitive real-time game as a programming problem rather than a clicking one."
編集コメントを表示
編集コメント
Simular が提示した「神経記号法」によるコスト削減戦略は、実務現場での AI エージェント普及に向けた重要な転換点となる可能性がある。特に、複雑なデスクトップ操作や API 連携を伴う業務において、高コストな推論モデルに頼らずに効率化を図れる点は、企業にとって即戦力となり得る技術的進展である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

Simular が開発した AI エージェント「Sai」が、木曜日に発表されたベンチマーク更新版「OSWorld 2.0」で 73% の成功率を達成しました。この評価は、熟練した人間でも通常 1 時間以上を要する日常的な業務や長尺の専門タスクを対象とした、全 108 タスクからなるベンチマークに基づいています。
Simular は今回の SOTA(最新技術)性能について、「Sai は GPT-5.6 Sol の 62.57%(OpenAI 発表)や Opus 5 の 70.57%(Anthropic 発表)を上回る」と述べています。さらに、Sai はこれらのモデルの約 3 分の 1 のコストでトップクラスの性能を発揮したと強調しています。
業界賞を巡る無制限のスループット追求ではなく、現実的な職場でのタスクや機能に焦点を当てて設計・構築された Sai は、フルデスクトップアプリケーションや Web ページ上で動作し、API を呼び出し、コードも記述します。
このエージェントは最先端モデルと専門モデルを組み合わせており、専用インターフェースを通じてユーザーのコンピュータを認識して操作します。企業は、個人やビジネスにとって「手頃なコスト」で複雑な実世界のタスクを実行できると約束しています。
日常的(だが不可欠)な業務に特化したコンピューターエージェント
Simular の共同創設者兼 CTO、ヤン・ジアチェン氏は The New Stack に対し、採用活動の outreach や請求書の検証、最新ニュースのリサーチなど、誰もが日常的に行う必要がある業務のために構築されたコンピュータエージェントは、「惑星規模の未解決数学問題の解明」や「純粋なエンジニアリング能力の誇示」を目的として訓練された基盤モデルだからといって、財布に穴を開けるような高価であってはならないと語りました。
ヤン氏はこう続けます。「将来の人々は、今なおそのような方法でモデルを構築している人々に対して、滑稽だと感じるでしょう。Sai の OSWorld 2.0 におけるコスト対成果の最適化は、作業を遂行するために高額な費用を支払うことを余儀なくされない未来への一歩です。」
Simular は今年 3 月、最初に Sai をリリースしました。パロアルトに拠点を置く同社は、元 DeepMind の科学者である CEO のアン・リー氏と CTO のヤン氏によって設立された、「研究志向の自律型スタートアップ」として紹介されています。
同社は神経記号手法を採用しています。これは、ニューラルネットワークの柔軟な探索能力と、記号的コードの精度を融合させたアプローチです。つまり、解決済みのタスクは(比喩的かつ文字通り)再利用可能なコードとしてエンコードされ、毎回同じように実行されます。ここでの本質的なポイントは非常にシンプルです。100 枚目の請求書処理にかかるコストは、最初の一枚よりも安価になります。
OSWorld 2.0 コンピュータ使用エージェントベンチマークとは何でしょうか?
香港大学 NLP グループに所属する Executable Language Grounding (XLANG) ラボによって 6 月 26 日に発表され(その後 8 月 8 日に更新)、OSWorld 2.0 は、初回版で見られた短く単純なデスクトップテストの評価を超えて進化しました。Simular 氏は、同社のオープンソース「Agent S」が昨年 12 月に OSWorld 1.0 で人間ベースラインを初めて上回ったと強調しています。

OSWorld 1.0 の時と同様に、なぜ Sai の結果がまだ OSWorld 2.0 の公式サイトに表示されていないのかと問われると、Simular 氏はこう述べています。「企業や組織がベンチマーク結果をまず自社のウェブサイトで発表するのは珍しくありません(Anthropic や OpenAI の事例も参照してください)。現在、OSWorld 2.0 リーダーボードへの提出手続きを進めており、同時に Hugging Face へトラジェクトリ(実行軌跡)のアップロードも行っています。」
OSWorld 1.0 のベンチマークが分単位で評価されるのに対し、OSWorld 2.0 のタスクは時間単位で測定されます。ここでは、メールや経費精算書に散在する領収書など複数のデータソースから情報を収集・推論したり、タスク中にメッセージが届くといった動的な環境変化に対応したり、返金ガイドラインのような手順書を正確に実行したり、矛盾するデータ間のトラブルシューティングを行ったりと、実生活で直面するような課題が課されます。
Simular チームは、これが業界内で最も堅牢なオープンベンチマークであり、現実世界のタスクを最も忠実に反映していると考えています。
Yang 氏らのチームによると、Sai がより優れた成果とコストのバランスを実現したのは、前述のような神経記号的プランニングによるものです。具体的には、1 ターンあたりの行動数を増やし、macOS のデスクトップ自動化用の Claude Code スキルである Simulang コードを計画および長時間のサブタスク実行のための記号言語として活用することで、純粋なモデルに比べて平均して約 1.5 倍少ないモデル呼び出しで済ませています。
Sai はどのように効率化のために設計されたのでしょうか?
キャッシュとメモリの効率性を高めるため、Sai は適応型サマライゼーション(モデルのコンテキストウィンドウを小さく保つ動的なメモリ管理手法)を通じて入力サイズを制限し、サマライゼーションが行われるまで可能な限り一定のプロンプトプレフィックスを維持します。コードによるプランニングにより、Sai はタスク実行中も重要な情報をランタイムメモリ上で保持・参照し続けることが可能になります。
モデルのオーケストレーションにおいて、Sai は UI 要素の特定、純粋な推論の実行、および検証のために専門的なモデルやインターフェースを呼び出します。これにより、タスク全体の文脈が不要なステップで高コストなモデルの使用を回避しています。
Sai、Sol、Opus の 3 つのエージェントは OSWorld 2.0 でテストされ、Chrome の「Dino」ゲームという反復的なリアルタイムゲームをプレイし、ライブページ上でスコア目標を達成する課題に挑戦しました。Sai はこの反復的なリアルタイムゲームを単なるクリック操作の問題ではなく、プログラミング問題として捉えました。Sai は生ピクセルデータから地面の位置、障害物の速度、そして自身の入力遅延を計測し、画面キャプチャ、障害物検出、ジャンプ動作を行う制御ループを作成しました。その後、このループは単一の「execute」呼び出しで仮想マシン上で実行されます。
また、エージェントたちは OSWorld 2.0 のタスク 28 も実施する必要がありました。これは「ワクチン予約」として知られるテストで、必要な免疫接種に関するメールの受信、デスクトップ上のスキャン済みの予防接種記録の確認、そして価格・距離・日付の制約がある予約サイトでの手続きが含まれます。
開発者たちは Sai をどう評価しているのでしょうか?
ハードコアな機械学習研究者であるサンティアゴ・バルダラマ氏は、Sai のファンであるようです。彼は LinkedIn で「Sai はブラウザや API だけでなく、フルデスクトップ上で動作するため、標準的な自動化をブロックするアプリケーションも処理できます。これにより、ほとんどのエージェントが手が届かないタスクのクラス全体に対応可能になります」と述べています。
「Sai はブラウザや API だけでなく、フルデスクトップ上で動作するため、標準的な自動化ではブロックされるアプリケーションも処理できます。これにより、多くのエージェントが手が届かないタスクのクラス全体を扱えるようになります。」
よりバランスの取れた見解として、同じ議論でバルジャインド・ラリー氏が投稿しました。彼は AI 収益システムのプロフェッショナルとして、「Sai の登場は、これまで私がエージェントワークフローを構築する中で見てきたものと一致している」と指摘しています。ただし、「デモは見事ですが、信頼性はガードレール、可視性、そして人間の監視ポイントによって生まれるもの」と警告しました。
AgenticMode AI の創設者であるジャハンザイブ・A.氏も同様に冷静な見解を示しています。「音声エージェントでも同じような信頼性の問題に直面しました。デモでは完璧にこなしても、誰も予測していなかったエッジケースで生産環境において静かに失敗するのです。可視化(観測)の部分がすべてです。それがなければ、ただ盲目でデバッグしていることになります」と彼は述べています。
エージェントによるユニバーサル・ドラッグレース
Simular 社は、この研究がデモではなく経済的価値のある仕事に基づいていると強調しています。同社によれば、これは「コンピューターエージェントのスタック全体」を理解していることを意味します。具体的には、モデル、プランニングとグラウンディング、スクリプト層、エージェントが動作する仮想マシン、そしてユーザーインターフェースです。
同社の目指すところは「Sai は特定の研究室だけの成果ではなく、誰もが使えるもの」という点にあります。これは、新興のモデル群が計算量やスループット、分析能力といった普遍的な競争レースに参加するのではなく、実務で即座に活用できる具体的なタスクの実行に焦点を当てて構築されていることを示しています。
「Posterity will find it ludicrous」: Sai エージェントが OSWorld 2.0 でルーティン(だが必須)の業務を遂行し、73% の達成率を記録。この記事は The New Stack に掲載されました。
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み