Artificial Analysis、実世界会話での音声エージェント評価「Speech Agent Arena」を発表
本文の状態
日本語全文を表示中
詳細モードで約4分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Artificial Analysis は、人間が実課題を完了する過程でモデルやシステムを比較し、会話の好みとツール使用成功率を測定する新ベンチマーク「Speech Agent Arena」を発表した。
AI深層分析を開く2026年8月25日 04:37
AI深層分析
キーポイント
Speech Agent Arena の新設
既存のベンチマークでは捉えきれない、実際のツール使用や会話の自然さを評価するために、人間参加者によるリアルワールドタスクでの対話比較プラットフォームが設立された。
評価指標と手法
15 のエージェント型タスクと 20 の非エージェント型タスクを用いて人間がモデルを比較し、選好度を示す「Preference Elo」と、ツール呼び出しの成否を示す「Task Success Rate」を算出する。
主要な評価結果
選好度(Elo)では GoogleAI Gemini 3.1 Flash Live Preview が首位となり、タスク達成率では SpaceXAI Grok Voice Think Fast 2.0 High が 94.7% でトップとなった。
選好と成功率の乖離
会話の自然さや反応速度で高い評価を得たモデルでも、タスクを確実に完了させる能力は必ずしも一致せず、両指標のバランスが重要であることが示された。
タスク成功率と好ましさの乖離
SpaceXAI Grok Voice Think Fast 2.0 High が94.7%でタスク成功率トップだが、Gemini 3.1 Flash Live Preview は好ま性では首位でも成功率は74.6%に留まる。これは会話の印象が良い場合でも、必要なツール呼び出しが失敗しているケースがあることを示唆する。
重要な引用
Existing Speech to Speech benchmarks cover reasoning, simulated agentic tasks, and conversational dynamics such as turn-taking and interruption handling.
The Speech Agent Arena compares models and cascaded systems as humans complete real-world tasks, measuring conversational preference and successful tool use.
Gemini 3.1 Flash Live Preview - Minimal leads overall preference at 1,046 Elo but records a 74.6% Task Success Rate, showing that a preferred conversation does not always result in successful task completion.
some conversations can sound as though the requested action was completed even when the required final tool call was unsuccessful
編集コメントを表示
編集コメント
音声 AI の進化において、会話の流暢さと実務遂行能力が必ずしも一致しないという事実は、システム選定において極めて重要な示唆を与える。開発者はユーザー体験とタスク成功率のトレードオフを考慮し、用途に応じた最適なモデルを選択する必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Speech Agent Arena の発表:実世界での会話を通じて、音声対話モデルの比較と評価
既存の音声対音声(Speech to Speech)ベンチマークは、推論能力やシミュレーションされたエージェントタスク、ターンテイクや割り込み処理といった会話ダイナミクスに焦点を当てています。一方、Speech Agent Arena は、人間が実世界でのタスクを完了する過程でモデルやカスケードシステムを比較し、対話の好みとツールの使用成功率を測定します。これにより、実際の利用状況をより反映した評価を提供でき、ユーザーがどのモデルとの会話を最も好むか、またそのモデルがいかに効果的にリクエストに応えられるかを洞察することができます。
Speech Agent Arena の概要とタスク成功率について
人間参加者は、同じ割り当てられたシナリオに対して 2 つの非公開の音声対話モデルを比較します。対象となるのは、15 のエージェント型シナリオ(注文やツール呼び出しが必要なタスク)か、20 の非エージェント型シナリオ(営業時間などの問い合わせなど、ツール呼び出しを伴わないタスク)のいずれかです。各モデルとの個別の実時間会話の後、参加者はどちらかを好む方を選択します。これらのペア投票は、Preference Elo スコアの算出に用いられます。エージェント型シナリオにおける「タスク成功率」とは、参加者の逸脱や検証不可能なケースを除いた有効な会話のうち、モデルが最終的な適切なツール呼び出し(または一連の呼び出し)を通じて要求されたアクションを完了した割合のことです。
New Patient Dental Booking の例を除き、シナリオモデルのプロンプト、ツールのスキーマ、参加者の指示は、過学習を防ぐために現在非公開となっています。また、Speech Agent Arena では、エージェント間のやり取りを実行・評価するために、審査を通った有償の第三者参加者プールを利用しています。
主な結果:
➤ Arena Preference Elo: GoogleAI Gemini 3.1 Flash Live Preview - Minimal が 1,046 Elo で首位。次いで Gemini 3.1 Flash Live Preview - High が 1,014、OpenAI GPT-Realtime-1.5 が 1,000、GPT Realtime (Aug '25) が 944、ElevenLabs Agents(Scribe v2 Realtime / GPT-4o Mini / Eleven v3 のデフォルトカスケードシステムで事前登録されたツールスキーマを使用)が 937 です。レビューした会話では、評価の高いモデルほど応答が早く、より自然な音声で、不自然な音やオーディオアーティファクトが少ない傾向がありました。
➤ Task Success Rate: SpaceXAI Grok Voice Think Fast 2.0 High が 94.7% で首位。次いで OpenAI GPT-Realtime-2.1 High が 91.5%、ElevenLabs Agents(デフォルトカスケードシステム)が 90.5%、GPT-Realtime-2 (High) が 89.8% です。GPT Realtime (Aug '25) と GPT-Realtime-2.1 Minimal はともに 89.4% で並んでいます。Gemini 3.1 Flash Live Preview - Minimal は全体で最も高い 1,046 Elo を記録しましたが、タスク成功率は 74.6% に留まりました。これは、会話の評価が高くても必ずしもタスクが完了するわけではないことを示しています。必要な最終的なツール呼び出しに失敗しているにもかかわらず、要求されたアクションが完了したかのような会話が成立してしまうケースもあるのです。
私たちは、ネイティブおよびカスケード型の音声対話システムに関する解説を継続して拡大しており、より多くのモデルやプロバイダー、シナリオを追加する過程で皆様からのフィードバックをお待ちしています。

全体的な好意度(Elo)は、最初の音声出力までの時間(TTFA)が短くなるほど高くなる傾向にあり、レスポンスの速さが会話体験の質を高める要因となっていることが示唆されます。Gemini 3.1 Flash Live Preview - Minimal は、0.96 秒の TTFA で全体好意度 1,046 Elo を記録し、GPT-Realtime-2 (High) の 914 Elo(TTFA 1.14 秒)や Qwen Audio 3.0 Realtime Plus の 699 Elo(TTFA 1.54 秒)を上回っています。

各モデルは、価格帯が大きく異なる中でも高い会話評価とタスク成功率を達成しています。Gemini 3.1 Flash Live Preview - Minimal は、入力音声 1 時間あたり 1.50 ドルという低コストで全体好意度 1,046 Elo を記録し、タスク成功率は 74.6% です。一方、Grok Voice Think Fast 2.0 High は、入力音声 1 時間あたり 4.80 ドルでタスク成功率 94.7% を達成し、この項目では首位です。GPT-Realtime-2.1 High はタスク成功率 91.5% で続きますが、コストは 1 時間あたり 10.75 ドルとなります。

Speech to Speech モデルをあらゆるベンチマークで比較する: https://artificialanalysis.ai/speech-to-speech
Speech Agent Arena リーダーボード: https://artificialanalysis.ai/speech-to-speech/arena
ベンチマークの概要と会話例: https://artificialanalysis.ai/speech-to-speech/arena/overview
Speech to Speech ベンチマーク手法: https://artificialanalysis.ai/methodology/speech-to-speech-benchmarking
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み