GPT-Live(8 分間の読み物)
本文の状態
日本語全文を表示中
詳細モードで約12分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
OpenAI は双方向同時通話と背景での高度な推論を可能にする新世代音声モデル「GPT-Live」を発表し、既存の遅延のあるシステムに代わり人間のような自然な対話体験を実現する。
AI深層分析を開く2026年8月6日 22:48
AI深層分析
キーポイント
フルデュプレックスアーキテクチャの実装
GPT‑Live は聴きながら話すことが可能で、相槌や沈黙によるタイミング調整を行い、自然な会話の流れを維持する。
背景での高度推論とモデル連携
複雑なタスクには裏側で最新フロンティアモデル(初期は GPT‑5.5)を活用し、処理中は対話を継続して流暢さを保つ。
2 つのバージョンと展開計画
「GPT‑Live-1」と「GPT‑Live-1 mini」がグローバルな ChatGPT ユーザー向けにロールアウトされ、API 経由での提供も予定されている。
従来のカスケード型システムの課題
音声認識・言語モデル・音声合成を順次処理する従来方式は情報損失や応答の遅延を招くが、新システムはこの欠点を解消する。
GPT-Live のアーキテクチャ的革新
GPT-Live はフルデュプレックスアーキテクチャを採用し、入力を処理しながら出力を生成する連続的な対話を実現した。これにより、従来のターンベースモデルが抱えていた硬直した応答や遅延の問題を解決している。
重要な引用
GPT‑Live is built on a full-duplex architecture, meaning it can listen and speak at the same time.
For questions that require web search, deeper reasoning, or more complex work, it delegates to our latest frontier model behind the scenes.
Our vision is to enable truly natural human–AI interaction: a world where collaborating with AI feels as fluid and responsive as working with another person.
GPT‑Live addresses these limitations through two architectural changes.
編集コメントを表示
編集コメント
音声 AI の対話体験における最大の障壁であった「待ち時間」と「不自然な間」を解消する技術的転換点となる発表である。特に、複雑な推論タスクを裏側で処理しながら対話を途切れさせない仕組みは、実用レベルの音声エージェント実現に向けた重要な一歩と評価できる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、AI との会話がまるで実際の会話のように感じられるようになる、新しい世代の声モデル「GPT-Live」をローンチします。
GPT-Live はフルデュプレックスアーキテクチャ(full-duplex architecture)に基づいて構築されており、同時に聴取と発話を行うことが可能です。会話中、GPT-Live は「mhmm」や「yeah」といったフレーズで注意を払っていることを示したり、素早いやり取りに参加したり、あなたが考える時間が必要な時には静かに待ったりします。その結果、驚くほど話しやすい音声体験が実現されます。
また、GPT-Live はこれまでで最も賢い声モデルでもあります。ウェブ検索や深い推論、より複雑な作業を必要とする質問については、裏側で最新のフロンティアモデル(frontier model)に委任し、準備ができ次第その結果を会話に戻します。処理中は、GPT-Live があなたとの会話を続け、会話の流れを維持します。ローンチ時点では、GPT-Live はバックグラウンドで GPT-5.5 を使用します。新しいフロンティアモデルがリリースされるたびに、GPT-Live が使用するモデルは継続的に更新されていきます。
これらの進歩により、より知的で自然に使える新しい ChatGPT Voice 体験が可能になります。時間の経過とともに、この研究は、音声を用いてますます複雑で長時間実行され、より自律的な作業を行う能力を開拓するものになると私たちは信じています。
本日、私たちは ChatGPT ユーザー向けに GPT‑Live の 2 つのバージョン、GPT‑Live‑1 と GPT‑Live‑1 mini をグローバルに展開し始めました。また、これらを API でも提供することを計画しており、開発者や企業は以下の フォーム から通知を受け取るための登録が可能です。
私たちのビジョンは、真に自然な人間と AI の対話を可能にすることです。AI との協働が他者と働くかのように滑らかで即応性がありながら、推論や複雑なタスクの実行が背景でシームレスに行われる世界を実現します。
以前の世代の声 AI システムは、このビジョンに近づいてくれましたが、重要なトレードオフを伴いました。
カスケード型(逐次処理型)音声システムは、各ターンを処理するためにモデルが連続して動作する一連の仕組みに依存しています。元の ChatGPT Voice は 3 つのモデルを連鎖させていました:あなたの発話を文字起こしするための音声認識(Speech-to-Text)モデル、応答を生成する大規模言語モデル(LLM)、そしてそれを再び音声に変換するテキスト読み上げ(Text-to-Speech)モデルです。このアプローチにより、私たちは初めて最前線の AI モデルと対話できるようになりましたが、その複雑さには代償がありました:モデル間で情報が失われる可能性があり、応答は遅く、不自然でした。
カスケード型音声システム
遅く不自然な応答、長い間欠け
トランスクリプト
GPT-5.5 Instant を使用した標準音声モードでの会話例
ChatGPT の高度な音声モードのようなターンベースの音声モデルは、オーディオの処理と生成を単一のモデル内で行うことでレイテンシを削減し、会話を滑らかにしましたが、依然として離散的なターンを通じて動作していました。モデルはユーザーが話すのを止めるまで応答を待たなければならず、その結果、硬直した行き来が生じていました。さらに、ターン検出が沈黙に基づいているため、わずかな一時停止や背景ノイズでさえターンの終了と誤認識され、不自然なタイミングでモデルが割り込んでしまう原因となっていました。
ターンベースの音声モデル
やや速く滑らかな応答ですが、モデルとの行き来はまだ硬直した印象です
トランスクリプト
ChatGPT 高度な音声モードとの会話例
GPT-Live は、2 つのアーキテクチャ上の改変を通じてこれらの制限に対処します。
第一に、フルデュプレックス・アーキテクチャ(full-duplex architecture)を用いて、GPT-Live を継続的な対話のために構築しました。個別のメッセージシーケンスを処理するのではなく、GPT-Live は出力を生成しながら入力も連続的に処理します。そのため、モデルは 1 秒間に何度も対話上の判断を下すことが可能になります:話すか、聴き続けるか、一時停止するか、割り込むか、あるいはツールを呼び出すかといった判断です。
これにより、モデルはより自然な行き来を行い、時間感覚をより適切に保ち、さらにはライブ翻訳も実行できるようになります。
継続的な対話
速く、自然で表現力豊かな応答と、より積極的な聴取
トランスクリプト
GPT-5.5 Instant を使用した GPT-Live-1 との会話例
第二に、継続的な対話を処理する GPT‑Live を、より深い作業から分離しました。質問に検索や推論、あるいはよりエージェント的な機能が必要となる場合、GPT‑Live は GPT‑5.5 などの別のモデルにタスクを委譲できます。これにより、バックグラウンドで複数のタスクを処理しながらも、会話を継続させることが可能になります。
このアーキテクチャの変更により、GPT‑Live は最新のモデルやエージェントを継続的に活用できるようになり、最先端の知能と自然な対話を組み合わせることが実現します。
より深い作業のための委譲
GPT-Live は迅速で自然な応答を提供し、GPT-5.5 がバックグラウンドで検索を担当します
トランスクリプト
GPT-Live-1 を使用した例会話(GPT-5.5 Instant を活用)
私たちは、対話の心地よさと流れを測定するための新しい人間評価を導入しました。これらの直接比較において、GPT‑Live‑1 および GPT‑Live‑1 mini は、全体の好み、ターン取り、割り込み、会話の流れ、各インタラクションがいかに自然に感じられたかを測定する 5〜10 分間のマッチド対話において、Advanced Voice Mode よりも強く好まれることが示されました。
- GPQA: GPT‑Live‑1 は、生物学・化学・物理学にわたる専門家レベルの科学的推論をテストする GPQA において、Advanced Voice Mode を大幅に上回ります。
- BrowseComp: GPT‑Live‑1 は、エージェント型ウェブ検索と、見つけにくい情報の発見能力をテストする BrowseComp において、Advanced Voice Mode よりも顕著な向上を示します。
- τ³-Voice Telecom (内部版)**: GPT‑Live‑1 は、現実的な多回会話型のテレコムサポートタスクで音声エージェントの能力をテストする τ³-Voice Telecom において、Advanced Voice Mode を上回ります。
- GPT‑Live‑1 (instant) と GPT‑Live‑1 mini はバックグラウンドで GPT‑5.5 Instant モデルを使用し、GPT‑Live‑1 Medium と GPT‑Live‑1 High は、中程度および高レベルの推論努力を備えた GPT‑5.5 Thinking モデルを使用します。
** この評価には、最新の推論モデルを搭載したカスタマイズされたユーザーモデルを使用しました。
毎週、1 億 5000 万人以上の人々が、Voice や Dictation といった機能を使用して ChatGPT と会話しています。彼らは、ハンズフリーでの日常のサポートを受けたり、語学練習をしたり、寝る前の物語を聞かせたり、通勤中にただ雑談したりするためにそれを利用しています。
本日より、ChatGPT と話すために Voice ボタンをタップすると、GPT‑Live によって支えられた改善された体験が提供されます。より自然な会話、賢い回答、優れた聴解力、そして視覚的な応答が可能になります。
ChatGPT との対話は、今や本物の会話のように感じるはずです。質問を投げかけたり、考えをまとめるために一時停止したり、ChatGPT に速度を落とすよう頼んだりできます。"mhmm" や "got it" といった表現で自然にあなたの発言を受け止めるため、相手が追従していることがわかります。また、ChatGPT の 9 つの異なる声を GPT‑Live 向けにリマスターしました。
ChatGPT Voice は、最新のフロンティアモデルを活用できるようになり、必要な時により賢い回答を提供します。また、あなたのニーズに合った推論レベルを選択できます:即座の応答には「Instant」、ChatGPT に時間をかけて考えるよう求める場合は「Medium」や「High」です。
少し考えている間、ChatGPT Voice は飛び込んで中断するのではなく待機します。静かにして聞くように頼めば、それに従います。また、通行する車や近くの会話などの背景ノイズがある場合でも、ChatGPT はあなたの声に集中し、気を取られることが少なくなっています。
一部の回答は、視覚的に確認できる方がより役立ちます。通話中も、天気、株価、スポーツなどに関するリッチなビジュアルカードを表示できるようになりました。音声機能では引き続き検索、メモリ、画像、ファイルアップロードをサポートしています。
その結果、日常の生活においてより自然で、より能力が高く、より有用な ChatGPT Voice の体験が実現しました。
GPT‑Live はデフォルトで安全に設計されています。最新のモデルからの安全性向上を基盤としつつ、主要なリスク領域全体に専用の安全性トレーニングを追加し、音声用に特別に設計された新たなセーフガードも導入しています。
人々が実際の環境で音声を使用する方法をより正確に反映させるために、私たちはまず安全性テストを拡張し、新しいオーディオネイティブ評価を含めることにしました。また、生成された音声を利用した合成評価も作成し、Advanced Voice Mode から得た知見に基づき、自己傷害、精神病・躁状態、AI への感情的依存、暴力、性的コンテンツといった重要な安全領域に集中的に取り組んでいます。内部の専門家たちはまた、音声固有のリスクについてもモデルに対するレッドチーム(攻撃的テスト)を実施しました。
私たちのテストでは、GPT‑Live は評価したほぼすべての分野において Advanced Voice Mode と同等か、それ以上のパフォーマンスを示しました。詳細なテスト内容とセーフガードについては、GPT‑Live の システムカード(新しいウィンドウで開く) をご覧ください。
音声会話はリアルタイムで進行するため、モデルが発話している最中に作用するセーフガードも構築しました。システムが潜在的に不安全な出力を検知した場合、より安全な応答へとモデルを誘導したり、追加の安全メッセージやリソースを表示したり、リスクが高いケースでは音声会話自体を終了させたりします。自己傷害に関連する会話については、ChatGPT のサポートフローを音声用に適応させ、専門家が審査した危機対応ヘルプラインの提供などを含めています。
ティーンユーザーをサポートするために追加の保護策を設計し、不適切な回答のリスクを減らすために、年齢に適切な行動をモデルに直接トレーニングしました。親御さんは、ペアレンタルコントロールを通じて、ティーンが ChatGPT Voice を使用できるかどうかを選択できます。また、自殺や自傷行為の兆候など、より高いリスクがある状況では、リンクされた親御さんに通知が行く仕組みとなっています。
さらに、感情的な依存に焦点を当てた長期的な測定とローンチ後のモニタリングを開始し、理解を深めつつ保護策を不断に改善していきます。これまでの 感情的な利用と心の健康に関する研究 に基づき、新たなパターンを特定し、感情的に敏感なやり取りにおけるシステムの対応方法を向上させることを目指します。
最後に、GPT‑Live は会話のために設計されたものであり、声の模倣を目的としたものではありません。ChatGPT で用意された事前定義された音声セットを使用し、実在する人物の声の模倣を防ぐための保護策が組み込まれています。
私たちは安全性とウェルビーイングのサポートにコミットしており、実際の利用から学びながら、これらの保護策をさらに強化していく所存です。
GPT‑Live は現在、iOS、Android、および ChatGPT.com(新しいウィンドウで開く) を含む世界中の ChatGPT ユーザー向けに展開されています。GPT‑Live‑1 は Go、Plus、Pro のユーザーに対して ChatGPT Voice を支えるデフォルトモデルとなり、GPT‑Live‑1 mini は無料ユーザー向けのデフォルトとなります。詳細な利用可能状況については、ヘルプセンター(新しいウィンドウで開く) をご確認ください。
ChatGPT で最も人気のある言語の一部に対して GPT‑Live の最適化を行いました。特定の言語では、モデルに非ネイティブなアクセントや流暢さの欠如が生じる場合があります。私たちは多言語にわたる体験を改善すべく積極的に取り組んでいます。
発表時点では、GPT‑Live は ChatGPT においてビデオや画面共有を伴う音声には対応していませんが、これらの機能の導入も近日中に予定しています。これらの機能が利用可能な標準モードおよび高度な音声モードを含む、ChatGPT Voice の従来バージョンへのアクセスは引き続き可能です。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み