動画記事 · OpenAI
API に音声モデル3種導入
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
OpenAI が API に導入したリアルタイム音声モデル「GPT Realtime Translate」と「GPT Realtime 2」の機能デモと、多言語翻訳・推論型エージェントとしての実用性を紹介。
OpenAI が音声の未来を変える:70 カ国語翻訳と「透明な」自律エージェントの実現
OpenAI は API に、言語の壁を瞬時に超える「リアルタイム翻訳モデル」と、複雑な業務処理を背景で推論しながらユーザーに状況を伝える「自律型音声エージェント」の 2 つの新機能を追加しました。これにより、音声インターフェースは単なる入力手段から、グローバルなコミュニケーションや高度な業務自動化の中核となるプラットフォームへと進化します。
70 カ国語以上を瞬時に翻訳する「GPT Realtime Translate」
新機能の 1 つが、話している最中に即座に翻訳を行う「GPT Realtime Translate」です。これは単なる文字起こしと翻訳の組み合わせではなく、会話の流れを維持したまま、70 カ国語以上で自然な対話を可能にするモデルです。
デモでは、フランス語を話すプレゼンターが英語の聴衆に向けて話している様子が示されました。モデルは話者の発言を聞きながらキーワード(動詞など)を検知すると即座に翻訳を開始し、結果として二人の間での会話のような自然な流れを実現します。言語を切り替える際にも途切れることなく、GPT Realtime や Computer Use といった専門用語も正確に処理できる点が特筆されます。
「モデルは私の話を聞きながら翻訳できます。話している間、キーワード(動詞など)を待ちます。すぐに翻訳を開始し、結果はより自然な会話になります。」
この技術は、メディアプラットフォーム、カスタマーサポート、教育ツールなどにおいて、言語の壁を取り除く強力な解決策となります。
背景で推論しながら「透明性」を保つエージェント「GPT Realtime 2」
もう一つの注目すべき機能は、指示に従ってアクションを実行する音声エージェント向けの「GPT Realtime 2」です。従来の AI はタスク実行中に沈黙してしまうことが多かったため、ユーザーは「何をしているのか分からない」という不安を抱きがちでした。
しかし、GPT Realtime 2 は推論中やツール呼び出し(例:カレンダー確認、CRM 更新)の間も、ユーザーに状況を伝え続けます。デモでは、アシスタントが顧客との会議を確認し、その間も会話を続けながら「Sable Crust Robotics 社との会議があと 12 分です」と情報を提供しました。
さらに重要な点は、複雑なタスクを実行する前にモデルが意図を説明する「プレアム(Pre-amble)」機能です。これにより、ユーザーは AI が何をするのか事前に理解でき、信頼性が向上します。
「アクションには当然数秒かかるため、モデルがそれらを認識することが極めて重要です。推論中やツール呼び出し中に直接コミュニケーションでき、ユーザーは常に情報を得た状態を保てます。」
自然な対話とシステム連携による業務自動化の進化
これらの新機能により、音声エージェントは「会話から離れることなく」複雑なタスクを処理できるようになります。デモでは、CRM の更新や会議内容の要約といった作業が、ユーザーとの会話を中断させることなく背景で実行されました。
モデルはあらゆるシステム(ダッシュボード、利用中のサービス、接続されたデバイスなど)に接続可能であり、文脈を保持したまま継続的なエージェントとして動作します。例えば、「CRM を更新して」と指示すると、直近の会議内容やセキュリティレビューの状況などを取得し、自動的に記録・更新を行うことができます。
「モデルをあらゆるシステムに接続できることです。ダッシュボードや利用中のサービス、接続されたデバイスなど、さらに多くの連携が可能です。」
音声はついに主要なインターフェースとなり得る段階来到了りました。OpenAI はこれらの新モデルを通じて、開発者が継続的に動作するエージェントを作成しやすくし、グローバルなサポートや業務自動化の負担を劇的に軽減することを約束しています。
まとめ
OpenAI の新たなリアルタイム音声モデルは、言語の壁を越えた自然な対話と、透明性のある自律的なタスク実行を実現しました。これにより、音声インターフェースはテキストやタッチ操作に代わり、企業業務やグローバルコミュニケーションの主要な入力手段として確立される転換点となっています。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。