リアルタイム音声対話 AI の知識強化を目指す Tandem アーキテクチャ「KAME」が ICASSP2026 に採択
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
研究者らが、思考を深めつつ遅延なく応答する新アーキテクチャ「KAME」を発表し、ICASSP2026 で採用された。これにより、従来の浅い推論に留まっていた高速音声 AI の知能が向上する可能性がある。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
音声 AI は、処理のために一時停止することなく深く思考できるのでしょうか?
私たちは、リアルタイムの音声対話型 AI における知識強化のための Tandem Architecture(Tandem Architecture)である KAME を紹介できることを嬉しく思います。この研究は ICASSP2026 に採択されました!🐢
実際の会話では、何を言いたいのかを完全に考え抜くまで待たず、話し始めると同時に思考が追いついてきます。
高速な音声対話モデルはこの挙動を実現しますが、その推論は浅い傾向にあります。知識豊富な LLM を経由するカスケード型パイプラインの方が賢明ですが、追加されるレイテンシーが流れを断ち切ってしまうため、「考えてから話す」という方式に戻ってしまいます。
私たちの新しい論文では、このトレードオフを打破する方法を提案します。これを KAME(日本語で「亀」)と呼びます。
音声対話モデルが高速な応答ループを担当し、即座に返信を開始します。並行して、バックエンドの LLM が非同期で実行され、生成された回答候補がリアルタイムで継続的に「オラクル」信号として注入されます。
これにより、AI のパラダイムは「考えてから話す」から「考えながら話す」へとシフトします。
バックエンドの LLM は完全に交換可能です。フロントエンドを変更することなく、タスクに応じて GPT-4.1、Claude Opus、または Gemini 2.5 Flash を差し込むことができます。私たちの実験では、推論能力においては Claude が高いスコアを示す傾向があり、一方、人文系質問においては GPT の方が優れていました。
ブログ:https://pub.sakana.ai/kame/
論文:https://arxiv.org/abs/2510.02327
モデル:https://huggingface.co/SakanaAI/kame
日本語訳
音声 AI の素早さと賢さを両立できるか?
私たち人間は会話の中で、言いたいことを全部まとめてから話し始めるのではなく、話しながら考えを整理していきます。応答の速い Speech-to-Speech モデルは、この「話しながら考える」を実現しましたが、そのぶん思考が浅くなりがちです。かといって知識豊富な LLM(大規模言語モデル)を挟むカスケード型では、遅延が生じるため「話しながら」が成立しません。
そこで Sakana AI は、このトレードオフを克服する KAME モデルを開発しました。Speech-to-Speech モデルが高速な応答ループを担当し、即座に話し始めます。その裏でバックエンドの LLM(大規模言語モデル)が非同期に推論を進めて応答候補を生成し、それをオラクル信号としてリアルタイムに注入します。これにより「考えてから話す」ではなく「話しながら考える」ことが可能になります。
バックエンドの LLM は差し替えが可能で、タスクに応じて GPT-4.1、Claude Opus、Gemini 2.5 Flash などを使い分けられます。フロントエンド側の変更は必要ありません。私たちの実験では、Claude は推論系のタスクで、GPT は人文系のタスクで、それぞれ高いスコアを出す傾向が見られました。
本研究は ICASSP2026 で発表されます。
ぜひ、お試しください。
ブログ:https://pub.sakana.ai/kame/
論文:https://arxiv.org/abs/2510.02327
モデル:https://huggingface.co/SakanaAI/kame
原文を表示
(*日本語は英文の後に)
Can a speech AI think deeply without pausing to process?
We’re excited to introduce KAME: Tandem Architecture for Enhancing Knowledge in Real-Time Speech-to-Speech Conversational AI, accepted at ICASSP2026! 🐢
In real conversation, we don’t wait until we’ve fully worked out what we want to say—we start talking, and our thoughts catch up as the sentence unfolds.
Fast speech-to-speech models achieve this, but their reasoning tends to stay shallow. Cascaded pipelines that route through a knowledgeable LLM are smarter, but the added latency breaks the flow—they fall back to “think, then speak.”
In our new paper, we propose a way to break this trade-off. We call it KAME (Turtle in Japanese).
A speech-to-speech model handles the fast response loop and starts replying immediately. In parallel, a backend LLM runs asynchronously, generating response candidates that are continuously injected as “oracle” signals in real time.
This shifts the AI paradigm from “think, then speak” to “speak while thinking.”
The backend LLM is completely swappable. You can plug in GPT-4.1, Claude Opus, or Gemini 2.5 Flash depending on the task without changing the frontend. In our experiments, Claude tended to score higher on reasoning, while GPT did better on humanities questions.
Blog: https://pub.sakana.ai/kame/
Paper: https://arxiv.org/abs/2510.02327
Model: https://huggingface.co/SakanaAI/kame
Japanese
音声AIの素早さと賢さを両立できるか?
私たち人間は会話の中で、言いたいことを全部まとめてから話し始めるのではなく、話しながら考えを整理していきます。応答の速い Speech-to-Speech モデルは、この「話しながら考える」を実現しましたが、そのぶん思考が浅くなりがちです。かといって知識豊富な LLM を挟むカスケード型では、遅延が生じるため「話しながら」が成立しません。
そこで Sakana AI は、このトレードオフを克服するKAMEモデルを開発しました。Speech-to-Speech モデルが高速な応答ループを担当し、即座に話し始めます。その裏でバックエンドの LLM が非同期に推論を進めて応答候補を生成し、それをオラクル信号としてリアルタイムに注入します。これにより「考えてから話す」ではなく「話しながら考える」ことが可能になります。
バックエンドの LLM は差し替えが可能で、タスクに応じてGPT-4.1、Claude Opus、Gemini 2.5 Flashなどを使い分けられます。フロントエンド側の変更は必要ありません。私たちの実験では、Claudeは推論系のタスクで、GPTは人文系のタスクで、それぞれ高いスコアを出す傾向が見られました。
本研究は ICASSP2026 で発表されます。
ぜひ、お試しください。
ブログ: https://pub.sakana.ai/kame/
論文: https://arxiv.org/abs/2510.02327
モデル: https://huggingface.co/SakanaAI/kame
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み