StereoFoley:映像から物体認識型ステレオ音声を生成するフレームワーク
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、映像から意味的に整合し時間同期された空間正確なステレオ音声を 48kHz で生成する「StereoFoley」というフレームワークを発表した。既存モデルがモノラルに限定される中、この手法は物体認識に基づく立体音像を実現する。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは StereoFoley を発表します。これは、48 kHz で意味的に整合し、時間的に同期され、空間的に正確なステレオサウンドを生成するビデオからオーディオへの生成フレームワークです。最近の生成型ビデオからオーディオへのモデルは強力な意味的および時間的忠実度を達成していますが、専門的にミックスされた空間的に正確なビデオからオーディオへのデータセットの欠如に制約され、モノラルまたはオブジェクト認識型のステレオイメージングを提供できないという点で依然として制限されています。まず、私たちはビデオからステレオオーディオを生成するベースモデルを開発・訓練し、意味的精度と同期性の両方で最先端を達成しました。次に…
原文を表示
We present StereoFoley, a video-to-audio generation framework that produces semantically aligned, temporally synchronized, and spatially accurate stereo sound at 48 kHz. While recent generative video-to-audio models achieve strong semantic and temporal fidelity, they largely remain limited to mono or fail to deliver object-aware stereo imaging, constrained by the lack of professionally mixed, spatially accurate video-to-audio datasets. First, we develop and train a base model that generates stereo audio from video, achieving state-of-the-art in both semantic accuracy and synchronization. Next…
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み