ページを読み込み中…
ページを読み込み中…
5件の記事
中国の MiniMax が、歌詞と音の説明を入力すると最大 5 分の構造的に整合した楽曲を生成するオープンウェイトモデル「MiniMax Music 3」を発表し、ComfyUI で利用可能になった。
WavFlow という技術が、従来の中間表現を経由せず、波形空間そのもので直接オーディオデータを生成する手法を実現しました。
研究者らが、ODEを積分してノイズからデータを生成するフローモデルの学習手法「フローマッチング」を、半離散カップリングを用いて改善する方法を提案した。
ABEJAのデータサイエンティストが、π0シリーズのaction expertの仕組みを、openpiの実装コードを基に解説するブログ記事。