動画記事 · AI Engineer
FLUX と Open Research、視覚 AI の未来を語る Black Forest Labs の Stephen Batifol氏
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Black Forest Labs の Stephen Batifol氏が、Flux シリーズの最新動向と、外部エンコーダーに依存しない「Selfflow」によるマルチモーダル学習、そしてリアルタイム生成と物理 AI(ロボット)への未来像を解説。
Black Forest Labs が語る AI の未来:外部依存を捨て、物理世界へ進む「Selfflow」とリアルタイム生成の革命
Black Forest Labs(BFL)は、Stable Diffusion や Flux モデルの開発チームとして知られる存在ですが、彼らの野心は単なる画像生成モデルの改良にとどまりません。同社の開発者である Stefan Batifol 氏は、最新の「Flux 2」による劇的な品質向上と、外部エンコーダーを不要とする独自学習手法「Selfflow」の実現が、視覚 AI をクリエイティブなツールから物理世界を制御するインテリジェンスへと進化させる鍵であると語りました。
Flux シリーズの進化:編集とリアルタイム性の融合
BFL の歩みは、2024 年 8 月の「Flux One」リリースから始まりました。当時、ノートパソコンでも動作し、解剖学的な精度が他モデルを凌駕するこのモデルは、オープンソース界で大きな衝撃を与えました。
「無名だった企業が突然、これほど優れた大規模モデルをリリースしたという点で画期的でした」
続く「Flux Context」では、テキストからの画像生成と画像編集を統合した世界初のオープンソース編集モデルとして登場。当時、画像処理に 40〜50 秒かかっていた時代において、7〜8 秒での処理を実現し、ストーリーボード作成や動画のキーフレーム生成といったワークフローを変革しました。
そして今年 11 月にリリースされた「Flux 2」は、BFL が「ビジュアルインテリジェンス」と呼ぶ領域への一歩です。このモデルは、AI 生成であることを視覚的に判別がつかないほど高品質な画像を生成します。静脈の描写やアクセサリーの質感、動物の毛並みに至るまで自然で、商品写真のような実写レベルのクオリティを実現。
さらに Flux 2 は、最大 10 枚の画像を入力として受け取り、それらを統合した新しい服装や環境を生成する「マルチ参照」機能も備えています。EC サイトでの仮想試着や、家具配置シミュレーションなど、実用的なユースケースにおいてキャラクターや製品のスタイル一貫性を保ちながら編集を行うことが可能になりました。
外部エンコーダーの壁:なぜ「Selfflow」が必要なのか
現在の AI モデルは、画像生成の際に「グラスがテーブルの上にあるべき」「椅子を貫通してはいけない」といった物理法則を理解するために、DINO などの外部エンコーダー(セグメンテーションやアライメントを行う別のモデル)に依存しています。
この手法は学習の収束を早め、品質を向上させる一方で、深刻なボトルネックを生んでいました。
- スケーリングの天井: エンコーダーが固定されているため、生成モデル自体を大きくしても性能が頭打ちになる。
- マルチモーダル対応の困難さ: 画像用、音声用、動画用のエンコーダーを個別に用意する必要があり、システムが複雑化(フランケンシュタイン的な構成)する。
- 目標の不一致: エンコーダーは「セグメンテーション」を目的としており、生成モデルの「創造性」とは根本的な目標が異なります。より高性能なエンコーダー(例:DINO v3)を使っても、生成性能が低下するという逆説さえ発生します。
「外部のエンコーダーなしで、モデル表現を直接学習させることができないか。これが私たちが約 1 年半前に発表した『Selfflow』の発想です」
Selfflow:自己教師ありによる統合的学習の実現
BFL が提唱する「Selfflow」は、外部エンコーダーやチェックポイントを一切使用しない、自己教師あり学習(Self-Supervised Learning)のアプローチです。
この手法では、「生徒モデル」と「教師モデル」の 2 つが連携します。生徒モデルはノイズの多い画像から、教師モデルはノイズの少ない画像からそれぞれ情報を取得し、同時に「生成の損失」と「表現の損失」を最小化するように学習を行います。
「外部エンコーダーに依存しないため、モデルをスケールアップすれば生徒も教師も同時に成長します。すべてのモダリティ(画像、動画、音声)を一つのモデルで扱うことが可能になります」
実験結果では、Selfflow を採用したモデルは、従来の手法よりも学習の収束が速く、最終的な損失値も低く抑えられました。文字の書き方における隣接関係の理解や、解剖学的な構造の正確さ、動画における滑らかな動作(腕立て伏せなど)において、ベースラインを大幅に上回る性能を発揮しています。
音声生成においても同様の効果があり、従来のモデルで見られた末尾の奇妙なノイズが除去され、自然で明瞭な発話が可能になりました。画像・動画・音声を同時に訓練できるため、これらのモダリティ間で矛盾が生じることもありません。
リアルタイム生成と物理 AI への道
技術的な革新に加え、BFL は「リアルタイム性」と「物理世界との連携」にも注力しています。
Flux 2 のクライアントモデルでは、画像編集を0.5 秒未満、画像生成を0.3 秒未満で完了させることに成功しました。これはインタラクティブなデザインツールやゲーム開発におけるリアルタイムレンダリングを可能にする画期的な速度です。
「単に画像を作るだけでなく、アクションを実行し、物理 AI へと繋げることが私たちの真の興味です」
Selfflow のモデルは、ロボットの制御にも応用可能です。実験では、この手法で訓練されたモデルが、缶を掴んで人間に近づけるという複雑な動作を、点滅や不自然な動きなしに正確に実行しました。これは、視覚 AI が単なる「見る」能力から、物理法則を理解し「行動する」能力へと進化していることを示しています。
まとめ
Black Forest Labs の戦略は、外部依存の壁を取り払い、自己完結型の強力なモデルを構築することにあります。「Selfflow」による学習手法と、0.5 秒未満のリアルタイム生成能力は、クリエイティブワークフローを加速させるだけでなく、ロボット制御や製造自動化といった物理世界への AI 実装を加速させる原動力となるでしょう。視覚 AI の未来は、単なる画像生成から、物理法則を理解し行動するインテリジェンスへと大きく舵を切ろうとしています。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。