動画記事 · AI Engineer
Krea 2 の訓練で重要視される点 — Krea.ai 李桑武氏
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Krea.ai の李桑武氏は、生成画像モデルの訓練においてデータのカキュレーションと多様性の確保が最重要であり、既存の大規模モデルが抱える画風単調化の問題を克服するための具体的な手法と将来の方向性を解説する。
Krea 2 の開発に込められた哲学:「速度」と「多様性」を優先したデータ戦略
Krea.ai の李桑武氏は、同社が公開した画像生成モデル「Krea 2」の訓練プロセスにおいて、既存の大規模モデルとは異なる独自の哲学を採用したと明かしました。それは「信頼性と安定性」よりも「生成速度」と「画風の多様性」を最優先し、AI 生成データによるモデルの劣化を防ぐための厳格なフィルタリング手法を実装した点にあります。
既存モデルとの決定的な違い:速度と創造性の追求
現在の主要な生成 AI モデル(ChatGPT-2 や Midjourney など)は、出力の信頼性を最優先し、生成に数分を要する設計になっています。その結果、ユーザーが求める「平均的な美しい人物」や「安全な構図」へとモデルが収束してしまい、画風の多様性が失われるという問題(モードコラプス)が生じています。
「ChatGPT-2 は『燃える頭蓋骨』と入力しても一貫した出力を出しますが、そこにはほとんど多様性がないのです。最も安易で確実な方法として、最も退屈な平均的な人物を中央に配置する傾向があります」
これに対し Krea 2 は、クリエイティブな探求プロセスを支援するために「高速な生成」と「画風の多様性」を重視しました。ユーザーがまだ具体的なイメージを持たない段階でも、異なるビジュアルアイデアを素早く試せるよう設計されています。
データの質こそが性能を決める:美意識に囚われないカキュレーション
アーキテクチャ(モデル構造)が決定された後、モデルの性能を左右するのは「データの質」です。李氏はこれを強調し、Krea 2 の開発ではデータのカキュレーション(選別・整理)に最大の労力を費やしました。
多くの開発者が「低解像度」や「ノイズが多い画像」を不良データとして排除しがちですが、Krea 2 ではあえてそれらを保持しています。例えば、レトロな CRT ビデオの質感や特定の美学は、一般的な評価基準では低く見られても、ユーザーにとっては魅力的なスタイルです。
「データカキュレーションにおいて最も重要なのは、美的評価基準に囚われず、多様なスタイルを意図的に残すことです」
高度なフィルタリング:AI 生成画像の排除と教師なしタグ付け
Krea 2 の訓練パイプラインでは、以下の3つの重要なフィルタリング手法が採用されました。
1. AI 生成画像の徹底的な除去
モデルに AI 生成データ(シンセティックデータ)を学習させると、一時的には性能が向上しますが、長期的には「AI 特有の画風」に収束し、元の多様性が失われます。李氏はこれを「モデル崩壊」として懸念しており、Krea 2 ではあらゆる AI 生成画像を排除する努力を行いました。
2. 大規模モデルから小規模クラスフィアへの知識蒸留
AI 生成画像の判定には、大規模な視覚言語モデル(VLM)を使用します。しかし、数十億枚の画像を検査するにはコストがかかりすぎます。そこで、大規模 VLM の判断ロジックを学習させ、軽量な SigLip などの小規模クラスフィアに知識を蒸留(ディストillation)しました。
「大規模モデルで得た『AI 生成かどうか』の判断基準を、小規模な分類器へ転送することで、効率的かつ信頼性の高いフィルタリングを実現しています」
3. キャプションの不備への対応と教師なしタグ付け
視覚言語モデルによるキャプション(説明文)は完璧ではありません。例えば、「壁に掛けられた絵画」という重要な文脈がキャプションから漏れ、生成時に常に「白い壁に掛かった絵」しか作られなくなるバイアスが生じます。
また、従来の教師あり学習では人手でタグ付けする必要がありますが、Krea 2 ではスパースオートエンコーダ(Sparse Autoencoder)を用いた教師なしタグ付けを採用し、画像の隠れた特徴を自動的に抽出・整理しました。これにより、人間が気づかない細部までキャプションに反映させることに成功しています。
将来の展望:テキスト条件付き生成への進化
今後の技術的発展として、バウンディングボックス(物体の位置を示す枠)やシーングラフ(物体間の関係性を表すグラフ)を条件として利用し、単一のクリーンなトランスフォーマーアーキテクチャへ統合する方向性が示されました。これにより、より高度で制御性の高いテキスト条件付き生成が可能になると期待されます。
まとめ
Krea 2 の開発は、「データの質と多様性」がアルゴリズム以上に重要であることを再認識させる事例です。AI 生成データによる劣化を防ぎつつ、クリエイティブな自由を最大化するための具体的なフィルタリング手法は、オープンソースコミュニティや企業開発者にとって極めて実用的な指針となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。