動画記事 · AI Engineer
Krea 2 のインフラ:大規模な学習と提供の仕組み
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Krea.ai の大規模拡散モデル学習と提供インフラにおける、メトリクス設計、カスタムファイルシステム、自己修復型 Kubernetes 運用の具体的な実装事例。
Krea 2 の大規模学習を支えたインフラ:GPU クラスターの不安定さを「メトリクス」と「スケジューリング」で制圧した実例
生成 AI モデルをゼロから大規模にトレーニングする際、研究者は GPU ハードウェアの物理的な限界やネットワークの微妙な不具合と常に向き合わなければなりません。Krea のインフラエンジニアである Gabriel Jorge Menezes 氏は、GPU クラスターの頻発するクラッシュや「見えないエラー」を克服するために、独自のメトリクス戦略と高度なスケジューリングシステムを構築した事例を明かしました。
GPU の「温度」と「Tensor Core」が語る真実
大規模学習において最も重要なのは、システムの状態を可視化する「メトリクス」の質です。Gabriel 氏は、単に GPU が動いているかどうかを見るだけでは不十分だと指摘します。特に GPU クラスターをスケールさせるほど、個々の機器の微妙な差異が全体の安定性を損なうからです。
「GPU の温度管理は極めて重要です。もし 1 つでも他の GPU よりも数度高いものがあったら、それはスロットリング(性能低下)を引き起こし、トレーニングを不安定にします」
Gabriel 氏のチームの方針はシンプルでした。78°C を超える GPU が検知されれば、修復を試みず即座に排除して交換要請を出すのです。この「愚直な対応」が、長期的な学習時間のロスを防ぎました。
また、よく誤解される指標として「GPU 利用率(Utilization)」があります。これは GPU が作業をしている時間を示すだけで、その作業が効率的かどうかは分かりません。Gabriel 氏はこれを「嘘」と呼び、代わりにTensor Core の利用率を真の効率指標として採用しました。
「Tensor Core の利用率こそが、GPU が実際にどれだけ効果的に計算を行っているかを示すプロキシ(代用指標)です」
画像解像度を 128px から 1024px へスケーリングするにつれ、この値が上昇し、トレーニングの進捗を正確に反映しました。さらに、マルチ GPU 間の通信エラーを検知するためには、デフォルトでは取得できないInfiniBand や NVLink のメトリクスを独自に収集する必要があります。特に InfiniBand はノード間通信のボトルネックとなりやすく、パケットのエラー数や待ち時間を監視することで、クラッシュの原因を特定する手がかりを得ました。
クラッシュ耐性を高める「高速チェックポイント」戦略
数千もの GPU を使う大規模トレーニングでは、クラッシュは避けられない事実です。Gabriel 氏は、メタの研究論文が示すような理想的な故障率ではなく、実際には 8 時間未満で頻繁に停止するケースが多発したと語ります。
「8 時間未満のランしかできない状態で大規模事前学習を行うのは問題です。GPU に仕事を続けさせられず、モデル完成が遅れるからです」
この課題に対する解決策は、信頼性の高いファイルシステムへの投資と頻繁なチェックポイントでした。安価なストレージ(SEF)ではデータ損失のリスクが高く信頼できなくなったため、有料の高信頼ストレージへ移行しました。
その結果、1 秒間に約 1.8TB の読み込み速度を確保し、30 分ごとに高速にチェックポイントを保存できるようになりました。これにより、クラッシュが発生しても直近の学習状態から再開でき、損失を最小限に抑えることが可能になったのです。
Q(Kubernetes 拡張)による優先度管理と自己修復
リソース競合を回避し、研究開発と本番環境を共存させるために採用されたのが、Kubernetes の拡張プロジェクトQです。このシステムは「ガンスケジューリング」を実装しており、トレーニングジョブに対して高い優先度を付与します。
「トレーニングポッドは常に最高優先度を持ちます。もし推論(本番環境)が実行中のマシンにトレーニングが割り当てられれば、自動的に推論プロセスを停止させます」
これにより、研究開発の効率化が最優先されます。ただし、本番サイトのダウンを防ぐため、Q の機能と連携してトラフィックを別のクラスターや外部プロバイダーへ自動で切り替える仕組みも構築されています。
さらに、リソースの最適化にはtaints(汚染)とdescheduler(スケジューラー)を組み合わせた自己修復システムを導入しました。GPU 使用状況に応じてノードに taint を動的に付与し、不要なポッドを自動的に他の空きノードへ移行させることで、リソースの無駄を防ぎました。
まとめ
Krea 2 の成功は、単にモデルアーキテクチャが優れていたからではなく、GPU クラスターの物理的限界を「メトリクス」で可視化し、「優先度管理」と「自己修復」で柔軟に対応したインフラ戦略の賜物です。大規模 AI トレーニングにおいては、ハードウェアの故障を前提とした設計こそが、最速の学習を実現する鍵となります。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。