動画記事 · AI Engineer
プライム・インテレクト・スタック — ウィル・ブラウン氏、同社を語る
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Will Brown 氏が、大規模オープンソース AI の研究とトレーニングを容易にする「Open Superintelligence Stack」の最新動向と、Verifiers ライブラリ、Primer RL、Lab プラットフォームの詳細を発表。
プライム・インテレクト・スタック:企業が独自に大規模 AI をカスタマイズする新時代
大規模オープンソース AI の研究と実用化を加速させる「Open Superintelligence Stack」の構築について、Primed and Loaded(旧 Primed and Loaded)の応用研究責任者、ウィル・ブラウン氏が語りました。このスタックは、企業が既存のワークフローを崩すことなく自社モデルをトレーニングし、生産環境で継続的に改善するための包括的なインフラストラクチャです。
特に注目すべきは、評価(Evals)と強化学習(RL)の境界を曖昧にし、ハーンネスコードの改変なしに RL トレーニングを実現する新ライブラリ「Verifiers V1」と、コスト効率の高い非同期学習フレームワーク「Primer RL」です。これらの技術により、企業は独自業務に最適化した「エンタープライズ AI」を迅速に構築できるようになります。
「Open Superintelligence Stack」とは何か
ウィル・ブラウン氏が提唱する「Open Superintelligence Stack(オープン・スーパーインテリジェンス・スタック)」とは、大規模オープンソースモデルを自社のワークフローに最適化し、実際の運用環境で遭遇するシナリオに基づいて継続的に改善するためのツールキットとインフラです。
かつてはマーケティング用語のように感じられたこの概念ですが、ブラウン氏は現在、「まさにそれが本質だ」と実感しています。目指しているのは、単に品質が向上したオープンソースモデルを使うだけでなく、それを基盤として自社のユースケースに合わせてさらに改良し、社内タスクやワークフローで活用できる状態を作ることです。
「モデルはすでに非常に良くなり、多くの点で超人的な性能を誇っています。私たちは人々が実際にトレーニングを行い、必要な制御権限を持って展開し、必要に応じてカスタマイズして仕事を完遂できるようにするオープンなツールキットを提供したいのです。」
このスタックは、世界中のデータセンターに展開された 10,000 基以上の GPU を活用した大規模な計算リソースの上に成り立っています。顧客と共にモデルをトレーニングし、独自ワークフローでの大規模学習を実現するための基盤として機能しています。
Verifiers V1:評価とトレーニングの融合
ポストトレーニングの核心となるのが「環境(Environment)」です。ブラウン氏によれば、環境とは「モデルに何をさせたいか」を指定する言語であり、データのエンカプシュレーションやエージェントが置かれるシナリオ、そして良し悪しの評価基準を含むものです。
従来のアプローチでは、評価(Evals)と強化学習(RL)のトレーニングは別々のプロセスとして扱われがちでした。しかし、Verifiers V1 はこの境界を曖昧にします。この新ライブラリは、既存のハーンネスコードを改変することなく、インタセプションサーバー経由で RL 環境に組み込むことを可能にしました。
「評価ができれば、これは論理の単位として、実際に行う必要があるポストトレーニングと同じものになります。評価を構築することは、何をするにしてもプロダクトの健全性にとって良いことです。」
Verifiers V1 の最大の特徴は、タスクセット(Task Set)、ハーンネス(Harness)、ランタイム(Runtime)という 3 つの要素を柔軟に組み合わせられる点です。
- タスクセット: エージェント非依存のデータとルール。何を行うべきかを示し、Hugging Face データセットや NeMo Gym など既存エコシステムとネイティブに統合されます。
- ハーンネス: モデルが動作する世界全体を構築するパズルの一部。CLI ツールやスキル、システムプロンプトなどが含まれます。
- ランタイム: ハーンネスのコードを実行する場所。ローカルの Docker やサンドボックス、あるいは UV スクリプトなど、好きなバックエンドを選べます。
この設計により、SFT(Supervised Fine-Tuning)やポリシー蒸留においても、環境内でロールアウトを実行し、結果を検証するという一貫したプロセスが実現します。Python パッケージとして提供され、PyDantic による厳密な型付けが行われているため、開発の信頼性も高まっています。
Primer RL:スケーラブルでコスト効率の高い学習
Verifiers V1 が環境を定義するならば、Primer RL はその環境でモデルを学習させるエンジンです。これは非同期強化学習をサポートするフルスタックのオープンソーストレーニングフレームワークであり、大規模モデルを効率的に訓練するための設計思想が反映されています。
「モデルが大きくなるほど計算コストは積み重みます。これを人々に利用可能にし、特に反復して改良できるようにしたいなら、それは速く、安価でなければなりません。」
Primer RL は、マルチテナント LoRA(Low-Rank Adaptation)やフルパラメータ微調整に対応しており、コスト効率と柔軟性を両立しています。また、オンポリシー蒸留や自己蒸留といった最新のアルゴリズムもサポートしており、研究の時代において人々が求める多様な能力をモデルに付与する際にも威力を発揮します。
特に注目すべきは、トレーニングにかかる計算リソースを推論予算のごく一部に抑えながら、リアルワールドからのフィードバック信号を得てモデルを継続的に改善できる点です。これは「一度きりの作業」ではなく、モデルが常に進化し続けるためのフライホイール(回転の持続力)を構築する仕組みです。
Lab プラットフォーム:プロトタイピングから大規模実行まで
これらの技術を統括するのが研究ワークフロー管理プラットフォーム「Lab」です。ローカルでのプロトタイピングから、クラウド上での大規模実行まで、開発者がシームレスに切り替えられる環境を提供します。
ブラウン氏は、現在「cookbook リポジトリ」をアルファ版として公開しており、過去数ヶ月で構築した取り組みのプレビューとなっています。まだ一部変更中ですが、スタートアップや企業のアジャイルなエンジニアが、大規模な研究チームを組むことなくポストトレーニングに投資し、実際に実行できるシステムとしての姿を示しています。
まとめ:参入障壁の低下とエンタープライズ AI の普及
ウィル・ブラウン氏の発表は、企業が独自の大規模 AI モデルをトレーニング・カスタマイズする際の参入障壁を大幅に下げる可能性を秘めています。特に、既存のハーンネスを改変せずに RL トレーニングが可能になる点は、開発者のワークフローを阻害せず、迅速なイテレーションと実用化を促進します。
これにより、オープンソース AI の生態系がより深く企業業務に統合され、独自性の高い「エンタープライズ AI」の普及が加速すると予想されます。企業が自社のデータとワークフローに基づき、継続的に改善されるモデルを構築する時代が、今まさに始まろうとしています。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。