動画記事 · Dwarkesh Patel
次なる学習パラダイムとは何なのか
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
次世代 AI は、検証可能な環境での強化学習(RLVR)と、学習内容を重みに圧縮する継続的学習(Dreaming/On-policy Distillation)により、実世界で自律的に進化し続けるエージェントへと進化する。
AI の未来は「学習」から「進化」へ:次なるパラダイムとは何か
現在の AI 開発は、膨大な計算リソースを投入してもなお「データ非効率性」という根本的な欠陥を抱えています。この壁を突破し、真の汎用知能へと進化させる鍵となるのは、明確な成功・失敗基準がある環境での強化学習と、学習した知識をモデル内部に圧縮する「継続的学習」です。
検証可能な環境が不可欠な理由
現在の AI が複雑な実世界タスクで進歩しない最大の理由は、トレーニング環境の性質にあります。コーディングのように「コードが動くか動かないか」という明確な正解が存在する分野では、AI は急速に成長しています。しかし、ビジネス構築や政治戦略など、結果が数ヶ月から数年かかり、再現性が低い領域では、AI の進歩は著しく鈍化しています。
「すべての現在の根本的な欠陥は、これらのモデルのデータ非効率性です」
この問題に対処するには、決定論的で再生可能な「検証可能な環境(RLVR: Reinforcement Learning with Verifiable Rewards)」が不可欠です。例えば、AI に「Etsy で商品を注文し、配送を確認する」というタスクを与えた際、すべてのエージェントが同じコンテナ内で同一のシナリオを並列実行できる環境が必要です。
現在の非効率なアプローチは、人間が手作業で環境を設定したり、Slack や Gmail などの一般アプリケーションに対して個別にテストを行ったりすることですが、これはスケーラブルではありません。数百万もの検証可能な RL 環境を構築できれば、AI はエラーや曖昧さから学び、オープンエンドな課題への解決策を自律的に見出すことができるようになります。
コンテキストウィンドウの限界と「継続的学習」
現在の AI は、推論時のコンテキストウィンドウ(記憶の範囲)に依存して情報を処理しています。しかし、これは人間のような学習効率とは程遠いものです。
「モデルが極めてトレーニング時にサンプル効率が低い」
人間の脳は、生涯を通じて得た経験を頭蓋骨を膨らませるのではなく、抽象概念や直感として重み(パラメータ)に圧縮・統合します。一方、現在の AI はコンテキストウィンドウを無限に広げようとするだけで、学習した知識をモデルの内部構造に定着させる仕組みが欠けています。
推論時に数百万回のリクエストを処理して得られる情報は、一度きりのセッションで完結してしまいます。これは、同じ情報を数百万人のユーザーに対して繰り返し学習させなければならない非効率な状態です。真の進化には、セッション中に得た知見をモデルの重みに戻し、次回の推論で即座に活用できる「継続的学習」が求められます。
有望な技術:自己教師ありと「Dreaming(夢想)」
この課題を解決する具体的なアプローチとして注目されているのが、「自己蒸留」と「Dreaming(夢想)」です。
1. 自己蒸留による重みへの圧縮
セッション中に AI が現実世界のタスクを解決した過程で得た経験や失敗を、ベースモデルの重みに凝縮する手法です。これは単なる強化学習よりも優れており、外部からの報酬信号に頼らずとも、AI 自身が「何が正しく、何が間違いだったか」を教師として機能させます。
「セッション中のこの経験を、単純な RL よりも優れた監督信号として利用します」
2. Dreaming(夢想)によるシミュレーション学習
AlphaZero が将棋や囲碁で成功したように、AI に現実世界での実時間を費やさずとも、頭の中で何千回ものシミュレーションを行わせる技術です。実際には数ヶ月かかるようなタスクを、短時間で反復練習させることで、サンプル効率を劇的に向上させます。
未来の AI:リリース後に「進化」するエージェント
2027 年〜2028 年には、AI のあり方は根本から変わります。これまではトレーニングが完了した時点で「完成品」としてリリースされていましたが、次世代の AI はリリース後も実世界の経験から自律的に学習し続ける動的なエージェントへと進化します。
「AI が向上するのは、一般公開された後ではない。世界中で広く展開されることで蓄積され、さまざまな種類のタスクにおいてより賢くなる」
このパラダイムシフトにより、AI は静的なツールから、現場でスキルを習得・洗練させる自律的な存在へと変わります。企業や開発者は、一度きりのトレーニングではなく、継続的な学習サイクルを持つインフラへの投資を迫られることになります。これこそが、人間のような汎用知能を実現するための唯一の道筋なのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。