動画記事 · Y Combinator
AI は人間のように学習できない 解決策示唆
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
AI の学習効率の壁を破る鍵として、人間が持つような「世界モデル」の構築と予測制御への注目が高まっている。
AI はなぜ人間のように学習できない?「世界モデル」が解くサンプル効率の壁
現在の人工知能(AI)は、膨大なデータに依存して訓練する必要があります。一方、人間は数回の試行で新しいスキルを習得します。この決定的な差である「サンプル効率」の課題を解決し、汎用人工知能(AGI)への道を開く鍵が、「世界モデル」という概念にあります。
人間の学習と AI の根本的な格差
AI 業界で最も大きな未解決問題の一つが「サンプル効率」です。これは、限られたデータからいかに素早く新しいタスクやスキルを習得できるかという指標です。
人間は驚くほど効率的に学習します。新しいゲームのルールや概念、スキルを、数回の試行だけでマスターできます。しかし、現在の最先端 AI モデルは、同じタスクを学ぶために数万点ものデータポイントが必要とされます。
「知能とは、単位ワットあたりの性能(インテリジェンス・パー・ワット)でもありますが、重要なのは『サンプルあたりの知能』です。新しいデータが 1 つ増えたとき、どれほど賢くなるかという速度こそが、現在の AI が最も苦手としている点です。」
この格差は、AI が「ゼロから(タブラ・ラサ)」学習しているわけではないことからも浮き彫りになります。現代の AI はインターネット全体の知識を圧縮して学習していますが、それでも数学的な推論や直感的なパズル解決といった分野では、人間には及ばないのです。
完璧な「世界モデル」とは何か?
サンプル効率を極限まで高める理想とは、実世界の環境からデータを収集する必要がゼロになることです。一見すると非現実的に思えますが、実は私たちはすでにそれを実践しています。それが「ニュートン力学」です。
NASA が小惑星の軌道を数年も前に計算し、ロケットで正確に交差させる計画を立てる際、実証実験を何百万回も繰り返す必要はありません。なぜなら、物理法則(世界モデル)が完璧に理解されているからです。
「もし私たちが完璧な世界モデルを持っていれば、環境からサンプルを集める必要はなくなります。これは『ニュートンの第二法則』やロケットの軌道計算のように、すでにプログラムされた世界モデルが機能している状態です。」
このアプローチを「モデル予測制御(Model Predictive Control)」と呼びます。物理法則が微分可能であるため、最適化アルゴリズムを用いて、エネルギー消費や時間などの制約条件下で最適な行動を瞬時に計算できるのです。
脳内シミュレーションと睡眠の役割
AI が世界モデルを持たない最大の欠点は、人間が日常的に行っている「思考実験」ができないことです。私たちは無意識に他者の反応や未来の結果をシミュレートしています。
例えば、投資家へのピッチや顧客との会話で、相手が何を言うかを脳内で事前にシミュレーションするのは、まさに世界モデルの活用です。起業家としての経験が長いほど、この内部シミュレーションの精度は高まります。
さらに、人間の学習メカニズムを裏付ける興味深い研究があります。1967 年のスタンフォード大学の研究(Richardson ら)では、バスケットボールのシュート練習において、実際にシュートを打つグループと、目を閉じてシュートのイメージトレーニングをするグループで比較されました。
「実際の実践でパフォーマンスが 24% 向上したのに対し、視覚を遮断して頭の中でシュートを想像するだけで 23% の向上が見られました。これは、脳内の世界モデルが学習を劇的に加速させる証拠です。」
この知見は、ニューロン皮質の進化が「世界モデル」をより精密に構築するためにあるという仮説(Shawn Duggan ら)とも一致します。単なる次の行動の予測ではなく、内部でシミュレーションを行う能力こそが、学習と適応の鍵なのです。
ロボティクスと自動運転への応用
自然言語処理においては、AI が明示的な世界モデルを持たなくてもある程度の推論ができるように見えますが、ロボティクスや自動運転のような物理的相互作用が必要な領域では、このアプローチは不可欠です。
ドローンの制御を例に考えてみましょう。ドローンには質量があり、重力が働いています。現在の位置と速度(状態)から、目標地点へ到達するための推力(行動)を決定する必要があります。
ここで重要なのは「遷移関数」、つまり状態がどう変化するかというモデルです。AI がこの遷移関数を学習しようとすると膨大なデータが必要になりますが、ニュートン力学という完璧な世界モデルがあれば話は別です。
「F=MA という物理法則を遷移関数として定義すれば、凸最適化(Convex Optimization)を用いて、エネルギー消費や最大推力の制約条件下で、ドローンが目標地点に到達する最適な軌道と制御信号を瞬時に計算できます。」
このように、物理法則という「世界モデル」を明示的に組み込むことで、AI は試行錯誤による膨大な学習なしに、複雑な環境でも安全かつ効率的に動作できるようになります。自動運転やロボット工学における実用化の鍵は、まさにこのシミュレーション能力と、触覚などの感覚情報を統合した予測制御にあります。
まとめ
現在の AI が人間のような柔軟な学習を実現できないのは、物理法則や環境変化を内部でシミュレートする「世界モデル」を欠いているからです。サンプル効率の壁を突破し、AGI に近づくためには、膨大なデータ収集に依存するアプローチから、物理法則に基づく予測制御と脳内シミュレーションを模倣したアーキテクチャへの転換が急務です。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。