動画記事 · Last Week in AI
OpenAI の Sora、Gemini 1.5、BioMistral、V-JEPA、AI 特別チーム
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
OpenAI の Sora や Gemini 1.5 など生成 AI の最新動向から、医療用オープンソースモデル、AI 特別チームの設立、そして業界の倫理的懸念まで、週間の主要ニュースを網羅的に解説。
AI 業界の二大巨頭が描く未来:Sora の物理法則理解と Gemini 1.5 の超長文処理能力
今週の AI ニュースは、映像生成における画期的な技術革新である OpenAI の「Sora」と、コンテキスト処理能力を限界まで引き上げた Google の「Gemini 1.5」の二大トピックが中心となりました。特に Sora が物理法則を理解する「時空間パッチ」アーキテクチャを採用したことは、AI が単なる映像生成ツールを超え、現実世界をシミュレートする能力を獲得したことを示す重要な転換点です。
OpenAI「Sora」:物理法則を学習する世界モデル
OpenAI が発表した Sora は、テキストから動画への変換においてこれまでに見たことのないレベルの高解像度と一貫性を誇ります。発表直後には「ハリウッドの終わり」や「AI による支配」といった過剰な反応も見られましたが、技術的な飛躍がどれほど劇的であるかは疑いの余地がありません。
Sora の真価は、そのアーキテクチャにあります。OpenAI は動画生成において、画像を単なる連続するフレームとして扱うのではなく、「時空間パッチ(spacetime patches)」という単位で処理しています。これは、動画内の複数のフレームにわたって追跡される画像の断片であり、意味の原子のようなものです。
Sora は言語モデルが学習できる形で動画を切り出す方法を発見しました。これにより、事象の物理的事実を捉える内部表現、つまり「世界モデル」を構築することが可能になりました。
このアプローチにより、Sora は物理法則を本能的に理解する能力を獲得しています。例えば、グラスが割れる様子やボールが落下する動きは、単なる映像のパターンマッチングではなく、モデルが物理的な因果関係を学習しているからこそ自然に表現されています。また、物体恒常性(オブジェクト・パーマネンス)も備わっており、画面から一時的に隠れた物体が再び現れた際にも、その存在を認識し続けることができます。
興味深いのは、この能力が特別な帰納的バイアスや明示的な記号 AI を導入した結果ではなく、単に計算リソースを増やし、フル解像度の HD 動画でスケールさせたことで「突発的に」獲得された点です。これは OpenAI の「スケーリング則」への信頼を裏付ける強力な証拠であり、物理法則のような複雑な事象も、適切なデータチャンク化と大規模学習によって AI が習得できることを示しています。
現時点では Sora は一般公開されておらず、安全性評価やリスク管理を行うレッドチームメンバー、および一部のアーティストや映画制作者に限定して利用されています。しかし、動画の拡張や編集機能など多様な応用が可能であり、実用化まで数ヶ月を要するものの、近い将来には業界に構造的な変化をもたらすことは間違いありません。
Google「Gemini 1.5」:100 万トークンのコンテキストウィンドウがもたらす革命
Sora が映像の物理法則を解明した一方で、Google は Gemini 1.5 Pro の発表で、AI の情報処理能力における新たな基準値を示しました。Gemini 1.5 の最大の特徴は、驚異的な「コンテキストウィンドウ」の長さです。
このモデルは標準で 100 万トークン、テスト環境では最大 1000 万トークンを処理できる能力を持っています。これは、1 時間の動画、11 時間の音声、あるいは 3 万行に及ぶコードベース全体を一度に入力として扱えることを意味します。
Gemini 1.5 は「干し草の針」テストにおいて、99.7% のリコール率を達成しました。これは、巨大な情報量の中に埋め込まれた微小な詳細さえも、後で正確に思い出せる能力を持つことを示しています。
これまでの大規模コンテキストモデルでは、プロンプトの初期部分に入力された情報が、長い処理過程の中で忘却されるという課題がありました。しかし Gemini 1.5 は、GPT-4 や Gemini Ultra を凌駕する精度でこの問題を解決し、長文書や複雑なコードベースから必要な情報を引き出す能力を確立しました。
パラメータ数は明言されていませんが、推測では中規模モデル(約 300 億パラメータ)でありながら、Soft Mixture of Experts というアーキテクチャを活用して Gemini Ultra に匹敵する性能を実現しています。今後、このモデルは開発者向けに展開され、OpenAI の GPT-4 と同等の価格帯で提供される見込みです。
医療 AI の民主化と社会実装への懸念
技術革新の裏側では、分野特化型のオープンソースモデルや、社会実装に伴う倫理的議論も活発化しています。特に医療分野では、BioMistral という新たなモデルが登場しました。
このモデルは PubMed などの医学データで微調整(ファインチューニング)されており、既存の医療 AI モデルを凌駕する性能を発揮しています。オープンソースモデルとして高性能な医療 AI が利用可能になることは、医療現場における AI の民主化と普及に大きく寄与すると期待されています。
一方で、AI エージェントや計算リソースへの巨額投資が加速する中、政府による「AI 特別チーム」の設立やハリウッドでの AI 反対運動など、規制と社会受容性の議論も同時に進行しています。技術の進化が物理法則や医療現場を根本から変える一方で、企業は革新とガバナンスのバランスを迫られる時代へと突入したと言えます。
まとめ
Sora が現実世界の物理法則を理解し始めたこと、そして Gemini 1.5 が膨大な情報を瞬時に処理できるようになったことは、AI が「道具」から「世界をシミュレートする知能」へと進化している証左です。技術の民主化と安全性確保という二つの潮流が交差する今、業界は成熟期を迎えつつあります。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。