動画記事 · AI Explained
AGI 巡る二大賭け Google I/O の焦点
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google I/O で示された「世界モデルによる AGI への賭け」と、OpenAI/Anthropic の「推論重視・自己改善」路線の対比と、その技術的課題である「ジャグネス」の深層分析。
AGI 巡る二大賭け:Google I/O が示した「世界モデル」と「推論」の分岐点
昨年の Google I/O は、単なる新モデル発表会ではなく、人工一般知能(AGI)への道筋を巡る Google と OpenAI/Anthropic の戦略的対立が鮮明になった転換点でした。Google は検索ボックスを AI ポータル化し、「世界を理解する」動画生成モデルで AGI を目指す一方、競合他社はテキスト推論と自己改善に賭ける別路線を歩んでいます。
検索ボックス vs チャットボックス:ユーザー体験の奪い合い
今回のイベントの本質は、Google が OpenAI から消費者を取り戻そうとする明確な戦略でした。Google の狙いは「検索ボックス」を AI 利用の入り口(ポータル)にすることです。一方、OpenAI は長年「チャットボックス」を主軸としており、ここでの対立がユーザー体験と広告モデルを巡る市場競争を激化させています。
Google は、あらゆる入力からあらゆる出力へ対応する新モデル「Gemini Omni」を発表しました。これは音声や画像を入力として受け取り、動画やインタラクティブなシミュレーションを生成する世界モデルです。デミス・ハザディス(Google DeepMind CEO)は、この技術が物理法則を理解し現実をシミュレートできる点で AGI への重要な一歩だと強調しました。
「世界を正しくシミュレートできれば、それを理解できることになる」
しかし、現状の「Omni」には厳しい制限があります。動画や画像を入力しても生成が起きないケースが多く、テスト結果では中国のモデル「Seedance 2」レベルの品質にとどまりました。それでも Google は、この世界モデルこそが AGI の基盤であると確信しています。
OpenAI と Anthropic が選ぶ「推論」への賭け
Google が「世界モデル(動画生成)」に賭ける中、OpenAI と Anthropic は異なる戦略を取っています。OpenAI の共同創設者 Greg Brockman 氏は、動画生成のような分野は「機会が多すぎて管理が難しい」と指摘し、テキストベースの推論能力と自己改善機能に集中する方針を明言しました。
「なぜあなたの賭けはこの世界モデル版ではないのか?動画が場所を理解するバージョンではなく、テキスト知能はどこまで進化できるかだ」
彼らの考えでは、数学的に妥当なアイデアであれば、計算資源さえあればあらゆる分野で良い結果が得られるという「推論の拡張性」こそが AGI への近道です。この技術的アプローチの違いは、今後数年間の AI 研究開発の方向性を決定づける重要な分岐点となっています。
Gemini 3.5 Flash:速さとコスト、そして専門分野での強み
イベントで発表された主要な新モデル「Gemini 3.5 Flash」は、高速・低コストを売りに実用性の高いモデルです。Google は企業に対し、このモデルへ切り替えることで数十億ドルの節約が可能だと訴え、「AI に使いすぎている」と警告しました。
ベンチマーク結果を見ると、Gemini 3.5 Flash の性能は以下の通りです。
- 速度: 同程度の性能を持つ他社モデルに比べ、はるかに多くのトークン/秒を出力します。ハードウェアの効率化も功を奏しています。
- 金融・チャート分析: 「Finance Agent V2」や複雑なチャートの解析において、Gemini 3.5 Flash は GPT-5.5 や Claude Opus 4.7 を上回る結果を示しました。正確な数値処理や業界慣習への対応力に強みがあります。
- コーディング: 「反重力(Anti-Gravity)」のようなインタラクティブなゲーム作成では、GPT-5.5 や Claude と同等かそれ以上の成果を 1 時間足らずで達成しました。しかし、生ベンチマークでは最高性能とは言い切れない部分もあり、専門分野での差が浮き彫りになっています。
「ジャグネス」:AGI への最大の障壁
Google DeepMind は、AI の「不連続な知性(ジャグネス)」が AGI 実現の重大な障壁であると警告しています。これは、モデルが特定のタスクでは完璧に動作しても、別の文脈や複雑な状況で突然能力が低下する現象を指します。
独立した研究者による 70 ページにわたる論文もこの問題を指摘しており、最新のフロンティアモデル(Gemini 3.5 や GPT-4 シリーズ)でも、捏造された情報に対して「真実」として信じてしまうなどの不連続な挙動が確認されています。Google は、この「ジャグネス」を解決することが AGI への最後の壁であると認識しており、その解決の難しさを示唆しています。
まとめ:多様な知能の時代へ
Google I/O が示したのは、AGI への道筋が一本ではないという現実です。Google は世界理解と検索体験の統合を、OpenAI と Anthropic は推論能力の深化をそれぞれ追求しています。また、Gemini 3.5 Flash の登場は、「万能な AI」よりも「特定の分野で圧倒的に優れた AI」が混在する多様性の時代への移行を示唆しています。
ユーザーとして重要なのは、検索ボックスかチャットボックスかを選ぶことではなく、それぞれのモデルが得意とする領域を理解し、使い分ける姿勢かもしれません。AGI 実現までの道のりはまだ険しいですが、技術の分岐点において私たちが直面する選択肢は確実に広がっています。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。