英伟达刘洺堉氏語る:黄仁勲の影響、全敵対者撃破不要
本文の状態
日本語全文を表示中
詳細モードで約57分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Language Is World
英伟达研究副总裁刘洺堉は、黄仁勋の「ゼロから十億ドル市場を創る」という哲学に基づき、物理世界向けAIモデルCosmosの開発方針と、競合を排除するのではなく市場全体を拡大する競争観について語った。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月13日 21:31
AI深層分析
キーポイント
競争観:市場創造の重視
劉洺堉は業界の競争を「鱿鱼游戏(ゼロサムゲーム)」と見なすのではなく、市場を創出する姿勢が重要だと主張し、他社を排除する意図はないと明言した。
Cosmosプロジェクトの戦略
英伟达は物理世界向けAI(Physical AI)の実現を目指し、世界基座モデル「Cosmos」の開発を進めており、黄仁勋から「Cosmos 97」まで到達するよう強い決意を示されている。
大模型の標準化と差別化
劉洺堉は将来的にモデル自体の能力が統一される可能性を示唆し、その後の競争優位性はエコシステムの構築や独自の組織力によって決まると分析した。
技術的アプローチと哲学
劉洺堉は東洋的な智慧を技術思考に活かしており、大模型を「中医」に例えたり、『孫子兵法』の「備多則力寡」を引用してリソース配分の重要性を説いている。
市場創造とゼロから十億ドルのビジネス
英伟达は既存市場での競争ではなく、ロボットや物理AIのような未開拓領域で需要を創出する「ゼロから十億ドルのビジネス」に注力している。
重要な引用
Jensen(英伟达创始人兼CEO黄仁勋)经常说,要造市场,而不是存量竞争
我并不是为了展现强大的破坏能力
模型的能力慢慢会统一,靠模型自己不会是区分
Jensen经常说,要造市场,而不是存量竞争。
編集コメントを表示
編集コメント
英伟达の技術リーダーが「競争は殺し合いではない」と明言した点は、業界全体のパラダイムシフトを示唆している。物理世界AIへの注力と、東洋的な哲学を融合させた経営戦略は、今後の技術開発の方向性を示す重要な指標となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
原创 张小珺 2026-08-13 11:33 上海
Cosmos、世界模型と中国武術。
執筆者:张小珺
劉洺堉氏に会うたびに、彼は黒いジャケットを着て、少し古びたショルダーバッグを背負っている。
現在、英伟达(NVIDIA)の研究副総裁を務める劉氏は、同社で初めて研究員から副総裁へと昇進した管理者だ。彼が率いるのは、世界基盤モデル「Cosmos」をはじめとする、英伟达の最重要プロジェクトの一つである。
台湾出身の劉氏は、金庸の小説を愛読している。18 歳から著名な武術家・徐紀(神槍李書文の一派の継承者)に師事し、中国武術を学び続けている。最近では「アイス・プランジ(氷水浴)」という新しい趣味も始めたそうだ。凌晨 4 時過ぎに起床した劉氏は、まず決まりのように武術の稽古を行う。一人での蹲踞(そんきょ)や拳法だ。一通り終えた後、自ら氷桶へと飛び込み、身体を修復する。
こうした鍛錬習慣は、私の劉氏に対する印象とは対照的だった。彼は謙虚で、話し声も決して大きくない。「中国武術において最も重要なのは、自分自身を制御することです」と劉氏は語る。「私は強大な破壊力を示すために武術をしているのではありません」
ある意味で、これは彼が代表する英伟达のような巨大なインフラ企業の競争観をも反映している。
インタビューの中で、彼は繰り返し強調した。自分には競争相手などいないと。誰とも競争していないし、すべての人がパートナーになり得ると。
「戦争とは何でしょうか?私は誰かを殺すつもりはありません」と劉洺堉氏は語ります。「私たちの姿勢は、他者を排除することではなく、新しい市場を創出することにあります。私の意図が伝わりますか?」
「ジェンセン(英伟达创始人兼CEO 黄仁勋)はよく、『市場を創るべきだ』と説きます。既存のシェア争いをするのではなく、ゼロから十億ドル規模のビジネスを作るのです。最初は赤字でも構いません。しかし、その事業が成功した際には、必ず大きな影響力を持つものでなければなりません。毎年100万ドル(1億円)稼ぐ程度ではダメです。この規模は多くの企業にとっては大きいかもしれませんが、英伟达にとっては『分断』に過ぎません。」劉氏は続けます。「最も重要な課題を解決し、最大の貢献を果たすことが求められています。」
英伟达が今、「創ろうとしている」市場とは、物理世界に向けた人工知能(Physical AI)のことです。その象徴となるのが世界基盤モデル「Cosmos」です。2024年にプロジェクトが始まり、2 年余りで既に Cosmos 3 が発表されています。直属のチームは 100 人未満ですが、実質的な規模は 200〜300 人に及びます。黄仁勋氏は劉氏に対し、明確な戦略的決意を示しました。「Cosmos 97 まで到達させるんだ」と。
現在、米国で 20 年、英伟达では 10 年間勤務する劉氏ですが、依然として技術的な表現に東洋の素朴な知恵を取り入れています。例えば、大規模モデルを中医(中国伝統医学)に例えたり、『孫子兵法』の「備多則力寡」(備えが多ければ力が分散し弱まる)という言葉を引用して、世界モデルの技術的潮流を考えたりします。
今回のインタビューでは、Cosmos シリーズ(特に直近で発表された Cosmos 3)、世界モデル、物理世界における AI、英伟达の競争観、組織哲学、そして避けて通れない黄仁勋氏について詳しく議論しました。
完全版は当社の動画ポッドキャストでご覧いただけます。小宇宙、Bilibili、小红书、抖音、视频号など全プラットフォームで配信中です。
以下はインタビューの一部抜粋です。
01
競争について語る
「誰かを殺すつもりはありません」
张小珺:あなたは「モデルの競争は『鱿鱼游戏』(韓国ドラマ『イカゲーム』。ゼロサムな生存競争を比喩)であるべきではない」とおっしゃいました。大規模モデルの競争のことですか?それとも世界モデルのことですか?あるいは、あなた個人にとってそうではないということでしょうか?
刘洺堉:もし皆が解こうとする問題が全く同じであれば、それは『鱿鱼游戏』になります。しかし、モデルの競争はそうあるべきではありません。世界中には解決すべき問題が無数にあり、価値を提供できる要素も多岐にわたります。また、人々が好むものもそれぞれ異なります。だから、これをゼロサムゲームと捉える必要はないと思います。
张小珺:それでは、各社が自社の大規模モデルを訓練する必要があるのでしょうか?
刘洺堉:それがコモディティ(汎用品)であれば、各社が自前で発電所を建設する必要はありません。経済的な合理性で判断すべきです。かつて自動車工場を設立する際、電力供給が不安定だった時代には、自前で発電所を建てて 24 時間稼働を確保する必要がありました。しかし、現代ではその必要はなくなっています。
AI デベロッパーの誰もが「自分のモデルが一番だ」と考えがちですが、歴史上かつてない現象です。人間同士の関係が容易ではないように、技術の世界でも同じことが言えます。例えば、Dario Amodei(Anthropic 創設者)と Sam Altman(OpenAI CEO)は当初から相性が合わず、結局 Dario 氏は退社しました。Anthropic の全員が全く同じ信念を持っていると思いますか?私はそう思いません。もしあなたが A プラットフォームへの昇格を拒否し B を選ぶ場合、B が追随者を引き連れて類似のプロジェクトを始める可能性はないでしょうか。
誰もが作れる時代です。決意とリソースがあれば、作ることは可能です。
张小珺:このモデル競争の最終的な姿はどうなるのでしょうか?
刘洺堉:これは少し議論を呼ぶかもしれませんが、モデル自体の能力は徐々に統一されていくでしょう。モデル単体で差別化を図ることは難しく、他の要素を組み合わせてこそ違いが生まれます。
先行するモデルには、その差別化ポイントを見つけるためのより長い時間があります。また、強力な企業であれば、自社の強みを活かしたエコシステム(生態系)を強化することで、新たな変化を生み出すことができます。
ソフトウェア業界も同じです。初期はソフトウェアを書ける企業が少なかったですが、現在は誰もが書けます。生き残っている企業にはそれぞれ独自の差別化戦略があります。モデルの競争がこれと異なる理由はありません。むしろ、最終的には能力は均質化していくでしょう。
张小珺:在您看来,将模型或模型公司神话是没有必要的,对吧?
刘洺堉:我把它比作中医。它就像一个 Black box(黑箱),经过众多不同尝试后形成了一套学问,很多人都会投身其中。关键在于你打算用它来做什么。
有些人解读得比较深,有些人则需要更多时间去消化。这是我的推测。我觉得这些概念会逐渐 diffuse(扩散)开来。
张小珺:对于你们而言,Cosmos 所在的世界模型战场,是一场不能输的战争吗?
刘洺堉:如果有其他公司也做开源模型,那就不算。什么叫战争呢?我并没有打算把别人“杀死”。
张小珺:也就是说,您必须 own(主导)这个赛道,让其他人长在自己的生态之上。
刘洺堉:Physical AI(物理人工智能)是一个巨大的市场。目前家家户户还没有机器人,但一旦普及,我家可能会买两三个。每个机器人都需要算力,这意味着整个世界对算力的需求将大幅增长。如果这件事发生,对 NVIDIA 来说将是巨大的利好。
我们的心态不是想把别人“杀死”,而是如何共同创造市场。您明白我的意思吗?
CUDA(英伟达的并行计算平台和编程模型)就是用来造市场的,它造就了现在的 AI 市场。我们的目标是创造出下一个大市场。
张小珺:那世界模型难道不是一场不能输的战场吗?
刘洺堉:我觉得也不是,因为这是全新的东西,我并没有在跟任何人竞争。
我们要共利——带着大家一起把那个市场建起来。你卖机器人赚钱,你做芯片也赚钱,当然也会有公司研发芯片并获利。整个市场因此兴起,而原本这里是一片 nothing(什么都没有)。
Jensen 经常说,要造市场,而不是进行存量竞争。他讲的是,我们要做 zero-billion-dollar business(从零到十亿美元的业务)。什么叫 zero-billion-dollar business?就是现在还不是个 business(业务),但未来成功后会变成 billion(十亿美元级)。如果现在已经有人在做,可能就不值得做了。
我们做事需要 make impact(产生影响)。Jensen 喜欢 zero-billion-dollar business——你可以不赚钱,但当这个生意成功的时候,必须是很 influential(有影响力)的。不能只满足于每年赚 100 个 million(1 亿)。这种 scale(规模)对很多公司来说已经很大,但对英伟达而言,这只是一个 distraction(分心)。
你要去解最重要的问题,产生最大的贡献。
张小珺:这是一种拥抱风险,还是一种 de-risk(降低风险)?
刘洺堉:我们做事的方法很 risky(有风险)。CUDA 那时候是很 risky 的一件事,等于赔本在卖。因为我们装了 CUDA,整个 GPU 价格都比别人高,同样的 Flops(浮点运算次数)就是比别人贵,因为我们要支援 programmability(可编程性)。
如果不做这件事,你的东西就会渐渐变 commodity(通用商品)。
02
谈边界
“希望具备 number one 的能力,但做出对世界贡献最大的事情”
张小珺:在英伟达从一名研究员升至 VP,这种情况多见吗?
刘洺堉:我可能是第一个吧。
张小珺:您在英伟达的职位是“研究副总裁”,能不能给大家介绍一下这个职位、团队和管辖范围?
刘洺堉:我现在是研究副总裁,也是 Cosmos Lab 副总裁。我们团队由研究员和工程师组成,直属我这儿的有八九十人。
另外还有其他团队也在做 Cosmos,英文叫 dotted line(虚线)。虽然他们不直接向我汇报,但我是整个 mission 的 overall pic(任务的总负责人),是发号施令的人。
整个做 Cosmos 的项目应该有 200 到 300 人之间。这是在英伟达非常重大的一个专案。
张小珺:研究员と管理職の資質は、ある意味で相反するものです。管理職への道を進む中で、研究者としての天性を抑制し、「鎖付きで踊る」ような状態になったことはありませんか?
劉洺堉:私はまだ一人の研究者です。論文を読み続けることも多いです。最も恐れているのは、管理職になる過程で現場から離れ、問題の本質を見失ってしまうことです。そのため、自らコードをレビューし、論文を読み込み、チームと議論することで、方向性が正しいことを常に確認しています。
私と一緒に働く人ならご存知の通り、私がまだコードを確認し、細部までこだわる数少ない VP の一人です。ただ、自分が常に「足元(grounded)」に留まり、すべての状況を正しく把握し続けたいという思いからです。
张小珺:Sora を開発した研究者は、もともとあなたのチームでインターンをしていました。Sora はあなたのチームから生まれたわけではないと聞き、残念に思われたのでしょうか?
劉洺堉:残念だとは思いません。むしろ、かつて一緒に働いた仲間がこれほど大きな貢献をしたことを嬉しく思います。
一方で、自分の判断の中でどこを見誤り、なぜ正しい時期に正しい行動が取れなかったのかを振り返ることもあります。私は自己反省を好む人間で、常に自分自身をより良くする方法を理解しようと努めています。
张小珺:Sora について伺います。なぜ OpenAI はその後、この製品ラインを事実上廃止したのでしょうか?
劉洺堉:Sora は重要な研究であり、多くの応用可能性があります。OpenAI は非常に野心的な会社で、膨大な人材を抱えています。サム・アルトマン氏は Y Combinator の初期から投資家として活動しており、投資家としてのマインドセットを持っています。社内には多様なプロジェクトがあり、その中には極めて成功したものもあれば、ポートフォリオ全体として多様性を持たせることを望んでいます。
過去一年間、Anthropic からの激しい競争圧力がありました。Anthropic はコーディングエージェントにおいて大きな経済的効果を生み出しています。ChatGPT との会話で生成されるトークン数は、1 分程度で完了するものですが、コーディングエージェントは 24 時間、あるいは 48 時間稼働し、膨大なトークンを生成します。OpenAI はこれを非常に有望な方向と捉え、社内のリソースをコーディング分野に集中させることを決断しました。
『孫子兵法』には「備えが多ければ力が薄くなる」とあります。リソースは有限です。彼らはリソースを再調整し、コーディング開発へと注力したのです。
OpenAI が Sora を悪い仕事だと考えているわけではありません。ただ、このタイミングで、会社にとってより重要な課題があり、困難な決断を下す必要があったのだと思います。
张小珺:Anthropic や OpenAI といった最先端研究所では研究こそが天職であり、それが製品です。しかし英伟达 はインフラ企業であり、これらの企業や研究所に計算資源を供給すればよいはずです。なぜ自ら研究を行うのでしょうか?
劉洺堉:インフラを「よくする」とは、応用企業が使いやすくすることを意味します。もし自らがその応用を行わなければ、彼らが必要としているものを根本から理解することはできません。そのため、彼らが辿るであろう道を実際に歩き、そこから洞察を得る必要があります。
チップやコンピュータアーキテクチャの設計には長いサイクルがかかります。すぐに修正はできず、長期間にわたる計画が必要です。この分野の研究を行い、何を解決すべき重要な課題なのかを理解して初めて、AI 大手企業を支援するより良いチップやインフラ(infrastructure)を設計できるのです。
私はいつも、理想と野心を持つ人々がすべてこのツールを手に入れ、自分たちのやりたいことを実現できれば、世界はもっと良くなると思っています。OpenAI や Anthropic、そして中国の大手企業が成し遂げた突破を目にし、非常に嬉しく思います。しかし、この社会には絶えず野心に満ちた若者が湧き上がっています。彼らにも機会を提供したいと考えています。それが英伟达 がオープンソースモデルに取り組む理由です。
张小珺:貴社の研究成果は、顧客との競合関係を生むことはないのでしょうか?
劉洺堉:特にオープンソースモデルについては、基本的に無料で公開し、誰でも利用できるようにしています。実際に現場で実装し、お客様のニーズに応えるためには、まだ多くの課題を解決する必要があります。とりわけ具身(embodied)の分野では、ハードウェアやビジネス上の問題など、解くべきことが山積しています。
私たちはコミュニティに対して明確なシグナルを送っています。「1 世代から 2.5 世代、そして 3 世代へと、段階的に進化し続ける」というメッセージです。これにより、英伟达 がこの分野に継続して投資し、進歩を続けていくという確信を持ってもらいます。その信頼があれば、リソースはより重要な「刃こぼれ」に集中投じられ、重大な貢献を生み出すことができるのです。
どんなに資金力のある企業でも、リソースは有限です。具身知能の課題は難しく、解決すべき要素が山ほどあります。私たちはそうしたモデルを作り、皆の負担を減らすお手伝いをしています。競争だと捉える必要はないのです。互いに成功するための協力関係だと考えています。
张小珺:研究者としての本能では「No.1」のモデルを作りたいはずですが、英伟达という企業の立場上、顧客と直接競合したくはありません。この二つの思いが衝突した場合、あなたはどちらを選びますか?
刘洺堉:科学の発展は本質的にインクリメンタル(漸進的)なものです。常に進化し続けており、いつでもどこでも改善(improvement)を提案できます。一歩ずつ前に進むだけです。「絶対的な No.1」になること、つまり「No.1」とは何なのかを定義するのは実は難しいです。私はむしろ「フロンティア(前沿)」のモデルであると言いたいのです。フロンティアのモデルが完成した瞬間は確かに No.1 であり、大きな達成感がありますが、その後にはさらに新しいモデルが現れます。
私が目指しているのは、No.1 のモデルを作る能力を持つことです。そして、社会に対して最大の影響を与え、最も貢献できることを成し遂げることです。No.1 のモデルを作ったとしても、限られた少数の人しか使えない場合や、権力が一部の人間に過度に集中して不均衡を生むのであれば、それは正しいことではないでしょう。
私は、No.1 となる能力を持ちながら、世界に対して最大限の貢献ができることを目指しています。
03
Cosmos について語る
「Jensen に続けようかと尋ねたら、『Cosmos 97 までやれ』と言われた」
张小珺:今後 10 年、おそらく最優先となる課題は世界基盤モデルの Cosmos でしょうか?
刘洺堉:はい。私たちのチームには Cosmos というプロジェクトが一つだけあります。Cosmos 1 を完成させた後、Jensen に「続けるか」と尋ねたところ、「Cosmos 97 までやりなさい」と言われました。
私は現在、まだ 3 の段階にいるので、あと 94 世代進む必要があります。
张小珺:なぜ 100 ではなく 97 なのでしょうか?
刘洺堉:数字は適当に言ったものです。しかし、その数字には彼の決意が表れています。彼はこの方向性が重要だと考えており、私たちが引き続き集中して、Physical AI の基盤(foundation)を作り、この分野全体を前進させることを望んでいるのです。
张小珺:なぜ当時、最も主流の大規模言語モデルや Sora のようなマルチモーダルモデルではなく、具身知能のための世界モデルという非常に重要なプロジェクトを選んだのでしょうか?
刘洺堉:大規模言語モデルは当時すでに非常に発展していました。私のバックグラウンドは大規模言語モデルではなく、Computer Vision(计算机视觉)出身です。そのため、自然とメディアや動画の分野で活動してきました。一緒に働く仲間たちも同様の背景を持っており、その背景が私たちの進む道を決めました。
NVIDIA にも大規模言語モデルチームがあり、Nemotron も着実に成長しています。私は私にこそ解ける問題に取り組むことに注力したいと考えています。
Sora が登場した際も、それは World Simulator(世界模拟器)でした。しかし、当時の主な用途は創作に偏っていました。創作はとても面白く、誰もがより良い方法で物語を語り、アイデアを表現し、具体化して、自分たちが目にする世界を理解してもらいたいと願っています。これは素晴らしい応用です。
しかし同時に、Digital AI(数字人工智能)の発展が極めて速い一方で、社会には Physical tool(物理工具)によって解決すべき多くの問題があることも見ていました。
例えば、高齢になると運転ができなくなり、生活の質が大きく低下します。自動運転車があれば、高齢者でも移動能力(mobility)を維持できます。また、多くの仕事は肉体的に過酷で危険を伴います。Physical AI のロボットがそれを手伝えば、人々の生活を改善できるでしょう。家には常に片付けや整理といった雑用があり、それが在宅中に行いたいことばかりとは限りません。ロボットが手伝ってくれることで、生活の質は向上します。
私たちは World Model(世界模型)が Physical AI に貢献できると考え、コンテンツ制作(Content Creation)の道ではなく、Physical AI の方向へと進みました。
张小珺:您在个人主页上提到,一直有一个愿景驱动着您——“为机器人构建一个黑客帝国”。能否请您阐释一下这个愿景?
刘洺堉:我认为世界模型能够帮助具身智能(Embodied AI)实现泛化。任何人工智能要解决的核心问题都是泛化:模型在训练数据之外是否也能表现优异?无论是编程(coding)还是聊天(chat),本质上都是在训练模型去处理它未曾见过的事物,使其具备像人类一样的能力。
物理人工智能(Physical AI)也不例外,其核心挑战同样是泛化。在 Cosmos 项目中,我们试图从三个维度提供支持:第一,提供更优质的数据;第二,提供更好的起点;第三,构建更理想的环境。
关于数据,我们可以利用生成式数据,即合成数据(synthetic data)。数据是提升 AI 模型泛化能力的关键。试想,真实世界采集到的数据点总是有限的,我们能否生成一些人类尚未采集、但模型真正需要看到的数据?这就是更优质的数据。
更进一步,如果我们能训练出一个优秀的世界模型,让它理解世界的运作机制并预测未来发生什么,那么它自身的表示(representation)就会非常出色,从而为物理人工智能的策略模型(Policy Model)提供一个更好的自举初始化(bootstrap)。从这个起点衍生出我们所需的策略(policy),这就是更优质的起始点。
第三点涉及人类如何在物理世界中学习。人类只能通过实验和与环境的交互来学习。然而,与真实环境交互往往成本高昂,可积累的经验和时间都有限。如果我们能像《黑客帝国》中的矩阵(Matrix)那样,同时生成多个逼真的虚拟环境,让模型在其中交互并获取反馈信号,学习效率将大幅提升。这就是更理想的环境。
在这三个方向中,“构建更好的环境”最具挑战性。我本不想在网页上写得过长、像一篇论文(essay),所以便用了“黑客帝国”这个比喻。
张小珺:Cosmos 项目在内部具体是如何立项的?
刘洺堉:大约是在 2024 年 3 月决定启动该项目,也就是在 Sora(OpenAI 的视频生成模型)发布之后。
张小珺:说服黄仁勋(Jensen)的过程困难吗?
刘洺堉:那时已经不难了。此前说服他比较困难,但看到 Sora 之后就不难了。他很聪明,一眼就能看出这项技术对公司的影响。
他非常有纪律。有些东西即使很重要,他也会要求我们“放慢脚步”(pace your steps),不要急于求成。他擅长打持久战,会一步一步朝着目标前进。
张小珺:为什么之前时机还没成熟?
刘洺堉:先发优势(First mover advantage)确实有益,但每家公司的定位不同,取决于你们想解决什么问题以及如何获利。我缺乏足够的信息来判断具体哪家会胜出。不过,目前看来许多公司都做得很好,在视频生成(Video Generation)领域最赚钱的可能是字节跳动的 Seedance。因此,这条发展轨迹很难预测。直到 Sora 出现时,我们才觉得时机成熟了。
黄仁勋让我们想一个名字。那时我已经猜到最终他会提出更好的名字,本想拒绝以免浪费精力,但他坚持让我来构思。我觉得有道理,因为这个名称与产品定位息息相关。
你看,我们将其命名为 Cosmos(宇宙)。
我们的目标不是生成内容(content),也不是为了创作,而是为了解决物理世界的问题,逐步迈向物理人工智能(Physical AI)。
当时已经逐渐显现,物理人工智能将是下一场革命(revolution)。这是刚需:每个人都会衰老,每个地方都缺乏劳动力,每个人都渴望提升生活品质。
一方、メディアは開発者市場(developer market)に注力し、開発者がより優れた製品を作れるよう支援します。私たちが直接コミュニティサイトや創作ツールを運営することはありません。英伟达にとって、それは消費者向け(to C)の領域でありすぎます。そのため、私たちは物理 AI(Physical AI)の世界モデルを構築し、そのコミュニティを支えることに注力することを決断しました。
张小珺:今日、世界模型(World Model)の定義は依然として非常に曖昧です。あなたなりの定義をお聞かせください。
刘洺堉:私は実用性を重視するタイプです。なぜモデルを設計するのか?それは「使える」からです。使い道が違えば、モデルの姿も異なります。
一つ目は予測(predict)のためです。世界を記述するモデルを構築し、そのモデルを通じて次に何が起こるかを予測します。これが世界模型の一つの目的です。
二つ目は理解(understanding)のためです。「なぜこの出来事が起きたのか?」物理学そのものが世界模型を構築する営みであり、ニュートン力学から量子力学に至るまで、世界の仕組みを理解しようとするものです。
もちろん、ディープラーニング(Deep Learning)の文脈では、理解は「ラベル付きデータを用いてモデルに教える」形をとります。「この出来事が起きたのは、あの出来事があったからだ」という因果関係を学習させ、大量のデータで汎化能力を高めます。そうすれば、将来新しい出来事が起こった際、動画(video)という信号を通じてその理由を説明し、人間が状況を理解する手助けができます。例えば工場の生産ラインが突然止まった場合、過去の誰かが何かを開け忘れたことが原因かもしれません。これも世界模型の目的の一つです。「何が起きたのか」を理解し、「問題の原因は何か」を見つけることです。
三つ目は三次元世界の再構築(reconstruction)です。これは非常に有用で、ルートの計画に役立ちます。また、物理的な世界にいなくても、仮想空間の中でその世界を探索できる可能性を開きます。
用途が異なるため、モデルの姿も異なります。しかし、それらはすべて同じ世界を指しており、単に異なる視点から記述しているに過ぎません。再構築は重要な学問ですが、私は以前はそれをやっていましたが、現在は行っていません。現在、私が主に取り組んでいるのは、物理世界の理解(understanding)と生成、そして予測(prediction)です。
张小珺:世界模型(World Model)の定義が定まっていない状況は、数年前に AGI(汎用人工知能)の定義が議論されていた頃と似ていますね。
刘洺堉:その通りです。厳密な定義があるかどうかは重要ではありません。この言葉はあまりにも大きく、抽象的すぎます。定義したところで、人類にどのような影響があるというのでしょうか?
张小珺:では、なぜ LLM(大規模言語モデル)という言葉は明確なのでしょうか?
刘洺堉:LLM は「Large Language Model」の略で、モデルが巨大であり、言語を扱うものであることが明確だからです。
世界模型とは、この世界をモデル化(model)するためのツールです。用途が違えば、世界をモデル化する方法も異なります。世界やモデルに対する用途が異なれば、定義も異なるのです。
张小珺:あなたにとって、世界模型は「Cosmos」を記述できるのでしょうか?それとも、あなたが取り組んでいることをより正確に表す別の名称があるのでしょうか?
刘洺堉:当初、私たちは Cosmos を「World Foundation Model(世界基盤モデル)」と呼んでいました。
私たちの目標は、誰もが各自の用途に適した世界模型を構築できるような基盤(foundation)を作ることです。私たちは「Foundation Model」として位置づけ、より下層のインフラとして皆のニーズを満たすことを目指しています。世界模型を構築したい人であっても、私たちの Foundation Model を土台にすればよいのです。
张小珺:英伟达はまた、ヤン・ルコン(Yann LeCun)氏の AMI Labs と李飛飛(Fei-Fei Li)氏の World Labs にも投資しています。これらも世界模型に取り組んでいますが、你们は競合関係にあるのでしょうか?
刘洺堉:NVIDIA は「エンabler(支援者)」の立場に立っています。NVIDIA の GPU エコシステム(ecosystem)上で事業を展開するすべての企業が成功することを願っており、皆でウィンウィンの関係を築きたいと考えています。
各社が注目している点や解決したい課題は異なります。Fei-Fei 氏の World Lab と Yann LeCun 氏の AMI は異なるアプローチを取っていますが、私たちは両者を支援し、投資し、協力関係にあります。
もし他社が Cosmos に興味を持ってくれれば、ぜひ活用してほしい。世界モデルを必要とする企業は他にもあるが、フェイ・フェイ・リー氏やヤン・ルコン氏のような資金力を持つ会社ばかりではない。むしろ支援が必要なケースが多いだろう。そこで Cosmos を活用していただくことが可能だ。私たちが目指しているのは、この分野全体が成功することである。
张小珺:つまり、競合相手は存在するのですか?
刘洺堉:NVIDIA の真の競合とは、同じことをする企業、つまり AI エコシステム全体を構築しようとする会社のことだと考えています。しかし、私が Cosmos を推進しているのは、競合を意識して勝とうとしているからではありません。むしろ、このエコシステムをどう支援できるかに注力しています。
NVIDIA のエコシステム内で、当社の GPU や計算プラットフォーム、ソフトウェアを活用する企業がすべて成功すれば、それこそが NVIDIA の成功につながります。また、まだエコシステムに参加していない企業や関係者にも、自信を持ってもらう効果があります。
私はもう、「卒業のために論文を出版し、自分のアルゴリズムが他より優れていると証明しなければならない」という時期は過ぎています。今の目標は、この分野全体と共に発展していくことです。
04
Cosmos 3 について語る
「ルイ・ヴィトンが陳列品数を減らしたら売上が上がった」
张小珺:Cosmos 1 から Cosmos 3 へと進む間に、多くの技術的変化がありました。最初の二世代で得られたノウハウはありますか?
刘洺堉:あります。これは昨年の取り組みで、非常にスピード感を持って進めました。Cosmos を始めた際、私が強調したのは「迅速なイテレーション」です。当時、私は DeepSeek の影響を強く受けていました。驚異的な成長を見せる同社は、1 年間で 3 回のバージョンアップを行い、DeepSeek V3 を生み出しました。そのため、私も常に速度の重要性を訴えてきました。
しかし、私たちが取り組んでいるのは物理世界モデルです。特に 2024 年は、どのような世界モデルが誰にとって有益なのか、まだ明確ではありません。私が先ほど述べたのは、予測(prediction)か理解(understanding)かの二点です。動画モデルを使って未来を予測し、推論モデルを使って発生した出来事を説明する——それが私の考えの核心です。
当初はパートナー企業と協力し、彼らのニーズを理解するとともに、自らのアイデアも取り入れてモデルを作成しました。そしてパートナーと共にイテレーションを繰り返し、方向性を徐々に絞り込んでいきました。「未来を予測する」ことから始まり、シミュレーション環境が広く使われていることに気づきましたが、その生成動画は現実世界との乖離がありました。そこで、モデルを使ってよりリアルにする「転移(Transfer)」を実現しました。また、「発生した出来事を説明する」ために「推論(Reason)」も実装しました。この時点で三つの方向性がありました。
その後、ピクセルの変化を記述できれば、それは動作(action)の変化と非常に近接していると理解し、Cosmos Policy というポリシーモデルを開発しました。
さらに進んで気づいたのは、先ほど述べた通り、これは一つの世界だということです。どの角度から見たとしても、モデルが対象としているのは同じ世界です。つまり、モデルは世界の内部表現(internal representation of the world)を学習しているのです。この世界が圧縮される過程で、どのような表現方法を学ぶのか——それが本質です。
同じものを扱う以上、ファウンデーションモデルの核心概念である「海千山千(多様なものを集める)」という考え方が適用できます。あらゆるデータからそのパターンを学習できるのです。したがって、推論・予測・転移・ポリシーに使用するデータをすべて統合して訓練すれば、モデルの性能上限はさらに高まります。
第一に、同じ世界を記述していること。第二に、ファウンデーションモデルがそれらを統合していること。これら二点から、私たちは徐々に単一モデルへと向かっていきました。
その過程で、実装上の問題も浮上しました。最初の Cosmos を構築した際、自分で計算してみたところ、パートナーを本当に支援するためには、モデル A から F まで、あるいは G…と合わせて約 22 個のモデルが必要だと分かりました。
私はジェンセンに報告し、「22 個のモデルが必要になる見込みです」と伝えました。ジェンセンは私の真摯な姿勢を評価し、「非常に良く、かつ非常に難しい仕事だ」と評しました。
しかし、彼は続けてこう言います。「ご存知ですか?ルイ・ヴィトン(Louis Vuitton)の店舗が陳列する商品の数を減らしたところ、逆に売上が上がったのです。消費者を混乱させる商品が多すぎると、決断できなくなります。」
この話は私に大きな影響を与えました。
自分自身でさえ A と B のどちらを使うべきか迷っているのに、他者が明確に分かるはずがありません。さらに実行の難しさもあります。モデルが増えれば増えるほど、メンテナンスや問題解決が必要になり、リソースが分散してしまいます。モデルが多すぎると力が薄れ、イテレーション(反復)の速度も低下します。
Cosmos 2 の開発を進めながら、このやり方では長続きしないと判断し、単一のモデルで世界を記述する「World Model」、つまり Cosmos 3 の開発に着手しました。
张小珺:最大の変化は、Cosmos 2 から Cosmos 3 への移行で見られますね。
刘洺堉:はい。Cosmos 1 から Cosmos 2 への変化は主にデータの向上や、Parity(一貫性)の導入といった点にありました。しかし、Cosmos 2 から Cosmos 3 への飛躍は、その規模が全く異なります。
Cosmos 3 の開発は去年の 10 月に開始しました。ちょうど Cosmos 2 がリリースされた直後です。もっと早くから「3 を作る必要がある」とは分かっていましたが、当時は Cosmos 2.5 の仕上げに追われていました。2.5 の作業が完了した後に始めて、9 月頃に正式決定し、10 月と 11 月に本格的な実行に移りました。開発には半年以上かかりました。
张小珺:中国の世界モデルを構築する起業家がいます。彼は Cosmos 3 の論文を 1 週間、毎日読み込んだそうです。「技術的な大発明は多くないが、多くの詳細な工程検証が行われている」と評価していました。この見解は妥当でしょうか?
刘洺堉:Mixture-of-Transformers(混合 Transformer 構造)や Parity Model(一貫性モデル)といった概念自体は、以前から提案されていました。私たちは初めて、これらを Mixture-of-Transformers のスケールで巨大化し、audio(音声)、video(映像)、action(動作)をすべて統合したのです。概念的には「組み合わせる」だけですが、実際に実装するのは容易ではありません。その難易度を克服し、実現できたのがまさにこれらの詳細な工夫です。
すべての大規模言語モデルは Transformer 構造を採用しています。「誰も革新していない」と言うことも可能でしょう。しかし、こうした細部が、あるモデルを他のモデルよりも格段に優れたものにします。
年月を重ねるにつれ、私は「それがどれだけ効果を生むか」を重視するようになり、「革命的な独自性があるかどうか」にはあまりこだわらなくなりました。私にとって重要なのは、実用性があり、インパクト(影響力)を持ち、人々が解決したい課題を解消できるかどうかです。
この論文では、オープンソースコミュニティ全体と、Physical AI(物理的 AI)の発展に貢献したいと考えています。ここ数年、多くの Frontier Lab(最先端研究所)がクローズド化し、論文を書いても重要なプロセスを明かさなくなりました。私たちはあえて異なる道を選びます。可能な限り詳細を公開し、モデルやトレーニングフレームワークをオープンソース化します。一部のトレーニングデータも公開しました。
透明性を保ち、どのように作られたかを示すことで、他者が私たちのオープンソース成果を活用し、Cosmos に似たものを構築できるようにしたいと考えています。目標はコミュニティ全体をエンパワー(支援・強化)することです。誰かが同じようなものを作っても心配していません。
张小珺:先ほど DeepSeek について触れられましたが、オープンソース化の選択と関係があるのでしょうか?
刘洺堉:直接的な因果関係はありません。DeepSeek の取り組みは AI 全体に深い影響を与えています。彼らは初めて MoE(Mixture of Experts)をオープンソース化し、最近のモデルでは技術の限界まで押し上げました。この分野全体に大きなインパクトをもたらしています。その点で、私たちが目指す「影響力を持つこと」や「詳細を明かすこと」とは共通する部分があります。
しかし、私たちの目標は DeepSeek とは異なるかもしれません。私たちは利用者の成功を支援することに注力したいと考えています。
张小珺:Cosmos 3 の技術選定において、入力層で言語(language)、映像(video)、音声(audio)、動作(action)を同時に扱うという点に注目しました。これは重要な技術的決断だったのでしょうか?
刘洺堉:はい。世界は視覚だけでなく聴覚も持っています。触覚も加えたいと考えていますが、触覚信号はまだ扱いが難しく、Touch sensor(触覚センサー)の進化が急速です。これには巧みなハンド(ロボットハンド)と、それを動かすためのデータが必要です。
大規模モデルの設計思想には主に二つの方向性があります。
一つは言語を「ファーストクラス・シチズン(一等公民)」として扱うアプローチで、コーディングやチャットと同様に扱います。もう一つは動画がファーストクラス・シチズンとなる道です。Seedance や Google の Veo などがその例ですね。
私たちが考える Physical AI(物理的人工知能)のモデルと、デジタル世界のモデルとの決定的な違いは、物理世界におけるエージェント(智能体)が「アクション」を起こし、世界の状態を変化させる点にあります。
したがって、優れた物理世界向けのファウンデーション・モデルもまた、アクションをファーストクラス・シチズンとして扱う必要があります。だからこそ私たちは、言語、動画、音声、そしてアクションの四つを統合して「Cosmos 3」を構築したのです。
张小珺:楊植麟氏(Kimi の創設者兼 CEO)が昨年、「大規模言語モデルでは言語を最も重要な知能向上ツールと位置づけ、ビジョン機能の追加が知能を低下させ、"愚かな多モーダル" になることを懸念している」と話していたのを覚えています。しかし今年、謝賽寧氏(AMI Labs の共同創設者兼首席科学官)は、「言語がビジョンに汚染を与えるのではないか」と懸念し、言語こそが人間の足場であり本質ではないと述べていました。
この二つの考え方をどう捉えますか?これらを一つのモデルで訓練する際、相互の汚染問題は生じないのでしょうか?
刘洺堉:これらの信号(モダリティ)をすべて取り込むには、それぞれ明確な目的があります。言語は人間の知識を持ち込み、人間と Physical AI を対話させるために必要です。動画は膨大な視覚情報を含み、世界がどのように機能しているかを記述します。この世界の物理的な動作をより正確に捉える(capture)ためには、言語を使うよりも動画の方が適しています。
しかし、最終的にモデルを作る目的は人間に奉仕することです。言語を理解できなければ人間との対話は成立しません。また、モデルの役割が機械にアクションを起こさせて世界を変化させることにあるなら、アクションを知らなければその目的は達成できません。
私たちの目指すところは異なります。私の目的は、Physical AI 用の優れたファウンデーション・モデルを作ることです。それは言語を理解し、物の動き方を把握し、そしてアクションを通じてそれを制御(control)して統合する必要があります。
私の目標は AGI の追求ではありません。AGI そのものを定義すること自体が困難です。もし AGI を「人間の本性を解明する」ことや「コーディングを行うこと」と純粋に定義するのであれば、視覚信号の影響を受けるのは必然でしょう。
遠い過去には言語が存在せず、人類の文明は世界の変化を観察することで発展しました。言語はあくまで人間のために発達したものです。しかし、機械がその仕組みを受け入れるかどうかは分かりません。もしかすると、動画信号から直接世界の成り立ちを学び、別の知能(intelligence)を発展させ、別の文明を築くことも可能かもしれません。その視点に立てば、言語信号は一種のノイズ(干渉)になり得ます。つまり、何を求めるかによって答えは変わるのです。
私が明確に求めているものはこれです:人間が Physical AI と対話できるために言語が必要であり、物理世界の変化から物理の本質を学ぶために動画と音声が必要であり、最終的に目標を達成(fulfill a goal)して世界を変化させるためにアクションが必要です。
张小珺:すべてのモダリティを融合させたとき、これらは互いに利益をもたらす(benefits)のか、それとも相互に制約し合うのでしょうか?
刘洺堉:過去一年、あるいはそれ以上の期間、私たちはこれらのモダリティの融合について研究を続けてきました。さまざまな研究から得られた手がかりを踏まえ、Cosmos 3 ではこれらを統合しました。
Cosmos Policy の研究において、動画と行動を統合することで行動予測が向上することが分かりました。世界動作モデル(World Action Model)として直接行動を予測する際、単に「どの行動を取るべきか」だけでなく、「その行動後に生じる状態や観測結果」も同時に予測させることで、学習の精度が高まります。つまり、動画生成は行動予測にとって有益な要素なのです。
音声も動画生成を支援します。「カチッ」という音から接触の瞬間が特定できるように、音声と動画は互いに補完し合う関係にあります。
一般的にテキストから動画を生成するプロセスでは、情報量が膨大になり、可能性のバリエーションが増えるため学習が難しくなります。そのため、文章による記述が詳細であればあるほど、高品質な動画が生成されやすくなります。言語情報の活用もまた、動画生成を助ける要因です。
Cosmos 3 では、これまでの Cosmos Reason(推論)、Cosmos Predict(予測)、Cosmos Transfer(転移)、Cosmos Policy(ポリシー)の各モデルを統合します。これらを一つにまとめることでシステム全体が簡素化され、メリットが生じます。これらの信号を互いに競合させるのではなく補完し合うように統合するには、実験設計(experiment design)やデータ比率(data ratio)の調整によって実現可能です。私たちはこの方針に確信を持っていました。
これらすべての信号は同じ世界を記述しており、その世界の動作原理に関する情報を含んでいます。それらを相互に協力させ、より多くの情報を活用することで背後にあるメカニズムを理解できるはずです。こうした信念に基づき、私たちはこの方向へと研究を進めました。
张小珺:ここには何らかの「秘密のレシピ(secret sauce)」があるのでしょうか?特に、互いに良い影響を与え合う点についてお聞きしたいです。
刘洺堉:大規模モデル開発に特別な秘訣はありません。仮説に基づいて厳密な実験を繰り返し、結果を確認し、知識を蓄積しながら次のステップへと着実に進むだけです。隠された秘密などなく、重要なのは「何を追求するか」であり、それを耐心強く実験と検証によって確かめていくことです。
张小珺:今回は双塔(tower)アーキテクチャを採用されましたが、一つは離散情報を処理し、もう一つは連続情報を処理する設計です。なぜこのような構成を選ばれたのですか?
刘洺堉:いくつかの理由があります。まず、Cosmos Reasoning(推論モデル)は視覚言語モデル(vision language model)を出発点としており、離散的なアプローチを採用しています。一方、予測転移ポリシー(predict transfer policy)は連続的な処理を必要とします。私たちは「理解には離散型が適し、生成には連続型が適している」と考えており、これらを組み合わせることは現時点で最も合理的な選択だと判断しました。
さらに、Cosmos の活用方法は多岐にわたりますが、一般的には後学習(post training)の形で利用されます。例えば、動画と行動のペア(video action pair)を用いて生成器(generator)を訓練したり、推論機能のみを利用するために自分野の理解データでモデルを微調整したりします。
もしすべての機能を一つのモデルに統合してしまうと、生成能力と理解能力が強く結びついてしまいます。その場合、生成分布(generation distribution)を変更しようとしても、モデル全体が連動するため、理解側の性能も同時に変化してしまいます。双塔構造を採用しない場合、理解側の調整が必要になっても関連するデータが存在せず、その能力が失われやすくなります。これはユーザーにとって使い勝手が悪い状況です。そのため、機能を分離した二つの塔を設けることで、実用上の柔軟性を確保しています。
確かにこの設計は「エレガント(elegant)」とは言い難いかもしれません。アーキテクチャを事前に固定し、データの関係性によって依存構造が形成されるため、人為的な区切りが必要になるからです。しかし、現状ではこの構成が最も合理的であり、実用面でも優れていると考えています。
この点から推測できる通り、私たちの次の目標はさらにシンプル化することです。なぜ二つの塔が必要なのか?将来的には一つの塔で十分となるはずです。
しかし、一つの統合モデルへと進化させる際、重要なのはユーザーが実際に使いこなせるかどうかです。私たちの目標は、自分たちだけで何でもできる万能モデルを作ることではなく、皆が勝てるよう支援することにあります。
ロボットや自動運転車はそれぞれカメラの数や配置が異なり、個体差があります。そのため、技術的に完璧な統合を目指すあまり、ユーザーが実際に活用できるかという視点を欠いてはいけません。これが私たちが取り組むべき課題です。
张小珺:相対的に見ると、離散信号の方が扱いやすく、それを連続変数に融合させると処理難度が高まります。両者をどう組み合わせ、さらにスケール(大規模化)させるのでしょうか?
刘洺堉:その通りです。現在では Transfusion(融合モデル)のような一連の取り組みがあり、離散データと連続データを同時に扱えるようになっています。次期トークンの予測(next token prediction)には離散アプローチを、拡散(diffusion)プロセスには連続アプローチを採用し、これらを一つのアーキテクチャで統合しています。
この分野では現在、さまざまなバリエーションが研究されており、誰もが関心を持つ共通の課題となっています。
信号は離散的な表現でも連続的な表現でも扱えます。理想としては、すべてを離散にするか、あるいはすべてを連続にするようなアーキテクチャを開発し、処理をシンプルにしたいものです。ただしこれはまだ実現可能な未来像であり、成功するかは未知数です。一つずつ実験を重ねて検証していく必要があります。
张小珺:直感的には、すべてを離散にする方が簡単でしょうか?それともすべて連続にする方が簡単でしょうか?
刘洺堉:それぞれにメリットがあります。離散は学習が容易で、連続は美的な側面があります。推論(inference)の段階では、両者の形態(shape)は大きく異なります。最も重要なのは、実際の導入コストです。最終的には、どのモデルが最も効率的にデプロイできるかによって選択が決まります。
张小珺:ある研究者から質問がありました。「現在、すべてのモダリティを一つのモデルで学習させていますが、理論上はプログラミングも得意にしつつ、ロボットの運動制御やクリエイター向けコンテンツ生成も可能になるはずです。では、単一のドメイン(例えばプログラミング)において、Claude よりも優れた性能を発揮できる可能性がありますか?」
刘洺堉:私は『孫子兵法』の「備多則力寡」という言葉が好きです。
すべての分野で優れようとするなら、学習中は幅広い知識を身につけ、さまざまなカテゴリに触れる必要があります。しかし、特定の用途に特化したいのであれば、戦略的な調整も可能です。他の機能にはこだわらないことで、あえて捨てるべきものがあるからです。すべてを手放さなければ、戦いは過酷なものになります。
戦略の本質は、何を捨てて何を維持するかを決めることにあります。
张小珺:モデルが簡素化され、二つの塔が一つの塔に統合されること以外にも、将来のモデルで期待できる変化は何でしょうか?
刘洺堉:私たちは、このモデルが Physical AI の構築者(builder)をどう支援できるかに注力しています。
一般化(generalization)はあらゆる AI における核心的な課題です。物理世界における AI において目指すべき一般化とは、例えば「今日、私が服の折り方を一、二度見せるだけで、ロボットが現実に即して素早く学習できるか」「物理的な知能体がマニュアルを読めば、機器の操作方法や工場の検査手順を理解できるか」といった能力です。Cosmos モデルには、こうした一般化能力を高める要素を取り入れていきます。
私はディープラーニング(Deep Learning)が中医に似ていると感じます。試行錯誤の中で詳細な実験記録を残し、その中から法則性を見出すのです。このプロセスは非常に興味深いです。厳密な実験設計、変数の制御、そして重要な結果の抽出——これらがモデルを反復改善する上で不可欠なステップです。
张小珺:別の研究者からは、「言語表現の比重をもっと大きくすべきではないか」という意見もあります。LLM が知能向上の鍵だと考える方々もいます。この点についてどうお考えですか?
刘洺堉:初期の画像生成研究、例えば Google の Imagen においても、「言語理解が強ければ、より大規模な T5(テキストからテキストへの変換モデル)を使用することで、画像生成能力が向上する」という提唱がありました。私はこれを支持します。より強力な意味表現(semantic representation)を用いることは、間違いなく有益です。
Physical AI の応用は、一般的なプログラミングやチャットとは異なり、実験による検証が必要です。私が目指しているのは、真の課題(ペインポイント)を把握し、そこからモデル能力を補強する適切な方法を見つけることです。特にリソースが限られる中で、どのように優先順位をつけていくかが大きな挑戦となります。
「備え多ければ力寡なし」という言葉がありますが、先人の知恵はやはり役立ちます。
张小珺:世界モデルには現在、効果的な評価手法が不足しています。貴社では何か良い取り組みがありますか?
刘洺堉:世界モデルも大規模言語モデルも、より優れた評価・検出方法を追求しています。
モデルの評価には 3 つのステップがあります。まず一つ目はベンチマーク(benchmark)です。固定されたデータセット(dataset)を用意し、その上でモデルの品質(quality)をテストします。二つ目はアリーナ方式(Arena style)で、A と B を比較してどちらが優れているかを見極めます。三つ目は専門家(Expert)の指導のもと、実際に課題を抱えている現場で問題を解決するアプローチです。これら 3 つはすべて重要です。
Physical AI の分野では、特に 3 つ目のアプローチが重要になります。Coding Agent は皆、プログラミングやデジタル領域の問題に取り組んでいますが、物理知能が扱う問題はそれぞれ異なります。そのため、モデルが本当に役立つかどうかを評価するために、協力パートナーと連携して課題を理解することが、モデルの発展を導く重要な一歩となります。
张小珺:その他にも、物理世界におけるデータ収集は大きな難題です。
刘洺堉:物理知能では各ロボットの形状が異なるため、物理的な設定(Physical setup)なしにはデータを収集できません。英伟达にとっては特に困難で、あらゆる物理知能のデベロッパーをサポートするため、個々のロボットの違いに対応する必要があります。私たちが目指すのは、最も共通性が高い部分を見つけることです。
物理知能のデータは主に 2 つに分類されます。1 つはナビゲーションデータ(navigation data)で、A から B への移動に関するものです。もう 1 つは操作データ(manipulation data)で、手やツールを使って目標を達成する方法に関するものです。
ナビゲーションデータの収集は比較的容易です。運動学に基づいた動き、車の挙動、ロボットの動作などはすべて収集可能です。ロボット A と B が異なっていても、空間内での移動や回転という点では共通しています。
操作データはより複雑です。最近の傾向として、人間の手に近い形状を持つアームを追求するケースが増えています。
その理由は、人間の世界は人間のために作られており、多くの道具が人手で操作できるよう設計されているからです。AI には大量のデータが必要ですが、データ入手が容易であれば、より早く突破できる可能性が高まります。そのため、データの収集主体も人間であり、人間の手が中心となります。現在、業界全体が人手に近い形状へと向かっています。
Cosmos 3 では、第一人称視点(ego-centric)のデータを特意に追加しました。これは、人間の目がどのように対象を見ているか、第一人称からの視点、そして手がその物体をどう操作するかを含んでいます。私たちの目標はロボット自体を作ることではなく、皆が優れたロボットを作れるよう支援することです。そのため、最も汎用性の高い要素を探求しています。第一人称視点(ego-centric)は非常に重要です。
张小珺:あらゆる制約や限界がある中で、英伟达が世界基盤モデルにおいて顕著な優位性を持っていると言えますか?
刘洺堉:英伟达では GPU 演算のコストが比較的安価です。というのも、私たちが GPU を製造しているからです。さらに、Physical AI の分野には長年の深耕があります。Thor チップや Isaac シミュレータといったツールを備えており、これらを組み合わせることで、多様な物理知能デベロッパーのニーズに応えるためのツールを提供しています。
もう一点、私たちは他社が成功することを心から支援したいと考えています。
私たちが提供できるサービスは明確です。顧客は、私たちが同じものを複製して競合を排除するのではなく、協力関係を築くことを望むため、私たちと連携することに前向きです。それが私たちの目標ではありません。
张小珺:Cosmos シリーズのモデルに対して、今後どの程度の GPU カードやリソースを投入される予定ですか?
刘洺堉:常に向上を目指しています。カード数の具体的な数字をお伝えできるかどうかは不明ですが、すでに万単位に達しており、さらに増やすことを目指しています。
张小珺:Cosmos 3 でご満足いただいている点と、残念に思っている点はありますか?
刘洺堉:ご満足いただいている点は、過去すべてのモデルを統合し、それ以前のどのモデルよりも優れた結果を出せるとお伝えした際、それが実現したことでした。当時は多くの人が信じませんでしたが、その結果に大変嬉しく思います。
2 つ目は、これまで別々に構築していた複数のモデルを統合し、単一のモデルとして作り上げた点です。この大規模な組織を一体としてまとめ上げ、一つのモデルを完成させたことに私は誇りを持っています。
残念なのは、モデルのさらなる向上余地があるにもかかわらず、時間制約のため完全な収束に至る前にリリースせざるを得なかったことです。修正したかった箇所もまだ残っています。しかし幸いなことに、3.1 や 3.2 のアップデートで、それらの改善点を追って実装していく予定です。
张小珺:ジェンセンが語る「Cosmos 97」の実現像を想像したことはありますか?
刘洺堉:「97 代」という言葉を聞いた時、私はこのモデルを最後までやり遂げ、完成させるという決意を感じました。これは大きなコミットメント(約束)です。なぜなら、この種のモデル開発には莫大なリソースが必要だからです。
世界モデルとは、究極的にはこの現実世界そのものに近づいていくものです。そのモデルを通じて、私たちが現実世界で学びたいことを学習できるのです。最も近い未来像としては、いつでも《黑客帝国》のマトリックス(Matrix)を構築できる能力を持つことです。それが最終的な到達点です。
もし半年ごとに世代が進むなら、40 年以上かかる計算になりますね。しかし AI の発展は極めて速く、もしかしたら 40 年など必要ないかもしれません。
05
《黑客帝国》について語る
「苦痛と苦難こそが、人類を前進させる原動力である」
张小珺:あなたはロボットのために《黑客帝国》のような世界を構築しようとしています。映画《黑客帝国》では、人類は機械の生体電池として仮想世界マトリックスに囚われ、目覚めた一人の人間がその運命から抜け出し、循環を終わらせようとします。
あなたがロボットのためにマトリックスを作っているなら、いずれロボットが目覚めて仮想世界からの脱出を図った場合、どうなるのでしょうか?
刘洺堉:私が《黑客帝国》という比喩を使ったのは、世界モデルが学習の加速にどれほど劇的な効果をもたらすかを具体化するためです。多くの人々は AI の能力が強くなりすぎれば「世界を乗っ取る(take over the world)」や「人類を抹殺する(eliminate)」のではないかと懸念しています。しかし、社会は人間によって築かれたものであり、その背後で技術を支えているのも人間です。皆が共通の認識を持っていれば、そのような事態は起こり得ません。
さらに哲学的な視点から言えば、苦痛(pain)と苦難(suffering)こそが人類を前進させる鍵だと私は考えています。チップで作られた知能(intelligence)にも同様の「苦痛」や「苦難」があるかどうかについては、私自身も確信を持っていません。もちろん、技術によって人間の生活を劇的に改善したいと考えており、そのために適切なガードレール(安全装置)を設け、現実世界の発展を阻害しないようにする必要があることは承知しています。
张小珺:あなたは常に「私は誰かの競争相手ではない」とおっしゃっていますが、世界モデルに取り組む他のチームからは依然としてライバル視されています。彼らに伝えたいことはありますか?
刘洺堉:世界モデルは問題を解決するためのツールです。世の中には多様な課題が存在し、物理的な知能に関する問題はその中でも特に困難です。もし私たちが協力して、私が開発した技術を活用すれば、より速く、より遠くへ進むことができるはずです。それは決して
原文を表示
原创 张小珺 2026-08-13 11:33 上海
image
Cosmos、世界模型与中国武术。
image
作者:张小珺
每次见到刘洺堉,他都穿一件黑色夹克,背着一个有点旧的斜挎包。
现任英伟达研究副总裁的刘洺堉,是英伟达第一位从研究员擢升至副总裁之位的管理者,他领导英伟达最重要的模型项目之一——世界基座模型Cosmos。
刘出生于中国台湾,是金庸小说爱好者。18岁起,刘洺堉就师从著名的武术家徐纪(神枪李书文一脉传人),练习中国功夫,一直至今。最近他又有了一个ice plunge(冰水浴)的新嗜好。凌晨4点多,刘洺堉起床后会依惯例进行武术训练:一个人蹲桩、打拳。做完全套后,再只身跳进冰桶,帮助身体修复。
这种锻炼习惯与我对刘洺堉的印象截然不同——他看起来谦和,说话音量也不大。“中国武术最重要的是控制自己。”刘洺堉说,“我并不是为了展现强大的破坏能力。”
某种程度上,这反映了他以及他所代表的英伟达这样巨型的基础设施型企业的竞争观。
访谈中,他反复强调,他没有任何竞争对手,他没有和任何人竞争,所有人都可以是合作伙伴。
“什么叫战争呢?我没有打算把别人杀死。”刘洺堉说,“我们的心态不是说想把别人给杀死,我们的心态是我们要怎么去造市场。你懂我意思吗?”
“Jensen(英伟达创始人兼CEO黄仁勋)经常说,要造市场,而不是存量竞争。他讲我们就要做zero-billion-dollar business(从零到十亿美元的业务)——你可以不赚钱,但当这个生意成功的时候,必须是很influential(有影响力)的。不能说满足每年赚100个million(1个亿)——这种scale(规模)对很多公司都很大,但对英伟达而言,这是一个distraction(分心)。”刘接着说,“你要去解最重要的问题,产生最大的贡献。”
英伟达正在“造”的市场,即面向物理世界的人工智能(Physical AI),世界基座模型Cosmos被寄予厚望。这个项目从2024年立项,经过两年多已发布至Cosmos 3。Cosmos直属团队不到100人,虚线汇报规模是200至300人。黄仁勋对刘洺堉表达战略决心,称:“你就做到Cosmos 97。”
如今,刘洺堉已在美国生活20年,在英伟达工作10年,他仍然用一些朴素的东方智慧进行技术表达——比如,他把大模型比作中医,时常援引《孙子兵法》“备多则力寡”来思考世界模型的技术趋势。
本次访谈,我们详细地聊了聊Cosmos系列(尤其是前不久发布的Cosmos 3)、世界模型、物理世界的人工智能、英伟达的竞争观、组织哲学,当然还有绕不开的黄仁勋。
完整版可以收看我们的视频播客,你可以在小宇宙、Bilibili、小红书、抖音、视频号等全平台收看。
以下为访谈节选。
01
谈竞争
“我没有打算把别人杀死”
张小珺:你说,“模型竞争不应该是鱿鱼游戏”(《鱿鱼游戏》,比喻零和生存竞争)。你指的是,大模型竞争不是鱿鱼游戏,还是世界模型竞争不是鱿鱼游戏,还是说,只是对于你来说不是鱿鱼游戏?
刘洺堉:如果大家想解的东西一模一样,那就是鱿鱼游戏。模型竞争不应该是鱿鱼游戏。世界上要被解的问题这么多,可以提供价值的东西这么多,每个人喜欢的东西又不太一样。我觉得不应该把它看成鱿鱼游戏。
张小珺:每个公司都需要训一个自己的大模型吗?
刘洺堉:如果是commodity(通用商品),你每家公司要建电厂吗?就看合不合经济效用。早期你要做汽车工厂,当电厂不充裕的时候,你盖个电厂,可以确保你公司是24小时运行。但现在这时代,你可能不需要了。
AI开发者每个都觉得我的模型最好。我觉得这东西在历史上从来没发生过。因为人跟人相处没那么容易的。你看当初Dario Amodei(Anthropic创始人)跟Sam Altman(OpenAI CEO)就是合不来,对吧?他就走了。你确定在Anthropic每个人的信念都一模一样?我不觉得。莫非哪天你升了A不升了B,B会不会带一群人走,去做个类似的东西?
大家都能做,你有决心、有资源,你是可以做的。
张小珺:模型这场竞赛的终局可能是什么样?
刘洺堉:我讲这就很controversial(有争议)。模型的能力慢慢会统一,靠模型自己不会是区分,一定要靠一些其他东西组织在一起。
领先的模型有更充裕的时间找到这个区分方式,强大的公司也可以加大自己强大的ecosystem(生态系统),来做出一些变化。
像Software(软件)刚出来,会写Software的公司很少,现在大家都会写Software,现在能活下来的Software公司都有自己的区分方式。没有理由模型会是不一样,我觉得会是一样。
张小珺:在你看来,没必要神话模型或模型公司是吗?
刘洺堉:我把它当成中医啊。就是一个Black box(黑箱),这么多人不同尝试,之后就是一套学问,很多人都会从医嘛。关键是你要拿它干什么。
有些人解读比较深一点,有些人需要多一点时间。这是我的臆测。我觉得这些东西慢慢会diffuse(扩散)。
张小珺:对于你们来说,Cosmos所在的世界模型战场,是一场不能输的战争吗?
刘洺堉:如果有其他公司也做开源模型,就不是。什么叫战争呢?我没有打算把别人杀死。
张小珺:就是,我必须要own(主导)这个赛道,其他人长在我的生态上面。
刘洺堉:Physical AI(物理人工智能)是一个重大市场。现在家家户户都没有机器人,如果有机器人的话,我家可能会买两三个,每个机器人需要算力,等于整个世界对算力的需求大幅增长。这个事情如果发生,对NVIDIA是巨大好处。
我们的心态不是说想把别人给杀死,我们的心态是我们要怎么去造市场。你懂我意思吗?
CUDA(英伟达的并行计算平台和编程模型)就是造市场,造出了现在的AI市场。我们想的是怎么造出下一个大市场。
张小珺:那世界模型是不能输的战场吗?
刘洺堉:我觉得也不是,因为是全新的东西。我没有跟任何人竞争。
共利嘛——带着大家一起把那个市场建出来。你卖机器人赚钱,你做卡也赚钱,当然会有公司研发芯片,也会赚钱。整个市场就起来,原本是nothing(什么都没有)。
Jensen经常说,要造市场,而不是存量竞争。他讲我们就要做zero-billion-dollar business(从零到十亿美元的业务)。什么叫zero-billion-dollar business?就是现在不是个business(业务),但以后成功会变成billion(十亿美元级)。如果现在已经有人在做,可能就不值得做。
我们做东西需要make impact(产生影响)。Jensen喜欢zero-billion-dollar business——你可以不赚钱,但当这个生意成功的时候,必须是很influential(有影响力)的。不能说满足每年赚100个million(1个亿)。这种scale(规模)对很多公司都很大,但对英伟达而言,这是一个distraction(分心)。
你要去解最重要的问题,产生最大的贡献。
张小珺:这是一种拥抱风险,还是一种de-risk(降低风险)?
刘洺堉:我们做事的方法很risky(有风险)。CUDA那时候是很risky的一件事,等于赔本在卖。我们因为装了CUDA,整个GPU价格都比别人高,同样的Flops(浮点运算次数)就是比别人高,因为我们要支援programmability(可编程性)。
不做这件事,你的东西就渐渐变commodity(通用商品)。
02
谈边界
“希望具备number one的能力,但做出对世界贡献最大的事情”
张小珺:在英伟达从一名研究员升至VP,这个多见吗?
刘洺堉:我可能是第一个吧。
张小珺:你在英伟达的职位是“研究副总裁”,能不能给大家介绍一下这个职位、团队和管辖范围?
刘洺堉:我现在是研究副总裁,也是Cosmos Lab副总裁。我们团队由研究员和工程师组成,直属我这的有八九十人。
另外还有其他团队也在做Cosmos,英文叫dotted line(虚线)。虽然他们不直接向我汇报,但我是整个mission的overall pic(任务的总负责人),是发号施令的人。
整个做Cosmos的应该有200到300人之间。这是在英伟达很重大的一个专案。
张小珺:研究员和管理者的天性,某种程度是相悖的。你在成为管理者的道路上,有没有抑制一部分研究员的天性,带着镣铐跳舞?
刘洺堉:我还是一个研究员。常常读论文。我最担心在成为管理者的历程中跟底层脱钩,不理解问题核心所在。我会强迫自己审阅(review)代码,读paper,跟大家辩论,来确保方向是对的。
跟我共事的人都知道,我可能是少数还继续看代码的VP,继续会纠细节。我只是希望自己一直stay grounded(脚踏实地),看清楚一切。
张小珺:做出Sora的研究员之前就在你的团队实习。我听说Sora没有出自你的团队,让你很遗憾,是吗?
刘洺堉:也不是遗憾,我感到很开心,自己曾经一起共事过的人可以做出这么大贡献。
但一方面也会反思,我的决策中,哪些地方我没有看对,导致我没有在正确的时期做出正确的事情?——我是一个很喜欢自我反省的人,往往会试图理解怎么样让自己更好。
张小珺:说到Sora,为什么OpenAI后来把这条产品线基本上关掉了?
刘洺堉:Sora是一个重大的研究工作,它本身有许多应用。OpenAI是一个很有野心的公司,他们有大量人才。Sam Altman从他早期在Y Combinator就是一个投资者,他希望有这种投资者心态,希望公司内部有各式各样的project,有些project非常成功,有各式各样的portfolio。
过去一年,他们受到Anthropic巨大的竞争压力。他们看到Anthropic在Coding Agent上产生了巨大的经济效益,跟ChatGPT聊天产生的token数可能最多1分钟就生成完了,但Coding Agent可以工作24小时、48小时,这个token量非常大。他们觉得这是一个很好的方向,集中公司精力往Coding方向走。
《孙子兵法》讲“备多则力寡”。大家的资源是有限的,他们重新调整资源往Coding发展。
我不觉得他们认为Sora不是一个好的work,只是在这个时间点,他们公司有更重要的事必须要做,必须做出一个不容易的决定。
张小珺:像Anthropic、OpenAI这种前沿实验室,做研究天经地义,这就是他们的产品;但英伟达是基础设施公司,我卖算力给这些公司、实验室就好了,为什么还要自己做研究?
刘洺堉:基础设施要做得好,“做得好”的定义是适合应用公司来用。如果你自己不做这些应用,根本不能理解他们需要的。所以要去走他们可能会走的路,从中理解。
设计芯片、设计电脑架构的周期很长,不能马上改,需要很长一段时间规划。你要做这方面的研究,去理解什么是重要问题要解,才能设计出更好的芯片、更好的infrastructure(基础设施),来满足AI大公司。
我总觉得,如果每个有理想、有抱负的人都有这个工具,可以做出他们想做的事,这世界会是一个更好的世界。一方面看到OpenAI、Anthropic,还有中国几家大公司做出的突破,非常开心。但我们这个社会有源源不断有抱负的年轻人,我们也希望他们有机会。这是英伟达做开源模型的原因。
张小珺:你们的研究成果会跟客户有竞争关系吗?
刘洺堉:我们做这些,尤其是开源模型,基本是免费,放在网络让大家都可以运用。实际真正要落地、满足客户需求,还有很多东西要做。尤其在具身领域,好多硬件、商业问题必须要解。
我们给community(社区)一个讯号:我们从1代做到2代、2.5代、3代,这样一代代做下去,让大家更加预期英伟达在这会一直投资、进步。大家有这个信心,就可以把资源投在更重要的刀口上,做出重大贡献。
再有钱的公司,资源都是有限的。具身这么难,这么多东西要解,我们做出这些模型帮助他们分担部分压力——我不觉得在竞争,是帮助大家成功。
张小珺:你作为一个研究员,本能想做出number one(第一)的模型;而因为英伟达本身业务的原因,它不想成为客户强劲的竞争对手。如果两者发生了冲突的话,你会选择哪个?
刘洺堉:科学发展本身就是incremental(渐进式的),一直在进步,你随时随地都可以提出improvement(改进),往上再走一步。我觉得be the absolute number one(成为绝对的第一),什么叫number one?这很难去定义。我比较喜欢说是一个frontier(前沿)的模型吧。frontier的模型做出来的那一刻是number one,很有成就感,但之后就会有其他的模型可以做上去。
我是希望,你具备做number one模型的能力,但是做出对社会影响最大、最有贡献的事情。你可以做出number one的模型,但你只给少部分人用,或者让权力过度集中在少部分人手里,产生不平衡状态,不见得是一件对的事。
我是希望具备number one的能力,但做出对世界贡献最大的事情。
03
谈Cosmos
“我问Jensen要不要继续往下做,他说,你就做到Cosmos 97”
张小珺:你接下来长达10年,也许重中之重的一个课题就是世界基座模型Cosmos?
刘洺堉:对,我们整个组只有一个project(项目),就是Cosmos。做完Cosmos 1,我问Jensen要不要继续往下做,他跟我说:“你就做到Cosmos 97。”
我现在才做到3,所以还有94代可以走。
张小珺:为什么不是100,是97?
刘洺堉:数字是随口说说,但他的决心展现在数字上面。他认为这是一个重要方向,希望我们可以继续专注,去做Physical AI的foundation(基座),帮助整个领域往下走。
张小珺:为什么你们当时要立一个非常重要的项目,没有选择最主流的大语言模型,也没有选择像Sora这样的多模态模型,而是选择了具身的世界模型?
刘洺堉:大语言模型在当时发展得非常好了。我的背景不是大语言模型,是Computer Vision(计算机视觉)出身,自然而然一直在media、video徘徊。跟着我一起合作的伙伴也都是类似背景,背景决定了自己的道路。
NVIDIA也有大语言模型团队,Nemotron也越做越好,我这边主要想解一些更适合我来解的问题。
Sora当初出来也是一个World Simulator(世界模拟器),但那时主要应用偏创作,创作非常有趣,每个人都希望用更好的方式讲故事、呈现想法,就是具象化,帮大家理解看到的世界,这是很好的应用。
但那时我们也看到,Digital AI(数字人工智能)发展极快,同时社会很多问题需要physical tool(物理工具)满足。
比如,人年纪大就没法开车,生活品质降低很多,如果有自动车,年纪大的人还是可以有mobility(行动能力)。还有很多工作非常劳力密集、非常危险,如果有Physical AI的robot(机器人)可以帮忙做,可以改善人的生活。家里总是一堆琐事,要收碗筷、整理,不见得是你在家最想做的,有机器人可以帮忙,提升人的生活品质。
我们看到World Model(世界模型)可以对Physical AI产生贡献,就往Physical AI方向走,而不是走Content Creation(内容创作)路线。
张小珺:你在个人主页上说,你一直被一个愿景驱动,就是“为机器人构建一个黑客帝国”。能不能阐释一下这个愿景?
刘洺堉:我认为世界模型可以帮助Embodied AI(具身智能)做到generalization(泛化)。任何AI要解的问题都是泛化问题:能不能在训练数据之外也表现得很好?在coding(编程)、chat(聊天)里,都是训练模型去解它没看过的东西,变得像人一样。
Physical AI也不例外,要解的就是泛化。在Cosmos,我们想从三个点来帮忙:1、提供更好的数据;2、提供更好的起始点;3、提供更好的环境。
数据方面,你可以用生成数据,也就是synthetic data(合成数据)。数据是帮助AI模型更泛化的关键。你可以想象真实世界看到的数据只有这么多点,你能不能生成一些你需要看到、但真实世界没采集到的数据?这是更好的数据。
进一步,如果你可以训练出一个好的世界模型,它理解世界怎么运作、能预测未来发生什么事,那它本身的representation(表示)就不错,可以给Physical AI的Policy Model(策略模型)提供一个更好的bootstrap(自举初始化),从里面衍生你想要的policy(策略)。这是更好的起始点。
第三,人怎么在物理世界学习?只有实验、跟环境交互。但跟真实环境交互往往很贵,能累计的经验、时间有限。如果你可以用《黑客帝国》的Matrix(矩阵)方式,同时产生多个真实无比的环境,跟它交互、获得讯号,你就可以学得很快。这就是更好的环境。
三个里面,最具挑战的是更好的环境。我总不想在网页写得太长、像一篇essay(文章),所以用“黑客帝国”这个说法。
张小珺:Cosmos在内部具体是怎么立项的?
刘洺堉:大概2024年3月决定要做,就是在Sora(OpenAI的视频生成模型)之后。
张小珺:说服Jensen的过程难吗?
刘洺堉:那时已经不难了,之前要说服比较难,看到Sora之后就不难。他很聪明,一看就知道这东西对公司的影响。
他很有纪律。有些东西即使很重要,他也会叫你“pace your steps”(放慢脚步),让你不要急。他擅长打马拉松战,会一步一步往目标前进。
张小珺:为什么之前时机还没到?
刘洺堉:First mover advantage(先发优势)有好处,但每家公司定位不同,取决于你想解什么问题、怎么获利。我没有足够资讯来判断。但你看现在很多家公司都做得很好,做Video Generation(视频生成)最赚钱的应该是字节Seedance。所以这个轨迹很难说。到Sora的时候,我们觉得时机到了。
Jensen叫我们想名字。我那时已经知道最后他会提出更好的名字,有点拒绝,不想浪费力气想。但他坚持要我去想。我觉得有道理,因为这个名词跟产品定位相关。
你看我们叫Cosmos,是一个宇宙。
我们的目标不是产生content(内容)、不是为了创作,而是为了解物理世界的问题,慢慢往Physical AI前进。
那时已经陆陆续续看得出来,Physical AI会是下一个revolution(革命)。这是刚需:每个人都会老化,每个地方都缺劳动力,每个人都想提升生活品质。
另一方面,media(媒体)是走developer market(开发者市场),帮助开发者做出更好的产品。我们自己不会经营社群网站,也不会经营创作工具。对英伟达来说,那有点太to C(面向消费者)了。所以,我们决定要做一个为了Physical AI的世界模型,服务Physical AI这个community(社群)。
张小珺:今天大家对世界模型的定义还非常不清晰,你跟我们讲讲你对世界模型的定义吧。
刘洺堉:我是个很讲究实用性的人。人为什么会设计一个模型?因为它可以用。用法不同,模型形态就不同。
一种是为了预测:你设计一个模型来描述世界,经由这个模型predict(预测)接下来会发生什么事情。这是世界模型的一种目的。
另一种是为了understanding(理解):为什么这事情发生了?某种程度,整个物理学就是去建世界模型,从牛顿力学到量子力学,去了解世界怎么运作。
当然在Deep Learning(深度学习)里,我们把understanding变成用标注数据去教模型:这件事这样发生是因为那件事。然后用大量数据去泛化,帮助未来新的事件发生时,你经由看到的video(视频)讯号去解释,帮助人理解发生了什么。比如工厂里产线突然卡住,可能是之前某个工人忘记打开什么。这也是建世界模型的目的:为了理解发生的事、找到问题。
还有一种是重建三维世界:重建很有用,可以规划路线,可以让人虽然身不在这个真实世界,却在虚拟状态下游历这个世界。
因为用途不同,模型的形态长得不一样。但大家终究是在同一个世界,这些模型只是经由不同观察来描述同一件事。重建是很重要的学问,我以前做过,但现在已经不再做重建了。我现在主要做物理世界的understanding,以及物理世界的生成,也就是prediction这些。
张小珺:现在定义什么叫World Model(世界模型),就像几年前大家定义什么叫AGI(通用人工智能)一样,没有共同定义。
刘洺堉:对。有没有精确定义不是很重要。这个词太大、过于笼统,定义出来对人类有什么影响?
张小珺:为什么LLM(大型语言模型)是一个精确的词?
刘洺堉:LLM就是large language model,模型很大、做language,很明确。
世界模型就是一个可以帮助你去model(建模)这个世界的工具。因为用途不同,你model世界的方式就不一样。只要对这个世界、对这个模型有不同用途,就有不同定义。
张小珺:在你看来,世界模型能够描述Cosmos吗?还是有一个更精确的名称来描述你在做的事?
刘洺堉:我们一开始把Cosmos叫做world Foundation Model(世界基础模型)。
我们的目标是建立一个foundation,让大家都能建出适合他们要用的世界模型。我们把自己叫Foundation Model,希望我们是更底层的东西,满足大家。哪怕是一个要做世界模型的人,也可以基于我们的Foundation Model来做。
张小珺:英伟达同时也投资了Yann LeCun的AMI Labs和李飞飞的World Labs,他们都在做世界模型,你们之间是竞争对手吗?
刘洺堉:NVIDIA是站在enabler(赋能者)的角度。我们希望所有在NVIDIA GPU ecosystem(生态系统)上建立的公司都能成功,大家一起win win(共赢)。
每家公司看到的点不太一样,想解的问题也不一样。Fei-Fei的World Lab和Yann LeCun的AMI走不一样的路线,我们都帮助他们,也投资他们,跟他们有合作。
如果他们对我们的Cosmos有兴趣,也可以利用。其他家公司需要世界模型,但可能不像Fei-Fei或Yann LeCun资金雄厚,他们更需要帮助,可以leverage(利用)Cosmos。我们的目标是帮助整个领域成功。
张小珺:所以你们有竞争对手吗?
刘洺堉:我觉得NVIDIA的竞争对手,是跟NVIDIA做同样事情的公司,也就是去做整套AI ecosystem的公司。但我现在做Cosmos,是不想竞争对手的。我想的是怎么去帮助这个ecosystem。
在NVIDIA ecosystem里,用我们GPU、用我们运算平台、用我们软件的公司,如果都成功了,NVIDIA就会成功。这也会帮一些还没在我们ecosystem里的人产生信心。
我已经过了那个时期——为了毕业把论文发出去,非要证明我的算法比别人好——我现在目标就是帮助这个领域一起往下走。
04
谈Cosmos 3
“当Louis Vuitton减少陈列的货品数,反而sales提升了”
张小珺:从Cosmos 1到Cosmos 3经历了非常多的技术变化,在你们最早的两代Cosmos中,有没有积累一些know-how(诀窍/经验)?
刘洺堉:有。这是去年的工作,步调很快。开始做Cosmos时,我强调一个点:迭代快速。我那时深受DeepSeek影响,它是很惊人的公司,一年内迭代三次,产生DeepSeek V3。所以我一直强调迭代速度要快。
但我们挑战的题目是物理世界模型,尤其在2024年,大家还不是很清楚怎么样的世界模型对大家有帮助。我刚才讲的不外乎就是prediction或understanding:用video model去帮助predict future,用reasoning model去解释发生的事。
一开始我们跟一些伙伴合作,理解他们的需求,自己也有一些想法,做出这些模型,再跟伙伴迭代,慢慢收敛。从Predict未来,想到仿真环境是大家常用的环境,但它生成的video跟真实世界有一定差距,能不能用模型帮助它更逼真?于是做了Transfer(迁移)。为了解释发生的事,做了Reason(推理)。当时有三个方向。
后来理解到,如果你可以描述pixel(像素)是怎么变化,那这个pixel变化跟action(动作)变化很接近,所以我们做了一个叫Cosmos Policy的Policy Model。
再后来发觉,就像刚才讲的,这是同一个世界,不管从哪个角度看,model的都是同一个世界。模型就是在学一个internal representation of the world(世界的内在表示),也就是这个世界在做压缩过程中,学到怎么样的表示方式。
既然是同一个东西,那Foundation Model的核心概念是“纳百川”,可以从各式各样的data(数据)里学会这个模式。所以如果你把train(训练)Reasoning、Predict、Transfer、Policy用的data全部合在一起,模型的上限更高。
第一个,你描述同一个世界;第二个,Foundation Model把东西合在一起。所以我们就慢慢往单一模型走。
中间还有一个执行上的问题。我记得建第一版Cosmos时,自己算一算,因为要真的帮助到合作伙伴,我可能需要模型A、B、C、D、E、F、G…大概需要22个模型。
我跟Jensen开会讲,预计需要22个模型。Jensen觉得我工作非常认真,说“very good and very hard”。
但他又说:你知道吗?Louis Vuitton(路易威登)这家店,当它减少陈列的货品数之后,反而sales(销量)提升了。你不希望太多东西困惑消费者,让他没办法做决定。
那对我影响很大。
我理解了:连我自己都分不清楚要用A还是B,其他人更不清楚。再加上执行困难,每个模型出来都要维护、要解决问题。模型一多就很辛苦,备多则力寡,影响迭代速度。
在做Cosmos 2的同时就觉得这样不长久,决定要做单一模型的World Model,也就是Cosmos 3。
张小珺:最大变化发生在Cosmos 2到Cosmos 3。
刘洺堉:是的。Cosmos 1到Cosmos 2的变化主要是数据提升,还有一些变化,比如Cosmos 2的时候把parity(一致性)带进来。但我觉得Cosmos 2到Cosmos 3是一个很大gap(差距)。
Cosmos 3从去年10月开始做,刚好在Cosmos 2发布之后。更早的时候就知道必须做3,但那时还在收尾Cosmos 2.5。等2.5收尾之后才开始做3。大概是9月决定要做,真正执行是10月、11月,做了超过半年。
张小珺:一个中国做世界模型的创业者说,他看Cosmos 3论文看了一周,每天看。他觉得Cosmos 3在技术的大创新上并不多,但把很多细节都工程验证出来了。你觉得这个评价中肯吗?
刘洺堉:Mixture-of-Transformers(混合Transformer架构)之前也有人提出,Parity Model(一致性模型)之前也有人提出。我们是第一个把这个Mixture-of-Transformers scale(规模化)到这么大,把audio、video、action都合在一起。这些东西从概念上来讲就是“合在一起”,但真正做出来不容易,真正做出来就是这些细节。
所有的大语言模型都是Transformer架构,你可以讲大家都没有创新,但那些细节会让某些模型比另外一些好很多。
这么多年后,我越来越重视这东西能产生的效果,越来越不重视它是不是革命性原创。对我来讲,它有用、产生impact(影响力)、解掉大家想解的问题,才是重点。
这篇paper我们希望帮助整个开源社区,做开源模型,帮助整个Physical AI。这几年很多Frontier Lab(前沿实验室)走向闭源,即使写paper也不愿意讲关键环节。我们决定走不一样的路:把能讲的东西尽量讲清楚,开源模型,也开源训练框架,部分训练data也开源了。
我们希望保持透明,让大家看到怎么做,也希望别人可以利用我们开源的东西,做出跟Cosmos类似的东西。我们的目标就是enable(赋能)整个community。我不担心别人做出一模一样的东西。
张小珺:你刚刚提到DeepSeek,选择开源跟它有关系吗?
刘洺堉:不算直接关系。DeepSeek的工作对整个AI影响深远。它第一个把MoE开源,最近的模型又把东西逼到极致,对整个领域产生深远影响。从影响的角度,我觉得是相通的:我们也想产生影响,把细节讲出来。
我们的目标可能跟DeepSeek不一样,我们希望帮助我们的使用者成功。
张小珺:在Cosmos 3的模型技术选择上,你们首先在输入层同时输入language、video、audio和action,这是一个重要的技术决策吗?
刘洺堉:是。我觉得这个世界不是只有视觉,也有听觉。我也想加入触觉,但触觉讯号还不好,touch sensor(触觉传感器)还在快速迭代,这需要灵巧手,需要数据。
大模型思路基本有两个:一个是让language成为first class citizen(一等公民),像coding、chat那样;另一个是让video成为first class citizen(一等公民),像Seedance、Veo(Google的视频生成模型)那样。我们认为Physical AI的模型跟数字世界模型最不一样的地方,就是物理世界的Agent(智能体)会take action(采取行动),会改变世界状态。
所以一个好的物理世界Foundation Model,也要把action当成first class citizen。这就是为什么我们把language、video、audio和action合在一起,建Cosmos 3。
张小珺:我记得杨植麟(Kimi创始人兼CEO)去年跟我说,他们做大语言模型把language当作最重要的智能提升工具,会很担心vision加入进来影响智商,变成一个“傻的多模态”。但谢赛宁(AMI Labs联合创始人兼首席科学官)今年又跟我说,他担心language对vision的污染,觉得language才是人类的脚手架,并不本质。
你怎么看待这两种观念?你把它们都训到一起时,会产生相互污染的问题吗?
刘洺堉:这些讯号带进来都有它们的目的。language可以把人类知识带进来,也帮助人类跟Physical AI沟通;video是大量视觉信息,audio是大量听觉信息,描述世界怎么运作,用video可以更精准capture(捕捉)这个世界的物理运作,用language反而很难。
但模型最后建出来是要服务人的,不懂language就没办法跟人沟通;模型最后是帮助机器take action的,不懂action就没办法改变世界。
我们的目的不同。我的目的是希望这成为一个好的Foundation Model for Physical AI,它需要懂language,需要知道东西怎么变动,也需要action,借由这个control(控制)把它们合在一起做。
我的目标不是追求AGI。AGI本身也很难定义;当你定义的AGI纯粹是要了解人类本质,或者去做coding时,视觉信号可能会影响你,那是必然的。
你可以讲,遥远的古代没有language,人类文明发展是经由看世界怎么变动而产生。language毕竟是发展给人类的,但你不知道机器接不接受这一套。也许你可以直接从video讯号里学会世界怎么运作,得到一种intelligence(智能),发展出另一个文明。从这个角度,language讯号也许是一种干扰。所以要看你要什么。
我很明确知道我要什么:我需要language让人可以跟Physical AI沟通,需要video和audio从物理世界的变化里学会物理本质,需要action是因为它最后要能fulfill a goal(完成目标)去改变世界。
张小珺:所有模态融合到一起,这些模态是相互benefits(受益)的,还是相互制约的?
刘洺堉:在过去一年甚至更久,我们一直在研究这些模态的融合。从各个不同研究里得到一些线索,在Cosmos 3时把它们结合在一起。
比如在Cosmos Policy那篇工作中,我们发觉把video和action合在一起是帮助action的。当你直接predict action,也就是做world action model(世界动作模型)时,除了predict要做什么action,也predict take这个action之后会产生的state(状态)、observation(观测),会帮助你训练得更熟练。所以我们知道predict video是帮助action的。
audio也可以帮助video generation。当你知道“咔”一声,碰到的点就是接触的时间点,所以audio和video是互补的。
一般做video的人都知道,从text到video是讯息量变大的过程,需求变大,代表有很多种可能性,方差大就不好学。所以大家会发现,当文字描述非常详尽时,比较容易产生好的video。所以language也可以帮助video。
Cosmos 3想把之前的Cosmos Reason、Cosmos Predict、Cosmos Transfer、Cosmos Policy合在一起。合在一起本身就有好处,整个东西都简化了。这些讯号怎么合在一起,让它产生互补而不是互相抗拒,可以经由experiment design(实验设计)和data ratio(数据比例)的调整来达到。我们那时候坚信这一点。
这些信号都是描述同一个世界,都含有这个世界怎么运作的信息。应该有一种方式让它们合在一起,互相帮助,更多的信息能帮助你了解背后的运作原理是什么。因为这样的信念,我们就从这个方向出发。
张小珺:这里面有什么secret sauce(秘密配方)吗?尤其是在互相受益上。
刘洺堉:做大模型没什么秘密配方。就是严格做实验,根据假设做实验,看到结果,累积知识,再做下一个实验,一步一步扎实地往下走。我不觉得有什么不可告人的秘密,关键在于你追求的是什么,然后耐心做实验、验证,对了就继续下一步。
张小珺:你们这次采取的是一个双塔(tower)设计,一个塔在处理离散信息,一个塔在处理连续信息,为什么采取这个设计?
刘洺堉:有很多原因。一开始,Cosmos Reasoning(推理模型)就是离散的,从视觉语言模型(vision language model)出发;而预测迁移策略(predict transfer policy)是连续的。我们知道离散的适合理解(understanding),连续的适合生成(generation),把它们放在一起,是现阶段很合理的选择。
再者,有很多种使用Cosmos的方法,但常用的是做后训练(post training)。比如用你的视频-动作对(video action pair)来训练生成器(generator),或者你只想用推理(reasoning),只用你自己领域的理解数据来训练。
如果我们全部连在一起,生成和理解就绑定在一起了。那我要换生成分布(generation distribution)的时候,因为全部连在一起,你的数据也会改变理解那边的表现。如果没有两个塔,只有一个,那理解那边既然要改变,而你的数据又没有理解数据,这部分能力就很容易流失,不方便客户使用。所以分成两个塔,在使用上有一定帮助。
虽然这样不够elegant(优雅),因为你要事先决定架构,让数据来形成依赖关系,而不是人为区分。但在这个阶段,我觉得这个设计比较合理,比较适合使用。
讲到这个,大家也可以猜出来,我们下一步目标是更加简单一点——为什么要两个塔?一个塔就够了。
但是在往一个塔前进时,我们要考虑用户是不是容易用上它。因为我们的目标是帮大家赢,而不是自己产生一个可以做很多事情的模型。我们相信每个机器人都不一样,相机数量、位置都不同;自动车也每个都不太一样。我们觉得需要克制,即使合在一起追求工程的简约完美,也要考虑使用者是不是有办法利用它。这是我们必须要研究的课题。
张小珺:相对来说,离散的信号更好处理,融合进连续变量之后,处理难度会变高。你们怎么把它们合在一起,并且scale(规模化)上去呢?
刘洺堉:对。现在有一系列工作像Transfusion(融合模型),它可以同时处理离散和连续的数据。在做下一词元预测(next token prediction)时做离散的,在做扩散(diffusion)时做连续的。这是同一个塔。这段时间有很多种不同的变体,大家都在研究这个,是大家共同关切的问题。
这些信号可以用离散表示,也可以用连续表示。我希望是不是能开发出一种架构,全部离散或者全部连续,让事情相对变得更简单一点。但这是一个理想,不确定能不能成功,要一步一步做实验验证往下走。
张小珺:直觉来看,全部离散更容易,还是全部连续更容易?
刘洺堉:各有各的好处。离散比较好做训练,连续有它漂亮的地方。在做推理(inference)的时候,它们两个是很不一样的形态(shape)。最关键的是,客户还是要部署,部署时成本的考量很重要。所以,最后会根据什么样的模型最适合部署来决定。
张小珺:有一个研究员问你,你现在是把所有模态都训到一个模型里,理论上它既可以把编程(coding)做得很好,也可以让机器人运动,还能够生成创作者内容。那它有可能在单一维度,比如说在编程上,比Claude还要强吗?
刘洺堉:我还是喜欢讲《孙子兵法》里说的,“备多则力寡”。
如果你什么都要好,训练中就要博学多闻,要触碰很多不同类别,来提升知识水平。但如果你确定只需要用单一应用,是不是可以有些调整?因为你不care(在意)其他东西了,有些东西你愿意放弃。如果你什么都不愿意放弃,会打得很辛苦。
策略往往就是关乎着,你决定可以放弃什么东西。
张小珺:除了模型会变得更简洁,双塔有可能会变成一个塔,还有什么在未来模型中大家能预期的变化?
刘洺堉:我们很关注这个模型怎么去帮助Physical AI的构建者(builder)。
泛化(generalization)是任何AI的核心问题。在物理世界的AI,一种我们需要达到的泛化是:假设我今天教机器人说,我的衣服我喜欢这样折、这样放,我就给机器人看一两次我怎么做,它是不是就可以在现实生活中快速学会?是不是给这个物理智能读了说明书,它就知道怎么操作这个仪器、怎么在工厂做检测?我们中间的提升会朝着这些提升泛化能力的角度,把这些东西加进Cosmos模型。
我常常觉得,Deep Learning就很像中医,是试出来的。试的过程中,你要做详细实验记录,从里面去理解中间的法则。我觉得这很有趣。做严格实验、控制变量、得到关键结果,是模型迭代的重要一步。
张小珺:也有研究员提出,是不是可以把模型的语言渲染比重加得更大,他们还是认为LLM是提升智能的关键,你认同吗?
刘洺堉:在早期图像生成(image generation)研究中,包含谷歌的Imagen,里面就提出了:当你的语言理解越强,用更大的T5(文本到文本转换模型),图像生成能力就更强。我是相信的。你用更大的语义表征(semantic representation),应该有帮助,我是同意的。
但毕竟Physical AI的应用跟大家常讲的编程(coding)或者聊天(chat)不太一样,需要做一些实验验证。我想做的是了解真正的痛点,从痛点找到合适的方式补强模型能力。比较有挑战的是,当你资源有限的时候,你怎么做取舍。
“备多则力寡”——老祖宗的智慧还是蛮管用的。
张小珺:世界模型现在缺乏有效的评估方法,你们有一些好的探索吗?
刘洺堉:世界模型、大语言模型,都在追求更好的评估检测方法。
模型的评测有三步:第一步是基准测试(benchmark),有一些固定的数据集(dataset),你去上面测试它的质量(quality);第二种是竞技场式(Arena style),A跟B比,看谁比较好;第三种是跟着专家(Expert),去真正有痛点的人那里,解这个问题。三个都很重要。
在Physical AI里,第三个特别重要。因为每个Coding Agent大家都在解编程、数字的问题,但物理智能每个要解的问题又不太一样。更加强调跟愿意一起合作的伙伴,一起去了解怎么样评估一个模型真正有用还是没用。这是指引模型发展的重要一步。
张小珺:除此之外,物理世界的数据问题也是一个大难题。
刘洺堉:因为物理智能每个形体都不太一样,收集数据没有物理设置(Physical setup)就没法收集。英伟达更困难,因为我们要服务各个物理智能的开发者,每个机器人都不一样。我们能做的就是找最容易共通的。
物理智能数据主要有两种:一种是导航数据(navigation data),从A到B;另一种是操作数据(manipulation data),怎么用手或者工具去操作、完成既定目标。
导航数据比较容易做,就是你的运动学怎么动、车子怎么动、机器人怎么动,这些都可以收集。机器人A跟B即使不一样,但动起来就是在空间中位移,有时候可能加一些旋转,是比较相同的。
操作就比较复杂。我们发现一个趋势:大家越来越追求接近人手的机器手臂。
论点是说,人类的世界是建出来给人类用的,大部分工具都适合人手操作。整个AI需要大量数据,如果你的数据越好取得,你就越容易更快得到突破。所以大部分收集数据的是人,人就是用手。今天大家往人手的方向前进。
我们在Cosmos 3的时候,特地把第一人称视角(ego-centric)数据加进去,包含了人眼怎么看这个东西、从第一人称,还有人手怎么去操作这个物件。我们的目标不是去做出一个机器人,而是帮助大家可以做出很好的机器人,我们要找最容易互通的东西。第一人称视角(ego-centric)对大家非常重要。
张小珺:在所有的限制和局限之下,英伟达做世界基座模型有显著优势吗?
刘洺堉:在英伟达,获得GPU运算的成本比较便宜,毕竟我们生产GPU嘛。再就是我们在Physical AI已经深耕多年了。我们有Thor芯片,有Isaac仿真器。这些东西合在一起,我们提供更多工具满足各式各样物理智能开发者的需求。
还有一点,我们真心想帮助其他家公司成功。
我们很清楚自己能提供的服务在哪。客户往往比较愿意跟我们一起合作,因为我们不会跟你做一模一样的东西、把你灭了——不是,这不是我们的目标。
张小珺:针对Cosmos系列模型,你们未来会投入多少卡和资源?
刘洺堉:一直在提升中。我不知道方便不方便讲卡的数量,但我们已经在万级,希望可以有更多更多。
张小珺:Cosmos 3让你满意的一点是什么?让你遗憾的是什么?
刘洺堉:满意的一点是,我当初跟大家讲可以把过去所有模型合在一起,还会做得比全部之前的模型都要好,这发生了。那时很多人不相信,我很开心。
第二个是,这是我们第一次把整个团队,原本是建造数个模型,现在合在一起建一个模型。把这么大的一个组织凝聚在一起去建这个模型,我也很骄傲。
遗憾是什么?我们的模型还可以继续提升,但因为时间限制,没有让它完全收敛就必须要推出了。还有很多想要改的地方,之前没时间改。好处是,我们继续会做3.1、3.2,把之前没做好的补进去。
张小珺:你有没有想象过,像Jensen说的,做到Cosmos 97会是什么样子?
刘洺堉:那时候听到97代,我的理解是我们有决心一路把它做下去,把它做好。这是一个很大的commitment(承诺),因为做这个模型很耗费资源。
世界模型,最后就是接近这个世界。
透过那个模型,你可以去学习你想在真实世界里学习的东西,就是往那个方向走。最接近的是,你有能力随时做出一个《黑客帝国》的矩阵(Matrix),就是最终的样子。
如果每半年一代,还要四十几年,对吧?但AI发展极快,也许不需要四十几年。
05
谈《黑客帝国》
“Pain and suffering,是驱动人进步的关键”
张小珺:你说你要为机器人构建一个黑客帝国,《黑客帝国》讲的是人类沦为机器的活体电池,活在一个虚拟世界Matrix中,一个觉醒的人试图挣脱系统的宿命,来终结这个循环。
你现在为机器人打造Matrix,如果有一天机器人要觉醒了,想要挣脱虚拟世界怎么办?
刘洺堉:我用《黑客帝国》是帮大家具象化,有一个世界模型可以这么快去加速学习。很多人担心AI能力太强,会take over the world(接管世界),会把我们消灭(eliminate)。那我觉得这个社会是人建立的,这些科技是人在背后操作。只要大家有共识,这件事不会发生。
再就是,比较哲学一点,我觉得pain(痛苦)和suffering(苦难),是驱动人进步的关键。我不是很确定这些由芯片做成的智能(intelligence),是不是有同样的pain和suffering——我心里是存疑的。我当然知道我们希望科技可以大幅改善人类生活,也需要做出相对应的guardrail(安全护栏),确保它不会影响正常世界发展。
张小珺:虽然你一直在说我不是任何人的竞争对手,但其他做世界模型的团队,仍然会把你视作竞争对手,你有什么想对他们说的吗?
刘洺堉:世界模型是工具,用来解决问题,世界上有很多种不同问题要解。物理智能的问题本身又特别难。如果你可以跟我们一起合作,利用我们做的东西,你可以走得更快更远,这不是
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み