ページを読み込み中…
ページを読み込み中…
15件の記事
ベゾスが支援するスタートアップ「General Intuition」は、大規模言語モデルでは空間や時間の理解に欠けるため、AGI 達成にはゲームデータの活用が必要であると主張している。
NVIDIA は、事前学習されたビジョン言語モデルを基盤とし、ロボット制御に適応させた「ワールド・アクションモデル(WAM)」という新しい技術の登場を発表した。これは、視覚と言語を理解する能力を行動計画に転用するアプローチである。
NVIDIA は今日、言語・画像・動画・音声・動作を統合する「Cosmos 3」を発表した。同モデルは推論と生成を組み合わせたアーキテクチャを採用し、Nano や Super など複数のサイズで提供される。
NVIDIA が、物理世界の推論と行動を担うための最初のオープンソース型オムニモデル「Cosmos 3」を発表した。この新モデルは、AI が現実世界を理解し、動作する能力を強化する基盤技術として期待されている。