[AINews] NVIDIA Cosmos 3、Nemotron 3 Ultra、RTX Spark の発表
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Latent Space
NVIDIA は今日、言語・画像・動画・音声・動作を統合する「Cosmos 3」を発表した。同モデルは推論と生成を組み合わせたアーキテクチャを採用し、Nano や Super など複数のサイズで提供される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今日のポッドキャストのゲストは、1 年以上前に NVIDIA Cosmos の責任者であり、ビデオ生成と世界モデルのトレーニングについて議論していました。ふさわしくも、Cosmos 3 は本日ローンチされ、言語、画像、動画、音声、アクションを統合し、自己回帰型推論器と拡散生成器を組み合わせた Mixture-of-Transformers(混合トランスフォーマー)アーキテクチャを採用しています:
base Nano (16B: 8B 推論塔 + 8B 生成塔)
Super (64B: 32B 推論塔 + 32B 生成塔) モデル、および
Text2Image(テキストから画像へ)と Image2Video(画像から動画へ)用の Super 微調整モデル。これらは現在、Nano Banana 2 に次ぐ、新しい SOTA(State-of-the-Art:最先端)オープンウェイトの画像生成・動画生成モデルとなっています。
台湾で開催された Computex で、Jensen はまた Nemotron 3 Ultra も発表しました。これは 550B-A55B の構成を持つ、驚くほど効率的かつ高速なオープンウェイト LLM(大規模言語モデル)であり、米国における新しい SOTA です:

最後に、RTX Spark 個人用コンピュータは 1 petaflop(ペタフロップス)のスーパーチップとして、Microsoft と OpenClaw、そして Hermes Agent をローンチパートナーとしてプレビューされました(詳細な分析はこちら)。
2026 年 5 月 30 日〜6 月 1 日の AI ニュース。私たちは 12 のサブレッド、544 のツイートを確認し、Discord は追加で確認していません。AINews のウェブサイトでは過去のすべての号を検索できます。念のため、AINews は現在 Latent Space の一部となっています。メールの頻度を選択的にオン/オフに設定可能です!
AI Twitter リキャップ
NVIDIA の Cosmos 3、Nemotron 3 Ultra、そしてオープン物理 AI への推進
NVIDIA のオープンソース週間:NVIDIA は、物理 AI 向けのオムニモーダル・ワールドモデルのオープンなファミリーである Cosmos 3 と、550B パラメータを持つオープンウェイトモデル「Nemotron 3 Ultra」を発表し、オープンモデルに関する議論を主導しました。この Nemotron 3 Ultra は、複数の投稿者によって「これまでの米国製オープンモデルの中で最強」と評されました。Cosmos 3 は、重み(weights)、コード、データセット、ファインチューニングのレシピを含むフルスタックリリースとして位置づけられ、NVIDIA はまた Runway などのパートナーと共に Cosmos コアリションを立ち上げ、ワールドモデルのためのオープンエコシステム構築を進めています @NVIDIAAI エコシステム文脈、@runwayml コアリション発表、@kimmonismus の Cosmos スレッド、@ClementDelangue が NVIDIA の Hugging Face (HF) フットプリントについて言及。
Cosmos 3 が技術的に重要だった理由:ロボティクスに関する修辞を超え、より具体的な詳細として、Cosmos 3 は言語、画像、動画、音声、アクションを単一の Mixture-of-Transformers(トランスフォーマーの混合設計)で統合し、自己回帰型推論器と拡散生成器を組み合わせたアーキテクチャを採用しています。Artificial Analysis によると、Cosmos 3 はオープンウェイトモデルの中で Text-to-Image(テキストから画像への変換)および Image-to-Video(画像から動画への変換)のリーダーボードでともに第1位を獲得しました。また、この生成器は構造化された JSON プロンプトを使用し、外部のプロンプアップサンプリングハーンチス(harness)によって駆動されるか、あるいは自身の推論器ブランチによって制御されることが可能であると指摘されています。一方、NVIDIA のハードウェアとソフトウェアの推進は、OpenMDW フレームワークの採用や、fal などのプラットフォームにおけるパートナーエコシステムとの統合にも及んでいます @ArtificialAnlys、@fal。
Nemotron 3 Ultra の反応:Nemotron 3 Ultra に対するコミュニティの反応は、新しいオープンリリースとしては異例に強かった。投稿者たちは、その能力と提供特性の両方を強調し、すでにいくつかのオープン評価で首位を争っているという主張や、一部の環境では 1 秒あたり 300 トークン以上の速度で動作している可能性を示唆する内容が含まれていた。これは @scaling01, @ctnzr, @caspar_br が指摘するように、大規模な DeepSeek や Kimi クラスのモデルよりもはるかに高速である。また、@eliebakouch による技術的な議論では、Nemotron は Kimi K2 や DeepSeek V4 などの競合他社と比較してスパース性(疎性)が低く、アクティブなパラメータ比率が約 10% 対約 3% である可能性があり、これが経済性と動作特性の両方に影響を与える可能性があることが示された。
MiniMax M3、Qwen3.7-Plus、JetBrains Mellum2 がオープンエージェントモデル分野を拡大
MiniMax M3 の発表が当日最大のモデルリリースとなった。M3 は 100 万トークンのコンテキスト長とネイティブなマルチモーダル性を備え、競争力のあるエージェントベンチマークを持つオープンウェイトのマルチモーダルエージェント/コーディングモデルとして紹介された。発表パートナー間で繰り返し強調された主要数値は、SWE-Bench Pro で 59.0%、Terminal Bench 2.1 で 66.0%、MCP Atlas で 74.2% である @MiniMax_AI, @PBDTokenRouter, @kimmonismus。Novita、Vercel AI Gateway、Cloudflare AI Gateway、OpenClaude、Flowith など複数のインフラベンダーが当日のサポートを提供しており、これは @MiniMax_AI on Novita, @rauchg, @gitlawb が示すように、異例の速さでエコシステムが採用されたことを示唆している。
ベンチマークと実務経験の結果は混在していました:M3 はフロントエンド生成、視覚・ゲームタスク、価格対性能において称賛され、並列デモではワンショットの UI/ゲーム出力が強く、Next.js エージェント評価におけるベンチマークでの好成績も目立ちました(@notjazii, @lostinlatencyX, @rauchg)。しかし、複数の評価者からはトークン消費量の多さ、冗長な自己チェックループ、長時間タスクにおける要件の逸脱が報告され、M3 は「品質を最優先し、効率化は後回し」というモデルのように映りました(@ZhihuFrontier のレビュー、@teortaxesTex の懐疑)。
Qwen3.7-Plus:アリババは Qwen3.7-Plus を、GUI と CLI 操作、視覚推論、コーディング、検索強化 QA を統合したマルチモーダルインタラクティブハイブリッドエージェントとして発表しました。これはアリババクラウドの Model Studio を経由して API で利用可能となり、Cline などのツールに迅速に追加されました(@Alibaba_Qwen の発表、@cline)。この発表は、オープン志向のアジア系ラボがもはや「チャットモデルのみ」をリリースするのではなく、エージェント機能を備えたフルスケールのマルチモーダルシステムを公開しているという傾向を強化するものです。
JetBrains Mellum2:JetBrains は、約 11T トークンでトレーニングされ、RLVR(強化学習による検証・調整)でポストトレーニングされた、アクティブパラメータが 25 億の 120 億 MoE モデルである Mellum2 をリリースしました。ベースモデル/SFT/RL チェックポイントと技術レポートを公開しており、@nv_pavlichenko と @jetbrains が発表しています。特に興味深いのはその狙いであり、ルーティング、RAG(検索拡張生成)、サブエージェント、IDE 利用における超低遅延推論です。また、vLLM に即座に実装され、@vllm_project で利用可能です。これはベンチマーク追従の最先端リリースというよりは、開発者ワークフロー向けの「小型高速オープンモデル」として真剣に取り組んだ取り組みに見えます。
エージェント、サンドボックス、メモリ、検索が真のプロダクト表面へと進化中
スタックはモデル呼び出しからエージェントランタイムへシフトしています:複数の発表で共通しているのは、主要なエンジニアリングのレバレッジがモデルそのものではなく、それを支えるハッチ(枠組み)にあるという点です。Perplexity の「Search as Code」が最も明確な例です:反復的な検索ツール呼び出しの代わりに、モデルは検索 SDK に対して Python を記述し、カスタムランキングパイプライン、インデックス上のマップ・リデュース、バッチ処理、集約、そしてトークンオーバーヘッドの削減を可能にします。Perplexity はこのアーキテクチャにより、内部 WANDR ベンチマークで 0.152 から 0.386 への飛躍的な向上を報告しています @perplexity_ai, @AravSrinivas。
マネージドエージェントとサンドボックスが標準化されつつある:Google は Gemini API でマネージドエージェントの詳細を公開し、単一の API 呼び出しで推論、コードの記述・実行、ファイル管理を行い、ホストされた Linux サンドボックス内で動作するエージェントを起動できる機能を備えている。これは @_philschmid と @GoogleAIStudio が紹介している。また LangChain は Deep Agents、Context Hub、LangSmith Sandboxes/Engine において同様のアイデアを推進しており、永続的なコンテキスト、エージェントライフサイクルのツール、自動化された障害トリアージに重点を置いている (@LangChain, @hwchase17)。
メモリは依然として欠落したプリミティブである:繰り返し指摘される不満の一つに、巨大なコンテキストウィンドウであってもセッション間での記憶解決にはならないという点がある。HydraDB 上のスレッドでは、「RAG + マニュアルコンテキスト注入」が誤ってメモリと名付けられている一方で、実際の永続的なセッション知識は依然として不十分であると論じられた (@kimmonismus)。関連する研究スレッドでは、AdaCoM のような再利用可能なコンテキスト管理ポリシーが指摘されており、これは凍結されたエージェントのコンテキストを剪定・保持するために別の LLM を RL で訓練するものである (@dair_ai)。
セキュリティはエンタープライズエージェントにおける最大の課題であり続けます:Microsoft Security Intelligence からは、npm/GitHub/AWS/SSH の認証情報を窃取する自己増殖型ワームを含む、90 以上の redhat-cloud-services パッケージに影響を与える大規模な npm サプライチェーン侵害に関する重要な警告が発表されました (@MsftSecIntel)。同時に、エンタープライズエージェントベンダーは、デプロイメントの前提条件としてサンドボックス化、ランタイム分離、セキュリティスタックとの統合を強調しました。これには、NVIDIA OpenShell や LangChain のサンドボックス基調講演に関する議論も含まれており、@shannholmberg、@LangChain が発言しています。
Codex、Claude Code、そして競争的なコーディングエージェントの戦い
OpenAI は Codex をより多くの場所に拡張しました:OpenAI は、最先端モデルと Codex が AWS / Amazon Bedrock で一般利用可能になったことを発表し、既存の AWS セキュリティ/コンプライアンスワークフロー内に OpenAI の機能を組み込みたい企業を明確にターゲットとしています (@OpenAI, @OpenAIDevs)。また、スレッド、ターン、ストリーミング、再開、画像、サンドボックス制御をサポートする Codex Python SDK をリリースしました (@reach_vb)、さらに Bedrock 対応の Codex ワークフローもサポートしています (@reach_vb on Bedrock config)。
Claude Code で実際の運用上のインシデントが発生:Anthropic は、一部の Opus 4.8 セッションで予期せず使用量が枯渇するほど多くの並列サブエージェント/ツール呼び出しが生成されるバグを修正した後、Pro および Max ユーザーに対して 5 時間および週間のレート制限をリセットしました (@ClaudeDevs, follow-up)。これは、コーディングエージェント製品の品質が、単なるモデルの知能 (IQ) だけでなく、オーケストレーションの動作によってますます決定されるようになるという重要な教訓となっています。
コーディングモデル間の振る舞いの違いは依然として重大である:開発者は、ProgramBench や WeirdML などのベンチマークにおいて、GPT、Claude、および他のモデル間に大きな質的差異があると指摘している。Opus は場合によってはスコア最大化よりも探索を優先したり、ベンチマーク固有の癖を示すことがある @OfirPress, @htihle。別の長いスレッドでは、新しい Claude Opus 4.6–4.8 バリアントがコーディング以外の分野で妥当だが架空の概念を捏造する可能性があり、これは通常のハルシネーションではなく、真実性やアライメント(整列)における後退を示唆している @distributionat。
インフラ、ハードウェア、およびローカル AI システム
NVIDIA は PC 市場に参入する:最も議論されたハードウェアの発表は、Grace と Blackwell を基盤とした NVIDIA/Microsoft の「パーソナル AI コンピュータ」である RTX Spark で、最大 128GB の統合メモリと 1 PFLOP FP4(FP4: Floating Point 4-bit)を謳っている。重要な戦略的洞察:NVIDIA はもはやアクセラレータを販売するだけでなく、Apple Silicon、x86 PC、および Qualcomm と同時に競合するエンドツーエンドのローカル AI システムを提供している @kimmonismus, @swyx。
クラスター/ネットワークの更新:データセンター側では、Lambda が NVIDIA Quantum-X InfiniBand Photonics Q3450-LD スイッチを採用する最初の企業となり、大規模な AI クラスターにおけるネットワーク電力と障害を削減するためにコパッケージド光学(Co-packaged Optics: 集積化された光通信技術)を推進している @LambdaAPI。OpenAI もまた、閉ループ冷却システムを採用し、労働力・教育へのコミットメントと連携する予定の 1GW データセンター「Stargate Michigan」を発表した @OpenAINewsroom。
ローカル向けオープンモデルのツールリングは急速に改善しています:MLX-VLM v0.6.0 のリリースは、より実質的なローカル推論・ツールリングのアップデートの一つであり、予測的デコーディング(speculative decoding)、Anthropic 型およびレスポンス型の API、ツール呼び出し機能、多数の新規マルチモーダルモデルへの対応、画像・音声機能のサポートを追加し、Apple デバイスを「真のローカルエージェントマシン」へと変えることを明確な狙いとして掲げています @Prince_Canuma。これは、ローカル向け NVFP4 モデル(MoE)推論サービスにおける DGX Spark と vLLM の実験動向の高まりとよく調和しています @vllm_project。
主要ツイート(エンゲージメント順・技術的関連性でフィルタリング)
Anthropic の IPO への道筋:Anthropic は、SEC に対して機密扱いの S-1 ドラフトを提出したと発表し、審査待ちながら IPO への扉を開きました @AnthropicAI。
Claude Code の利用インシデント:Opus 4.8 における並列サブエージェント・ツール呼び出しバグによりクォータが過剰に消費されたため、Anthropic はユーザーのレート制限をリセットしました @ClaudeDevs。
Qwen3.7-Plus:アリババは、GUI/CLI 操作、コーディング、視覚タスクを跨ぐマルチモーダルエージェントモデルを発表しました @Alibaba_Qwen。
OpenAI の Bedrock 対応:OpenAI モデルおよび Codex が、エンタープライズワークフロー向けに Amazon Bedrock で利用可能になりました @OpenAI。
ARC-AGI-3 における進展:Claude Opus 4.8 は ARC-AGI-3 ベンチマークで新たな SOTA(最良結果)を記録し、達成率は 1.5% でした。絶対値としては依然として微小ですが、このベンチマーク上では意味のある飛躍です @arcprize。
AI Reddit まとめ
/r/LocalLlama および /r/localLLM まとめ
- 新 Frontier モデルのリリースと初期テスト
MiniMax M3 - コーディングとエージェントの最前線、100 万トークンのコンテキスト、マルチモーダル(活動状況:1090): MiniMax M3 は、コーディングおよびエージェント機能に焦点を当てたオープンウェイトのフロンティアモデルとして発表されました。ネイティブのマルチモーダル性・ビジョン機能を備え、MiniMax Sparse Attention(ミニマックススパースアテンション)により最大 1M トークンのコンテキストをサポートし、最低でも 512K トークンを保証します(MiniMax M3)。主張される長期的なエージェント機能の結果には、ICLR 論文の 12 時間にわたる再現、Hopper FP8 GEMM CUDA/Triton の最適化による 147 回の反復後の 9.4 倍の高速化、PostTrainBench で Opus 4.7 と GPT-5.5 に次ぐ第 3 位へのランクインが含まれます。現在は API/MiniMax Code を通じてアクセス可能ですが、HuggingFace/GitHub でのウェイト公開やローカルデプロイは計画されています。コメント投稿者は、安価で効率的なビジョン機能と長文コンテキストを活用したエージェントコーディングの組み合わせに慎重に関心を示していますが、発表が「オープンウェイト」と呼びながらまだウェイトもパラメータ数すら公開されていない点については懐疑的です。技術的な議論の一つは、これらの結果が約 250B を大幅に超えるモデルを示唆しているのか、極端なベンチマーク最適化の結果なのか、それとも真のオープンウェイトにおける画期的成果なのかという点です。
コメント投稿者の関心は、リリース詳細の欠如に集中していました。「3 つのフロンティア機能を備えた最初のオープンウェイトモデル」という主張にもかかわらず、ユーザーは MiniMax M3 の実際のウェイト、パラメータ数、またはサイズ情報を見つけることができませんでした。ある投稿者は発表からプレビュー画像(Reddit 画像)へのリンクを貼りましたが、スレッド内では依然としてモデルの規模やダウンロード可能なアーティファクトの確認はありませんでした。
技術的な実質的な懸念として、宣伝されている能力レベルは以下の3つの可能性のいずれかを示唆しているという点がありました:予想よりはるかに大きなモデル、異常に強いベンチマーク最適化、あるいは主要なオープンウェイトブレイクスルーです。議論の中心は、MiniMax M3 が実際には約 250B パラメータ程度なのか、それともさらに大幅に大きいのかが不明確である点と、そのコード生成・エージェント機能・マルチモーダルに関する主張が、重み(weights)と独立したベンチマークデータが利用可能になった際に実際に成立するかどうかという点でした。
NVIDIA は Nemotron 3 Ultra の発表を行いました(活動数:621)。この画像は NVIDIA Nemotron 3 Ultra に関する技術発表のスライドで、コメントでは MoE(Mixture of Experts)550B-A55 モデルと説明されています。このスライドは、「フロントティアスマート」ベンチマークカテゴリーであるエージェント生産性、コーディング、指示従順性、知識作業、長文コンテキスト処理能力などにおいて、GLM 5.1、Kimi K2.6、Qwen3.5 を含むオープン/オープンウェイト競合他社製品と比較されています。コメント投稿者たちは、他のオープンソース/オープンウェイトモデルとの比較を肯定的に捉えていましたが、ある投稿者は「人工的な分析スコア」が 48 であると指摘し、これはフロントティアモデルの直下であり MiniMax 2.7 の範囲に近いと評価しました。その上で、これが米国製のオープンウェイトモデルの中で最強となる可能性があると期待されています。
NVIDIA Nemotron 3 Ultra は MoE(Mixture of Experts)550B-A55 モデルとして特定されており、これは約 550B の総パラメータ数と、トークンあたり約 55B のアクティブパラメータ数を意味します。このアーキテクチャの詳細は、スレッド内で言及された最も具体的な技術仕様です。
あるコメント投稿者は、Artificial Analysis のスコア 48 を引用し、Nemotron 3 Ultra を「フロンティア級のモデルより一つ下位」と位置づけ、MiniMax 2.7 とほぼ同程度の水準にあると指摘しつつ、この指標においては米国製のオープンウェイトモデルの中で最も強力なものである可能性を示唆しています。
共有された技術的参照資料には、GitHub 上の NVIDIA 公式の Nemotron 3 Ultra Base 使用クックブック(NVIDIA-NeMo/Nemotron)および LifeArchitect のモデル比較表(lifearchitect.ai/models-table)が含まれます。あるコメント投稿者は、Qwen3.5 との比較が注目すべき点であると主張しており、その理由は Nemotron が NVIDIA のベストなオープンウェイトモデルであるにもかかわらず、米国製やオープンソース以外のいくつかのモデルにはまだ及ばないという点にあると述べています。
Stepfun 3.7 Flash は非常に優れています(アクティビティ数:473):この GIF はミームではなく技術的な視覚デモであり、プロンプト「単一の HTML ページで美しくリラックスできるフライトシミュレーターを作成する」に対する Stepfun 3.7 Flash の出力を示しています。低ポリゴンの 3D 飛行シーンに HUD スタイルの速度・高度インジケーターを描画したものです。投稿者はこれが公式の Q4_X_S 量子化版であると主張し、美観においては GLM 5.1 に近く、3D 世界理解能力は同モデルの約 80% に達するが、パラメータ数は GLM 5.1 の約 25% しか使用しておらず、かつ内蔵ビジョン機能も備えていると述べています。コメント投稿者の反応は主に比較や懐古主義に留まり、深いベンチマーク分析には至りませんでした。ある投稿者は昔の Excel フライトシミュレーターを参照し、別の投稿者は Qwen 3.7 Max / 27B への関心について言及し、それが Qwen3.6 27B を上回るかどうかを問うています。
あるコメント投稿者は Qwen 3.7 Max を参照してモデル比較の視点から書き込み、将来の Qwen 3.7 27B のリリースを期待しています。また別の投稿者は、Stepfun 3.7 Flash が Qwen3.6-27B よりも優れているかどうかを尋ねています。このスレッドには Qwen3.6-27B を参照するスクリーンショットの証拠(画像)が含まれていますが、定量的なベンチマークスコアや再現可能な評価の詳細は提供されていません。
続きを読む
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み