NVIDIA、アジェンティックAI時代を牽引するRubin GPUアーキテクチャを発表
本文の状態
日本語全文を表示中
詳細モードで約17分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
NVIDIA はAgentic AI時代に対応する次世代GPU「Rubin」を発表し、Blackwell比でエネルギー効率10倍の推論スループットとHBM4搭載を謳う。
AI深層分析を開く2026年7月27日 22:07
AI深層分析
キーポイント
Agentic AIワークロードへの対応
単発のプロンプト応答ではなく、推論・計画・ツール使用・検証を行う持続的な推論ワークロードが主流となり、データセンター全体の再設計が必要とされる。
Rubin GPUの性能向上目標
NVIDIA Rubin GPUはBlackwellアーキテクチャと比較して、エネルギー効率あたりのAgenticスループットを最大10倍に高めることを目指している。
新技術要素の統合
拡張された精度柔軟性を備えたTensor Cores、次世代HBM4メモリサブシステム、そしてNVFP4性能で最大50 petaflopsを達成する第3世代Transformer Engineを搭載する。
アジェンシー推論性能の劇的向上
Vera Rubinプラットフォームは内部2T MoEワークロードにおいて、世代交代による10倍のパフォーマンス向上を示す。
スケーラビリティとインタラクティブ性の拡大
Rubin NVL72 plus Veraシステムは、従来のHopperやBlackwellと比較して約10倍のエージェント数と2倍のツール呼び出し数を支える。
重要な引用
These factories are now tasked with powering agentic workflows that reason, plan, use tools, verify intermediate results, and execute complex multistep tasks across vast contexts.
The data center must be reimagined as a single unit of compute, a vision realized with the NVIDIA Vera Rubin platform.
NVIDIA Rubin GPU, designed to deliver up to 10x more agentic throughput per unit of energy than NVIDIA Blackwell
Figure 1. Pareto frontiers illustrating the 10x generational uplift in agentic inference performance of the Vera Rubin platform (internal 2T MoE workload)
編集コメントを表示
編集コメント
Agentic AIの実用化に向けたハードウェア要件が明確に定義され、Blackwellからの飛躍的な性能向上が期待される。ただし、HBM4やNVFP4といった新技術の実際の導入時期と実環境での安定性は今後の検証が必要である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AI モデルの学習や人間向けのチャットインターフェースとして始まった技術は、今では大規模な知能を生成するための常時稼働型「AI ファクトリ」へと進化しました。これらのファクトリは現在、推論を行い、計画を立て、ツールを活用し、中間結果を検証し、広大なコンテキストにわたって複雑な多段階タスクを実行する「エージェントワークフロー」を支える役割を担っています。
エージェントワークロードは、単一のプロンプトとレスポンスで定義されるものではなく、多くの推論ステップにわたる持続的な推論によって特徴づけられます。これには、1 ステップあたりの低レイテンシ、高いデコードスループット、効率的な長文コンテキストアテンション、大容量の KV キャッシュ、そして密結合した GPU ドメイン間でモデルをスケールさせる能力が求められます。データセンターは計算ユニットとして単一の単位へと再構築される必要があり、このビジョンを実現するのが「NVIDIA Vera Rubin プラットフォーム」です。
このプラットフォームの核心となるのは、NVIDIA Rubin GPU です。これは 1 エネルギー単位あたり、NVIDIA Blackwell に比べて最大 10 倍のエージェント処理能力を実現するように設計されています(図 1)。拡張された精度の柔軟性を備えたTensor Cores、新しい HBM4 メモリサブシステム、そして最大 50 ペタフロップスのNVFP4 パフォーマンスを提供する第 3 世代の Transformer Engine が連携し、エージェントワークロードを効率的に加速します。

本記事では、データ転送や計算効率、長文コンテキストの実行、そしてラック規模での展開に至るまで、エージェント推論のボトルネックを包括的に解決する NVIDIA Rubin GPU と、それと共設計されたスケールアップシステムについて解説します。
Rubin GPU アーキテクチャは、どのようにしてエージェントワークロードをサポートするのか?
ルビン GPU(図 2)は、高密度と高効率を実現するために、リトレイル制限された計算用ダイを 2 つ採用しています。これら 2 つのダイは、NVIDIA High-Bandwidth Interface (NV-HBI) と呼ばれる高速なダイ間リンクによって単一のパッケージ上に統合されています。

このアーキテクチャは、エージェント型ワークロードが推論、生成、検索、ツール利用の間をシフトする際に膨大な計算リソースをいかに有効活用するかという課題から始まります。3,360 億個のトランジスタ、224 のストリーミングマルチプロセッサ (SMs)、896 の Tensor Cores が提供する圧倒的な計算密度と、数値形式に応じて精度を適応させる第 3 世代 Transformer Engine がその基盤となります。この柔軟性により、ルビン GPU は精度を損なうことなく、最大 50 ペタフロップスの NVFP4 推論性能を実現します。
性能は Tensor Core のスループットだけでは決まりません。Rubin GPU は、計算リソースを Graphics Processor Clusters (GPCs) に整理し、大規模な集中型 L2 キャッシュを備えています。GigaThread Engine が作業を調整し、MIG Control が複数のワークロード向けに GPU を分割します。また、NV-DEC がデコード処理を加速します。これらの機能を組み合わせることで、Rubin GPU は計算密度を実際の稼働率に変換し、大規模なエージェントシステムを特徴づける多様で動的なワークロード全体で持続的な利用を実現します。
この稼働率は、データが計算コアにどれだけ速く到達できるかにも依存しています。Rubin は専用 HBM コントローラーと 12-Hi スタックを駆使し、最大 288 GB の HBM4 メモリを搭載することで、ピーク帯域幅として最大 22 TB/s を実現します。強化された Tensor Memory Accelerator (TMA) が複雑なデータレイアウト間での高効率なデータ移動を管理します。また、NVIDIA NVLink 6 は NVLink Switch 経由で GPU から GPU までのオール・トゥー・オール通信に 3,600 GB/s のスケールアップ帯域幅を提供し、NVLink-C2C は CPU と GPU の整合性のある通信に 1,800 GB/s を、x16 PCIe Gen 6 はホスト接続に最大 256 GB/s をそれぞれ提供します。
最後に、大規模なエージェント型システムの展開においては、実行ドメイン内を移動するデータの保護が不可欠です。TEE-I/O を備えた機密コンピューティングは、AI ファクトリー全体で保存中・転送中・使用中のデータを包括的に守るために設計されています。これら計算能力、メモリ機能、接続性、そしてセキュリティ機能を組み合わせることで、大規模化し続けるモデルやスケールアップ領域にわたって効率的な実行を維持する必要があるエージェント型ワークロードのための GPU レベルの基盤が完成します。
Rubin GPU はどのようにして重要な推論パスを加速するのか?
ピーク演算性能だけでは、エージェント型の推論を加速するには不十分です。実際のパフォーマンスは、GPU がデータをどれだけ効率的に移動させ、行列演算を実行し、長いコンテキストの注意機構(アテンション)を処理し、依存関係のあるカーネル間で遷移するかに大きく依存します。本節では、これらの重要な実行パスにおけるオーバーヘッドを削減するために設計された Rubin GPU の機能について解説します。
ラックスケールでの MoE 重みとトークンの移動加速
Mixture-of-experts (MoE) モデルは、多数のエキスパートネットワーク間で動的にトークンをルーティングします。エキスパートの数が増加するにつれて、推論パフォーマンスを向上させるためには、エキスパートの重みを効率的に見つけて移動させることがますます重要になります。
Rubin GPU は、Tensor Memory Accelerator を強化し、エキスパート依存度の高いモデルにおけるデータ移動のオーバーヘッドを削減しました。改良された記述子(ディスクリプタ)処理により、ソフトウェアはメモリ上の異なる場所に存在するが共通のレイアウトを持つテンソルをより効率的に扱えるようになります。
Rubin は、TMA(Tensor Memory Accelerator)向けのインライン記述子更新サポートにより、この課題を改善します。Figure 3 に示すように、メモリ上の記述子を修正するのではなく、同じレイアウトを持つテンプレートに対しては単一の統一された記述子を保持し、メモリアドレスやストライドといったフィールドを TMA 命令内で実行時に直接上書きできるようにしています。

これにより、エキスパート数が増加しても MoE モデルの拡張性が向上します。メタデータ管理やデータ転送のオーバーヘッドを削減することで、Rubin は GPU の処理時間をより多くの有用な推論計算に割くことを可能にし、大規模な MoE モデルを活用するエージェントワークロードにおけるスループット向上を支えます。
ラックスケールでの行列演算効率を倍増へ
Rubin は、1 クロックあたりの Tensor Core の処理能力を 2 倍に引き上げます。これは、d 次元方向で処理できるデータ量を倍増させることで実現されています。この最適化は、スループットボトルネックとなるカーネルだけでなく、メモリ帯域やレイテンシがボトルネックとなるカーネルにも効果的です。
モデルの実行は多くの GPU に分散されるため、各 GPU が受け取る出力作業の断片は小さくなる一方で、集約(reduction)を行う次元のサイズは依然として大きくなります。
より大きな次元を持つことで、ループ回数を減らすことができます。図 4 に示すように、Blackwell では 4 回のイテレーションが必要だった GEMM(行列乗算)が、Rubin では 2 回で完了します。
ループ回数が減ることでオーバーヘッドが削減され、Tensor Core の利用率が向上します。これにより、コンテキスト処理とデコード処理の両方の GEMM が、高いテンソル並列度でもより効率的に実行できるようになります。

エージェント型 AI の長文コンテキスト処理における主要な課題への対応
長文コンテキストやエージェント型 AI のワークロードは、アテンション(注意機構)にますます大きな負荷をかけています。コンテキストウィンドウが大きくなるにつれ、モデルはより多くのトークンを比較し、より巨大なアテンションスコア行列を正規化し、そのスコアを用いて次層の出力生成に用いる値データへの重み付けを行う必要があります。このため、ユーザーあたりの 1 秒間あたりに処理できるトークン数(tokens per second)を向上させる上で、アテンションは最も重要なパフォーマンス経路の一つとなっています。
Rubin は、活性化のスパース性と適応圧縮を組み合わせることでアテンション処理を加速します。また、ソフトマックスのスループットも向上させています。
Rubin の新しいスパース性機能をアテンションに安全かつ効果的に活用するシンプルな方法があります。まず、アテンションパイプラインは密な計算(dense computation)から始まり、中間のアテンションスコアを生成します。その後、Rubin はこの中間データを Tensor Memory から読み取り、構造化された 2:4 スパース圧縮形式に変換します。これにより、非ゼロ値と効率的に利用するためのメタデータが同時に生成され、スコアの書き込みコストやストレージ要件を削減できます。
その結果、後のアテンション処理段階ではデータを減らして動作できるようになりますが、モデルの残りの部分が期待する密な出力フォーマットは維持されます。

図 5 Rubin のスパース性機能は、アテンションブロックと MLP ブロックの活性化に適用可能です
この圧縮中間表現は、ソフトマックスと2回目のアテンションGEMMという2つの重要な箇所での処理負荷を削減します。ソフトマックスはゼロでないアテンション値のみで動作可能となり、続く密行列との乗算では、ソフトマックスからの非ゼロ値と元の圧縮ステップからのメタデータを活用したスパースMMA(行列演算)を利用できます。その結果、長文コンテキストにおけるアテンション処理の中で最もコストがかかる部分での計算量とデータ転送量が削減され、周辺モデルパイプラインのインターフェースを変更することなく、トークンあたりの電力効率を向上させることができます。
Rubinはまた、ソフトマックスのスループットも改善しています。Tensor Coreのスループットが向上する一方で、指数関数計算やアテンション行全体での集約処理に依存するため、ソフトマックスがボトルネックとなる可能性があります。Rubinでは指数関数の演算スループットを強化し、Blackwell世代のベースラインと比較してFP32で2倍、BF16/FP16で4倍のスループットを実現しました。これにより、高速化する行列演算にソフトマックスが追いつくことが可能になっています。
| NVIDIA GPU プラットフォーム | FP32 指数スループット(SM あたりクロックあたり) | BF16/FP16 指数スループット(SM あたりクロックあたり) |
|---|---|---|
| Blackwell | 1x | 1x |
| Blackwell Ultra | 2x | 2x |
| Rubin | 2x | 4x |
表 1. Blackwell から Rubin へ向けてスループットが指数関数的に向上
これらの機能により、Rubin のアテンション加速は単一のカーネル改善を超えたものとなります。活性化のスパース性が中間的なアテンション処理量を削減し、より高速な指数計算がソフトマックスのボトルネックを解消します。
カーネル実行効率の向上
推論処理においてモデル規模が大きくなり、複数の GPU にまたがるようになると、Tensor Core の純粋なスループットだけでは性能を説明しきれません。GPU はカーネル間をいかに効率的に移動できるかも重要です。特に推論では、活性化データがクリティカルパス上に位置することが多く、これがボトルネックになりがちです。あるカーネルが活性化データを生成してメモリへ書き出し、次のカーネルがそのデータを読み込んで次のトークンを生成する、という一連の流れがこれに該当します。
従来のプロデューサー・コンシューマー型の実行方式では、GPU のタイムライン上に「待ち時間(バブル)」が生じる可能性があります。プロデューサー側のカーネルは一部のタイルやスレッドブロックの処理を早く完了できるものの、依存関係が解消されるまでコンシューマー側は有効な作業を開始できません。
Blackwell ではプログラムによる従属起動機能でこれを改善しましたが、必要な活性化データが利用可能になるまで、従属する作業が待たされるケースはまだあります。

図 6: プロデューサー・コンシューマーの重なり。Blackwell のバルクトリガー(上)と Rubin のタイルレベルトリガー(下)
Rubin は、依存関係にあるカーネル間のより微細な調整を可能にします。これにより、必要な入力データが利用可能になった時点でコンシューマー側の処理を開始でき、プロデューサー側の作業全体が完了するまで待つ必要がなくなります。
その結果、GPU のタイムラインはより密に詰められ、アイドル状態のギャップが減少し、依存関係にあるカーネル間の重なりが改善されます。これは特にアジェンティック推論において価値が高く、ここでは活性化値がモデル内を順次通過するため、カーネル間遅延がユーザーあたりの 1 秒間に生成されるトークン数に直接影響します。
Rubin のメモリと通信は、どうやって高スループット推論を支えるのか?
モデルやコンテキストウィンドウ、GPU ドメインが大きくなるにつれ、データ移動の重要性は計算と同程度になります。Rubin は、GPU 内部およびスケールアップシステム間における重み、活性化値、KV キャッシュデータ、通信トラフィックの流れを改善するように設計されています。以下のセクションでは、高スループット推論を支えるメモリと通信に関する革新について解説します。
スピードアップされたスケールアップ通信
推論が単一の GPU からラック全体のシステムへとスケールするにつれ、通信は重要な性能パスの一部となります。通信を GPU カーネル内に直接統合することで、カーネルは停止して CPU に制御を戻す必要がありません。代わりに、計算が進行中のまま NVLink を介して他の GPU へデータを直接書き込んだり、集約処理を行ったりします。
従来のGPU間通信では、ペイロードデータの転送に加えて調整や同期処理が必要でした。これらの手順はレイテンシを増加させ、特に分散推論ワークロード内で頻繁に通信が発生する場合、相互接続帯域幅を消費する要因となります。
Rubinアーキテクチャでは、デバイスが開始するNVLink通信に対して「カウント書き込み」機能を導入しました。これにより、受信側GPUが転送完了を追跡しやすくなり、GPU間データ転送の同期処理が効率化されます。

NVLinkにカウント書き込みを融合させることで、GPU間データ転送の調整を低レイテンシで実現し、同期処理を待たずに計算処理を継続できるようになります。
推論におけるデコード(生成)フェーズは、本質的にメモリサブシステムに制約されます。重要なのはピーク帯域幅のスペックではなく、各カーネルがメモリサブシステム全体をいかに効率的に活用できるかです。現代の推論やエージェントワークロードでは、デコードにかかるエンドツーエンドの実行時間が長くなる傾向があり、この制約がさらに顕著になります。長いコンテキスト、大規模な KV キャッシュ、対話型のトークン生成といった要素により、実現可能なメモリ帯域幅がパフォーマンスを左右する重要なレバーとなっています。
AI算出
主要ニュースainew評価高い
記事は AI エージェント推論に特化した新 GPU「Rubin」の詳細、NV-HBI 技術、HBM4 メモリ、および NVFP4 パフォーマンスなど具体的な技術的革新と数値(10 倍向上、50 ペタフロップス)を報じており、新規性と AI 関連性が極めて高い。ただし、日本企業や日本固有の導入事例・規制に関する記述は含まれていないため、日本の文脈での直接価値は限定的である。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み