NVIDIA、AIファクトリ向けスケールアップネットワーク「NVLink」を発表
本文の状態
日本語全文を表示中
詳細モードで約23分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
NVIDIA は AI ファクトリー向けに、GPU 間通信の帯域と遅延を最適化する第 6 世代 NVLink とスイッチを発表し、大規模モデルの効率的な運用を支える基盤技術として位置づけた。
AI深層分析を開く2026年8月5日 15:27
AI深層分析
キーポイント
AI ファクトリーの定義と要件
データセンター規模でデータを知能に変換する AI ファクトリーでは、単なるピーク演算性能ではなく、多数のアクセラレータを単一計算ユニットとして連携させることが不可欠である。
スケールアップネットワークの重要性
アクセラレータ間の高速通信と低遅延が実現できなければ、トークンの移動や集合演算がボトルネックとなり、ファクトリーの全体スループットとリスク管理に直結する。
第 6 世代 NVLink の技術的特徴
NVIDIA が発表した第 6 世代 NVLink と NVLink 6 スイッチは、スケールアップネットワークにおいて最高クラスの帯域と最低の遅延を提供し、SHARP による集合演算オフロードもサポートする。
エンドツーエンドのコデザイン
チップからシステム、ファブリック、ソフトウェアに至るまで全体を設計・最適化するコデザインにより、NVIDIA はこの技術を成熟したインフラストラクチャのバックボーンとして確立している。
Scale-up ネットワークの役割と経済性
Scale-out はデータセンター全体のサーバーを接続するが、Scale-up はドメイン内の GPU を単一の計算エンジンとして振る舞わせる。このネットワークは ROI を最適化し、ワット・ドル・平方フィートあたりのトークン数を最大化することでコスト削減を実現する。
重要な引用
Peak accelerator FLOPS are no longer enough.
The scale-up fabric is what enables accelerators to work as a single unit of compute
NVIDIA NVLink is the purpose-built scale-up networking fabric for AI factories.
All of the GPU-to-GPU communication must happen in parallel. If the experts sit behind a low-bandwidth or high-latency fabric, gains from expert parallelism can be erased by communication overhead.
編集コメントを表示
編集コメント
本記事は、AI ファクトリーという概念の定着に伴い、ハードウェア単体の性能競争からシステム全体の連携効率へのパラダイムシフトを浮き彫りにしている。NVIDIA の技術ロードマップが産業標準として確立されつつある現状を示唆する重要な資料である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AI への需要は加速し続けています。処理負荷は増大し、モデルは複雑化を遂げ、AI コンピューティングインフラの展開にはかつてないほどのスピードが求められています。この渇望する需要に応えるため、データとエネルギーを継続的に知能へと変換するデータセンター規模のシステムである「AI ファクトリー」AI factories が展開されています。
この AI ファクトリーというアプローチは、データセンターにおけるシステムの設計と運用を根本から変えました。ピーク時のアクセラレータの演算性能(FLOPS)だけではもはや不十分です。現在では、パラメータ数が 1 兆を超えるモデルや混合专家アーキテクチャ(MoE)、長い文脈での推論、そして非集約型サービスなど、AI ワークロードは多数のアクセラレータが一つの計算ユニットとして連携する必要があります。これを実現するには、GPU と GPU の間の高速・低遅延な通信、集合演算のための迅速なネットワーク内計算、そしてソフトウェアを意識したスケジューリングが不可欠です。
構成要素の数が膨大であるため、レジリエンス(回復力)はデータセンター全体に組み込まれる必要があります。AI の進化スピードに追いつき続けるには、業界のイノベーションと同じ速度で動ける技術とサプライチェーンが求められます。
これが、スケールアップ・ネットワーキングが AI ファクトリーにおける最も重要なアーキテクチャ上の意思決定の一つとなっている理由です。スケールアップ・ファブリックは、アクセラレータを単一の計算ユニットとして機能させるものであり、トークンがエキスパート間をどのように移動するか、集合演算がどの程度迅速に完了するか、そしてファクトリーがどれだけの有用なスループットを提供できるかを決定します。また、これは新しいプラットフォームを導入する際にオペレーターがどの程度のリスクを負うかにも大きく影響する要素です。
NVIDIA NVLink は、AI ファクトリー向けに設計された専用スケールアップ・ネットワーキング・ファブリックです。これは、大規模かつ高速な GPU 間通信を必要とする AI 推論、トレーニング、その他の並列計算ワークロードを加速するために作られています。第 6 世代の NVLink インターコネクトと NVLink 6 スイッチは、スケールアップ・ネットワーキングにおいて最低レイテンシで最高速度の GPU 間帯域幅を提供する全対全トポロジーを実現し、集合演算をオフロードするための SHARP(Scalable Hierarchical Aggregation and Reduction Protocol)によるインネットワーク計算もサポートしています。さらに、生産環境での AI ファクトリーの稼働率向上のために設計されたラックレベルの耐障害性機能も備えています。
チップからシステム、ファブリック、ソフトウェアに至るまで全体を一体的に設計・最適化する極限までの共同設計(コデザイン)によって開発された NVLink は、NVIDIA の年次 AI インフラストラクチャロードマップの一部として位置づけられています。この成熟し、実証済みで広く展開されている技術が、現代の AI インフラストラクチャを支える骨格となっています。
スケールアップ・ネットワーキングが AI ファクトリーの経済性を決定する理由
データセンター全体でサーバーを接続するのが「スケールアウト」ネットワークです。一方、ドメイン内の GPU を単一の計算エンジンとして振る舞わせるのが「スケールアップ」ネットワークです。どちらも不可欠ですが、解決する課題は異なります。
NVIDIA Quantum InfiniBand や NVIDIA Spectrum-X Ethernet といったスケールアウトファブリックは、数千から数十万の GPU に及ぶ大規模クラスターを構築します。これは、大規模なデータ並列処理による AI 学習ワークロード(および大規模な科学シミュレーション)にとって極めて重要です。
一方、スケールアップファブリックは、単一のドメイン内のアクセラレーター同士を、高帯域幅と予測可能な低レイテンシ、そして共有された高帯域メモリアーキテクチャ(HBM)で接続します。現代の AI 学習や推論において、レイテンシに敏感な通信パターンが最も頻繁に発生するのは、まさにこのスケールアップ領域です。
具体例として、MoE モデルにおける推論を見てみましょう。
効率的な推論実装では、expert parallelism を活用して専門家(エキスパート)を GPU 間に分散させ、大規模バッチサイズを採用してファクトリ全体のスループットを最大化します。これによりワークロードは並列化されますが、GPU 間での集中的なオール・トゥー・オール通信が発生します。トークンは選択されたエキスパートに配信され、処理され、集約され、再順序付けられて次に渡される必要があります。
GPU から GPU への通信はすべて並列で行われなければなりません。もし専門家が低帯域幅や高レイテンシのファブリックに囲まれていれば、専門家並列化によるメリットは通信オーバーヘッドによって相殺されてしまいます。この現象は MoE モデルのトレーニング時にも同様に見られます。
重要な点は、すべてのオール・トゥー・オール(all-to-all)帯域幅とレイテンシが AI ファクトリーの性能に決定的な影響を与えるということです。AI ファクトリーでは、負荷下やあらゆるワークロードにおいてこれらの能力を維持できるよう、システム全体と協調設計された専用スケールアップネットワークが必要です。スケールアップネットワークは、ワットあたり、ドルあたり、そしてファクトリーの床面積あたりの提供トークン数を最適化することで ROI(投資対効果)を向上させます。その結果、トレーニング期間の短縮、利用率の向上、そして AI ファクトリーにおけるトークン単価の低下が実現します。
NVIDIA は、大規模な MoE において高帯域幅・低レイテンシのスケールアップネットワークがもたらす影響を実証しました。DeepSeek-R1 や Qwen 235B、そしてシミュレーションされた 2T パラメータの LLM といったモデルにおいて、NVLink は主要な市販 Ethernet(OTS)と比較して、最大で 2.3 倍のデコードスループットを実現します。

図 1:第 6 世代 NVLink は、OTS Ethernet(72 アクセラレータのスケールアップドメイン)と比較して、デコードスループットを最大 2.3 倍向上させます。結果はシミュレーションに基づくものです。
スケールアップ技術の評価
仕様書では、ファブリックを比較する際に単純な帯域幅の数値(リンクレート、スイッチの集約容量、あるいはデバイスあたりのヘッドライン帯域幅など)が用いられることがよくあります。これらの数値は有用ですが、それだけでは不十分です。
今日の AI ワークロードに対するスケールアップ能力を評価するには、工場全体の視点に立つ必要があります。重要なのは、単位時間あたり、消費電力あたり、そして工場の敷地面積あたりに処理・生成できるトークン数を決定する「実効的なフルシステム性能」です。これには、すべての GPU の HBM メモリからファブリックを経由して他のすべての GPU の HBM メモリに至るまでのエンドツーエンドのレイテンシ(つまり、全ノード間の通信遅延)、ネットワーク内での集約計算やその他の集合操作のための計算能力、そして今日使われているライブラリやフレームワークを完全にサポートし、ルーティングの最適化、集合操作の露出、リンクトラフィックの負荷分散、データ転送のパイプライン化を実現する全レベルにわたる統合ソフトウェアが不可欠です。
工場の稼働状況が確保されていなければ、実効性能は意味を持ちません。故障なく長時間運転し続ける能力、システムヘルスの継続的な監視、そして工場全体の運用を維持しながらコンポーネントレベルでのサービスや保守をサポートする能力こそが、理論上の性能を実際の生産性(グッドプット)へと変換します。これは、工場の全寿命にわたってどれだけ生産できるかを示す指標です。
複雑な技術を通じて、多様なワークロード全体で最適なパフォーマンスと実効スループットを達成することは、極めて困難な課題です。この課題は、広く展開されたスケールアップインフラストラクチャでの長年の経験と、堅牢なサプライチェーンによって解決されてきました。
未検証の技術スタックを使用したり、スケールアップネットワークに特化していないソリューションを採用したりすると、工場のパフォーマンスが最適化されなかったり、稼働停止による大きな支障が発生したり、供給が不安定になったりするリスクがあります。
これらの指標は、AI ファクトリーのライフサイクルを通じて持続可能で信頼性の高い投資収益率(ROI)を達成するという、唯一重要となる結果へとつながります。
AI ファクトリーにおけるスケールアップネットワークの主要指標
| 提供されるパフォーマンス | ファクトリーの回復力 | プラットフォームの成熟度と実証されたサプライチェーン |
|---|---|---|
| 今日の AI ワークロードにおける提供されるファクトリーパフォーマンスは、帯域幅とレイテンシから始まりますが、还包括エンドツーエンドのスケーラブルネットワークのパフォーマンス、集約やその他のコレクトティブのためのネットワーク内計算、そしてソリューションのすべての部分を通じて統合された成熟したフルスタックの実装を含みます。 | 提供されるパフォーマンスを実効性のあるスループット(goodput)に変換するには、システム全体の回復力が必要です。これには、長時間の稼働時間、継続的なシステムヘルスモニタリングとテレメトリ、そしてファクトリーの残りが稼働し続ける中でコンポーネントレベルでのサービスおよびメンテナンスのサポートが含まれます。 | AI ファクトリーのスケーリングは、多くの依存関係を持つ極めて複雑な課題です。オペレーターは、大規模展開の実績と実現された ROI を持つ成熟した技術スタックを活用することでリスクを最小限に抑えたいと考えています。 |
表 1. スケールアップ・ネットワークソリューションを評価する上で、この 3 つの主要指標が極めて重要です。
NVLink:パフォーマンス、レジリエンス、成熟度
現在第 6 世代を迎えた NVLink は、ファクトリーの良質処理量(goodput)を最大化するために必要な性能と耐障害性を提供します。10 年以上にわたるスケールアップ技術への投資実績があり、世界有数のハイパースケーラー、クラウドサービスプロバイダー(CSP)、スーパーコンピューティングセンターなどでの実証済み導入事例も多数あります。
世界トップクラスのパフォーマンス
Vera Rubin NVL72 を搭載した第 6 世代 NVLink は、1 つの GPU あたり 3.6 TB/s の双方向 GPU-間帯域幅と、72 GPU ドメインにおけるラックレベルで 260 TB/s の GPU 帯域幅を実現します。GPU 間の転送にかかるエンドツーエンドのレイテンシは、市販のエサネット(Ethernet)ベースの代替ソリューションと比較して 3 分の 1 に低減され、パケットレートは 10 倍向上しています。
- 3 分の 1
レイテンシ低下
- 10 倍
パケットレート向上
- 130 TFLOPS
ネットワーク内での計算能力
市販のエサネットベースの代替ソリューションと比較して、第 6 世代 NVLink は GPU 間転送におけるレイテンシの低減とパケットレートの向上を実現するだけでなく、集合演算(collective operations)のためのネットワーク内計算機能も備えています。
NVLink スイッチトレイと NVLink スパインを構成する 5,000 本のケーブルは、単一のオール・トゥー・オール(all-to-all)トポロジーを形成しています。これにより、どの GPU でも他の任意の GPU と均一なレイテンシと帯域幅で通信することが可能になります。
各トレイには NVLink 6 スイッチチップが 4 つ搭載されており、総帯域幅は 28.8 TB/s、ネットワーク内計算能力(in-network compute)は FP8 で 14.4 TFLOPS を提供します。単一の Vera Rubin NVL72 ラックでは、NVLink 6 が集約帯域幅 260 TB/s とネットワーク内計算能力 130 TFLOPS を実現し、リダクションやその他の集合操作(all-reduce、reduce、broadcast など)の高速化を支援します。
NVLink の技術ロードマップには、最大 1,152 GPU に至るスケールアップドメインへの対応と、コパッケージ光学(co-packaged optics)による接続サポートが含まれています。

スケールアップネットワークスタックにおいて、ソフトウェアは極めて重要な要素です。NVIDIA Dynamo、NVIDIA TensorRT-LLM、NVIDIA Collective Communications Library(NCCL)などが含まれます(これらについてはプラットフォームの成熟度に関するセクションで詳しく解説します)。これらはすべて、約 20 年前に初めてリリースされた世界をリードする並列コンピューティングプラットフォームである NVIDIA CUDA を基盤として構築されています。
ハードウェアとソフトウェアは、極限の共設計 を通じて開発されています。これにより、個別に最適化された要素だけでは達成できない性能向上が可能になります。今日の AI ワークロードにおいては、これが直接的なインフラ経済性の向上につながります。
具体例として、NVIDIA Hopper から NVIDIA Blackwell への移行では、NVLink の帯域幅を倍増させ、NVLink スケールアップドメインのサイズを 8 GPU から 72 GPU に拡大し、分散推論のために Dynamo を導入しました。その結果、ワットあたりの MoE(Mixture of Experts)推論性能が 50 倍向上しています。
NVIDIA の Vera Rubin プラットフォーム はさらに、NVLink の帯域幅とネットワーク内計算能力の両方を倍増させることで、この進化を推し進めています。

モデルアーキテクチャが進化するにつれ、ハードウェアの基盤とソフトウェアの通信スタックもともに進化します。この極端な協調設計アプローチの開発には、スタック全体にわたる緊密な連携が不可欠です。特に超スケール展開における圧力下では、開発を分断したアプローチでこれを再現するのは現実的ではありません。しかし、単にアクセラレータを追加するのと、実用的なパフォーマンスとしてスケーリングするのでは、その差は歴然としています。
速度とインテリジェントな耐障害性の両方を備えた設計
AI ファクトリーは継続的に稼働し続ける必要があります。ラックが高密度化し価値が高まるほど、保守性と障害管理はパフォーマンスの方程式の一部となります。高い帯域幅を提供する一方で、破壊的なメンテナンスを必要とするファブリックでは、実効容量や収益が損なわれる恐れがあります。
NVLink 6 は、AI ファクトリー運用向けに設計された管理機能とインテリジェントな耐障害性機能を導入しました。これらの機能により、ラックの保守が容易になり、コンポーネントのパフォーマンスや負荷分散に関する洞察が得やすくなり、個々のノードでサービスやアップデートが必要な場合でもファクトリーの稼働を維持できます。
第 6 世代の NVLink Switch は、アップタイムと有効スループット(goodput)を最大化するためのインテリジェントな耐障害性機能をサポートしています:
- コントロールプレーンの耐障害性
- 部分的に搭載されたラックでの動作対応
- ホットスワップ可能なスイッチトレイ
- 管理コントローラーのフォールバックを備えたソフトウェア定義ルーティング
- ダイナミックなトラフィック再ルーティング
- サービス中のソフトウェアアップデート
- モニタリングと障害特定のための微調整済みのリンクテレメトリ
これらの機能は二次的なものではありません。生産環境の AI ファクトリーにおいて、リンクやスイッチ、トレイ、管理コントローラーのいずれかが故障しても、ラック全体が停止してはなりません。運用担当者は、インフラストラクチャの経済的価値に見合った障害分離、テレメトリ、およびサービス手順を必要としています。NVLink 6 は、スケールアップネットワークを AI ファクトリースタックの残りの部分と同じ運用規範に統合します。
成熟した技術と高速な開発サイクル
最も強力な技術戦略は、成熟度とスピードを両立させるものです。NVLink はその両方を備えています。
NVLink は現在、目的別に設計されたスケールアップネットワークファブリックの第 6 世代を迎えました。ほぼ 10 年にわたり大規模な生産環境で展開されており、数百万個の NVIDIA チップが NVLink 対応システムに搭載されています。また、サーバー、ラック、ケーブル、スイッチ、ソフトウェア、運用ツールを含むエコシステムも確立されています。
NVIDIA の年次プラットフォームサイクルは、AI イノベーションのペースに合わせて新機能を提供し、業界が世界の AI ニーズに応えるために新しいモデルやワークフローを迅速に展開できるよう支援します。
ハードウェアに加え、NVIDIA とコミュニティはスケールアップネットワークスタックの重要な構成要素としてソフトウェアも提供しています。その一例が以下です。
- **Dynamo**:分散型サービスや動的な GPU 割り当て、KV キャッシュ対応ルーティング、NIXL ベースのデータ転送を備え、マルチノード GPU 環境で生成 AI や推論モデルをスケーリングするためのオープンソースフレームワーク。
TensorRT-LLM:NVIDIA GPU 上で高性能な大規模言語モデル(LLM)推論を実現するオープンソースの NVIDIA ライブラリです。最適化されたカーネル、計算と通信のオーバーラップ、NVFP4 や FP8 といった低精度フォーマットを活用し、MoE モデルを含むスループットの向上を図ります。
NIXL:GPU メモリ、CPU メモリ、NVMe、リモートストレージ間での高速なデータ転送を可能にするオープンソースの NVIDIA ライブラリです。分散システムにおいて KV キャッシュや推論状態を効率的に移動させるのに役立ちます。
NCCL:10 年以上にわたるオープンソースの革新を積み重ねた、高速な GPU 通信のためのオープンな NVIDIA ライブラリです。トポロジ対応のコレクティブ操作、主要 AI フレームワークとの統合、ネットワーク内での集約やその他の集合演算をサポートする SHARP 機能を備えています。
ファブリックとメモリ管理:アドレス空間管理 API、拡張可能なメモリスемantics、効率的な HBM アクセスのための組み込みメモリ整合性を提供します。
ソフトウェアの革新はハードウェアリリース後も継続し、製品ライフサイクルを通じて X ファクターによる速度向上を実現します。
NVLink-C2C がファブリックを CPU へ拡張
AI ファクトリーには、GPU から GPU への帯域幅だけでなく、オーケストレーション、データ移動、メモリ管理、ストレージサービス、計算フェーズが混在するエージェントワークロードに対応するための、高帯域幅かつ整合性を保つ CPU-GPU 接続も必要です。
その道筋を示すのが NVIDIA NVLink-C2C です。Vera Rubin NVL72 プラットフォームに搭載される Vera CPU を用いることで、NVLink-C2C は CPU と GPU の間で 1.8 TB/s の整合性のある帯域幅を実現します。これは PCIe Gen6 の 7 倍の速度です。これにより、CPU と GPU のメモリ間での高速なデータ共有と、統合された整合性メモリアーキテクチャが可能になります。
インフラチームにとっては、制御・メモリ・計算処理間のボトルネックが削減されることを意味し、ソフトウェアチームにとってはプログラミングモデルが簡素化され、KV キャッシュのオフロードやマルチモデル実行、データ処理、エージェント型オーケストレーションといったワークロードに対応できるようになります。
Vera はこの役割のために設計された CPU で、88 基の NVIDIA カスタム Olympus コアを搭載し、AI ファクトリー向けワークロードに最適化された高いメモリ帯域幅と省電力動作を実現しています。NVIDIA のプラットフォームでは、CPU、GPU、NVLink、HBM、システムメモリ、ネットワーク、そしてソフトウェアが協調して設計され、パフォーマンスの最適化を図っています。
NVLink Fusion: 一から作り直す必要のない半カスタム XPU インフラストラクチャ
ハイパースケイラーや AI ネイティブ企業は、特定のワークロード向けに専用シリコンを構築し、顧客に選択肢を提供していますが、その展開にはいくつかの課題があります。最先端のスケーラブル・ネットワークの統合、ラック規模全体のアーキテクチャ設計と実装、シリコン供給リスクを踏まえたデータセンター設計へのコミットメント、そして異種混合インフラのサポートなど、それぞれが固有の難しさを伴います。
「NVIDIA NVLink Fusion」(https://www.nvidia.com/en-us/data-center/nvlink-fusion/) がその道筋を示します。NVLink Fusion は、独自シリコンを NVIDIA の世界最高峰の AI インフラプラットフォームに接続するための、高帯域・低遅延な相互接続技術および IP です。これにより、企業は実証済みの NVLink スケールアップスタックとエコシステムを活用して、開発や導入の複雑さを軽減し、パフォーマンスを向上させ、半カスタム AI ファクトリの市場投入までの期間を短縮できます。さらに、単一の統一アーキテクチャに標準化することで、データセンター全体の運用が簡素化され、データセンター容量の柔軟な再割り当てが可能になります。また、カスタム AI XPUs を GPU とシームレスに統合した分散コンピューティングを実現します。
これは、「独自 XPUs か、世界クラスの AI プラットフォームか」という二者択一の制約を解消することで根本的な課題を解決するものです。NVLink Fusion は NVIDIA の技術ロードマップに合わせて進化するため、採用企業も同社の年次サイクルに遅れずに追随できます。
生産向け AI ファクトリの道筋
次の AI ファクトリで勝つのは、単体で最も高速なアクセラレーターを持つ企業ではありません。最も少ない導入リスクで、トークンあたりのコストを最小限に抑えながら、最大の知能を提供し、最も速いサイクルで実現できるインフラを持つ企業が勝ちます。
NVLink は、3 分の 1 の低遅延と 10 倍の高速パケット転送、さらにネットワーク内計算能力として 130 TFLOPs を実現し、ファクトリーレベルの耐障害性と成熟した実績あるプラットフォームを提供します。AI ファクトリーは現在、AI コンピューティング時代の基盤インフラとして確立されつつあります。NVLink は、これらを支えるための高性能、運用性、成熟度、そして継続的なイノベーションを届けるネットワークです。
NVIDIA Vera Rubin Platform や NVLink、NVLink Fusion について詳しくは、それぞれのリンクをご覧ください。
AI算出
主要ニュースainew評価高い
記事は NVLink の新世代技術とその経済的・技術的意義について詳細に記述しており、AI インフラの核心となる新規事実を含んでいるため novelty は高く評価される。ただし、日本企業固有の情報や日本語一次情報ではなく、グローバルな技術発表であるため japan_relevance は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み