NVIDIA、Spectrum-X Ethernet で大規模 AI のネットワークボトルネックを解決
本文の状態
日本語全文を表示中
詳細モードで約21分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
NVIDIA は、生成 AI の大規模化により生じたデータセンターのスケールアウトネットワークのボトルネック解消に向け、従来のイーサネットルールを書き換える「Spectrum-X Ethernet」を発表した。
AI深層分析を開く2026年8月25日 01:01
AI深層分析
キーポイント
従来型イーサネットの非効率性
従来のイーサネットは高エントロピーな一般トラフィックには適しているが、AI 学習で必要とされる同期された大規模フローに対してハッシュ衝突や遅延を引き起こし、ボトルネックとなる。
Spectrum-X のアーキテクチャ
NVIDIA はスイッチとホスト側の NIC を協調設計した「Spectrum-X Ethernet」を導入し、極限状態下での予測可能な低遅延と高いファブリック利用率を実現する。
Multiplane 技術の活用
Spectrum-X Multiplane 技術を最大限に活用することで二分帯域幅を最大化し、AI の導入期間(Time-to-AI)を短縮する構造となっている。
Lossy と Lossless の運用における課題
RoCEv2 でパケット損失を防ぐために Priority Flow Control (PFC) を使用すると、一時停止フレームが混雑を伝播させ、ヘッド・オブ・ラインブロッキングやファブリックの停止を引き起こす可能性がある。
遅い輻輳制御
データセンター量子化輻輳通知 (DCQCN) などのプロトコルは同期された AI バーストに対して調整が難しく、反応の遅延や過剰な対応がバッファ蓄積やレイテンシの急上昇を招く。
重要な引用
As distributed model training scales to span hundreds of thousands of GPUs, the scale-out network connecting these nodes has emerged as a first-order performance bottleneck.
Spectrum-X Ethernet co-designs high-performance switches and host-side network interface cards (NICs) to deliver predictable low latency, high fabric utilization, and robust resilience under extreme load and stress.
"noisy neighbor" traffic from one job can bleed into another, causing an All-to-All collective's bandwidth to collapse by more than 80%.
Spectrum-X Ethernet, by isolating congestion per plane and dynamically routing around hotspots, maintained a stable training step time of 668 ms under both standalone and heavily congested multi-tenant conditions representing virtually zero degradation.
編集コメントを表示
編集コメント
生成 AI の急成長により、計算リソースだけでなくネットワークインフラの設計が重要度を増している。NVIDIA はこの課題に対し、ソフトウェア的な最適化ではなくハードウェアレベルでの根本解決を提示しており、業界の標準が変わる可能性を示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
生成AIの爆発的な成長は、データセンター設計を根本から変えました。分散型モデルのトレーニングが数十万個ものGPUに及ぶ規模へと拡大する中、これらのノードをつなぐスケールアウトネットワークが、パフォーマンスにおける最大のボトルネックとして浮上しています。
長年にわたり、従来の汎用イーサネットはエンタープライズおよびクラウドネットワークにおいて疑う余地のない王者でした。安価で標準化されており、一般向けの高エントロピーなウェブトラフィックを処理する能力に優れています。しかし、AIアーキテクチャが要求する大規模かつ高度に同期された通信パターンを従来のイーサネットが強制的に処理しようとすると、物理的な限界に直面します。
このギャップを埋めるために、NVIDIA は Spectrum-X Ethernet を導入しました。これは、ギガスケールの AI ファクトリー向けにゼロから設計されたハードウェアアクセラレーション型ネットワークアーキテクチャです。数十年も前のルーティングや輻輳制御のパラダイムに依存する従来のイーサネットとは異なり、Spectrum-X Ethernet は高性能スイッチとホスト側のネットワークインターフェースカード(NIC)を協同設計することで、極度の負荷とストレス下でも予測可能な低遅延、高いファブリック利用率、そして堅牢な耐障害性を実現します。
本稿では、従来のイーサネットが AI ワークロードに不向きである構造的限界を探り、Spectrum-X Ethernet の独自アーキテクチャ原則を分解し、さらに Spectrum-X Multiplane 技術がいかに二分帯域幅を最大化して Time-to-AI を加速させるかを解説します。
衝突する道:なぜ従来のイーサネットは AI ワークロードに対応できないのか
標準的なデータセンターのトラフィックはエントロピーが高く、数百万もの独立した小さなフローが異なる方向へ流れます。Equal-Cost Multi-Path (ECMP) ルーティングはこのフローを並列パスに分散させるため静的なフローハッシュを使用し、一般的にはバランスの取れた利用状況を実現します。
一方、AI 学習トラフィックはエントロピーが低く、GPU は All-Reduce や All-Gather、All-to-All といった集合操作を通じて継続的に同期を行います。その結果、数少ない非常に大きな同期フローが発生します。これが従来のイーサネットの3つの限界を浮き彫りにしています。
- ハッシュ衝突と遅延ノード(ストランガラー): ECMP はリアルタイムの輻輳状況を考慮しないため、大規模なフローが特定のリンクで衝突し、他のパスは過小利用される事態が発生します。同期型集合操作は最も遅いフローが完了するまで終了できないため、1 つでも輻輳した経路が存在すると、その集合全体の処理が遅延し、多くの GPU がアイドル状態に陥ります。
- 損失ありと損失なしの運用: 輻輳によりスイッチバッファが溢れ、パケットロスや再送が発生します。これらは AI パフォーマンスに深刻な悪影響を及ぼします。RoCEv2 の導入では損失を減らすために Priority Flow Control (PFC) がよく使われますが、一時停止フレームは輻輳を広げ、先頭ブロック(head-of-line blocking)を引き起こし、ネットワーク全体を停止させるリスクさえあります。
- 低速な輻輳制御: Data Center Quantized Congestion Notification (DCQCN) などのプロトコルは、同期する AI バーストに対して調整が難しく、遅れた反応や過度な反応がバッファの蓄積、リソースの未利用、そしてレイテンシの急上昇を招く可能性があります。
「ほぼ完璧なマルチテナント分離」:従来のイーサネットでは、あるジョブからの「ノイジー・ネイバー(混雑する隣人)」トラフィックが他のジョブに漏れ出し、All-to-All コレクティブの帯域幅が 80% 以上も低下するという問題が発生します。この分離機能の欠陥は、DeepSeek-V3 LLM のトレーニングシミュレーションで実証されました。単独実行時には標準イーサネットでもトレーニングステップ時間は 735 ms を記録しましたが、背景ノイズトラフィックを導入すると、ステップ時間は 1.18 秒に膨れ上がり(1.6 倍の遅延)しました。一方、Spectrum-X イーサネットは混雑を平面ごとに分離し、ホットスポットを動的に迂回することで、単独実行時でも過密なマルチテナント環境下でもトレーニングステップ時間を 668 ms で安定維持し、実質的な性能低下は見られませんでした。
![RDMA ノイズトラフィック下における DeepSeek-V3 トレーニングステップ時間の分離。従来のイーサネットは背景負荷下で 1.6 倍の遅延(735 ms から 1.18 秒)を記録する一方、Spectrum-X イーサネットはほぼ完璧な分離により安定したトレーニングステップ時間(668 ms)を維持します [1, 4].](https://developer-blogs.nvidia.com/wp-content/uploads/2026/08/image3-3.webp)
*図 1. RDMA ノイズトラフィック下における DeepSeek-V3 トレーニングステップ時間の分離*
Spectrum-X イーサネットの解明:3 つの相互連動する制御ループ
800 Gbps を超える速度域において、伝搬遅延は光の速さによって固定されますが、その結果として帯域幅と遅延の積(Bandwidth-Delay Product)は極めて巨大なものになります。この状況でキューの蓄積やパケット損失を防ぐには、ネットワークファブリックがマイクロ秒単位でリアルタイムに輻輳を検知し、即座に対応できる必要があります。
ソフトウェアベースの制御パスではこうした厳密な時間制約に応えることができないため、Spectrum-X Ethernet ではハードウェアによる完全なアクセラレーションを設計上の必須要件として採用しています。Spectrum-X Ethernet の根本的な設計思想は、スコープ(範囲)、信号、責任に応じてハードウェア加速された制御ループを分離することです。ネットワーク制御を干渉し合わない 3 つの独立したループに分解することで、Spectrum-X Ethernet はファブリックを不安定にするフィードバックループを生み出すことなく、輻輳をその本来の時間スケールで解決します。
In-switch Adaptive Routing(スイッチ内部での適応型ルーティング)
従来のイーサネットが静的なハッシュベースの ECMP ルーティングに依存するのに対し、Spectrum-X Ethernet スイッチはパケットごとの適応型ルーティング(AR)を実装しています。Join-Shortest-Queue(JSQ)アルゴリズムを量子化されたハードウェア近似で利用し、スイッチは ECMP グループ内のすべての出口ポートのキュー深度をサブマイクロ秒間隔でサンプリングします。パケットが到着すると、スイッチは動的に最も輻輳の少ない物理ポートへ転送先を切り替えます。このステートレスでフロー非依存のメカニズムは、局所的な一時的な不均衡に対して数百ナノ秒で反応し、スイッチ内のキューを小さく保ちつつ、ローカルなホットスポットの発生を防ぎます。
Targeted Congestion Control(標的型輻輳制御)
AR はファブリック内のパス利用を均等化できますが、エンドポイントのインキャスト(複数の送信者が同時に単一の受信者にデータを送信し、受信者の出口ポートを飽和させる現象)は解決できません。これを処理するため、Spectrum-X Ethernet は高度なハードウェア加速型輻輳制御 (CC) メカニズムを実装しています。
重要なのは、Spectrum-X Ethernet がスイッチと SuperNIC の応答を協調設計している点です。スイッチは適応ルーティングの容量が完全に枯渇し、キューがさらに増加した場合にのみ、明示的輻輳通知 (ECN) マークを生成します。送信側は、正確な RTT 測定プローブと ECN マークを組み合わせて、RTT スケールで送信レート調整を行います。これにより、AR で容易にバランスが取れる短時間のマイクロバーストに対してネットワークが過剰反応するのを防ぎつつ、実際にエンドポイントレベルの輻輳が発生した際には迅速かつ正確なレート削減を実現します。
NIC ベースのプレーン負荷分散
ホストエッジで動作する Plane Load Balancer (PLB) は、Spectrum-X Ethernet SuperNIC(NVIDIA ConnectX など)内に組み込まれた専用ハードウェアエンジンです。PLB はローカルキューフィードバックとエンドツーエンドの各プレーン輻輳テレメトリを組み合わせて使用し、パケットを複数のネットワークプレーンに動的に分散します。このメカニズムについては以下で詳しく解説します。
マルチプレーントポロジーと Spectrum-X マルチプレーン技術の正体
AI ファクトリーを数十万基の GPU にスケールさせる際、従来のネットワークアーキテクチャでは階層を追加する必要がありました(2 階建てから 3 階建てのファットツリートポロジーへ移行するなど)。しかし、階層を増やすことは深刻な問題を引き起こします。レイテンシが増加し、ジッターが悪化し、負荷分散が偏り、さらに光モジュールやケーブル、電力のコストが劇的に膨らんでしまうのです。
このスケーリング課題を解決するため、現代の AI データセンターではマルチプレーン・トポロジーを採用しています。単一の巨大な多階層ネットワークファブリックを構築するのではなく、マルチプレーン・トポロジーは、1 つのホストが持つ膨大なネットワーク帯域幅(例:8 ラーンの ConnectX SuperNIC から 800 Gbps)を、複数の低速で物理的に独立したネットワーク平面に分解します。具体的には、4 つの別々の 200 Gbps プレーンなどが該当します。各プレーンは、非常に効率的で浅い 2 階建てのファットツリーとして構築されます。
ホストをこれらの平面に接続するには、シャッフルボックスやトランクケーブルといったパッシブ光デバイスがホストエッジに利用されます。これらのデバイスは、マルチポート NIC から各独立したプレーンへファイバーをルーティングし、ホストエッジで広範なパス多様性を確保しつつ、NIC 間での完全な到達可能性を維持します。これにより、従来の多階層ファブリクトポロジーが抱えるレイテンシやジッターのボトルネックを導入することなく、単純な 2 階建てトポロジーで 128,000 エンドポイント以上、あるいは 3 階建てトポロジーでは最大 1600 万エンドポイントまでスケールすることが可能になります。
無差別パケットスプレーの欠陥
マルチプレーン・トポロジーは理論上、莫大な帯域幅を提供しますが、すべてのプレーン間でトラフィックが完璧にバランスされていなければ、その効果は発揮されません。一部の標準的なアーキテクチャでは、各プレーンの状態を一切把握しない「無知なスプレイ(oblivious spraying)」によってこの課題に対処しようとしています。これは、トランスポート層でパケットをすべてのプレーンに順次割り当てる手法です。
しかし、このアプローチは現実世界では完全に機能しません。ギガスケール規模では、物理的な故障、光コネクタの劣化、ファイバーリンクの断続(フラップ)が恒常的な運用環境の一部となっています。もし平面 2 の単一のファイバーリンクが劣化したりフラップしたりすれば、そのプレーンの容量は低下します。無知なスプレイはこの非対称性を認識できないため、劣化したプレーンにも依然として等量のトラフィックを押し付け続けます。その結果、ネットワーク全体の性能が最も遅く、劣化したプレーンによってボトルネック化され、単一の局所的なリンクのフラップによる影響範囲(ブラスト・半径)が、マルチプレーン・クラスター全体に拡大してしまうのです。
解決策:Spectrum-X マルチプレーン技術
マルチプレーンアーキテクチャの真の可能性を引き出すため、Spectrum-X Multiplane テクノロジーでは、SuperNIC シリコン内にハードウェアアクセラレーションされた Plane Load Balancer (PLB) を実装しています。この PLB により、アプリケーション層に対してマルチプレーンアーキテクチャは完全に透明化されます。オペレーティングシステムや集合通信ライブラリからは、単一の統合された RoCE デバイスとしてしか見えません。すべてのトラフィック分散、負荷分散、障害時のフェイルオーバー処理は、Spectrum-X Ethernet ハードウェア内で完結して行われます。

Spectrum-X Ethernet スイッチと連携して、PLB は送信されるすべてのパケットに対して、独自で状態を保持する 2 段階の階層選択プロセスを実行します。
エンドツーエンドの輻輳フィルタリング:各宛先 GPU に対して、SuperNIC は物理平面ごとに独立した状態管理型の輻輳制御コンテキストを保持します。各コンテキストは RTT プロブを個別に監視し、輻輳通知パケット(CNP)を処理して、対応する平面ごとのリアルタイム転送レート許容量を算出します。パケット送信前には、SuperNIC が要求される転送レートと各平面の許容量を比較します。エンドツーエンドで輻輳が発生しているかリンク障害が起きている平面は、一時的に利用可能な平面セットから除外されます。
ローカルキュー選択:残りの健全で輻輳していない平面の中から、SuperNIC ハードウェアはローカル出力キューの深さが最も浅い平面を選択します。これはホストエッジにおけるスイッチの適応型ルーティング機構と同等の動作です。
平面ごとに CC 状態を分離し、これにローカル出力キューの深さを組み合わせることで、Spectrum-X Ethernet は輻輳を影響を受けた平面に限定します。Plane 2 でリンク障害が発生した場合、Connect-X SuperNIC は即座に RTT タイムアウトを検知し、Plane 2 を利用可能なセットからマスクして、残りの 3 つの健全な平面へすべてのトラフィックを透明にリダイレクトします。この処理は 3 ミリ秒未満で完了するため、総ラインレートバイセクション帯域幅の 75% が維持されます。
リアルワールドでのインパクト:レジリエンス、分離、そして AI までの時間
これらのアーキテクチャ設計を検証するため、NVIDIA と研究者たちは、本番環境のクラスターと高忠実度のシミュレーションを用いて Spectrum-X Ethernet を厳密に評価しました。その結果、高負荷時や障害発生時、マルチテナント環境下における Spectrum-X Ethernet と従来の汎用 Ethernet の間には明確な対比が浮かび上がりました。
マルチプレーン耐性: 例えば、8 層構成のネットワークのうち 1 層で局所的にスイッチ間の接続が 20% 失われた場合、従来の Ethernet マルチプレーンネットワークは即座にボトルネックを起こします。これは、負荷分散を盲目的(オブリビオス)に行う仕組みに依存しているためです。その結果、すべての層の性能が劣化した層と同等まで低下し、ネットワーク全体として 80% の容量しか利用できなくなります。
一方、Spectrum-X Multiplane は状態を把握する PLB(Stateful PLB)を活用して、局所的なボトルネックを動的に迂回します。これにより、7 つの健全な層は 100% の容量で稼働し続け、劣化した層のみが 80% で動作します。最低共通値に合わせるのではなく、利用可能な健全な容量をすべて活用することで、障害発生時でも全体のアットオール(All-to-All)集合通信帯域を 1.2 倍向上させます。これは大規模 AI 学習ジョブを継続させるために不可欠な、容量に応じた滑らかな性能低下(グラシウス・デグレード)を実現するものです。

図 3:マルチプレーン耐性。Spectrum-X のマルチプレーン構成は、接続障害が発生した場合に、オール・トゥー・アール性能を 1.2 倍向上させます。
予測可能な高利用率パフォーマンス:最悪ケースの RDMA バイセクションベンチマークにおいて、従来のイーサネットはフローハッシュの衝突により静的な ECMP ルーティングが崩壊し、一部の GPU ペアではスループットが 25 Gbps まで低下します。一方、AR と PLB を活用した Spectrum-X イーサネットは、タイトで予測可能な帯域幅配分を実現し、すべての GPU ペアで理論上のラインレートの 98% を維持します。
さらに、従来のイーサネットではレイテンシのジッターが広く、99 パーセンタイル(P99)の遅延が最大 22 µs に達するのに対し、Spectrum-X イーサネットはネットワーク負荷 75% の下でも、8〜9 µs という低く密に集約された P99 遅延を維持します。

図 4. 負荷時のパフォーマンス:従来の市販イーサネットに対する Spectrum-X イーサネットの安定したパフォーマンス
シームレスなフェイルオーバー耐性:ホストとリーフ間の接続でリンクがフラップ(断続的な切断)した場合、従来のイーサネットではソフトウェアベースまたは非加速化のロードバランサーが復旧してトラフィックを再ルーティングするまでに 1.08 秒以上を要します。これにより GPU の集合操作が凍結し、通信が大幅に停止します。一方、Spectrum-X イーサネットのハードウェア加速型 PLB は障害を検知し、わずか 2.68 ミリ秒でフェイルオーバーを完了します。これは 400 倍の高速化であり、進行中の LLM 学習ステップを中断させることなく、一時的な障害を透明に吸収します。

図 5. Spectrum-X ハードウェア PLB とソフトウェアロードバランサーのシングルリンクフラップ回復時間
最後に考慮すべき点は、リンク障害は避けられないが、そのパフォーマンスへの影響は物理的な接続断の損失に比例するべきだということです。これを達成するのは困難です。なぜなら、パス上の複数の障害により、多くのソース・宛先ペア間で接続性が著しく低下してしまうからです。
従来のイーサネットは、ケーブル障害やリンクの断続が発生すると非比例的に性能が低下します。例えば、リーフアップリンクの 10% が失われると、ルーティングの不均衡により集合的な帯域幅が 50% も減少してしまうことがあります。
一方、Spectrum-X イーサネットは、容量に対して厳密に比例した形でしか性能を低下させません。ファブリックリンクの 10% に障害が発生するシナリオでも、Spectrum-X イーサネットはほぼ理想的なパフォーマンスを維持し、帯域幅は比例して 11% 減少するだけで、遅延の尾部(タイラット)もわずか 7% の増加に抑えられます。
この堅牢な復元力により、オペレーターは物理インフラの問題が完全に解決される前から、トレーニングワークロードをほぼ最適な効率で実行することが可能になります。これにより、「AI までの時間」を劇的に短縮できます。
今日のアイファクトリーの設計図
汎用クラウドコンピューティングからギガスケールの生成 AI への移行は、ネットワーク要件における根本的な転換点を意味します。高いエントロピーを持つトラフィック、静的なルーティング、ソフトウェアによる輻輳制御ループを前提として構築された従来の市販イーサネットでは、同期型 AI コレクティブが要求するマイクロ秒スケールかつジッターゼロの要件を満たすことは根本的に不可能です。
Spectrum-X Ethernet は、ネットワークのルールブックを書き換えるものです。ファブリック内での適応型ルーティング、トランスポート層における標的型輻輳制御、そしてホストエッジでの PLB(Platform-Level Bypass)を通じて、主要な制御ループを分離しハードウェアアクセラレーションを実現します。これにより、ギガスケール AI が要求する予測可能で安定した超低遅延パフォーマンスが実現されます。さらに、Spectrum-X Multiplane 技術は、堅牢かつ高い耐障害性を備え、運用上の可視性も確保されたネットワークファブリックを提供します。これによってクラスターの拡張が簡素化され、マルチテナントワークロードが保護され、「AI までの時間(Time-to-AI)」を最小限に抑えることが可能になります。
AI ファクトリーを構築するあらゆる組織にとって、Spectrum-X Ethernet は単なるパフォーマンスの最適化ツールではありません。それはアーキテクチャ上の必須要件なのです。
さらに詳しく知るには
Spectrum-X Ethernet や Spectrum-X Multiplane についてさらに詳しく知りたい場合は、公開されたホワイトペーパー こちら をご覧ください。
リソース
・DeepSeek-AI. (2024). 『DeepSeek-V3 技術報告書』arXiv プリプリント
https://arxiv.org/abs/2412.19437
・Khashab, S., et al. (2025). 『AI サーバー上での大規模ネットワークシミュレーション NSX』ACM AI ネットワーキング会議論文集
https://dl.acm.org/doi/abs/10.1145/3748273.3749199
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み