NVIDIA、BlueField-4 でアジェンティック AI ファクトリ向けスケールイン基盤
本文の状態
日本語全文を表示中
詳細モードで約21分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
NVIDIA は Agentic AI ファクトリー向けに BlueField-4 と DOCA を活用した Scale-In ネットワークインフラを発表し、ホスト CPU に依存しない高速かつ安全なデータ処理を実現する。
AI深層分析を開く2026年8月25日 01:04
AI深層分析
キーポイント
Scale-In インフラの導入
NVIDIA は AI ネットワークの第5の柱として、Agentic AI ファクトリー向けの Scale-In ネットワークインフラを導入し、セキュリティや管理を目的別に加速する。
BlueField-4 と DOCA の役割
NVIDIA BlueField-4 データ処理ユニットと DOCA ソフトウェアが基盤となり、ホスト CPU に負荷をかけずにラインレートでのネットワーク、ストレージ、セキュリティ処理を担う。
North-South ネットワークの進化
従来の南北方向ネットワークを協調したインフラドメインへと進化させ、AI ファクトリー内のアプリケーション、データ、ストレージトラフィックを効率的に移動させる。
Agentic AI 向け統合インフラドメインの確立
従来のソフトウェア定義ネットワークや弾力性だけでは不十分となり、セキュリティやデータアクセスを汎用CPUに依存しない統一されたインフラ領域として再設計する必要がある。
BlueField-4 と DOCA によるホスト非依存アクセラレーション
NVIDIA BlueField-4 と DOCA がホストから独立したアクセラレーションとオフロードを提供し、AI ファクトリ全体のアクセス、データ移動、セキュリティを統一的に制御する。
重要な引用
NVIDIA is introducing Scale-In network infrastructure, the fifth pillar of NVIDIA AI networking, bringing purpose-built acceleration to secure, manage, and operate agentic AI factories.
Dedicated, host-independent processing keeps these infrastructure services off host CPUs, helping prevent security, data access, and operations from becoming bottlenecks as AI compute scales.
The infrastructure must be accelerated and co-designed as part of the AI factory.
Scale-In addresses these requirements by evolving north-south access into a unified, accelerated infrastructure domain across the AI factory.
編集コメントを表示
編集コメント
Agentic AI の実用化に向けたインフラ要件が明確になり、従来のサーバーアーキテクチャの限界を補う専用プロセッサの重要性が浮き彫りになった。NVIDIA はネットワークとストレージの役割を DPU に移管することで、AI ファクトリーの拡張性とセキュリティを両立させる戦略を示している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
従来のクラウドインフラは、予測可能な汎用ワークロードと標準的なインターフェースを前提に設計されていました。一方、アジェンティックAIファクトリーでは、多様なユーザー、エージェント、アプリケーション、データソース、ストレージシステムが接続され、サーバーあたりマルチテラビット帯域幅で超高速な計算リソースへアクセスします。このため、ラインレートでのネットワーク、ストレージ、セキュリティを実現するために、専用のDPU(Data Processing Unit)処理が不可欠となっています。
NVIDIAは、アジェンティックAIファクトリーを安全に管理・運用するための目的別アクセラレーションを提供する「Scale-In」ネットワークインフラを発表しました。これはNVIDIA AI networkingの5つ目の柱です。
Scale-Inは、従来の南北方向(north-south)のネットワークを進化させ、AIファクトリーのための協調されたインフラドメインへと変革します。この基盤にはNVIDIA BlueField-4とNVIDIA DOCAが採用され、NVIDIA Spectrum-X Ethernetを介して接続されています。Scale-Inは、AIスタック全体を保護するサービスや、AIファクトリー内でアプリケーション・データ・ストレージのトラフィックを移動させるサービスを加速します。
ホストCPUに依存しない専用の処理により、これらのインフラサービスがホストCPUから切り離されます。これにより、AI計算リソースがスケールしても、セキュリティ対策、データアクセス、運用管理がボトルネックになるのを防ぎます。その結果、需要が増大する中でも一貫してAIサービスとデータへのアクセスが可能となり、より安全で効率的な共有AIインフラが実現します。
本稿では、BlueField-4 のアーキテクチャを解説し、アジェンシー AI ファクトリーにおいて、セキュアなアクセス、高性能なデータ転送、テナントの分離、運用の簡素化、そして予測可能なパフォーマンスを実現する「Scale-In」がどのように機能するかを説明します。
Scale-In が加速する北南方向の AI ファクトリーインフラ
AI ファクトリーでは、規模に応じた独自のインフラ要件が存在します。
- スケールアップ: NVIDIA NVLink により、GPU を統合した一貫性のあるアクセラレーターとして機能します。
- スケールアウト: NVIDIA Spectrum-X Ethernet と NVIDIA Quantum InfiniBand が、AI ファクトリー内のサーバー間を接続します。
- スケールアクロス: NVIDIA Spectrum-XGS Ethernet が、分散した AI ファクトリーを接続します。
- コンテキストメモリ: NVIDIA CMX は、AI ネイティブストレージのためのモジュール基盤である NVIDIA STX をベースに構築され、ファクトリー内で共有 KV キャッシュストレージを提供します。
- スケールイン: NVIDIA BlueField-4、NVIDIA DOCA、および NVIDIA Spectrum-X Ethernet が、AI 計算を取り巻くアクセス、セキュリティ、データ転送、そしてインフラ運用を加速します。
南北ネットワークは、データセンターへのアクセス経路として機能し、ユーザーやアプリケーション、データソース、ストレージシステム、サービスと個別のシステムを接続します。従来のクラウドデータセンターでは、ソフトウェア定義インフラストラクチャ、コンポザビリティ(構成可能性)、エラスティシティ(弾力性)を中心にこれらのネットワークを構築しており、需要の変化に応じてリソースやアクセス権限を柔軟に割り当ててスケールできる仕組みになっていました。
しかし、アジェンティック AI の登場は、このインフラに対する要求をさらに高めています。ソフトウェア定義ネットワーキング、コンポザビリティ、エラスティシティは依然として不可欠ですが、もはや十分ではありません。AI ファクトリーでは、大規模なアクセラレーテッド・コンピューティングと、増加し続けるユーザー、エージェント、アプリケーション、エンタープライズデータソース、ストレージシステムが統合され、すべてが継続的かつ大規模に相互作用します。
インフラは AI ファクトリーの不可欠な一部として加速され、共設計される必要があります。セキュリティ、マルチテナントネットワーキング、データおよびストレージへのアクセス、そしてインフラ運用は、汎用ホスト CPU で動作するソフトウェアや独立して管理されるレイヤーに依存することはできません。これらの機能は、AI ファクトリー全体にわたるアクセス、データ転送、セキュリティ、プロビジョニング、観測性に対する一貫した制御をオペレーターに提供するため、統合されたインフラドメインとして連携して動作する必要があります。
Scale-In は、AI ファクトリー全体にわたる統一された加速インフラドメインへと北西方向のアクセスを進化させることで、これらの要件に対応します。BlueField-4 がホスト非依存のアクセラレーションとオフロードを提供し、DOCA がインフラサービスのプログラミングと運用のための統一モデルを担います。また、Spectrum-X Ethernet は、外部ストレージやデータソースを含む Scale-In アクセス経路全体で高性能なイーサネット接続を実現します。
これら 3 つの技術が連携することで、演算処理とデータ保存を支えるインフラ全体にわたるアクセス、データ移動、セキュリティ、プロビジョニング、観測性に対する一貫した制御が可能になります。これにより、オペレーターは複雑な環境を統一的に管理できるようになります。

図 1. Scale-Up、Scale-Out、Scale-Across は計算接続性を拡張し、Scale-In は計算ドメインを取り巻くインフラを接続・保護・プロビジョニング・観測します。
AI ファクトリーでは、永続的なデータや推論コンテキストのために補完的なストレージインフラストラクチャが不可欠です。Scale-In は、トレーニング、推論、分析用の AI ファクトリーストレージや、検索・マルチモーダルインデックス用のエンタープライズ AI データシステムなど、AI ネイティブなストレージへの高性能アクセスを提供します。一方、CMX はファクトリー内で共有される KV キャッシュや再利用可能な推論状態のためのポッドレベルのストレージを担当します。
BlueField-4 は、Scale-In のインフラストラクチャプロセッサとして機能する一方で、CMX においてはデータおよびストレージプロセッサとして役割を果たします。Scale-In は AI ファクトリーとエンタープライズデータを AI コンピューティングに接続し、CMX は推論をより高速かつ効率的にするためにコンテキストを保持・共有します。
これら 5 つのインフラストラクチャの柱は、AI ファクトリーの異なる要件に対応しています。GPU、ラック、データセンターのスケーリングが真の価値を生むのは、データアクセス、ストレージ、サイバーセキュリティ、運用管理もそれに応じて拡張される場合に限られます。
BlueField-4 が Scale-In インフラを駆動
BlueField-4 は、GPU サーバー上のスケールインサービス、エージェント型 CPU システム、AI ファクトリのストレージシステム、およびクラウドサービス全体を加速します。NVIDIA Vera Rubin NVL72 において、テナントのワークロードトラフィックは NVIDIA ConnectX-9 SuperNICs を介してスケールアウトネットワークを通過しますが、BlueField-4 は各サーバーを接続・保護・管理するインフラストラクチャサービスを実行し加速します。これにより、運用担当者はテナントホストとは独立したインフラ処理ドメインを取得できます。ここでは、ホスト CPU に依存したりそのリソースを消費したりすることなく、セキュリティポリシーやサービスの状態、テレメトリデータを管理することが可能です。
NVIDIA BlueField Astra は、信頼できる制御を南北方向のアクセスから東西方向のスケールアウトファブリックへと拡張します。Astra は、サービスプロバイダーに対して、両ドメインにわたるプロビジョニング、テナント分離、ネットワークポリシーを一元的かつホスト非依存なコントロールポイントとして提供します。BlueField-4 がポリシーのインストール・更新とテレメトリ監視を担当し、ConnectX-9 がこれらのポリシーをデータパス上で直接強制執行します。このクローズドループにより、デバイス管理をテナントホストに置かずに、スケールインとスケールアウト全体で一貫した制御を実現できます。
BlueField-4 は、プログラム可能な制御プレーン処理と加速されたデータパス処理を組み合わせます。インフラストラクチャの決定はソフトウェアが行い、ローカルでの実行はホスト CPU に戻すことなく、インラインエンジンが直接担当します。この設計により、ファクトリ全体でポリシーを調整しつつ、線速度(line rate)でローカルに強制することが可能になります。表 1 は、主要コンポーネントがこの処理モデルをどのように支えているかを要約しています。
| コンポーネント | 役割 | メリット |
|---|---|---|
| 64 コア NVIDIA Grace CPU | ポリシー、プロビジョニング、テレメトリ、およびインフラストラクチャオーケストレーションソフトウェアを実行 | 前世代比で 6 倍の計算能力を提供し、複数のインフラサービスが並列実行可能に |
| インラインアクセラレーションエンジン | パケット、RDMA、ストレージプロトコル、暗号化、ファイアウォールルール、およびポリシー適用を処理 | 最大 800 Gb/s で操作を処理し、Grace CPU およびホスト CPU の処理負荷を軽減 |
| LPDDR5X メモリサブシステム | インフラストラクチャソフトウェアにデータとサービス状態を供給 | メモリのボトルネックを生じさせることなく、高帯域幅および省電力動作を実現 |
| PCIe Gen6 ホスト接続 | BlueField-4 をホストサーバーに接続 | ホストとスケールイン・インフラストラクチャ処理ドメイン間の高帯域幅パスを提供 |
| 800 Gb/s ネットワークインターフェース | サーバーをスケールインファブリックに接続 | 高スループットアクセス、セキュリティ、データ転送、およびストレージトラフィックをサポート |
表 1:BlueField-4 の各コンポーネントは、スケールイン処理パス全体において、制御プレーンの処理、データパスのアクセラレーション、メモリアクセス、ホスト I/O、そしてネットワーク帯域幅をバランスよく分担しています。
BlueField-3 と比較して、BlueField-4 はメモリ帯域幅が 4 倍、ネットワーク帯域幅も 2 倍に向上しました。この増強された容量により、より多くの同時実行サービスや大規模なポリシー・テレメトリデータセットの処理が可能になり、トラフィック処理能力とセキュリティスループットを大幅に引き上げることができます。
NVIDIA DOCA がスケールインサービスを強化
NVIDIA DOCA は、BlueField-4 のハードウェアアクセラレータを活用し、プログラム可能かつ展開可能なスケールインサービスを実現します。本番環境で即座に使用可能なコンテナ化された DOCA マイクロサービスは、BlueField-4 上で直接実行可能です。また、DOCA ライブラリと SDK を活用すれば、開発者はカスタムサービス向けに高速化されたネットワーク、セキュリティ、ストレージ、テレメトリ機能を自由に利用できます。
具体的には、「DOCA Flow」がハードウェアのパケット処理パイプラインをプログラムし、「DOCA PCC」がプログラマブルな輻輳制御を実現します。「DOCA Telemetry」はデバイスやサービスの健全性を可視化し、「DOCA Platform Framework(DPF)」がプロビジョニング、デプロイメント、アップデートを一括管理します。BlueField-4 のマルチサービスアーキテクチャとネイティブなサービス関数チェーン機能により、各トラフィックフローを必要なサービスシーケンスに自動的に誘導できます。これらの機能により、スケールインでは個別のサーバーパイプラインを管理するのではなく、BlueField-4 システム全体でサービスを運用するための統一されたソフトウェアモデルを実現しています。
NVIDIA Spectrum-X Ethernet がスケールインファブリックを接続
NVIDIA Spectrum-X Ethernet は、外部ストレージを含むスケールインのアクセス経路全体に高パフォーマンスなファブリックを提供します。BlueField-4 は各システムでインフラストラクチャサービス処理を担当し、Spectrum-X Ethernet は AI ファクトリとユーザー、アプリケーション、データソース、サービス、および周辺にある外部ストレージ間のトラフィックを伝送します。
Spectrum-X Ethernet は、大規模環境における負荷分散の競合や輻輳に対処し、リソース利用率を向上させます。また、高い実効帯域幅の維持をサポートし、同時実行されるトラフィックを分離することで、アクセスおよびストレージフローに対してより一貫性があり予測可能なパフォーマンスを実現します。
BlueField-4 DPUs、DOCA マイクロサービス、そして Spectrum-X Ethernet ネットワークは、NVIDIA Vera Rubin と共設計されています。これにより、プロセッサ性能、メモリ帯域幅、PCIe 接続、ネットワーク帯域幅、アクセラレーション、ソフトウェアが互いに歩調を合わせることができます。これらによって、AI ワークロードに割り当てられたリソースを消費することなく、輸送、サービス処理、制御を担うスケールイン経路が提供されます。
エージェント型 AI ファクトリの主要なスケールインユースケース
エージェント型 AI ファクトリでは、アクセラレータ付きのインフラストラクチャを安全に共有し、企業データを供給し、システムを稼働させ、パフォーマンスを継続的に監視する必要があります。以下のユースケースは、BlueField-4 のアクセラレーション機能と DOCA サービスがこれらの生産要件にどう対応するかを示しています。
孤立した AI ファクトリの仮想プライベートクラウドの構築
AI ファクトリ仮想プライベートクラウド(VPC)は、共有物理インフラ上でテナントとアプリケーションのトラフィックを分離します。DOCA Host-Based Networking (HBN) は、BlueField-4 上で北南方向の Layer 3 ルーティングとマルチテナント分離を高速化します。DOCA Flow はトラフィック分類とアクセス制御ルールをプログラムし、DOCA アクセラレーションされた Open vSwitch (OVS-DOCA) が東西インターフェースで対応するポリシーを適用します。
BlueField Astra により、同じ VPC ポリシーが東西方向の Scale-Out インターフェースにも拡張され、アクセスと Scale-Out の両方のトラフィックを一つのポリシーモデルが統括します。
Vera Rubin では、この協調モデルは合計 7.2 Tb/s のインターフェース帯域幅に及びます。これは北南方向の BlueField-4 パスで 800 Gb/s、各コンピューティングトレイで東西方向に 1.6 Tb/s のパスが 4 つある構成です。これにより、すべての東西トラフィックを 800 Gb/s インターフェース経由でルーティングすることなく、アクセスと Scale-Out の両方のトラフィックに一貫したポリシーカバレッジを実現します。
オペレーターは中央から隔離された AI ファクトリ VPC をプロビジョニングし、テナントは引き続き高速化されたファブリックを利用できます。このアーキテクチャは、クラウドのような弾力性、一貫した分離、ホスト CPU オーバーヘッドの低減、そして共有 AI インフラのより効率的な利用を提供します。
Enforce security in silicon
BlueField-4 は、ホスト OS 外でハードウェアレベルの制御ポイントを確立します。テナント側のソフトウェアがこれらの制御を無効化したり迂回したりすることはできず、セキュリティ処理をオフロードすることでホスト CPU のリソースを温存し、追加のソフトウェア処理ステップも不要になります。BlueField-4 は脅威検出を加速し、ネットワーク・ファイル・オブジェクトへのアクセスポリシーをラインレートで強制します。
DOCA Argus がランタイムでの脅威検出を担当し、DOCA Vault がファイルアクセスポリシーを強制、DOCA Flow がラインレートでのネットワーク制御プログラムを実行します。BlueField Astra は各サーバー上の異なるネットワーク間で暗号化・分離・ポリシーの調整を行います。Astra は南北および東西トラフィック全体でポリシー・テレメトリ・キー・執行を同期させ、特権的なセキュリティ制御をテナントホストの外に維持することで、共有 AI サービスに一貫した保護を提供し、AI ワークロードのためにホストリソースを温存します。
ストレージアクセスの加速
Scale-In は、AI 計算リソースを外部ストレージから得られるトレーニングデータ・モデル資産・企業知識・アプリケーションデータに接続します。もしプロトコル処理やストレージ仮想化、データ転送が追いつかない場合、GPU は計算能力と Scale-Up/Scale-Out ネットワーク帯域が利用可能な状態でも、データの到着を待たなければなりません。
BlueField-4 は、RDMA および TCP を介して NVMe-oF、ファイル、オブジェクトストレージプロトコルを加速し、専用インフラ上でストレージ仮想化とデータ転送を実現します。Spectrum-X Ethernet は、ストレージ経路全体に AI 最適化されたイーサネットファブリックを提供します。ここで、輻輳管理とパフォーマンスの分離により、並行するストレージフロー間で高い実効帯域幅を維持し、市販のイーサネットと比較して最大 1.45 倍のストレージスループットを実現します。これによりホスト CPU のオーバーヘッドが削減され、AI コンピュートへの供給が安定するとともに、トレーニング、検索、推論のためのエンタープライズデータへのアクセスが一層安定します。この外部データ経路は CMX を補完するものです。

AI ファクトリのコントロールプレーンを実行する
AI ファクトリーのノードは、AI ワークロードを実行する前に、プロビジョニング、設定、セキュリティ確保、接続が完了している必要があります。BlueField-4 はノードのオンボーディングを行い、ネットワークとストレージリソースを割り当て、サーバーを起動し、ホストオペレーティングシステムをネットワーク経由で読み込みます。このコントロールプレーンはホストとは独立して動作するため、テナントソフトウェアが起動する前にポリシーの策定やリソースのプロビジョニングが可能になります。
DOCA Platform Framework は、Kubernetes ネイティブなオーケストレーションフレームワークです。BlueField DPUs を Kubernetes ノードとしてプロビジョニング、管理、スケールします。AI ファクトリー全体における DPU の検出、プロビジョニング、サービス展開、更新を一元管理し、デプロイ時間の短縮、設定の一貫性向上、ホスト CPU リソースの節約を実現するとともに、新たな AI 容量をより早く稼働させます。
AI オペレーションの監視と最適化
大規模な AI ファクトリーを運用するには、ネットワークトラフィック、ストレージアクセス、サービスの健全性、パフォーマンス、リソース利用率などに対する継続的な可視性が不可欠です。DOCA Telemetry はこれらの情報を収集してネットワーク監視プラットフォームへエクスポートし、DOCA ライブラリは観測性プロバイダーが同じインフラストラクチャ信号を独自のツールに統合することを可能にします。BlueField-4 を通じてテレメトリを集約することで、運用者はテナントホスト側のソフトウェアに依存しない可視性を維持できます。インフラストラクチャのテレメトリが GPU やネットワーク利用率まで拡張されれば、運用者はアクセス、トラフィック、ストレージ、ポリシー適用、ワークロード配置に関連するボトルネックを特定できるようになります。このファリット全体での可視性は、異常の検出やボトルネックの特定を可能にし、AI ワークロードに影響を与える前にインシデントを解決するのに役立ちます。
スケールインで計算資源を AI ファクトリーのパフォーマンスへ変換
スケールインは、データアクセス、セキュリティ、運用のための調整された加速されたインフラストラクチャドメインへと南北ネットワークを進化させます。NVIDIA BlueField-4 はネットワークアクセラレーションと DOCA プログラムを提供し、各種サービスを実行します。一方、Spectrum-X Ethernet は、スケールインのアクセスおよびストレージ経路全体で高い実効帯域幅とパフォーマンス分離を実現します。これらが連携することで、計算資源を安全かつ運用可能な AI ファクトリプラットフォームへと変換することが可能になります。
次のステップ
- 製品アーキテクチャ、仕様、リソースについては NVIDIA BlueField プラットフォーム をご覧ください。
NVIDIA Spectrum-X Ethernet や NVIDIA DOCA ソフトウェアフレームワークの詳細については、以下のリンクをご覧ください。
BlueField のプログラミングを始めるには、NVIDIA DOCA をダウンロードし、DOCA 入門ガイドに従って DOCA サンプルを作成してください。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み