NVIDIA、BlueField で Agentic AI ファクトリを拡張
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
1 つのリクエストで複数のモデル呼び出しやデータアクセスが発生するため、従来のインフラでは対応が困難になり、GPU と CPU の生産性を維持するために高速なデータ移動と保護が必要となる。
AI深層分析を開く2026年7月29日 23:46
AI深層分析
キーポイント
Agentic AI によるインフラ負荷の増大
1 つのリクエストで複数のモデル呼び出しやデータアクセスが発生するため、従来のインフラでは対応が困難になり、GPU と CPU の生産性を維持するために高速なデータ移動と保護が必要となる。
BlueField プラットフォームによるオフロード
NVIDIA BlueField-4 DPU がホスト CPU からネットワーク、ストレージ、セキュリティ、テレメトリなどのインフラ処理をオフロードし、データ移動を加速してコンテキストの再利用を可能にする。
Vera BlueField-4 STX の新機能
新しいストレージプロセッサである Vera BlueField-4 STX が、Agentic AI 向けのコンテキストメモリや高性能ストレージインフラ、およびセキュアなデータサービスを支える基盤となる。
DOCA ソフトウェアによる統合管理
NVIDIA DOCA ソフトウェアがネットワーク、ストレージ、セキュリティ、ライフサイクル管理のプログラム可能なモデルを提供し、Rubin プラットフォームや DSX アーキテクチャ上でサービスを展開する基盤となる。
インフラストラクチャが推論パイプラインの一部となる
Agentic AI では、データ移動やコンテキスト保持などにより、ネットワークやストレージなどのインフラが推論プロセスそのものの中核を担う。GPU メモリ不足時の KV キャッシュ管理も、レイテンシやコストとのトレードオフを含み、インフラ経路の一部として扱われる必要がある。
重要な引用
Agentic AI changes the infrastructure pattern for AI factories.
BlueField offloads infrastructure work from host CPUs, accelerates data movement, enforces policy inline, and enables context reuse.
NVIDIA Vera BlueField-4 STX storage processors power a new class of data platforms for context memory, high-performance storage infrastructure, and secure data services across AI factories.
As a result, infrastructure is no longer adjacent to inference. Infrastructure is now part of the inference pipeline.
編集コメントを表示
編集コメント
Agentic AI の実用化に伴い、インフラ層の重要性が劇的に高まっていることを示す記事である。専用プロセッサとソフトウェアスタックを統合したアプローチは、大規模なエージェントシステムにおけるコストとパフォーマンスのバランスを最適化する鍵となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Agentic AI は、AI ファクトリーのインフラパターンを根本から変えています。1 つのリクエストに対して、最終的な回答が出力されるまでに、多数のモデル呼び出しやツール呼び出し、メモリ参照、ポリシーチェック、ストレージアクセス、ネットワーク転送が発生します。複数のエージェントが同時に実行され、ステップ間やユーザー、ツール、サービス、セッション間でコンテキストを引き継ぐようになると、インフラはデータを高速で移動・保護・取得・再利用できるようになる必要があります。そうしなければ、GPU や CPU の生産性を維持できません。
NVIDIA BlueField プラットフォームは、AI ファクトリーのデータパスに専用かつプログラム可能なインフラ処理機能をもたらします。BlueField はホスト CPU からのインフラ負荷をオフロードし、データの移動を加速し、ポリシーをインラインで適用し、コンテキストの再利用を可能にします。これらの機能により、GPU の利用率向上、予測可能なレイテンシの実現、強力な分離性の確保、トークンあたりのコスト削減、ワットあたりのトークン数増加といった、実運用での成果が実現されます。
AI ファクトリー向けに、専用設計のインフラとストレージプロセッサを NVIDIA DOCA ソフトウェアと組み合わせることで、強力な基盤を構築します。NVIDIA BlueField-4 DPUs は、ホスト CPU からネットワーク、ストレージ、セキュリティ、テレメトリ、制御プレーンなどのサービスをオフロード・加速・分離し、GPU と CPU の計算システム間でのデータ転送も高速化します。また、NVIDIA Vera BlueField-4 STX ストレージプロセッサ は、AI ファクトリー全体でコンテキストメモリ、高性能ストレージインフラ、そしてセキュアなデータサービスを実現する新たなデータプラットフォームを駆動します。
これらのプロセッサにおいて、NVIDIA DOCA はネットワーク、ストレージ、セキュリティ、テレメトリ、ライフサイクル管理にわたるサービスの構築と運用を支えるソフトウェア基盤を提供します。AI ファクトリー向けの NVIDIA Vera Rubin プラットフォームや、より広範な NVIDIA DSX アーキテクチャにおいて、BlueField はインフラを加速し、DOCA はデータセンター全体でこれらのサービスを展開するためのプログラム可能なソフトウェアモデルを提供します。
本記事では、エージェント型 AI と長文コンテキスト推論が新たなインフラ要件を生み出す背景と、BlueField-4、Vera BlueField-4 STX、そして DOCA が、AI ファクトリーのデータパス全体にわたるインフラサービスのオフロード・加速・分離を通じて、それらの課題をどのように解決するかについて解説します。
エージェント型 AI がインフラを推論の一部に組み込む
エージェント型 AI は、単なるモデルの実行を超え、GPU、CPU、メモリ、ネットワーク、ストレージ、セキュリティにまたがる分散ワークフローへと拡張されます。AI ファクトリー全体でデータを移動し、文脈を保持し、ポリシーを適用し、サービスを調整する各ステップが推論パイプラインの一部となり、インフラのデータ経路そのものが推論プロセスに組み込まれることになります。
GPU はモデル推論を実行してトークンを生成しますが、CPU はツールの実行、検索結果の処理、プロンプトの準備、出力の検証、そして次の推論ステップとの調整を通じて、エージェントランタイムをオーケストレーションします。また、推論がターンを超えて継続できるよう、文脈を保持・取得する機能もインフラに不可欠です。
特に KV キャッシュ(Key-Value Cache)の保持と取得は重要です。プリフェッチ段階で LLM は中間のアテンション状態を保存する KV キャッシュデータを生成します。プロンプトや会話、そしてエージェントワークフローが複雑化するにつれ、推論ステップ間でのキャッシュ状態の永続化や、リクエスト間での再利用が必要になってきます。GPU メモリが逼迫した状況では、システムは KV キャッシュの退避と再計算、コンテキスト長の制限、あるいは別のメモリ階層への状態移動を行わざるを得ません。これらはレイテンシ、スループット、コストの間でトレードオフを生み出します。つまり、KV キャッシュもインフラデータ経路の一部となり、推論を遅滞させることなく、移動・配置・保護・取得が求められるのです。
その結果、インフラは推論の隣接要素ではなくなり、推論パイプラインの一部へと変貌しました。ネットワーク、ストレージ、セキュリティ、テレメトリ、コントロールプレーンサービス、そしてコンテキストメモリ管理といった機能は、エージェントのトラフィックを処理する際、GPU による推論を遅延させたり、エージェント実行に必要なホスト CPU リソースを奪ったりすることなく動作する必要があります。
BlueField が AI ファクトリーの OS を支える
エージェント推論には、高速で安全かつプログラム可能なインフラデータパスが不可欠です。BlueField はそのデータパスを支える専用インフラプロセッサとして、AI ファクトリー全体にわたる接続、セキュリティ強化、分離、そして各種サービスの加速を実現します。
BlueField-4 は Rubin GPU と NVIDIA Vera CPU の間でデータ処理ユニット(DPU)として機能し、Vera 搭載の BlueField-4 STX ストレージプロセッサは NVIDIA CMX を介してコンテキストメモリと AI ネイティブストレージを管理します。これらの役割を通じて、BlueField は高速ネットワーク、組み込みインフラ計算機能、ローカルメモリ、PCIe 接続、インラインアクセラレーション、分離機能、そして DOCA プログラマビリティを統合し、協調する AI ファクトリーデータパスを構築しています。
BlueField-4 DPU は、最大 800 Gb/s のイーサネットまたは InfiniBand 接続、64 コアの NVIDIA Grace CPU、高帯域幅 LPDDR5X メモリ、PCIe Gen6、ならびにネットワーク、ストレージ、セキュリティ、データ転送のためのインラインアクセラレーションと DOCA ソフトウェアプラットフォームを統合しています。
BlueField-3 と比較すると、ネットワーク帯域幅は 2 倍になり、計算性能は最大 6 倍、メモリ容量は 4 倍、メモリ帯域幅も 3 倍以上に向上しています。
BlueField-4 のストレージプロセッサ(STX)は、NVIDIA Vera CPU、ConnectX-9 SuperNIC、1.6 Tb/s の Spectrum-X イーサネット接続、高性能な NVMe ストレージアクセス、データ転送の高速化、シリコンレベルでのセキュリティ、そして DOCA によるプログラマビリティを統合したものです。
DOCA は BlueField インフラ処理ドメインをプログラム可能にし、ライブラリやマイクロサービスを通じて加速されたインフラサービスを構築・展開するためのソフトウェア基盤を提供します。これにより、開発者、運用担当者、ISV(独立系ベンダー)は、KV キャッシュの再利用、テナント分離、ストレージメタデータ、輻輳制御、安全なプロビジョニング、そして新しいエージェント型ランタイムパターンなど、要件が変化する状況に合わせて、BlueField や ConnectX を活用したサービスを統一的に作成・運用できるようになります。
BlueField のシステムレベルでの機能
ネットワークの相互操作性を高めるには、組み込み計算能力、メモリ帯域幅、PCIe、アクセラレーション、ソフトウェアがすべて同じ速度でトラフィックを処理できる必要があります。追加された計算性能も、十分なメモリ容量、I/O 帯域幅、そしてプログラム可能なサービスが備わっていなければ、スループットの向上にはつながりません。BlueField はこれらのリソースをバランスよく調整するために共同設計されており、インフラトラフィックは発生した場所で即座に処理できるようになっています。
高速接続により、AI ファクトリーのデータパスには AI ワークロード、ストレージ、セキュリティ、制御トラフィックが統合されます。Bluefield の組み込み計算機能と省電力な LPDDR5X メモリは、処理対象のデータ(キュー、ポリシー、メタデータ、テレメトリ、KV キャッシュ配置など)にサービスロジックと状態を近接させることで、効率的な運用を実現します。また、PCIe Gen6、VirtIO、DOCA SNAP によるストレージ仮想化を活用することで、ホストは Bluefield のアクセラレーションをサポートする標準的なネットワークおよびストレージデバイスモデルを利用でき、ホスト CPU の負荷を大幅に削減できます。
エージェントリクエストが AI ファクトリー内を移動する際、パケットによって運ばれ、RDMA 転送やストレージコマンドの発行、ポリシーチェック、メタデータ検索、テレメトリイベントの発生を引き起こします。Bluefield はこれらに関連するフロー制御、データ転送、ストレージアクセス、暗号化、整合性確認、ポリシー強制執行をアクセラレートし、インフラストラクチャサービスがエージェントトラフィックに追いつきながら、ホスト CPU リソースを消費することなく運用できるようにします。
DOCA はこのハードウェア基盤を、AI ファクトリー向けにプログラム可能なサービスへと変換します。具体的には以下の機能を提供します:
- DOCA Host-Based Networking (HBN): サーバーサイドの Layer 3 ルーティングをサポートし、Bluefield が BGP ルーターとして動作することで、スケーラブルなマルチテナント設計を可能にします。
- BlueField ASTRA: ConnectX-9 と連携し、Spectrum-X のゼロトラスト・マルチテナントベアメタルデプロイメントを実現。Bluefield は複数のインフラストラクチャ平面全体で管理制御ポイントとして機能します。
- DOCA Memos: 計算ノードとストレージノード間で KV キャッシュの管理と共有を支援し、長期コンテキストやエージェント推論において文脈の再利用を可能にします。
DOCA セキュリティサービスは、ゼロトラストアクセスのサポート、ポリシー適用、ランタイム可視化、および分離機能を提供し、AI ファクトリー全体におけるデータ、推論処理、エージェントを保護します。
これらの機能を組み合わせることで、ネットワーク、ストレージ、セキュリティ、コンテキスト管理、制御サービスをデータパスに近接配置でき、ホスト CPU リソースとの競合を防ぐことができます。これにより、BlueField は GPU 利用率の向上、推論レイテンシの低減、マルチテナント環境での分離強化、トークンあたりのコスト削減、そしてワットあたりのトークン数増加を実現します。
Vera Rubin AI ファクトリーにおける BlueField-4 の活用
極限までの共設計(エクストリーム・コデザイン)とは、AI ファクトリーを相互依存するシステムとして設計することを意味します。各コンポーネントには明確な役割が定義されており、それらが互いに補完し合うことで、本番環境のワークロード下でもスループット、対話性、分離性、トークン効率を維持できるプラットフォームを実現しています。
Vera Rubin プラットフォームは、高スループット推論、高密度な CPU 実行処理、大規模なコンテキストメモリ、そして安全なデータ転送を必要とするエージェント型 AI ワークロード向けに構築されています。このプラットフォーム内では、Rubin GPU が計算加速を担当し、Vera CPU はツール呼び出し、オーケストレーション、データ転送をサポートします。スケールアップ通信には NVLink を利用し、ConnectX-9 と Spectrum-X がスケールアウトネットワークを担います。BlueField は、計算、ネットワーク、ストレージ、セキュリティにまたわるこのシステム全体で機能します(図 1)。

GPU コンピューティング:Rubin GPU のセキュリティ強化と高速化
GPU の性能は、アクセラレーターに作業、データ、そして安全な接続を途切れることなく供給できるシステム全体の能力にかかっています。BlueField-4 は GPU 計算トレイ内でインフラプロセッサとして動作し、フロントエンド(南北方向)のネットワーク処理、ホスト CPU のオフロード、データの安全なアクセス、管理機能、観測性、そしてインフラストラクチャの分離を実現します。これらのサービスをオフロードして分離することで、BlueField は GPU 計算がホスト CPU のオーバーヘッドや可変的なアクセス制御、あるいは管理トラフィックによってボトルネックに陥るのを防ぎます。
南北方向の経路は GPU にとって極めて重要です。ここにはユーザーからのリクエスト、取得されたデータ、コンテキスト、ストレージトラフィック、そして管理サービスが Rubin 計算層へと流入するからです。BlueField-4 はこのフロントエンド経路を拡張し強化するとともに、ホスト CPU のサイクルを消費する前に、関連するネットワーク、ストレージ、セキュリティ、テレメトリの処理をインラインで実行します。より高いフロントエンド帯域幅と低いホスト CPU 競合は、GPU へのデータとコンテキストの可用性を高め、AI ファクトリー全体において予測可能な推論レイテンシの実現と、ユーザーあたりのトークン生成速度向上を支えます。
CPU 実行:Vera エージェントワークロードからのインフラ分離
エージェント型 AI や強化学習の普及により、CPU の性能に対する需要が高まっています。なぜなら、AI エージェントはツールの呼び出し実行やコードの実行、データ閲覧・照会、入力変換、出力解析、結果評価、そしてワークフローの調整など、多岐にわたる処理を行うからです。
Vera CPU は、コアあたりの高性能と並列処理能力、さらに省電力なメモリ帯域幅を兼ね備え、AI ファクトリー規模での CPU 実行層を支えます。一方、BlueField-4 は Vera CPU のワークロードを取り囲むインフラ処理層として機能し、フロントエンドのネットワーク、ストレージアクセス、セキュリティと分離、プロビジョニング、ポリシー管理、テレメトリ、そして運用管理を担います。
この役割分担が重要なのは、エージェント型 CPU ワークロードが推論ループ内部で動作しているからです。もしインフラサービスがホスト CPU のサイクルを消費したり、スケジューリングの揺らぎ(ジッター)を加えたりすれば、GPU 計算リソースが利用可能な状況であっても、ツールの実行やデータ取得、検証が遅れてしまう恐れがあります。BlueField はネットワーク、ストレージ、セキュリティ、制御プレーンサービスなどを DPU ドメイン内で処理することで、Vera CPU がエージェントの実行に集中し、インフラ関連の作業に時間を割かなくて済むようにします。
AI ネイティブなストレージとコンテキストメモリ
エージェント型 AI は、コンテキストを能動的なインフラデータへと変換します。多段階の対話を行うエージェントや、長い文脈での推論、検索強化型のワークフロー、マルチエージェントシステムは、再利用可能な推論結果(KV キャッシュを含む)を生み出します。これらは、推論が停止することなく保存・共有・保護・取得できる必要があります。
NVIDIA の CMX(Context Memory eXtension)は、GPU メモリとスケーラブルな共有ストレージの間に位置する、共有可能で拡張性が高く、電力効率に優れた AI ネイティブな記憶階層プラットフォームです。このプラットフォームでは、Vera BlueField-4 STX ストレージプロセッサを活用し、KV キャッシュ(Key-Value Cache)に最適化されたイーサネット接続のフラッシュ階層を実現しています。Vera CPU、ConnectX-9 ネットワーク、そして DOCA Memos を統合したこのプロセッサが、その中核を担っています。
ストレージプロセッサは、KV の入出力処理、メタデータ管理、データの配置、セキュリティ、制御オペレーションなどを実行します。これらはすべて、ストレージとネットワークの経路に近い場所で実行されます。従来のフラッシュをブロックストレージとして提示するのではなく、CMX は KV メタデータを追跡し、キューを管理し、キャッシュの呼び出しや事前準備(プレステージング)をサポートします。さらにテナントごとのポリシー適用やデータ保護も担います。こうした制御処理が多く、レイテンシに敏感なオペレーションをストレージプロセッサ内に配置することで、コンテキストが膨大になってもシステム間の応答性を維持できます。
DOCA Memos を活用すれば、CMX は AI 計算ノードと CMX データノードの間で KV キャッシュの管理・共有が可能になります。これにより、受動的な記憶階層ではなく、能動的に動作するコンテキストメモリデータパスへと進化します。KV キャッシュを再利用することで、事前生成(prefill)の繰り返しやコンテキストの再計算、GPU のアイドル時間、そして不要なデータ転送を削減できます。その結果、長いコンテキストやエージェントワークロードにおけるトークン生成速度と電力効率が向上します。
データ・推論・エージェントのためのインシリコン保護
エージェント型 AI は、セキュリティモデルそのものを変革します。なぜなら、AI ファクトリー内ではエージェントがデータ、モデル、ツール、コンテキストメモリ、推論サービスに繰り返しアクセスするからです。最終的な回答を生成する前には、機密情報や規制対象となるデータを処理したり、モデルの状態、埋め込み表現、KV キャッシュを操作したりします。このため、データそのものも、推論プロセスも、そしてエージェントの振る舞い自体がセキュリティの攻撃対象(サーフェス)の一部となります。
AI ファクトリーのセキュリティは、ホスト上のソフトウェアだけに頼ってはいけません。ホストに常驻するセキュリティ制御機能は、保護すべきワークロードと同じリソースと信頼境界を共有するため、もしホストが侵害された場合、それら自体も改ざんや回避の対象となり得ます。BlueField はセキュリティ処理をシリコン内部へ移し、ホストのワークロード領域の外側に配置します。これにより制御境界を強化しつつ、AI 作業のために CPU や GPU のリソースを温存できます。
マルチテナント型の AI ファクトリーにおいて、このアーキテクチャはデータパスを遅延させることなくインラインでの保護を実現します。BlueField は、テナントの分離、ネットワークポリシーの適用、安全なアクセス制御、ランタイム検知、暗号化、そして計算・ストレージ・推論インフラ全体にわたるテレメトリを提供する、信頼できるインフラ上の管理ポイントとなります。DOCA はさらに、ゼロトラストデータアクセス、推論保護、エージェントの振る舞い可視化、ネットワークレベルでの分離を実現するためのプログラム可能なサービスを通じてこのモデルを拡張します。これにより、エージェント型ワークロードがスケールしても、モデルやデータセット、コンテキストメモリ、ランタイム上の相互作用を守ることができます。
Learn more
エージェント型 AI は、推論パイプラインの一部としてインフラストラクチャを構成するようになり、AI ファクトリは GPU や CPU の速度、コンテキストメモリの容量を低下させることなく、データを移動・保護・取得・再利用する必要があります。BlueField は、ネットワーク、ストレージ、セキュリティ、テレメトリ、そしてコンテキストサービスにおけるインフラ処理を加速します。一方、DOCA によりこれらのサービスがプログラム可能となり、データセンター全体での展開が可能になります。
これら BlueField-4、Vera BlueField-4 STX、そして DOCA を組み合わせることで、AI ファクトリは相互運用性、分離性の向上、GPU の利用率拡大、トークンあたりのコスト削減、ワットあたりのトークン数増加を実現できます。
はじめに
NVIDIA DOCA をダウンロードし、最新リリースをインストールして サンプル をビルドすれば、BlueField によるネットワーク・ストレージの高速化、セキュリティ強化、テレメトリ機能、ライフサイクル管理のためのプログラミングが開始できます。
AI算出
主要ニュースainew評価高い
記事は Agentic AI のインフラ要件に対する NVIDIA の具体的な解決策(BlueField-4, DOCA, Vera)を報じており、新規性と技術的詳細が明確である。ただし、日本企業や日本固有の導入事例に関する記述はないため、日本の関連性は低い。
6つの評価軸を見る
- AI関連度
- 75
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み