NVIDIA Vera CPU が AI ファクトリーの処理能力を向上させ、エージェント型ワークロードの加速を実現
本文の状態
日本語全文を表示中
詳細モードで約12分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
NVIDIA Developer Blog
NVIDIA は新 CPU「Vera」を発表し、AI ファクトリーにおける推論と学習の間の処理ボトルネックを解消することで、エージェント型ワークロードのスループット向上を実現すると発表した。
AI深層分析を開く2026年8月4日 08:53
AI深層分析
キーポイント
CPU が AI ファクトリーのボトルネックとなる理由
GPU の加速だけでなく、モデルステップ間のサンドボックス評価やツール呼び出しなど CPU が実行する処理が全体の性能を決定し、これが遅延すると学習サイクルの低下やキャッシュ損失を招く。
Vera CPU の設計目標と解決策
NVIDIA は並列ワークロードの増加に対応しつつ、各エージェントの逐次ステップ処理速度を向上させる「Vera」CPU を開発し、スループットと効率性を最大化する。
強化学習(RL)における CPU の役割変化
強化学習ではデータが単にストリームされるのではなく、環境ロールアウトやシミュレーションを通じて経験データを能動的に生成する必要があり、ここでの論理的処理が CPU 負荷の中心となる。
プロセッサのストールがトレーニングパイプライン全体に悪影響
並列化されたロールアウトフェーズでプロセッサがストールすると、環境ステップの実行数が減少し、モデルのポリシー更新品質である勾配が劣化する。
CPU のコア性能が学習信号の生成効率を決定
難問は逐次的に深くなるため、CPU の1コアあたりの性能がトレーニングウィンドウ内で完了できる評価数の上限を決める。
重要な引用
As these systems scale across the AI factory, performance depends not only on GPU acceleration, but also on the CPU work that happens between model steps.
If CPU-side execution slows, the GPU fleet suffers in three key ways: RL receives fewer useful evaluations per cycle, leading to an inflated time-to-train.
A slower processor means fewer environment steps are completed per second, degrading the quality of the model's policy updates, known as gradients.
For example, a baseline CPU might only complete 45% of its evaluations, leaving the GPU waiting for actionable feedback.
編集コメントを表示
編集コメント
本記事は、GPU 中心の議論から一歩進み、AI インフラ全体における CPU の決定的な役割を浮き彫りにしている。NVIDIA が自社の CPU アーキテクチャでこの課題に直接取り組む姿勢は、ハードウェアベンダーとしての戦略的意図を示すものであり、システム設計の視点を変える契機となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
エージェント型システムは、推論、ツール利用、コード実行、検索、オーケストレーション、結果処理を組み合わせた多段階ワークフローを通じて、モデルの推論を行動へと変換します。これらのシステムが AI ファクトリー内でスケールするにつれ、そのパフォーマンスは GPU による加速だけでなく、モデルステップ間の CPU が担う処理にも依存しています。
エージェント型システムの構築から展開に至るまで、CPU は GPU リソースと AI ファクトリー全体が最適なパフォーマンスを発揮することを保証します。推論、応答時間、学習において CPU がクリティカルパスとなるのは、サンドボックス評価、ツール呼び出し、コード実行、データ処理、KV キャッシュの調整、結果処理など、モデルステップ間の作業を実行するからです。
エージェント型 AI にとって、最も重要な CPU メトリクスの一つは、ソケット全体に負荷がかかった状態での持続的なコアあたりのパフォーマンスです。ソケットには並行して実行されるサンドボックス、ツール、シミュレーション、オーケストレーションタスク、データサービスが詰め込まれているかもしれませんが、各エージェントや RL ワークフローは、次のステップを開始する前に完了しなければならない逐次ステップに依存しています。コア数が増えればワークフロー間の並列処理が可能になりますが、各コアの速度が速ければ、トークンの生成、モデルの更新、次のターンへの提供など、各ワークフローがどれだけ迅速に進むかが決まります。
CPU 側の実行が遅れると、GPU ファームは以下の 3 つの点で悪影響を受けます:
- RL はサイクルあたりに得られる有用な評価数が減り、トレーニングに要する時間が膨らみます。
- ファームが個別のユーザーに応答するまでの時間が長くなります。
KV キャッシュが失われると、ファームウェア全体でキャッシュされたコンテキストの計算効率メリットを享受できなくなります。
以下のセクションでは、NVIDIA Vera がこれらの課題にどのように取り組むか、また NVIDIA Vera CPU の設計がファームウェアのパフォーマンスを最大化する方法について探ります。
Vera CPU はより賢く、効率的なエージェントを実現する
強化学習(RL)は、GPU と CPU の間に継続的な対話型フィードバックループを導入することで、計算のパラダイムを変革します。AI 学習のようにデータを単にアクセラレータへストリーミングするのではなく、RL では経験データの能動的な生成が求められます。このデータ生成フェーズ(環境ロールアウトやシミュレーションとも呼ばれます)は、逐次的で論理的な処理を強く必要とします。

これらの高度に並列化されたロールアウトフェーズでプロセッサがストールすると、トレーニングパイプライン全体が影響を受けます。プロセッサが遅いほど、1 秒間に完了できる環境ステップ数が減り、モデルの方針更新(勾配として知られる)の品質が低下します。
これらの勾配は、ニューラルネットワークに対して「どのようにポリシーを改善すべきか」を数学的に指示する役割を果たします。強化学習(RL)では、これらは CPU 環境で生成されたフィードバックや報酬といった学習信号に完全に依存しています。難問は逐次的に深くなる性質があるため、CPU のコアあたりの性能が、トレーニングの時間枠内でどの程度の評価を完了できるかを左右します。
例えば、ベースラインとなる CPU では評価の 45% しか完了できず、GPU が有効なフィードバックを待つ状態になってしまいます。

Vera CPU は、スケールした環境における最大のスレッド単一性能(max single-threaded CPU)を実現し、フルソケット負荷下でもコアあたりの持続的なパフォーマンスを最大化することで、このボトルネックを解消します。コアの速度が 1.8 倍向上しているため、同じ時間枠内で評価の最大 85% を完了できます。
より多くの RL フィードバックを提供できる Vera CPU は、より豊かで高品質な学習信号をもたらします。これにより GPU はより正確な勾配を計算できるようになり、収束までの時間を短縮して、より賢いモデルを生み出すことが可能になります。
この性能向上は、強化学習(RL)やエージェント実行において支配的な、逐次的かつ分岐の多いCPUワークロード向けに設計された「NVIDIA Olympus」コアによって実現されています。表1では、Vera CPUの特徴とRLワークロードへの影響について概説しています。
| Vera CPU の機能 | RL への影響 |
|---|---|
| ニューラル分岐予測器 | Python、シミュレータ、報酬ロジック、ツールにおける複雑な制御フローを通じてパイプラインを稼働し続ける。 |
| 幅 10 のデコード前段部 | 各サイクルでより多くの命令を実行ユニットに供給し、CPU スループットを向上させる。 |
| 深いアウト・オブ・オーダー実行 | 長いレイテンシを持つ演算の周りで進捗を維持し、不規則な RL ワークロードにおけるストールを削減する。 |
| NVIDIA スパテシャルマルチスレッディング | 数千の並列環境にスケールしても、コアあたりの高いパフォーマンスを維持する。 |
表1:RL(強化学習)のパフォーマンスとスケーラビリティを向上させるVera CPUの主要機能
Vera CPUは、GPU時間あたりのユーザー数を増加させる
オフライン学習からライブで対話的なエージェント展開へ移行すると、最適化の主な指標は純粋な処理速度から、厳密かつ予測可能なレイテンシへと変化します。このような環境では、AIエージェントは自律的に動作し、一連のアクションを実行して複雑なユーザーの問い合わせに答えます。
このシーケンスの各ステップでは、モデルが次に進む前に、ツールの呼び出しを開始したり、コードを実行したり、テストをコンパイルしたり、データを照会したりする必要があります。

図3:Vera CPUは、より高速なエージェント応答を実現する
スケーラビリティを維持してこのレスポンシブ性を担保するためには、平均レイテンシが低いだけでは不十分です。ソケットに多数の並行サンドボックス、サービス、データ処理タスクが負荷されている場合でも、エージェントは予測可能なレイテンシを必要とします。
Vera CPUは、図2に示されるように、この負荷によるレイテンシの悪化を軽減するように設計されています。Vera CPUは、88個のOlympusコアを持つモノリシックな計算ダイ(集積回路)を採用することで、マルチチップレットCPU設計で一般的に見られるパフォーマンスの急落を防ぎます。従来の設計ではワークロードがチップレット間やサブNUMAドメインにまたがってスプリル(溢れ出す)するリスクがありましたが、Vera CPUは複雑なチップレット間のコア同士のホップを不要とします。

大規模な統一キャッシュと NVIDIA スケーラブル・コヒーレンシー・ファブリック(SCF)を組み合わせることで、データはシステム全体でより均一に移動します。この意図的かつエージェント指向の実装により、Vera CPU は x86 CPU と比べてピーク負荷時の遅延を 40% 削減しました。予測可能なファブリックはテール遅延(極端な遅延)の低減にも寄与し、ツールの応答が厳密にスケジュール通りに完了することを保証します。
遅延だけでなく、エージェントには膨大なメモリ帯域幅も必要です。数千もの並行サンドボックス、ツール呼び出し、検索操作、データベースクエリ、データ処理タスクが、大規模で不規則なデータを移動しながら、各エージェントの状態、コンテキスト、出力をコアの近くに維持する必要があります。Vera CPU は省電力な LPDDR5x を採用し、最大 1.2 TB/s の総メモリ帯域幅と、コアあたり最大 14 GB/s の帯域幅を提供します。これは従来のデータセンター向け CPU と比較して、コアあたりのメモリ帯域が 3 倍以上でありながら消費電力は半分以下です。これにより、すべてのコアが稼働している状況でもエージェントのスループットを維持できます。
その結果、ハードウェアのボトルネックによってユーザー体験が阻害されることなく、厳格なサービスレベル契約(SLA)を維持できる、極めてレスポンシブなエージェント AI パイプラインが実現しました。
Vera CPU はセッションあたりの GPU 計算リソースを最大化します
エージェント推論では、GPU は一度に連続して動作するわけではありません。1 つのセッションには、CPU 側でのツール呼び出し、コード実行、検索、データベースクエリ、サンドボックス評価などが挟まれた複数のモデルステップが含まれます。データセンターがフル稼働している場合、GPU はこれらのギャップを待機しません。CPU が作業中も、新しいリクエストとアクティブなコンテキストを引き受けます。リクエストが蓄積するにつれ、元のトレースの KV キャッシュをその場で保持することが次第に困難になります。

図 5. 遅いツール呼び出しはキャッシュの排除と高コストな再計算を引き起こす可能性があります。
CPU の処理が遅くなると、GPU の計算ステップ間のギャップが広がります。その結果、システムは他のユーザー(実行準備ができている作業を持つ)のために GPU メモリから元の要求の KV キャッシュを排除する必要に迫られる可能性が高まります。ツール呼び出しが完了した際、GPU はキャッシュされた状態から再開するのではなく、以前のシーケンスを大きな入力プロンプトとして再処理することで、その文脈を再構築する必要があります。
Vera CPU は、トレースの CPU 側部分を圧縮することで貢献します。ツール実行が高速化され、負荷下でのコアあたりのパフォーマンスが強固になり、高いメモリ帯域幅と予測可能なレイテンシを実現することで、エージェントが GPU ステップ間で待つ時間が短縮されます。これにより、KV キャッシュが_eviction_(退去)圧力にさらされる期間が短くなり、HBM 内にアクティブなコンテキストをより多く保持できるため、高価な再計算を通じて以前の状態を復元する必要性も減ります。
その結果、GPU の時間が文脈の再構築ではなく、有用なトークン生成により多く割かれるようになります。飽和したエージェントシステムにおいて、CPU パフォーマンスは GPU 効率に直接寄与する要素となるのです。
AI ファクトリーの未来を加速する
Vera CPU は、エージェント型 AI ファクトリーにとって最も重要な CPU 機能を統合しました。すなわち、持続的なコアあたりのパフォーマンス、負荷下での予測可能な低レイテンシ、広大なメモリ帯域幅、そしてスケールした環境における効率的なデータ転送です。エージェント型 AI が拡大するにつれ、CPU はもはや背景のインフラストラクチャではありません。AI ファクトリーのスループット、応答性、GPU 効率を直接牽引する存在へと進化しました。ストールを減らし、再計算を制限し、負荷下でもシステム全体が生産性を維持できるよう支援することで、NVIDIA Vera CPU は次世代のエージェント型 AI ファクトリーにおけるパフォーマンス最大化を目指して設計されています。
これらの機能が実際の性能にどう反映されるかを確認するには、NVIDIA の Vera CPU や Vera Rubin NVL72 について詳しく知るほか、Phoronix が実施した Vera CPU のベンチマーク結果 も参照してください。
※相対性能は測定データに基づくものであり、変更される可能性があります。NVIDIA Vera CPU(LPDDR5X 搭載)の性能は、最新の x86 CPU を基準に比較しています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み