NVIDIA、Groq 3 LPX AI推論アクセラレータの量産開始
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
NVIDIA は Hot Chips 2026 の発表の一環として、Groq 3 LPX AI インフラアクセラレータチップのフル生産(量産)を開始したと発表した。
AI深層分析を開く2026年8月26日 22:00
AI深層分析
キーポイント
Groq 3 LPX の量産開始発表
NVIDIA は Hot Chips 2026 の発表の一環として、Groq 3 LPX AI インフラアクセラレータチップのフル生産(量産)を開始したと発表した。
Vera Rubin NVL72 との連携強化
Groq 3 LPX ラックは NVIDIA の Vera Rubin プラットフォームを拡張するものであり、応答速度が敏感なアジェンティック AI ワークロードにおける超高速トークン生成を実現する。
記録的なパフォーマンス達成
NVIDIA は Artificial Analysis によるデモンストレーションで、10 万トークンのコンテキストウィンドウを持つ Gemma 4 31B モデルにおいて、3,400 トークン/秒という過去最速の生成速度を記録したと発表した。
AI ファクトリーへの重要性
数百から数千の推論ステップにわたって大量のトークンを生成する必要があるアジェンティック AI において、高速なトークン生成は AI ファクトリーの重要な要素であると位置づけられている。
Groq 3 LPX と Rubin GPU の役割分担による性能向上
Rubin GPU が大規模な文脈処理を、LPX が遅延敏感型のデコード作業を担当することで、予測可能なトークン生成速度を実現する。これにより AI ファクトリーは応答性の高い推論やスムーズなエージェント操作が可能になる。
重要な引用
NVIDIA today announced that its Groq 3 LPX AI inference accelerator chip is in full production.
In one demonstration, NVIDIA showcases its Vera Rubin NVL72 platform with Groq 3 LPX pushing out a record 3,400 tokens per second in Artificial Analysis running the Gemma 4 31B open model.
"Inference is the growth engine of AI. NVIDIA Grace Blackwell and NVL72 revolutionized large language model inference with an unprecedented leap in performance and efficiency," said Jensen Huang, founder and CEO of NVIDIA.
"Generation is the phase of inference that determines how responsive an AI system actually is, and that's exactly what NVIDIA Groq 3 LPX is built to accelerate," said Danila Shtan, chief technology officer of Nebius.
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
NVIDIA の Groq 3 LPX は量産体制に入り、エージェント型 AI 分野における Vera Rubin プラットフォームのトークン生成速度を大幅に向上させました。
NVIDIA、Vera Rubin NVL72 のトークン生成能力を強化、Groq 3 LPX で過去最速の 3,400 TPS を記録
Hot Chips 2026 の発表の一環として、NVIDIA は本日、Groq 3 LPX AI インフラアクセラレータ が量産に入ったと発表しました。これは、Vera CPU と Vera Rubin サーバーの量産発表に続くもので、NVIDIA の AI ロードマップが着実に実行されていることを示しています。

Groq 3 LPX ラックは NVIDIA Vera Rubin プラットフォーム の拡張として機能し、AI インフラの能力を強化しています。これにより、応答速度が求められるエージェント型ワークロードに対して超高速なトークン生成が可能になります。これらのシステムは、数百乃至数千もの推論ステップにわたって膨大な量のトークンを生成するため、高速なトークン生成は AI ファクトリーにとって極めて重要な工程なのです。
NVIDIA の「Vera Rubin NVL72」はアジェンシー AI(自律型 AI)のための最先端ソリューションですが、その能力をさらに強化するのが Groq 3 LPX です。
あるデモでは、Gemma 4 31B というオープンモデルを実行する Artificial Analysis 上で、Groq 3 LPX を搭載した NVIDIA Vera Rubin NVL72 プラットフォームが、驚異的な 1 秒あたり 3,400 トークンの生成速度を記録しました。10 万トークンという広大なコンテキストウィンドウを処理しながらのこのパフォーマンスは、同モデルにおける史上最高速です。
NVIDIA Rubin GPU は大規模な文脈処理を担当し、LPX は遅延が許されないデコード作業を高速化します。その結果、生成速度が向上し予測可能性が高まることで、AI ファクトリーはより迅速な推論や滑らかなエージェント間の対応、そしてインフラ全体の効率化を実現できます。

Groq 3 LPX を導入することで、コーディングを含むアジェンシー AI のタスクが数時間かかるものから数分で完了するようになり、最速の競合プラットフォームと比較して応答速度が 4 倍に向上します。これはまさに画期的な進歩です!
「推論は AI の成長エンジンです。NVIDIA Grace Blackwell と NVL72 は、性能と効率における前例のない飛躍によって大規模言語モデルの推論を革命化しました」と NVIDIA 創業者兼 CEO のジェンソン・ファン氏は述べています。「Vera Rubin は、このビジョンをさらに拡張し、エージェント AI の時代に対応したワークロード最適化された AI ファクトリ構成で LPX を導入することで、超高速なトークン生成を実現します。これにより、世界中で AI 計算への需要が加速する中で、知能の生産方法そのものが変革され、AI スループット、効率、応答性においてさらに大きな飛躍をもたらすことになります。」
NVIDIA Groq 3 LPX ソリューションは、拡大するニーズに対する解決策として AI クラウドプロバイダーからも注目されており、企業や開発者が大規模なトレーニング、推論、そして推論のための高度なインフラストラクチャにアクセスできるようになります。これに伴い、Nebius は Nebius Token Factory で Groq 3 LPX を活用する計画です。
「生成は、AI システムの実際の応答性を決定する推論の段階であり、まさに NVIDIA Groq 3 LPX が加速するために設計された部分です」と Nebius の最高技術責任者であるダニラ・シュタン氏は語っています。「Nebius Token Factory を通じてこれを本番環境に導入する最初の AI クラウドとして、開発者がすでに使用している API をそのまま利用し、新しいスタックへの移行を必要とせずに、エージェントのループにおけるすべてのステップが瞬時に行われるようにしています。」
Groq 3 LPX と Vera Rubin の組み合わせは、エージェント AI エラに対応するために設計されたものです。この構成は、応答性、スループット、効率性を最大化する目的に特化した推論アーキテクチャを提供し、次世代の AI ファクトリーを支える原動力となります。
著者について: 訓練ではソフトウェアエンジニアであり、情熱的には PC エンタジストであるハサン・ムジュタバ氏は、Wccftech のハードウェアセクションのシニア編集者を務めています。業界での長年の経験を活かし、次世代 CPU や GPU アーキテクチャ、マザーボード、冷却ソリューションに関する詳細な技術分析を専門としています。彼の活動は、新技術に関する速報の伝達だけでなく、実機を用いた広範なレビューやベンチマークにも及んでいます。
Wccftech の Google プロフィール [https://profile.google.com/cp/Cg0vZy8xMWM3NDB2MmIyGgA] をフォローして、ニュースをフィードで直接受け取りましょう。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み