NVIDIA Nemotron 3 Embed が RTEB で総合1位
本文の状態
日本語全文を表示中
詳細モードで約17分の本文を読めます。
NVIDIA は Hugging Face の RTEB ベンチマークで NLP エンベディングモデルが総合 1 位を獲得したと発表し、エージェント型検索の精度向上に寄与する。
AI深層分析を開く2026年7月29日 22:45
AI深層分析
キーポイント
RTEB ベンチマークでの首位獲得
NVIDIA の「Nemotron 3 Embed」モデルが Hugging Face が運営する Retrieval and Text Embedding Benchmark (RTEB) で総合 1 位を記録した。
エージェント型検索の性能向上
このモデルは、複雑な質問への回答や情報探索を行う「アジェンティック・リトリーバル」の精度を高めるために設計されている。
Hugging Face による公式発表
NVIDIA の開発者らが Hugging Face Blog でこの成果を発表し、同モデルが業界標準ベンチマークで他社モデルを上回ったことを示した。
NVIDIA Nemotron 3 Embed の公開
RAG、アジェンティック検索、コード検索、エージェントメモリ向けのオープンおよび商用利用可能な埋め込みモデルコレクションがリリースされた。
SOTA を達成する8Bモデルと効率的な1Bモデル
精度と効率性のバランスにおいて最先端を達成する3つのオープンモデルが含まれており、その中核にはRTEBリーダーボードで1位を獲得した8Bモデルがある。
重要な引用
NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB
Advancing Agentic Retrieval
Retrieval is critical in multi-step agentic workflows where poor retrieval can cause agents to fetch irrelevant context, re-query, waste token budget, and carry noise into later reasoning steps.
The collection includes three open models that achieve state-of-the-art retrieval across the accuracy-efficiency curve, led by an 8B model that tops the RTEB leaderboard and efficient 1B variants built for production-scale deployment.
編集コメントを表示
編集コメント
Hugging Face の公式ベンチマークで首位を獲得したことは、NVIDIA のエンベディング技術が実世界での検索タスクに即していることを示唆する。開発者はこのモデルをエージェント型アプリケーションの基盤として再評価する価値がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
多段階の自律型ワークフローにおいて、検索精度は極めて重要です。検索結果が不適切だと、エージェントが不要なコンテキストを取得したり、再クエリを実行してトークン予算を浪費したり、後続の推論ステップにノイズを持ち込んだりするリスクがあります。
本日、NVIDIA Nemotron 3 Embed(Hugging Face コレクション)を公開します。これは、検索品質の向上を図りつつ、開発者が大規模な RAG(検索拡張生成)、自律型検索、コード検索、エージェントメモリといった本番環境向けに実用的なデプロイオプションを選べるよう設計された、オープンかつ商用利用可能な埋め込みモデル群です。
このコレクションには、精度と効率性のバランスにおいて最先端の性能を発揮する 3 つのオープンモデルが含まれています。その中でも特に注目すべきは、RTEB リーダーボードで首位を獲得した 8B モデルと、本番環境での大規模展開に適した効率的な 1B バリアントです。
| モデル | 役割 | 最適な用途 |
|---|---|---|
| Nemotron-3-Embed-8B-BF16 | フラッグシップ品質のアンカー:RTEB で 1 位を獲得した、フラッグシップの埋め込みモデル。 | 精度が極めて重要な検索および高リスクなエンタープライズ RAG |
| Nemotron-3-Embed-1B-BF16 | 高効率の標準モデル:レイテンシとコストが重要な、本番環境での検索用。 | コストおよびレイテンシに敏感な本番環境でのサービス提供 |
| Nemotron-3-Embed-1B-NVFP4 | ハードウェアアクセラレーション対応のバリアント:Blackwell 最適化版で、より少ないメモリフットプリントで高スループットの検索を実現。 | 超高速スループットおよび大規模インフラ向け |
表 1:Nemotron 3 Embed モデルの可用性と展開マトリクス
図 1:RTEB マルチリンガルリーダーボード のスクリーンショット(2026 年 7 月 15 日)。Nemotron-3-Embed-8B-BF16 が第 1 位にランクインしている様子を示しています。
主な特徴
RTEB の結果以外にも、Nemotron 3 Embed はエンタープライズ向け検索展開に向けた実用機能を備えています:
- オープンな重み・データセット・レシピ:チームが自社のインフラ上で検索モデルを検証し、調整やファインチューニングを行い、展開できるようになります。
- 32k コンテキストウィンドウ:長いドキュメント、大規模なコードコンテキスト、多段階のエージェント履歴にわたる検索をサポートし、切り捨てを減らします。
- マルチリンガル・コード検索:グローバルなエンタープライズデータ、技術文書、複数ファイルからなるコードリポジトリ全体での検索に対応しています。
- NVIDIA NVFP4 効率化:Blackwell に最適化された 4 ビット展開パスを提供し、メモリフットプリントを抑えつつ高スループットの検索を実現します。
**ファインチューニング** および **蒸留** のレシピ:NVIDIA NeMo AutoModel のレシピにより、チームは自社のデータに合わせて検索モデルを適応させるためのドメイン適応やモデル圧縮が可能になります。
Day-0 エコシステム統合
Nemotron 3 Embed は、Hugging Face で即座に利用可能で、NVIDIA NIM マイクロサービスとしてデプロイでき、vLLM によるサポートも受けられます。さらに、主要な AI クラウドおよび推論パートナーを通じてアクセス可能です。
評価:検索品質、エージェント効率、そして導入のトレードオフ
Nemotron 3 Embed の性能は、検索品質、下流のエージェント効率、そして導入におけるトレードオフという 3 つの観点から評価されます。8B モデルがコレクション全体の品質上限を決定し、1B BF16 および NVFP4 バリアントは、低コストかつ高スループットな展開環境においても、同じく検索に特化した設計をもたらします。
RTEB での首位と検索ベンチマーク全体での大幅な向上
まず、RTEB において Nemotron-3-Embed-8B-BF16 が第 1 位を獲得したことを確認しました。また、平均 NDCG@10 を指標に、ViDoRe V3 Text、MMTEB Retrieval、そして LongEmbed においてもこれらのモデルをテストしました。
*図 2. RTEB、ViDoRe V3 Text、MMTEB Retrieval、LongEmbed における平均 NDCG@10 を用いた検索精度。Nemotron 3 Embed モデルと前世代の Nemotron ベースラインを比較した結果を示す。
- Nemotron-3-Embed-8B-BF16 は RTEB で第 1 位となり、RTEB では 78.5%、MMTEB Retrieval では 75.5% のスコアを記録しました。
「Nemotron-3-Embed-1B-BF16」は、8B モデルの検索品質をより小さなデプロイ規模で実現します。RTEB では 72.4% のスコアを記録し、前世代の 1B モデル(llama-nemotron-embed-vl-1b-v2)と比較して誤り率を 27% 削減しました。また MMTEB Retrieval でも 71.0% を達成し、誤り率は 28% 減少しています。
エージェントにとって検索精度が重要な理由
エージェント環境における検索性能を評価するため、Nemotron 3 Ultra に基づく 検索エージェント を用い、検索システムで使用する埋め込みモデルを変更して検証を行いました。検索精度が高まれば、関連する証拠資料をより早く取得できるため、エージェントが繰り返し検索を行ったり、不要な推論ステップを経たり、文脈の精査に時間を割いたりすることを防げます。ここでは ViDoRe V3、BRIGHT、BrowseComp-Plus における平均検索精度と、クエリあたりの推定ダウンストリームエージェントトークンコストを比較します。
*図 3. ViDoRe V3、BRIGHT、BrowseComp-Plus における平均検索精度とクエリあたりのダウンストリームエージェントトークンコストの対比*
*評価ノート:検索エージェントには Nemotron 3 Ultra を使用しています。ダウンストリームのトークンコストは、Nemotron 3 Ultra の入力・出力トークン数に基づき、GPT-5.5 の価格計算式を用いて推定した値です。*
図3は、検索精度が高まると下流の推論トークンコストが削減されることを示しています。より正確な検索器は関連する証拠を早期に返すため、エージェントは繰り返しの検索や推論ターンを減らしてタスクを完了できます。これらの評価において、Nemotron 3 Embed モデルはアジェント型検索の性能限界を引き上げました。特に8Bモデルは、ViDoRe V3、BRIGHT、BrowseComp-Plusのすべてのベンチマークで、平均検索精度が最も高く、推定される下流トークンコストも最低を記録しています。
Blackwell での NVFP4 を活用したスケーラブルな検索
スループットの高い展開では、レイテンシとコストの要件を満たすため、チームは小型の埋め込みモデルを選ぶことが一般的です。Nemotron-3-Embed-1B-NVFP4 は、NVIDIA Blackwell アーキテクチャ上でネイティブな NVFP4 加速を活用することで、サービス効率と検索品質の格差を縮めるよう設計されています。このモデルは線形層の重みと活性化値を NVFP4 に量子化して効率的な推論を実現し、長い入力シーケンスに対する精度回復を支援するために、量子化意識型蒸留(QAD)を採用しています。
*図4. 検索精度とサービス効率の比較。Nemotron-3-Embed-1B-NVFP4 を、Qwen3-Embedding-0.6B や EmbeddingGemma-300M など、選択された小型のオープンソース埋め込みベースラインと比較した ViDoRe V3 の結果。
- サービス効率: Blackwell 上の NVFP4 は、高スループットかつ低レイテンシな検索サービスの提供において、BF16 と比較して最大2倍のスループットを実現します。
精度の維持:NVFP4 バリアントは、メモリ使用量を削減しつつ、BF16 の検索精度を 99% 以上維持します。
Day 0 で実用可能な NIM
本番環境での大規模検索システムでは、異なる入力シーケンス長やハードウェアターゲットにわたって、実際のリクエスト負荷下でもその効率性を保つ必要があります。今日からエンタープライズスケールで Nemotron 3 Embed を高性能に運用するために、1B モデル向けの最適化された NVIDIA NIM マイクロサービスも公開します。図 5 に示す通り、Rust ベースの Nemotron 3 Embed NIM は、ISL が 256 と 1024 の場合、NVIDIA GB200 および RTX PRO 6000 GPU 上で vLLM チェックポイントと同等かそれ以上のパフォーマンスを発揮します。
*図 5. NVIDIA GB200 および RTX PRO 6000 GPU における Nemotron 3 Embed NIM のサービングパフォーマンスと、vLLM チェックポイントとの比較。*
Nemotron 3 Embed モデルの構築方法
Nemotron-3-Embed-8B-BF16 は、Ministral-3-8B-Instruct-2512 のバックボーンを流用し、因果デコーダーを双方向エンコーダーに変換することで、全文検索に対応できるようにしました。このモデルは、ウェブソースと合成テキストのペアを混合したデータで対照的事前学習を行い、その後、法務、金融、医療、ビジネス、教育などのドメインにわたる厳選された多言語検索データセットで微調整されています。この 8B モデルがフラッグシップエンベディングモデルとして機能し、同じ開発ラインから派生した以前の 8B ティーチャーチェックポイントは、効率的な 1B バリアントを蒸留するために使用されました。
1B へのスケーリングダウン
この 1B モデルは、ゼロから訓練された小型の検索エンジンではありません。まず、Ministral-3-3B-Instruct-2512 をバックボーンとしてバイディレクショナル適応手法を適用し、3B の検索基盤モデルを作成しました。その後、構造化された剪定と蒸留を 2 ラウンド実施して圧縮しています。
まず、3B の親モデルを NVIDIA ModelOpt の mcore_minitron Neural Architecture Search (NAS) エンジンを用いて、中間的な 2B フットプリントに圧縮しました。この NAS パイプラインは、パラメータ予算の制約下で隠れ層の幅、FFN サイズ、アテンションヘッド数、深さを探索し、検索ワークロードに適した効率的なアーキテクチャを特定します。
得られた 2B の中間モデルは、8B の教師チェックポイントから蒸留され、ランク付け精度を回復させました。多言語かつドメイン固有の検索データブレンドを用いて、コサイン距離損失と平均二乗誤差損失を組み合わせた手法で、生徒モデルの埋め込み表現を教師モデルに整合させています。
*Figure 6. The pruning and distillation pipeline compresses the retriever from a 3B base to the final 1B production model.*
この一連の手順、つまり ModelOpt による構造化剪定と 8B 教師モデルからの蒸留をもう一度繰り返すことで、2B の中間モデルから最終的な 1.14B の埋め込みモデルへと圧縮しました。最終トレーニングでは、段階的な 2 ステージのコンテキストスケーリングスケジュールを採用しています。
第1段階では、1024トークンのコンテキスト長において広範な多言語アライメントに注力し、親モデルのコア検索動作を再構築しました。
第2段階では、コンテキスト長を4096トークンに拡張し、長期コンテキスト用の合成データと推論データを追加することで、1B モデルがより長い入力に対しても識別可能な記憶保持能力を維持できるようにしました。
以下の表は、Nemotron 3 Embed モデルの主要な技術仕様と導入ターゲットを要約したものです。
| モデル | サイズ | 埋め込み次元数 (Emb Dim) | コンテキストウィンドウ | プーリング手法 | 入力プレフィックス | 対象ハードウェア |
|---|---|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | 8.0B | 4096 | 32k | Mean | query: / document: | 汎用 GPU 推論 |
| Nemotron-3-Embed-1B-BF16 | 1.14B | 2048 | 32k | Mean | query: / document: | 低遅延 CPU/GPU |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | 2048 | 32k | Mean | query: / document: | NVIDIA Blackwell/GB200 |
表 2. Nemotron 3 Embed モデルのアーキテクチャ仕様と主要な推論設定。
エンタープライズパートナーによる評価
エンタープライズ向け独立系ソフトウェアベンダー(ISV)、AI ネイティブ企業、メモリプロバイダらはすでに、エージェント型検索やエージェント用メモリ、コード検索、本番環境での推論ワークフローにおいて Nemotron 3 Embed の評価を進めています。
- 「エージェントの精度には文脈が不可欠です。当社の『Context Intelligence Graph』は埋め込み表現と意味的類似性を活用し、NVIDIA と共同で今年 5 月に発表したエンタープライズ向けエージェント『EnterpriseClaw』などに対して、最も関連性の高い企業情報を提供します。NVIDIA の新モデル『Nemotron 3 Embed』の初期結果は有望であり、特に質問応答においては既存モデルよりも性能が向上しています。これらのモデルが、当社のエンタープライズエージェントの精度と信頼性をさらに高める可能性に期待しています。」
- Adi Kuruganti 氏(Automation Anywhere 最高 AI 開発責任者)
- 「NVIDIA の『Nemotron 3 Embed』モデルに対する初期評価では、エージェント型検索ユースケースにおける検索性能の高さが確認できました。1B パラメータ版と 8B パラメータ版の両方が利用可能であるため、チームは環境ごとに品質、レイテンシ、デプロイ要件のバランスを柔軟に調整できます。引き続きこれらのモデルを検証し、本番環境向け AI アプリケーションにおける高パフォーマンスな検索を実現する方法を探っていきたいと考えています。」
- Mani Gill 氏(Boomi 製品管理担当シニアバイスプレジデント)
IBM は、watsonx.data を基盤とした概念実証(PoC)で、新しい NVIDIA Nemotron Embed モデルの評価を行い、有望な初期結果を掴んでいます。
「自社スタック内で Nemotron-3-Embed-1B を各種モデルと比較したところ、最上位となりました。例えば、LongMemEval の Retrieval@10 では 80.38% を記録し、Qwen-3-0.6B の 78.71% を上回りました。オープンウェイトとファインチューニングのレシピが最も関心が高い点です。これにより、モデルをメモリテキストに適応させ、自社で提供することが可能になります。」
Palantir は、NVIDIA と協力し、エッジでの検索ワークロードを行うエンドユーザー向けに Nemotron 3 Embed の展開を検証しています。これは、AIP のモデルカタログで NVIDIA の埋め込みモデルを利用可能にした先行成果を踏まえたものです。
ServiceNow は、ドキュメントからの情報取得のために NVIDIA Nemotron Embed を評価中であり、検索精度向上のためのドメイン特化型ファインチューニングへの関心も継続しています。
turbopuffer は、Nemotron 3 Embed をネイティブの埋め込みサービスに統合し、開発者が同社の意味検索エンジン内でこれらのモデルを利用できるようにしました。
「再ランキングスタックに NVIDIA Nemotron 3 Embed モデルを組み込むことで、パフォーマンスが劇的に向上しました。これにより、ウェブページからクエリに関連するスニペットを、これまで使ったどのモデルよりもはるかに高い精度で選別できるようになりました。」
— Rahul Mohan, シニア AI エンジニア、You.com
Zep は、エージェントのメモリおよび文脈検索のために NVIDIA Nemotron 3 Embed 1B を評価しました。Nemotron 3 Embed 1B よりもはるかに大きなモデルを含む、Zep が以前から使用していた複数のモデルとの初期内部ベンチマークでは、すべてのメモリ検索タスクで首位を獲得しました。Zep は、FP4 チェックポイントが利用可能になったことで、同社のスケールにおいてストレージとレイテンシの面で非常に競争力のあるモデルになると考えています。
Zoom は、エンタープライズ向けエージェント検索の背後にある検索層として NVIDIA Nemotron 3 Embed の評価を進めています。この検索は Zoom の文脈層を支えるもので、会議やドキュメント、チャット、チケット、その他の社内システムなど、幅広い職場知識ソースから関連する文脈をエージェントが取得できるよう支援します。
始め方
NVIDIA Nemotron 3 Embed は、オープンウェイトとオープンソースのトレーニングレシピと共にリリースされており、組織は検索モデルを生産環境向け AI アプリケーション用にカスタマイズし、展開する方法を完全に制御できます。
開発者は、ワークフローに最も適したデプロイオプションを選択して利用を開始できます。
Hugging Face では、SentenceTransformers、Transformers、vLLM 向けのモデル重み、モデルカード、サンプルコードにアクセスできます。
NVIDIA NIM を利用すれば、build.nvidia.com で本番環境での推論に対応した最適化されたマイクロサービスを利用可能です。
AI クラウドおよび推論パートナーを通じて、Nemotron 3 Embed を主要なエコシステムパートナー経由で展開することもできます。詳しくは Baseten、Bitdeer AI、DeepInfra、Friendli AI、OpenRouter をご覧ください。
ドメイン適応やモデルの軽量化が必要なワークロード向けに、NVIDIA NeMo AutoModel のトレーニングレシピもオープンソース化しています:
- ファインチューニング用レシピ - 自社のエンタープライズデータセットや検索タスクに合わせて Nemotron 3 Embed を適応させる。
- 知識蒸留用レシピ - 本番環境への展開を前提に、ランキング性能を維持しつつ大規模な検索モデルを圧縮する。
例えば、NV Docs での評価では、Nemotron-3-Embed-1B-BF16 をファインチューニングすることで、NDCG@10 が 56.7% から 63.3%(+11.6%)、Recall@5 が 56.1% から 62.8%(+11.9%)に向上しました。
エンタープライズ検索、本番環境の RAG、エージェントメモリ、コード検索、あるいはアジェンティック AI システムを構築する際でも、NVIDIA Nemotron 3 Embed は柔軟なデプロイオプションを提供します。Hugging Face で公開されているオープンソースモデルから、フルマネージドの AI クラウドプラットフォーム、そして NVIDIA NIM マイクロサービスまで、用途に応じて選べます。
ぜひモデルを確認し、お好みのプラットフォームでデプロイしてください。また、どのようなシステムを構築しているか、私たちにも教えていただければ幸いです。
AI算出
主要ニュースainew評価高い
記事は特定の AI モデル(Nemotron 3 Embed)とその最新バージョン(8B, 1B など)の詳細な性能データ、ベンチマーク結果、および実装特徴を報じており、AI テクノロジーの核心的な新事実を含んでいる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み