NVIDIA、埋め込みモデル「Nemotron 3 Embed」発表
本文の状態
日本語全文を表示中
詳細モードで約17分の本文を読めます。
NVIDIA は Hugging Face 上で、RAG や検索機能の精度向上に寄与する高性能な埋め込みモデル「Nemotron-3-Embed」シリーズを公開し、開発者が容易に利用可能な環境を提供した。
AI深層分析を開く2026年8月5日 21:41
AI深層分析
キーポイント
Nemotron-3-Embed シリーズの公開
NVIDIA は Hugging Face 上で、RAG(検索拡張生成)や情報検索タスク向けに最適化された「Nemotron-3-Embed」シリーズのモデルを公開した。
高性能な埋め込み能力
同社によると、このモデルは複雑なクエリに対する理解力や、関連性の高い文書の検索精度において既存のモデルを上回る性能を発揮すると発表した。
オープンソースとアクセシビリティ
NVIDIA はこれらのモデルを Hugging Face 上で無償で公開し、開発者がすぐに実験や実装に組み込めるようにした。
多段階エージェントワークフローにおける検索の重要性
不適切な検索は関連性の低いコンテキストを取得させ、再クエリやトークン予算の浪費を招き、後の推論ステップにノイズをもたらす。
NVIDIA Nemotron 3 Embed の概要と用途
本モデルコレクションは検索品質を向上させるために設計され、大規模な RAG、エージェント検索、コード検索、およびエージェントメモリへの実用的なデプロイオプションを提供する。
重要な引用
Nemotron-3-Embed models are designed to excel at RAG and search tasks.
These models outperform existing solutions in retrieving relevant documents.
Retrieval is critical in multi-step agentic workflows where poor retrieval can cause agents to fetch irrelevant context, re-query, waste token budget, and carry noise into later reasoning steps.
Today, we are releasing NVIDIA Nemotron 3 Embed, a collection of open and commercially available embedding models designed to improve retrieval quality while giving developers practical deployment options for production-scale RAG, agentic retrieval, code retrieval, and agent memory.
編集コメントを表示
編集コメント
検索精度の向上が求められる RAG システムにおいて、高性能な埋め込みモデルをオープンソースで提供するのは大きな進展である。開発者はすぐにこのモデルを試すことで、既存システムのボトルネック解消が可能となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
多段階の自律型ワークフローにおいて、検索精度が低いと、エージェントが不要なコンテキストを取得したり、再クエリを実行してトークン予算を浪費したり、後続の推論ステップにノイズを持ち込んだりするリスクがあります。
本日、NVIDIA Nemotron 3 Embed(Hugging Face コレクション)を公開します。これは、検索品質を向上させつつ、開発者が大規模な RAG(検索拡張生成)、自律型検索、コード検索、エージェントのメモリ管理などを実用的に運用できる選択肢を提供するよう設計された、オープンかつ商用利用可能な埋め込みモデル群です。
このコレクションには、精度と効率性のバランスにおいて最先端の性能を発揮する 3 つのオープンモデルが含まれています。その中心となるのは RTEB リーダーボードでトップを記録した 8B モデルであり、大規模な運用に適した効率的な 1B バリアントも用意されています。
| モデル | 役割 | 最適な用途 |
|---|---|---|
| Nemotron-3-Embed-8B-BF16 | フラッグシップ品質アンカー:RTEB で 1 位を獲得した、フラッグシップの埋め込みモデル。 | 精度が極めて重要な検索および高リスクなエンタープライズ RAG |
| Nemotron-3-Embed-1B-BF16 | 高効率スタンダード:レイテンシとコストが重要な、本番環境での検索に特化した高効率モデル。 | コストおよびレイテンシに敏感な本番環境でのサービス提供 |
| Nemotron-3-Embed-1B-NVFP4 | ハードウェアアクセラレーション対応バリアント:メモリフットプリントが小さく、高スループットの検索を実現する Blackwell 最適化版。 | 超高速スループットおよび大規模インフラストラクチャ向け |
表 1. Nemotron 3 Embed モデルの運用性とデプロイメントマトリクス。
図 1. RTEB マルチリンガルリーダーボード のスクリーンショット(2026 年 7 月 15 日)。Nemotron-3-Embed-8B-BF16 が第 1 位にランクインしている様子を示しています。
主な特徴
RTEB の結果に加え、Nemotron 3 Embed はエンタープライズ向け検索システムの実装に必要な機能を提供します。
- オープンな重み・データセット・レシピ: チームが自社のインフラ上で検索モデルを検証し、調整やファインチューニングを行い、デプロイする自由を確保します。
- 32k コンテキストウィンドウ: 長いドキュメント、大規模なコードコンテキスト、多段階のエージェント履歴に対する検索をサポートし、切り捨てを最小限に抑えます。
- マルチリンガル・コード検索: グローバルなエンタープライズデータ、技術文書、複数ファイルからなるコードリポジトリ全体での検索に対応します。
- NVIDIA NVFP4 効率化: Blackwell に最適化された 4 ビットデプロイパスを提供し、メモリ使用量を削減しながら高スループットの検索を実現します。
- **ファインチューニング** および **蒸留** レシピ: NVIDIA NeMo AutoModel のレシピにより、チームは自社のデータに合わせて検索モデルをドメイン適応させたり、モデルを圧縮したりすることが可能です。
Day-0 エコシステム統合
Nemotron 3 Embed は、Hugging Face で即座に利用可能で、NVIDIA NIM マイクロサービスとしてデプロイでき、vLLM によるサポートも受けられます。さらに、主要な AI クラウドおよび推論パートナーを通じてアクセス可能です。
評価:検索品質、エージェント効率、そして展開におけるトレードオフ
Nemotron 3 Embed の性能は、検索品質、下流のエージェント効率、そして展開時のトレードオフという 3 つの観点から評価しました。8B モデルがコレクション全体の品質上限を決定し、1B BF16 および NVFP4 バリアントは、低コストかつ高スループットな展開環境でも同様の検索特化型設計を提供します。
RTEB での首位と検索ベンチマーク全体における大幅な向上
まず RTEB ベンチマークでモデルを評価したところ、Nemotron-3-Embed-8B-BF16 が第 1 位を獲得しました。また、平均 NDCG@10 を指標に、ViDoRe V3 Text、MMTEB Retrieval、および LongEmbed におけるテストも実施しました。
*図 2. RTEB、ViDoRe V3 Text、MMTEB Retrieval、LongEmbed における平均 NDCG@10 を用いた検索精度。Nemotron 3 Embed モデルと前世代の Nemotron ベースラインを比較した結果です。*
- Nemotron-3-Embed-8B-BF16 は RTEB で第 1 位となり、RTEB では 78.5%、MMTEB Retrieval では 75.5% のスコアを記録しました。
「Nemotron-3-Embed-1B-BF16」は、8B モデルの検索品質をより小さなデプロイ規模で実現します。RTEB では 72.4% のスコアを記録し、前世代の 1B モデル(llama-nemotron-embed-vl-1b-v2)と比較して誤り率を 27% 削減しました。また MMTEB Retrieval でも 71.0% を達成し、誤り率は 28% 低下しています。
エージェントにとって検索精度が重要な理由
エージェント環境における検索性能を評価するため、Nemotron 3 Ultra に基づく 検索エージェント を用い、検索システムで使用する埋め込みモデルを変えて検証を行いました。検索精度が高まれば、関連する証拠をより早く取得できるため、エージェントが不要な再検索や推論の繰り返し、余計なコンテキストの確認を防ぐことができます。ここでは ViDoRe V3、BRIGHT、BrowseComp-Plus における平均検索精度と、クエリあたりの推定ダウンストリームエージェントトークンコストを比較します。
*図 3. ViDoRe V3、BRIGHT、BrowseComp-Plus における平均検索精度とクエリあたりのダウンストリームエージェントトークンコストの対比*
*評価ノート:検索エージェントには Nemotron 3 Ultra を使用しています。ダウンストリームのトークンコストは、GPT-5.5 の価格計算式に基づき、Nemotron 3 Ultra の入力・出力トークン数から推定されています。*
図3は、検索精度を高めることで下流のエージェント処理に必要なトークン数を削減できることを示しています。より正確な検索システムは関連する証拠を早期に返すため、エージェントは繰り返し検索や推論ターンを減らしてタスクを完了できます。これらの評価において、Nemotron 3 Embed モデルはエージェント検索の性能限界を引き上げました。特に8Bモデルは、ViDoRe V3、BRIGHT、BrowseComp-Plusのすべてのベンチマークで、平均検索精度が最も高く、推定される下流トークンコストも最低でした。
Blackwell 上の NVFP4 を活用した検索のスケーリング
スループットを重視する展開では、レイテンシとコスト目標を満たすため、より小さな埋め込みモデルを採用することが一般的です。Nemotron-3-Embed-1B-NVFP4は、NVIDIA Blackwell アーキテクチャ上でネイティブの NVFP4 加速を活用し、サービス効率と検索品質のギャップを埋めるために設計されています。このモデルは線形層の重みと活性化値を NVFP4 に量子化して効率的な推論を実現し、長い入力シーケンスに対する精度回復には量子化意識型蒸留(Quantization-Aware Distillation: QAD)を採用しています。
*図4. Nemotron-3-Embed-1B-NVFP4 を、Qwen3-Embedding-0.6B や EmbeddingGemma-300M といった他の小型オープン埋め込みベースラインと比較した、ViDoRe V3 の検索精度とサービス効率の関係。
- サービス効率: Blackwell 上の NVFP4 は、高スループットかつ低レイテンシの検索サービスにおいて、BF16 と比較して最大2倍のスループットを実現します。
精度の維持:NVFP4 バリアントは、メモリ使用量を削減しながら、BF16 の検索精度を 99% 以上維持します。
Day 0 で実用的なパフォーマンス
本番環境での大規模検索システムでは、異なる入力シーケンス長やハードウェアターゲットにわたって、実際のリクエスト負荷下でもその効率性を保つ必要があります。今日からエンタープライズスケールで Nemotron 3 Embed を高性能に運用するために、1B モデル向けの最適化された NVIDIA NIM マイクロサービスも同時にリリースします。図 5 に示す通り、Rust ベースの Nemotron 3 Embed NIM は、ISL(入力シーケンス長)が 256 と 1024 の場合、NVIDIA GB200 および RTX PRO 6000 GPU 上で vLLM チェックポイントと同等かそれ以上のパフォーマンスを発揮します。
*図 5. NVIDIA GB200 および RTX PRO 6000 GPU 上での Nemotron 3 Embed NIM のサービング性能と、vLLM チェックポイントとの比較。*
Nemotron 3 Embed モデルの構築方法
Nemotron-3-Embed-8B-BF16 は、Ministral-3-8B-Instruct-2512 のバックボーンを基に、因果的なデコーダーを双方向エンコーダーに変換することで、全文検索に対応できるように適応しています。このモデルは、ウェブソースと合成テキストのペアを混合したデータで対照的事前学習を行い、その後、法務、金融、医療、ビジネス、教育などのドメインにわたる厳選された多言語検索データセットで微調整されています。この 8B モデルがフラッグシップエンベディングモデルとして機能し、同じ開発ラインから派生した以前の 8B ティーチャーチェックポイントは、効率的な 1B バリアントを蒸留するために使用されました。
1B へのスケーリングダウン
この 1B モデルは、ゼロから訓練された小型の検索用モデルではありません。まず、Ministral-3-3B-Instruct-2512 のバックボーンに双方向適応のレシピを適用して 3B の検索基盤モデルを作成し、その後、構造化された剪定と蒸留を 2 回繰り返すことで圧縮を行いました。
まず、3B の親モデルを NVIDIA ModelOpt の mcore_minitron Neural Architecture Search (NAS) エンジンを用いて、中間的な 2B のサイズに圧縮しました。この NAS パイプラインは、厳格なパラメータ予算の下で隠れ層の幅、FFN のサイズ、アテンションヘッドの数、深さなどを探索し、検索ワークロードに適した効率的なアーキテクチャを特定します。
得られた 2B の中間モデルは、8B の教師チェックポイントから蒸留され、ランク付け精度を回復させました。学生モデルの埋め込み表現を教師と整合させるため、多言語かつドメイン固有の検索データブレンドに対して、コサイン距離損失と平均二乗誤差損失を組み合わせて使用しました。
*Figure 6. The pruning and distillation pipeline compresses the retriever from a 3B base to the final 1B production model.*
この一連の手順、すなわち ModelOpt による構造化剪定に続く 8B 教師モデルからの蒸留をもう一度繰り返して、2B の中間モデルを最終的な 1.14B の埋め込みモデルまで圧縮しました。最終的なトレーニングでは、段階的にコンテキスト長を拡張する 2 ステージのスケジュールを採用しています。
第1段階では、1024トークンのコンテキスト長において広範な多言語アライメントに注力し、親モデルのコア検索動作を再構築しました。
第2段階では、コンテキスト長を4096トークンに拡張し、長期文脈の合成データと推論用データを追加することで、1Bパラメータモデルが長い入力に対しても識別性の高い記憶保持を実現できるようにしました。
以下の表は、Nemotron 3 Embed モデル群の主要な技術仕様と導入ターゲットを要約したものです。
| モデル | サイズ | 埋め込み次元数 | コンテキストウィンドウ | プーリング手法 | 入力プレフィックス | 対象ハードウェア |
|---|---|---|---|---|---|---|
| Nemotron-3-Embed-8B-BF16 | 8.0B | 4096 | 32k | Mean | query: / document: | 汎用 GPU 推論 |
| Nemotron-3-Embed-1B-BF16 | 1.14B | 2048 | 32k | Mean | query: / document: | 低遅延 CPU/GPU |
| Nemotron-3-Embed-1B-NVFP4 | 1.14B | 2048 | 32k | Mean | query: / document: | NVIDIA Blackwell/GB200 |
表 2. Nemotron 3 Embed モデルのアーキテクチャ仕様と主要な推論設定。
エンタープライズパートナーによる評価
エンタープライズ ISV、AI ネイティブ企業、メモリプロバイダーらはすでに、エージェント型検索、エージェント用メモリ、コード検索、本番環境での推論ワークフローにおいて Nemotron 3 Embed の評価を進めています。
- 「コンテキストはエージェントの精度にとって鍵となります。私たちが NVIDIA と共同で 5 月にリリースした EnterpriseClaw などのエージェントに対し、Context Intelligence Graph は埋め込みと意味的類似性を用いて最も関連性の高いエンタープライズコンテキストを提供します。NVIDIA の新しい Nemotron 3 Embed モデルからの初期結果は有望であり、特に質問応答においては既存モデルよりも改善が見られます。これらのモデルが当社のエンタープライズエージェントの精度と信頼性をさらに高める可能性に期待しています。」——Automation Anywhere 首席 AI 開発責任者 Adi Kuruganti
- 「NVIDIA Nemotron 3 Embed モデルに対する初期評価では、エージェント型検索ユースケースにおける強力な検索パフォーマンスを確認しました。1B と 8B の両バリアントが利用可能であるため、チームは異なる環境において品質、レイテンシ、デプロイ要件のバランスを柔軟に調整できます。本番 AI アプリケーション向けの高性能検索をサポートする方法を探求し、モデルの評価を継続していくことに興奮しています。」——Boomi 製品管理担当シニアバイスプレジデント Mani Gill
IBM は、watsonx.data を基盤とした概念実証(PoC)で、新しい NVIDIA Nemotron Embed モデルの評価を進め、有望な初期結果を捉えています。
「独自のスタック内で Nemotron-3-Embed-1B を各種モデルと比較したところ、最上位となりました。例えば、LongMemEval の Retrieval@10 において、Qwen-3-0.6B の 78.71% を上回る 80.38% のスコアを記録しています。特に注目しているのは、オープンウェイトとファインチューニングのレシピです。これにより、メモリテキストへの適応や自社での提供が可能になります。」— Mem0 のプロダクトマネージャー、Rudraj Mehta 氏
Palantir は、NVIDIA と協力し、エッジでの検索ワークロードを行うエンドユーザー向けに Nemotron 3 Embed の展開を評価しています。これは、AIP のモデルカタログで NVIDIA の埋め込みモデルを利用可能にした先行する取り組みを踏まえたものです。
ServiceNow は、ドキュメントからの情報取得のために NVIDIA Nemotron Embed を評価しており、検索精度の向上を目指したドメイン固有のファインチューニングへの関心も継続しています。
turbopuffer は、Nemotron 3 Embed をネイティブ埋め込みサービスに統合し、開発者が同社の意味検索エンジンでこれらのモデルを活用できるようにしました。
「再ランキングスタックに NVIDIA Nemotron 3 Embed モデルを組み込んだことで、パフォーマンスが劇的に向上しました。その結果、ウェブページからクエリに関連するスニペットを、これまで使ったどのモデルよりもはるかに高い精度で選別できるようになりました。」
— Rahul Mohan, シニア AI エンジニア、You.com
Zep は、エージェントのメモリおよび文脈取得のために NVIDIA Nemotron 3 Embed 1B を評価しました。Nemotron 3 Embed 1B よりもはるかに大きなモデルを含む、Zep が以前から使用していた複数のモデルとの内部ベンチマークでは、すべてのメモリ検索タスクで同モデルが首位となりました。Zep は、FP4 チェックポイントの提供により、自社のスケールにおいてストレージとレイテンシの面で非常に競争力があると評価しています。
Zoom では、エンタープライズ向けエージェント検索の背後にある取得層(リトリーバル層)として、NVIDIA Nemotron 3 Embed の導入を検討しています。この検索は Zoom の文脈レイヤーを支えており、会議や社内ドキュメント、チャット、チケット、その他の内部システムなど across する関連文脈をエージェントが取得できるよう支援します。
Getting Started
NVIDIA Nemotron 3 Embed は、オープンウェイトとオープンソースのトレーニングレシピと共にリリースされており、組織は検索モデルのカスタマイズや本番環境での AI アプリケーションへの展開を完全にコントロールできます。
開発者は、自身のワークフローに最適なデプロイオプションを選んで利用を開始できます。
- Hugging Face で、SentenceTransformers、Transformers、vLLM 向けのモデル重み、モデルカード、サンプルコードにアクセスできます。
- NVIDIA NIM では、本番環境での推論に対応した最適化されたマイクロサービスを build.nvidia.com で利用可能です。
- AI クラウドおよび推論パートナー - 主要なエコシステムパートナーを通じて Nemotron 3 Embed をデプロイできます。Baseten、Bitdeer AI、DeepInfra、Friendli AI、OpenRouter。
ドメイン適応やモデルの軽量化が必要なワークロード向けに、トレーニングレシピもオープンソース化しています。詳しくは NVIDIA NeMo AutoModel をご覧ください。
- 微調整レシピ - 自社のエンタープライズコーパスや検索タスクに合わせて Nemotron 3 Embed を適応させます。
- 知識蒸留レシピ - 推論時のランク付け品質を維持したまま、大規模な検索モデルを圧縮し、本番環境への展開を可能にします。
例えば、NV Docs での評価では、Nemotron-3-Embed-1B-BF16 をファインチューニングしたことで、NDCG@10 が 56.7% から 63.3%(+11.6%)、Recall@5 も 56.1% から 62.8%(+11.9%)に向上しました。
エンタープライズ検索、本番環境の RAG、エージェントメモリ、コード検索、あるいはアジェンティック AI システムを構築する場合でも、NVIDIA Nemotron 3 Embed は柔軟なデプロイオプションを提供します。Hugging Face 上のオープンソースモデルから、フルマネージド型の AI Cloud プラットフォーム、そして NVIDIA NIM マイクロサービスまで、用途に合わせて選べます。
各モデルを確認し、お好みのプラットフォームでデプロイして、構築中のプロジェクトについてぜひ教えてください。
AI算出
主要ニュースainew評価標準
記事は特定の AI モデルの発表という明確なニュースであり、既存の類似報道と比較して RTEB ベンチマークでの首位獲得や NVFP4 最適化など独自の技術的詳細を含んでいるため新規性が高い。ただし、日本企業固有の情報や日本語一次情報がないため、日本の関連性は標準的なレベルとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 69
- 日本での有用性
- 25
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み