NVIDIA、専門分野向け現代ギリシャ語対応のNemotronモデルと評価指標HERAを公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
NVIDIA は現代ギリシャ語対応の Nemotron リトリーバルスタックを完全適応させ、専門ドメインでの検索精度と生成品質を大幅に向上させる新ベンチマーク HERA を公開した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月8日 13:05
AI深層分析
キーポイント
現代ギリシャ語対応モデルの完成
NVIDIA は Corpus Mining や合成教師データを用いた学習を通じて、Nemotron リトリーバルスタックを現代ギリシャ語に完全適応させた。
専門ドメインにおける精度向上
65,773 組の検索ペアで微調整した結果、Nemotron 1B エンベッダーの nDCG@10 が 0.362 から 0.835 に向上し、汎用モデルや BM25 を凌駕する性能を示した。
新ベンチマーク HERA の導入
RAG システム向けの最初の大規模ギリシャ語ベンチマーク「HERA」を新たに策定し、法務・エネルギー・金融・医療などの専門領域での評価基準を提供した。
生成品質と忠実度の改善
LoRA による微調整で Nemotron 30B-A3B マルチエキスパートリーダーを最適化し、回答の正答率を 29.4% から 66.9% に引き上げるとともに、出典引用の質も向上させた。
重要な引用
Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks
a parameter-free BM25 baseline outperforms several off-the-shelf multilingual dense retrieval models on specialist Greek corpora
We further adapt a cross-encoder reranker and demonstrate consistent improvements across specialist domains
編集コメントを表示
編集コメント
ギリシャ語圏の専門ドメインにおける RAG 技術の空白を埋める重要な一歩である。特に BM25 を凌駕する成果は、言語リソースが限られる環境での実用性を示す好例と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
現代ギリシャ語は、法律・エネルギー・金融・医療分野における検索拡張生成(RAG)の重要性にもかかわらず、NVIDIA の Nemotron 検索モデルや主要な多言語検索ベンチマークから除外されています。本研究では、現代ギリシャ語向けに Corpus Mining(コーパス採掘)、合成教師あり学習、検索モデルの訓練、reranker(再ランク付け器)の適応、リーダー(回答生成器)の微調整、そして新たに HERA と名付けたベンチマークを含む Nemotron 検索スタック全体をエンドツーエンドで適応させました。
その結果、専門分野のギリシャ語コーパスにおいては、パラメータ不要な BM25 ベースラインが、市販のいくつかの多言語密着型検索モデルを上回る性能を示すことが判明しました。65,773 組のギリシャ語検索ペアで微調整を施した Nemotron 1B エンベッダーは、nDCG@10 を 0.362 から 0.835 に向上させ、未適応版と比べて大幅に優れた性能を発揮しました。学習された言語能力は一般領域のギリシャ語にも転移しますが、BM25 に対する優位性はドメイン依存性が残ります。
さらに、クロスエンコーダー型 reranker の適応を行い、専門分野全体で一貫した改善効果を確認しました。最後に、Nemotron 30B-A3B Mixture-of-Experts(MoE)リーダーを LoRA で微調整して Grounded Generation(根拠に基づく生成)を実現し、評価された回答の正答率を 29.4% から 66.9% に引き上げるとともに、忠実性と引用品質も大幅に向上させました。
また、本研究では検索拡張生成向けの最初の大型ギリシャ語ベンチマークである HERA を導入し、適応済みモデルとベンチマークを公開することで、今後のギリシャ語 RAG システムに関する研究を支援します。
原文を表示
Modern Greek is absent from NVIDIA's Nemotron retrieval models and from major multilingual retrieval benchmarks, despite being important for retrieval-augmented generation (RAG) in legal, energy, financial, and medical applications. We present an end-to-end adaptation of the Nemotron retrieval stack for Modern Greek, including corpus mining, synthetic supervision, retrieval model training, reranker adaptation, reader fine-tuning, and a new benchmark called HERA. Our study shows that a parameter-free BM25 baseline outperforms several off-the-shelf multilingual dense retrieval models on specialist Greek corpora. After fine-tuning on 65,773 Greek retrieval pairs, a Nemotron 1B embedder improves nDCG@10 from 0.362 to 0.835 and substantially outperforms its unadapted counterpart. The learned language competence transfers to general-domain Greek, although the advantage over BM25 remains domain-dependent. We further adapt a cross-encoder reranker and demonstrate consistent improvements across specialist domains. Finally, we LoRA-tune a Nemotron 30B-A3B mixture-of-experts reader for grounded generation, increasing judged answer correctness from 29.4% to 66.9% while significantly improving faithfulness and citation quality. We also introduce HERA, the first large-scale Greek benchmark for retrieval-augmented generation, and release our adapted models and benchmark to support future research on Greek-language RAG systems.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み