Jina AI、垂直領域特化の軽量重排器「Reranker v3.5」を公開
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Jina AI
Jina AI は垂直領域と構造化データ処理に特化した軽量重排器「jina-reranker-v3.5」を公開し、0.6B 規模で 4B モデルを超える性能を実現した。
AI深層分析を開く2026年7月31日 23:42
AI深層分析
キーポイント
0.6B 規模での高性能化
BEIR ベンチマークにおいて 63.20 のスコアを記録し、参数量が 7 倍の Qwen3-Reranker-4B を上回る性能を示した。
3L2G 混合注意力アーキテクチャ
計算コストを平方級から線形級へ削減するため、スライドウィンドウ注意機構と周期的なグローバル注意層を組み合わせた新構造を採用した。
垂直領域と構造化データの強化
法律・医療・金融などの専門分野や JSON/テーブルデータにおける論理的制約の理解を深めるため、専用データセットを用いた学習を実施した。
垂直領域と構造化データでの性能向上
法律・金融などの垂直分野で総合評価が4.3%向上し、特に法律タスクではnDCGが11-14ポイント改善された。構造化データ理解能力も大幅に強化され、Recall@5はQwen-4Bと同等の水準に達した。
長文処理における推論速度の劇的向上
混合注意力アーキテクチャにより、長文ドキュメントの処理速度が最大56%加速し、メモリ不足や遅延の問題を解決した。
重要な引用
0.6B 規模で 4B モデルを超える性能を実現
計算複雑度から平方級を線形級へ引き下げた
JSON データのフィールド背後にある制約と論理関係を理解する
「法律任務 AILA 上,v3.5 的 nDCG 指標相比 v3 猛增了 11 - 14 个点」
編集コメントを表示
編集コメント
0.6B という極めて小さなパラメータ数で業界標準の 4B モデルを凌駕した性能は、エッジデバイスやコスト敏感な実装において大きな意義を持つ。特に構造化データの論理理解能力向上は、RAG システムの実用性を一段階引き上げる要素と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Jina Reranker v3.5:垂直領域に特化した 0.6B パラメータのリスト型リランクモデル
0.6B パラメータ規模で最強の性能を誇るリランクモデル
本日、私たちは「jina-reranker-v3.5」の正式リリースを発表します。
v3 シリーズの後継モデルとして、引き続き 0.6B パラメータ規模を維持し、「LBNL(Last but not late:一度の前向計算で文書バッチ全体を処理)」と呼ばれる特徴的なリスト型アーキテクチャを採用しています。軽量な推論速度という利点を保ちつつ、v3.5 では生産環境において最も厄介な 3 つの課題に特化して対応しました。
- 垂直領域への適応性
- 構造化データにおける論理認識
- 長文リスト処理時のメモリ爆発問題
HF 🤗 https://huggingface.co/collections/jinaai/jina-reranker-v3.5
魔搭(ModelScope)🧙 https://modelscope.cn/models/jinaai/jina-reranker-v3.5
技術報告書 📖 https://arxiv.org/abs/2607.18152
API 💻 https://jina.ai/reranker/
性能プレビュー
| 評価指標 | nDCG@10 結果 | v3 からの改善幅 |
|---|---|---|
| BEIR(汎用) | 63.20 | +1.10 |
| MIRACL(多言語) | 74.11 | +2.6% |
| RTEB(業界特化) | 70.95 | +4.3% |
| Struct-IR(構造化データ) | 48.3 | +24.8% |
主要な特徴:
- BEIR(汎用): 63.20 のスコアは、4B パラメータ規模の Qwen3-Reranker を上回る性能です。
- MIRACL(多言語): 0.6B パラメータクラスにおける性能の新たな基準となりました。
- RTEB(業界特化): 法律、金融、医療、コード関連など、主要な垂直領域を網羅しています。
- Struct-IR(構造化データ): JSON 形式やテーブル構造、そして背後にある論理ルールに対する理解度が大幅に向上しました。
推論速度の向上:
1.22 倍〜1.56 倍。リストが長くなるほど、その加速効果は顕著になります。
なぜ v3.5 をリリースしたのか?
Jina Reranker v3 の性能は、私たちが予想していた以上に素晴らしいものでした。0.6B という軽量なパラメータ規模でありながら、Listwise 構造を採用することで、大規模モデルと互角に戦える通用性の高さを証明しました。
しかし、実際の業務現場で v3 を運用してみると、ベンチマークのスコアだけでは見えない課題が浮き彫りになりました。
垂直領域への対応です。法律条文や臨床診断、金融レポートなど、専門分野の言語パターンは一般的なウェブページとは全く異なります。BEIR ベンチマークで優勝したモデルであっても、複雑な法廷判例の前では機能しなくなることがあります。
構造化データの扱いも課題でした。JSON や表形式データに対し、Reranker がフィールド間の論理的制約(例えば「価格は 100〜200 円の間であること」や「サイズは L であること」など)を理解できていないと、あり得ない評価を下してしまうのです。
また、長文リストの処理における遅延も無視できません。全自己注意機構(Full Self-Attention)では、計算コストがリストの長さに対して二乗級に増加するため、遅延を制御することが困難でした。
v3.5 の登場は、こうした軽量化を維持しつつ、工程上の盲点を解消するためにあります。
三大核心演进
1. 3L2G 混合注意力アーキテクチャ
長文リストにおける計算コストを根本から削減するため、従来の全自己注意機構を見直し、「3L2G 混合注意力アーキテクチャ」を採用しました。
モデルの大部分の層では「スライディングウィンドウアテンション(Sliding Window Attention)」を実行し、ウィンドウサイズを 1024 に設定しています。これにより計算複雑度は二乗級から線形級へと劇的に低下しました。ただし、グローバルな文脈情報を失わないよう、定期的に「グローバルアテンション層」を挿入して同期を図り、最終層では必ず全ドキュメントへのアクセスを可能にしています。これによって、最終的なスコアリングが候補となる一連のドキュメント全体の特徴を十分に把握できるようになっています。
2. 弱点を補強するデータ戦略
v3 の弱みを埋めることに訓練の重点を置きました。
法律や業界コンプライアンスの分野では、EUR-Lex や AILA など権威ある判例データベースを追加し、多国にわたる法規制を網羅しました。医療分野では臨床会話データや生物医学論文を強化しています。さらに、大規模言語モデルを活用して極めて困難なネガティブサンプル(誤って除外すべきデータ)を大量生成し、微細な司法管轄の違いや専門用語の区別を学習させることで、モデルの識別能力を高めました。
EC サイトや企業システムで扱われる JSON レコードや表形式データについては、従来のモデルが文字列の表面的な一致しか見ておらず、数字の論理を理解できていないという課題がありました。例えば「150 円以下」と検索した際に「160 円」の商品までマッチしてしまうようなミスです。
これを解決するため、「Struct-IR(構造化情報検索)」戦略を採用しました。価格や仕様といった JSON の重要フィールドに対して意図的に微調整やノイズを加え、モデルがフィールド背後の制約条件と論理関係を理解するよう訓練したのです。
さらに、多言語コーパスも 50 以上の言語に拡大され、汎用性と一般化能力がさらに強化されました。
3. 三段階の自己蒸留プロセス
スパースモデルを直接訓練すると性能が不安定になりがちだったため、迂回した戦略を編み出しました。
まず、性能を最大限に引き出した全自己注意機構を持つ「教師モデル」を訓練します。次に、「3L2G 学生モデル」に対して注意力の経路変化への適応を促します。最後に、KL 散度や隠れ状態の MSE(平均二乗誤差)など多角的な指標を用いた蒸留を行い、大幅な高速化を実現しつつも、教師モデルが持つ高いソート品質を学生モデルに完璧に継承させることに成功しました。
性能実測
v3.5 と前世代の v3、そして市販されている主要な大パラメータ重排モデルを比較検証しました。評価は「一般検索」「多言語対応」「垂直分野」「構造化データ」の 4 つの観点から行っています。
1. 一般検索:0.6B モデルが 4B モデルを凌駕
Jina Reranker v3.5 は、汎用的な BEIR 検索ベンチマークで平均スコア 63.20 (nDCG@10) を達成しました。これは、パラメータ数が約 7 倍の Qwen3-Reranker-4B(62.28)を上回る性能です。
垂直業界への対応強化:法律・金融分野
法律、金融、医療、コードといった専門分野の文脈(RTEB ベンチマーク)において、v3.5 の総合性能は 4.3% 向上しました。特に法律タスクである AILA では、v3 から nDCG スコアが 11〜14 ポイントも急上昇しています。
構造化データ理解の飛躍的進化
これは v3.5 において最も劇的な進歩が見られた領域です。Struct-IR テストではスコアが 38.7 から 48.3 に向上し、24.8% の改善を記録しました。特に履歴書選考など制約の厳しいシナリオでは、Recall@5 指標において Qwen-4B と互角の性能を発揮しています。
推論速度の劇的改善
| データセット | 平均ドキュメント長 | jina-reranker-v3 | jina-reranker-v3.5 | 加速率 |
|---|---|---|---|---|
| BEIR(短文書) | ~145 トークン | 371.1 ms | 305.3 ms | 22% |
| RTEB(長文書) | ~1,900 トークン | 16,064.9 ms | 10,290.9 ms | 56% |
混合アテンションアーキテクチャは、長文書のリスト処理において大きな優位性を示しています。例えば法律判例の検索では処理速度が 56% 向上し、これにより長文脈での重排序で課題となっていたメモリ爆発やレイテンシの不安定さが解消されました。
すぐに使える導入方法
1. Jina AI API の利用
Jina AI の公式サイトですでに提供を開始しており、モデル名を jina_reranker_v3.5 に変更するだけで、既存のコードロジックを変更する必要はありません。
curl https://api.jina.ai/v1/rerank \
-H "Authorization: Bearer $JINA_API_KEY" \
-d '{
"model": "jina-reranker-v3.5",
"query": "有機化学反应机制",
"documents": ["SN2 亲核取代反应...", "如何烤制酸面包...", "钯催化偶联反应..."]
}'2. Elasticsearch への統合
Elastic Inference Service (EIS) を介して呼び出すことで、混合検索パイプラインの「text_similarity_reranker retriever」として統合可能です。
- プライベートデプロイメント
https://github.com/jina-ai/jina-on-prem では Docker によるワンクリック展開をサポートしており、社内ネットワークの分断環境や規制が厳しいデータセンターでの利用に適しています。
- モデルはオープンソース化済み
モデルの重みは Hugging Face に公開されており、transformers ライブラリを使って直接読み込むことができます。
model = AutoModel.from_pretrained("jinaai/jina-reranker-v3.5", trust_remote_code=True)jina-reranker-v3.5 は CC BY-NC 4.0 ライセンスの下で提供されています。商用利用をご希望の場合は、sales@jina.ai までお問い合わせください。
まとめ
0.6B という軽量なモデルサイズでありながら、「3L2G 混合アテンションアーキテクチャ」を採用したことで、長文リストの推論コストを大幅に削減しました。また、構造化データに対する理解力も実務レベルに引き上げられています。
現在、システムで長文リストへの応答が遅い課題を抱えている場合や、垂直領域での検索精度向上、あるいは構造化データの解析能力不足にお困りであれば、Jina Reranker v3.5 は非常にコストパフォーマンスの高い選択肢となるでしょう。
技術的な詳細や実験データは、すべて技術レポート https://arxiv.org/abs/2607.18152 に公開されています。実際の業務環境でのベンチマークテストをぜひご検討ください。
WeChat で開く
原文を表示
原创 Jina AI 2026-07-29 14:00 新加坡
image
0.6B 体量的卷王重排器
image
今天,我们正式推出 jina-reranker-v3.5。
作为 v3 系列的进阶版,它依旧保持了 0.6B 的参数规模以及标志性的 LBNL( Last but not late,一次前向传播处理整批文档)的列表式架构。在保持轻量化推理优势的同时,v3.5 专门解决了生产环境中最棘手的三个工程痛点:垂直领域适配、结构化记录的逻辑识别,以及长列表下的显存爆炸。
HF 🤗 https://huggingface.co/collections/jinaai/jina-reranker-v3.5
魔搭 🧙 https://modelscope.cn/models/jinaai/jina-reranker-v3.5
技术报告 📖 https://arxiv.org/abs/2607.18152
API 💻 https://jina.ai/reranker/
性能预览
维度
nDCG@10 表现
相比 v3 提升
核心亮点
BEIR (通用)63.20+1.10
超越 4B 规模的 Qwen3-Reranker
MIRACL (多语言)74.11+2.6%
0.6B 档位的性能标杆
RTEB (行业领域)70.95+4.3%
覆盖法律/金融/医疗/代码
Struct-IR (结构化)48.3+24.8%对 JSON 格式,表格,和字段背后的逻辑和规则的理解更清楚
推理速度——
1.22×–1.56×
列表越长,加速越明显
为什么推出 v3.5?
Jina Reranker v3 的表现已经超出了我们的预期,它证明了 0.6B 参数配合 Listwise 架构,完全有能力在通用基准测试上和大模型掰掰手腕。但当我们将 v3 投入真实的业务时,却发现了一些榜单无法体现的坑。
垂直领域: 法律条文、临床诊断或金融研报,其语言模式与通用网页截然不同。BEIR 上的冠军模型,在复杂的法律判例面前也可能失效。
结构化数据: 面对 JSON 或表格数据,Reranker 如果不懂字段间的逻辑约束,比如“价格必须在 100~200 之间”、“必须是 L 码”等,就很容易给出离谱的评分。
长列表延迟:处理长文档列表时,全自注意力机制带来的显存开销是平方级增长的,延迟根本不可控。
v3.5 的出现,就是为了在保持轻量的同时,把这些工程盲区扫平。
三大核心演进
- 3L2G 混合注意力架构
为了从根本上降低长列表下的计算开销,我们放弃了传统的全自注意力模式,转而采用 3L2G 混合注意力架构。
模型的大部分层运行 滑动窗口注意力(Sliding Window Attention),窗口大小设为 1024,这直接将计算复杂度从平方级拉到了线性级别。为了不丢失全局信息,我们周期性地 穿插了全局注意力层进行同步,并强制 末层必须全局可见,确保最终打分能吃透整组候选文档的特征。
- 覆盖失效场景的数据策略
在训练阶段,我们将重点放在补齐 v3 的弱势场景上。
在法律和行业合规领域,我们补充了 EUR-Lex 和 AILA 等权威判例库,涵盖多国法律法规;医疗方面则补充了临床对话与生物医学论文。同时,利用大模型生成了大量极具干扰性的难负样本,逼模型学会区分细微的司法辖区和专业差别。
面对电商或企业系统中的 JSON 记录或者表格数据,传统模型往往只看字面词汇,不懂数字逻辑,比如搜 150 元以下,可能把 160 元的也匹配出来。我们采用 Struct-IR 策略,故意对 JSON 数据的关键字段,如价格、规格做微调或扰动,,逼模型去理解字段背后的约束与逻辑关系。
此外,多语言语料库 也扩展到了 50 多种语言,整体通用性与泛化能力进一步增强。
- 三阶段自蒸馏流程
直接训练稀疏模型往往性能抖动,我们摸索出了一套迂回战术:
先练一个性能触顶的全注意力教师模型;再让 3L2G 学生模型去适应注意力路径的变化;最后通过 KL 散度和隐状态 MSE 等多维度蒸馏,让学生模型在大幅提速的同时,完美承接教师模型的排序质量。
性能实测
我们对比了 v3.5 与前代版本 v3,以及目前市面上主流的大参数重排模型。数据覆盖了通用搜索、多语言、垂直行业以及结构化数据四个维度。
- 通用搜索:0.6B 规模超越 4B 模型
在通用的 BEIR 搜索基准测试中,v3.5 的平均分达到 63.20 (nDCG@10)。性能超过了参数量是其 7 倍的 Qwen3-Reranker-4B(62.28)。
- 垂直行业:法律与金融场景的专项补强
针对 法律、金融、医疗和代码 等行业语境(RTEB 基准),v3.5 的综合表现提升了 4.3%。在法律任务 AILA 上,v3.5 的 nDCG 指标相比 v3 猛增了 11 - 14 个点。
- 结构化数据理解
这是 v3.5 进步最大的地方。在 Struct-IR 测试中,得分从 38.7 提升至 48.3,提升 24.8%。尤其在简历筛选等强约束场景中,Recall@5 指标已经能够与 Qwen-4B 持平。
- 推理速度
数据集
平均文档长度
jina-reranker-v3
jina-reranker-v3.5
加速
BEIR 短文档场景
~145 Tokens
371.1 ms
305.3 ms
22%
RTEB 长文档场景
~1,900 Tokens
16,064.9 ms
10,290.9 ms
56%
混合注意力架构在长文档列表上展现了巨大的优势。以法律判例检索为例,处理速度提升了 56%,这直接解决了长上下文重排时最头疼的显存爆炸和延迟抖动的问题。
如何快速上手?
- Jina AI API
已在 Jina AI 官网同步上线,直接把模型名改成 jina_reranker_v3.5即可,代码逻辑不用改动。
curl https://api.jina.ai/v1/rerank \
-H "Authorization: Bearer $JINA_API_KEY" \
-d '{
"model": "jina-reranker-v3.5",
"query": "有机化学反应机制",
"documents": ["SN2 亲核取代反应...", "如何烤制酸面包...", "钯催化偶联反应..."]
}'2. Elasticsearch 集成
通过 Elastic Inference Service (EIS) 调用,可作为 text_similarity_reranker retriever 接入混合搜索的流水线。
- 私有化部署
https://github.com/jina-ai/jina-on-prem 支持 Docker 一键部署,适用于内网隔离或受监管的数据环境。
- 模型已开源
模型权重已发布至 Hugging Face,支持通过 transformers 库直接加载。
model = AutoModel.from_pretrained("jinaai/jina-reranker-v3.5", trust_remote_code=True)jina-reranker-v3.5 适用 CC BY-NC 4.0 许可协议,如有商业用途需求,请随时联系我们:sales@jina.ai
总结
在 0.6B 这个不挑卡的体量下,我们借由 3L2G 混合注意力架构,降低了长列表的推理门槛,并把对结构化数据的理解能力补齐到了生产可用的水平。
如果你现在的系统正面临长列表响应慢,或者垂直领域的检索,结构化数据的理解差点意思,Jina Reranker v3.5 提供了一个极具性价比的技术选型。
所有的技术细节与实验数据都已同步在技术报告 https://arxiv.org/abs/2607.18152 中公开,欢迎在实际业务中进行压测。
跳转微信打开
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み