腾讯混元、1B パラメータの OCR 大モデル「HyOCR-1.5」を全ソースコード公開
本文の状態
日本語全文を表示中
詳細モードで約15分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tencent Hunyuan
腾讯混元が全パラメータ、訓練・推論フレームワークを含む HyOCR-1.5 を完全开源し、軽量な 1B モデルで OCR の速度と精度を同時に向上させた。
AI深層分析を開く2026年8月4日 19:57
AI深層分析
キーポイント
DFlash による推論加速の実現
約 90.7M パラメータの草稿モデルを用いた DFlash 投机解码フレームワークを採用し、Transformers 環境で最大 6.37 倍、vLLM で 2.14 倍の速度向上を達成した。
完全なオープンソース化
データ構築方法、訓練レシピ、モデル重み、推論加速フレームワークまで全て公開され、開発者は誰でも復現や二次開発が可能となった。
汎用性と軽量化の両立
1B 規模でありながら、文字認識から古文字・動画字幕まで 8 種以上のタスクをカバーし、CPU や消費級 GPU でも動作可能な軽量設計を実現した。
ベンチマークでの首位維持
OmniDocBench v1.6 で 94.74 の高得点を記録し、既存の多段階型 OCR モデルよりも高速かつ高精度なエンドツーエンドモデルとしての地位を確立した。
Agent 駆動型データフローによる能力拡張
従来の人手依存から脱却し、モデルの弱点(低リソース言語や古文字など)を自然言語で指定すると Agent が自律的に素材収集・検証・データ生成を行う仕組みにより、331 カ国語対応や古文字認識などの新機能が実現された。
重要な引用
HyOCR-1.5 は端到端 OCR 大模型領域で初めて訓練、推論、モデル重みを完全开源する OCR 专家大模型である
DFlash は目標モデルの出力分布を厳格に維持しつつ、推論速度を最大 6.37 倍加速する
OmniDocBench v1.6 で 94.74 の高得点を記録し、端到端 OCR モデルとして首位に君臨している
「伝統的なデータパイプラインはほぼ人手によるスクリプト作成と素材収集に依存していたが、Agentic Data Flow はモデルの具体的な弱点を可実行なデータ要件に変換し、Agent に完結させることで『短板』を『能力』へと転換する」
編集コメントを表示
編集コメント
1B という小規模パラメータで OCR の速度と精度を同時に向上させた点は、リソース制約のある現場における実用性を大きく高める。完全なオープンソース化により、研究コミュニティや開発者が独自に改良を加える余地も広がった。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
腾讯混元 2026-07-13 19:13 广东
1B の軽量ボディが、越級の成果を叩き出す
VLM(Vision-Language Model)に特化したエンドツーエンド OCR 専門家モデル「HyOCR-1.5」をフルスタックでオープンソース化しました。わずか 10 億パラメータながら、8 つ以上のテキスト中心タスクをカバーし、推論速度は最大 6.37 倍向上。OmniDocBench v1.6 のベンチマークでは 94.74 という高得点を記録し、エンドツーエンド OCR モデルのトップに君臨しています。
大規模モデルで契約書や請求書、PDF 論文を処理する際、ユーザーは「速くて正確」な結果を本能的に求めます。複雑な表計算や数式、多段レイアウトを構造化テキストとして忠実に再現しつつ、数秒以内で回答を得たいものですよね。しかし現実には、文書が長く構造が複雑になればなるほど、自己回帰型大モデルのデコード処理は遅延しやすくなります。速度を追求すれば精度が犠牲になったり、高性能な GPU への依存が高まったりするのが実情です。
HyOCR-1.0 で「軽量エンドツーエンド OCR 専門家モデル」というアプローチの有効性を証明した同社ですが、HyOCR-1.5 ではさらに一歩踏み込み、「いかにして速度・精度・機能のすべてを同時に向上させるか」に挑みました。
HyOCR-1.5 は、エンドツーエンド OCR 大模型分野において、トレーニング手法から推論フレームワーク、そしてモデル重みまでを完全にオープンソース化した初の専門家モデルです。データ構築の方法や学習のレシピ、推論加速の仕組みに至るまで公開されており、誰でもこれをベースに再現実験や微調整、二次開発を行うことが可能です。
何より重要なのは、その軽量性です。サーバーだけでなく、llama.cpp を介して CPU や汎用 GPU、さらには一般的なノート PC 上でも動作可能。これにより、強力な OCR 能力が個人向けデバイスにもたらされました。さらに機能面では、従来の文字検出・認識やドキュメント解析に加え、情報抽出、写真翻訳、チャート解析、古文字認識、動画字幕の自動抽出、多ページ文書への質問応答など、多彩なタスクをワンストップでサポートします。
図 1:HyOCR-1.5 のネットワーク構造図
HyOCR-1.5 が目指すのは、B 端・C 端を問わず、あらゆるユーザーに対して最適な OCR ソリューションを提供することです。部署コストと運用コストを最小限に抑えながら、多様なカスタマイズされた OCR ニーズに応えることがその使命です。
最新の技術レポートに基づき、わずか 10 億パラメータという小規模モデルが、「速度」と「能力」の両面でいかにして突破を果たしたのか、詳しく見ていきましょう。
プロジェクト公式サイト:https://github.com/Tencent-Hunyuan/HunyuanOCR
論文アドレス:https://arxiv.org/pdf/2607.04884
モデル重み:https://huggingface.co/tencent/HunyuanOCR
一、Faster:長文書のデコード遅延を「DFlash」が解決する
「エンドツーエンド OCR」には避けて通れない課題があります。それは長文の自己回帰(autoregressive)デコードです。ドキュメントが密集し、表が大きくなり、数式が長くなると、モデルはトークンを一つずつ出力していく必要があり、その結果、デコード遅延が線形に膨張します。これが実運用における最大のボトルネックの一つとなっています。
そこで HyOCR-1.5 では、DFlash に基づく投機的デコード(speculative decoding)フレームワークを導入しました。これは約 90.7M パラメータの軽量なブロック拡散(block-diffusion)ドラフトモデルで、一度の並列前向き計算で候補トークンの塊を「推測」し、それをターゲットモデルが一度に検証して、最も長い正しいプレフィックスを受け入れます。このプロセスはターゲットモデルの出力分布を厳密に維持するため、「高速化されるが結果は変わらない」という状態を実現しています。
私たちの評価では、DFlash により HyOCR-1.5 は Transformers ベースで 6.37 倍、vLLM ベースで 2.14 倍の加速を達成し、現在利用可能なすべての OCR VLM(Vision Language Model)の中で最も高速な推論を実現しました。
全体速度:並列検証で複数のトークンを一度に前進させる
権威あるドキュメント解析ベンチマーク「OmniDocBench」を用いたテストでは、単一リクエストの推論設定において DFlash の効果は即座に確認できました。
● vLLM 環境:平均遅延が 3.032 秒から 1.408 秒へ低下し、スループットは 466.9 から 1002.3 token/s へ向上。ページ処理速度も 0.330 page/s から 0.706 page/s に改善され、全体で 2.14 倍の加速となりました。
● Transformers 環境:自己回帰(AR)ベースラインが逐トークンデコードに近いため、より大きな恩恵を受け、全体で最大 6.37 倍の加速を達成しました。
表 1:AR デコード vs. DFlash デコード(OmniDocBench、バッチサイズ = 1)
出力が長く構造化されるほど、速度は向上する
投機的デコードの特性として、「出力が長くなるほど加速効果が顕著になる」ことが挙げられます。vLLM 環境では、0〜256 トークンの範囲で 1.31 倍だった加速比が、2048 トークム以上になると 2.30 倍に向上します。Transformers 環境ではさらに大きく、4.56 倍から 6.67 倍へと伸びました。
コンテンツタイプ別にみると、表ページの加速効果が最も大きくなります(vLLM で 2.39 倍、Transformers で 7.81 倍)。次いで数式ページ、純粋なテキストページの順です。これは HTML 表のような高度に構造化されたデータでは、未来のトークンが「推測」されやすく、有効に受け入れられるプレフィックスの長さが伸びるためです。
エンドツーエンド速度比較:2段階カスケード型よりも高速
さらに注目すべきは横断的な比較結果です。OmniDocBench テストセットで同等の計算リソース下、DFlash を適用した HyOCR-1.5 を主要な OCR VLM と比較しました。その結果、HyOCR-1.5 は参加全方案の中で最も高速なエンドツーエンド推論を実現し、ページあたり 1.408 秒、毎秒 0.706 ページの処理速度を達成しました。
これは GLM-OCR や PaddleOCR-VL-1.6 のような「2段階カスケード型」のソリューションよりも高速でありながら、「レイアウト分割不要」「分区カスケード不要」という統一されたエンドツーエンドの形態を維持しています。
表 2:代表性 OCR システムとのエンドツーエンド速度比較(OmniDocBench)
サーバーからノート PC へ:あなたのパソコンにも搭載可能
HyOCR-1.5 は、vLLM を用いたサーバー向けデプロイだけでなく、llama.cpp を介した PC での推論もサポートしています。CPU やコンシューマー向けの GPU、さらには一般的なノートパソコンでも動作するため、軽量 OCR の「どこでも展開可能」という実現を可能にしました。
二、Better:エージェントを活用しモデルの自己進化を促進、「弱点」を「強み」へ変える
DFlash が「速さ」を実現したのであれば、HyOCR-1.5 の「強さ」は、新しいデータ構築哲学である Agentic Data Flow(エージェント駆動型データフロー)に支えられています。
従来のデータパイプラインでは、スクリプトの作成から素材収集、データ注釈に至るまで、ほぼすべてが人手に頼っていました。一方、Agentic Data Flow のアプローチは、モデルの具体的な弱点(例えば低リソース言語への対応不足や古文字認識の弱さ、複数画像の理解欠如など)を明確な実行要件に変換し、エージェントにその課題解決を任せるというものです。
アルゴリズムエンジニアが自然言語で目標能力を指示するだけで、エージェントはタスクを自律的に分解し、素材を集め、ツールを呼び出して検証を行い、データパイプラインを開発します。そしてエンジニアとの継続的な対話を通じて、最終的には再利用可能なデータ生産プロセスとして確立されます。
図 2:エージェント駆動型データ構築システム。低リソース言語 OCR、古文字認識、複数画像への質問応答という 3 つの能力拡張タスクに対応。
エージェントが担う 3 つの重要な役割
●素材の検索と整理:自律的に Web 検索などのツールを呼び出し、低リソース OCR 向けに多言語コーパスや TTF フォント、レンダリング背景を収集します。古文字認識には七体(漢字の書体の七種類)に関連するフォントや古籍風の背景を、複数画像への質問応答には多ページ PDF を整理し、ページ単位のテキストと構造を抽出します。
●ツールを活用したクリーニングと品質検査:HyOCR-1.0 などのサービスを利用して背景画像に対して複数モデルによるクロス検証を行い、ノイズ文字が含まれるものや品質が不安定な素材をフィルタリングします。また、フォントのレンダリング互換性をテストし、バッチ処理で推論を実行して見落としや構造の乱れ、テーブル解析の失敗といった難易度の高い事例(オウルケース)を発掘します。
●弱点克服のためのデータパイプライン開発と改善:自律的にデータプロジェクトを作成し、レンダリングや質問応答生成のスクリプトを記述します。単一のテンプレートから始まり、多様な版式やエフェクト、複数のタスク形式に対応できるデータ生産システムへと進化させます。
3 つの能力拡張の実践的導入
このシステムは HyOCR-1.5 において、以下の 3 つの代表的な方向で具体化されています。
●低リソース OCR:SynthText や SynthDoG の手法を参考に多言語合成パイプラインを構築し、最終的に 331 言語に対応する解析データを維持しています。
●古文字 OCR:漢字の「七体の変遷」に焦点を当て、歴史的ドキュメントの書写方向、版式、視覚的スタイルに基づいて解析データを合成し、希少な歴史的字形を補完します。
● 多图像質問応答機能:複数ページの PDF を基に、ページを跨ぐ検索や複数ページの比較、証拠の集約といった高度な質問応答を実現します。単一のページで回答可能なサンプルは自動的にフィルタリングされ、「本当に複数の画像理解が必要か」という基準を満たすデータのみが対象となります。
三、トレーニング手法の刷新:4K 解像度対応、128K コンテキスト、そして RL レシピ
訓練面では、HyOCR-1.5 も HyOCR の段階的学習アプローチを踏襲しつつ、目標を「汎用的な OCR 能力の構築」から「能力範囲の拡張とタスク上限の引き上げ」へとシフトしました。これにより、事前学習→SFT(教師あり微調整)→RL(強化学習)という完全な学習パイプラインが確立されています。
● 事前学習(Stage 3 の再設計):Agentic Data Flow が生成した新機能データや多画像データ、そして過去の OCR データを注入。最大画像解像度を 4K に引き上げ、コンテキストウィンドウも 128K に拡張しました。これにより、高解像度ドキュメントや長大な文脈、複数ページ・複数画像の入力にも安定して対応できるようになっています。
● SFT:1.0 版の後処理データから徹底的にクリーニングを行い、ラベル付けミスやフォーマットの不整合、テキストと画像の不一致といった問題を排除。各タスクのプロンプトインターフェースも統一し、強化学習のためのクリーンで構造化された土台を整えました。
● RL(精心設計された強化レシピ):IcePop(GRPO スタイル)を採用し、3 つの補完的な報酬設計を導入しました。ドキュメント解析における事実性の確保、汎用質問応答における一貫性の評価、そして過剰な長さや重複出力を抑制する退化防止の報酬です。これらが相乗効果を生み、モデルを「より忠実で、より強力に、さらに包括的なもの」へと導きます。
図 3:HyOCR-1.5 の RL フレームワーク概要。3 つの補完的な報酬コンポーネントを通じて最適化され、汎用 OCR モデルがより忠実で、強力で、包括的な振る舞いを発揮することを目指しています。
四、1B パラメータという軽量ボディながら、越級の実力
単一のベンチマークに頼るのではなく、能力指向の「評価ツリー」を構築しました。これにより、1.0 版から継承された中核機能がさらに強化されているかを確認するだけでなく、新たに拡張した境界領域の能力が実際にモデルに取り込まれているかも検証しています。
① ドキュメント解析:OmniDocBench v1.6 でトップクラスへ
OmniDocBench v1.6 において、HyOCR-1.5 は Overall スコアで 94.74 を記録。エンドツーエンドの OCR エキスパートモデルとして SOTA(State of the Art)を達成しました。特に表形式データ(TEDS 93.67 / TEDS-S 94.71)や読み順の認識において顕著な成果を示しています。これらは、軽量なエンドツーエンドアーキテクチャを維持したまま実現されたものです。
表 3:OmniDocBench v1.6 ドキュメント解析比較(抜粋)
② 古文字 OCR:Chronicles-OCR で 1B パラメータクラス内 SOTA
在涵盖汉字「七体之变」的 Chronicles-OCR 基准测试中,HyOCR-1.5 表现卓越:古早字体(甲骨/金文/篆书)平均分达 0.54,成熟字体(隶/楷/行/草)平均分高达 0.79。这一成绩大幅领先包括 GPT-5、Gemini 3.1 Pro、Kimi K2.5 在内的众多大模型,有力验证了古文字数据构造与训练策略的有效性。
③ 图表解析:1B 体量打出 8B 级水准
在细粒度图表解析基准 ChartArena 上,HyOCR-1.5 凭借仅 1B 的参数量,取得英文(EN)48.9、中文(ZH)64.1 的平均分,达到甚至超越 8B 级模型的水平。
④ 多语种、多图与复杂表格:全面开花
● MORE(149 种低资源语言解析):整体得分 91.90,刷新 OCR 专家模型的 SOTA;
● TableVerse-5K(复杂表格):TEDS 78.23 / TEDS-S 84.84,位居专家 OCR 模型榜首;
● DUDE(文档级多图问答):得分 54.64,逼近通用多模态模型 Qwen3.5-0.8B 的 56.41;
● 文本图像翻译(MMTIT / DoTA):多语种、多场景下的翻译能力得到进一步优化。
⑤ 抑制幻觉:更「忠于所见」
我们特别提出了 CHAOS-Bench,专门评估模型是否真正「所见即所得」——即在图像中将选定词替换为无意义的扰动词后,检验模型是否会忠实保留这些视觉上真实存在的字符。HyOCR-1.5 以页均召回率 14.15 取得最佳成绩,说明它比现有模型更少受语言先验干扰;但绝对值仍偏低,也坦诚地指出了「忠实生成」这一方向仍有待攻坚。
⑥ 不遗忘:核心能力稳中有升
在文本检测识别、信息抽取、视频字幕、OCRBench 等继承能力上,HyOCR-1.5 相较 HyOCR-1.0 均稳定保持甚至有所提升。特别值得一提的是,它新增了负样本处理能力:面对无文字图像,在 1000 张无文字内部测试集上的正确处理率达到 99.8%(1.0 版本为 78.1%),有效避免了「凭空幻觉出检测框」的问题。
五、为什么这件事重要?
HyOCR-1.5 想证明的,并非「把模型堆大就能更强」,而是一条更务实的路径:
● 对部署者而言:一个 1B 以内的端到端模型,既能在服务器上以最快速度批量处理,也能装进个人电脑本地运行——「又快、又强、又轻」不再是三选二。
● 对研究者而言:DFlash 证明了投机解码在长结构化 OCR 生成上的巨大价值;Agentic Data Flow 则提供了一种「以模型短板驱动数据生产」的可复用范式,进一步指向了未来由 Agent 主导的数据闭环与模型自进化路径。
● 对应用侧而言:从密集文档、复杂表格图表,到多语种、古文字、多图问答与幻觉抑制,能力边界被系统性地向长尾场景推进。
一个真正实用的 OCR 模型,不该只是「更大的文档解析器」,而应是一个又快、又准、又能覆盖多元任务的统一端到端专家。
我们开源了全套模型权重与训练、推理代码,为社区提供可复现、可微调、可扩展的基础设施,推动 OCR 感知、文档理解与多任务建模的下一步发展。
The end
让 OCR 大模型「跑得更快、看得更准、功能更全」,从来不是单点优化,而是速度、能力与部署三者的协同。HyOCR-1.5 用 1B 的小身板,把这三条线同时向前推了一步——我们希望它能成为轻量端到端 OCR 走向真实世界的一块坚实基石。
📌 项目主页:https://github.com/Tencent-Hunyuan/HunyuanOCR
📌 论文:https://arxiv.org/pdf/2607.04884
📌 モデルの重み:https://huggingface.co/tencent/HunyuanOCR
学界と産業界が協力し、軽量 OCR とドキュメントインテリジェンスの次のステップを推進しましょう。
微信で開くにはこちらへ
原文を表示
腾讯混元 2026-07-13 19:13 广东
image
1B 的身板,打出越级的成绩
VLM 端到端 OCR 专家模型全栈式开源,仅 1 B 参数覆盖 8 种以上 text-centric 任务,推理最高提速 6.37 倍,OmniDocBench v1.6 以 94.74 高分稳居端到端第一。
用大模型处理一份合同、一张发票、一篇 PDF 论文时,人们会本能地期待它“又快又准”——既能把密密麻麻的表格、公式、多栏版面一字不差地还原成结构化文本,又能在一两秒内出结果。但现实往往是——越是长、越是结构化复杂的文档,自回归大模型解码越慢;越是想跑得快,就越要牺牲精度或换上更好的显卡。
在 HyOCR-1.0 已经验证“轻量端到端 OCR 专家模型”这条路走得通之后,HyOCR-1.5 把目标又推进了一步:如何让它同时变得更快、更强、更全面?
HyOCR-1.5 是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的 OCR 专家大模型:从数据构造方法、训练配方到推理加速框架均对外公开,任何人都可以在此基础上复现、微调与二次开发。
更重要的是,它足够轻量——不仅能部署在服务器上,还能通过 llama.cpp 跑在 CPU、消费级显卡乃至普通笔记本上,让强大的 OCR 能力真正走进个人电脑;同时足够全能——不仅支持传统的文字检测识别与文档解析任务,还一次性囊括了信息抽取、拍照翻译、图表解析、古文字识别、视频字幕提取、多页文档问答等多种能力。
图1:HyOCR-1.5 网络结构图
HyOCR-1.5 真正想做的,是为广大 B 端与 C 端用户提供一套最优的 OCR 解决方案——用尽可能低的部署与使用成本,精准满足各类定制化的 OCR 需求。
下面就结合这份最新发布的技术报告,看看这个只有 1 B 参数的小模型,是如何在「速度」与「能力」两条战线上同时取得突破的。
项目主页:https://github.com/Tencent-Hunyuan/HunyuanOCR
论文地址:https://arxiv.org/pdf/2607.04884
模型权重:https://huggingface.co/tencent/HunyuanOCR
一、Faster:把长文档解码的「慢」,交给 DFlash 来解
端到端 OCR 有一个绕不开的痛点:长自回归解码。文档越密、表格越大、公式越长,模型就要一个 token 接一个 token 地往外「吐」,解码延迟随之线性膨胀,成为真实部署中最大的瓶颈之一。
为此,HyOCR-1.5 引入了基于 DFlash 的投机解码(speculative decoding)框架:一个仅约 90.7M 参数的轻量级 block-diffusion 草稿模型,一次并行前向就能「猜」出一整块候选 token,再交给目标模型一次性验证、接受最长的正确前缀。整个过程严格保持目标模型的输出分布——也就是说,快,但结果不变。
在我们的评测中,DFlash 让 HyOCR-1.5 在 Transformers 下取得 6.37× 加速、在 vLLM 下取得 2.14× 加速,成为所有 OCR VLMs 中推理最快的一个。
整体速度:一次并行验证,多推进好几个 token
采用权威文档解析基准 OmniDocBench 测试,在单请求推理配置下,DFlash 的效果立竿见影:
●vLLM:平均延迟从 3.032s 降到 1.408s,吞吐从 466.9 提升到 1002.3 token/s,页速从 0.330 提到 0.706 page/s,整体 2.14×;
●Transformers:由于 Autoregressive(AR) 基线更接近逐 token 朴素解码,收益更大,整体加速高达 6.37×。
表 1:AR 解码 vs. DFlash 解码(OmniDocBench,batch size = 1)
越长越结构化,速度越快
投机解码的天然特性是:输出越长,加速越明显。在 vLLM 下,加速比从 0–256 token 的 1.31× 一路提升到 2048+ token 的 2.30×;Transformers 下更是从 4.56× 提升到 6.67×。按内容类型看,表格页加速最大(vLLM 2.39×、Transformers 7.81×),其次是公式页、纯文本页——因为 HTML 表格这类高度规整的结构,未来 token 更容易被「猜中」,有效接受长度也更长。
端到端速度对比:比两阶段级联方案更快
更值得一提的是横向对比。我们在 OmniDocBench 测试集、同等算力下,把适配了DFlash 的 HyOCR-1.5 与主流 OCR VLM 放在一起比拼——它是所有参评方案中端到端推理最快的一个,达到每页 1.408s、0.706 page/s,甚至比 GLM-OCR、PaddleOCR-VL-1.6 这类两阶段级联方案还要快,同时保持着「无需版面切分、无需分区级联」的统一端到端形态。
表 2:与代表性 OCR 系统的端到端速度对比(OmniDocBench)
从服务器到笔记本:还能装进你的电脑
除了面向服务器的 vLLM 部署,HyOCR-1.5 还支持通过 llama.cpp 进行 PC 端推理,可以跑在 CPU、消费级显卡乃至普通笔记本上——让轻量 OCR 真正做到「随处可部署」。
二、Better:巧用Agent参与模型自进化,把「短板」变成「能力」
如果说 DFlash 解决的是「快」,那么 HyOCR-1.5 的「强」,靠的是一套全新的数据构造哲学——Agentic Data Flow(智能体驱动的数据流)。
传统数据管线,几乎全靠人工写脚本、人工搜集素材、人工标注数据。而 Agentic Data Flow 的思路是:把模型的具体短板(比如低资源语种覆盖不足、古文字感知薄弱、缺乏多图理解),直接翻译成可执行的数据需求,再交给 Agent 去闭环完成。 算法工程师只需用自然语言提出目标能力,Agent 就会自主拆解任务、搜集素材、调用工具验证、开发数据管线,并与工程师持续迭代,最终沉淀成一套可复用的数据生产流程。
图2:智能体驱动的数据构造系统,面向低资源语种 OCR、古文字识别、多图问答三类能力扩展任务。
Agent 在做三件关键的事
●素材搜索与整理:自主调用网络搜索等工具,为低资源 OCR 搜集多语种语料、TTF 字体与渲染背景;为古文字搜集七体相关字体与古籍风格背景;为多图问答整理多页 PDF 并抽取页级文本与结构。
●工具辅助的清洗与质检:调用 HyOCR-1.0 等服务对背景图做多模型交叉验证,过滤含干扰文字或质量不稳的素材;测试字体渲染兼容性;批量跑推理挖掘漏识、结构错乱、表格解析失败等难例。
●面向短板的数据管线开发与迭代:自主创建数据项目、编写渲染/问答生成脚本,从单模板原型逐步演化为支持多版式、多增强、多任务格式的数据生产系统。
三个能力扩展的真实落地
这套系统在 HyOCR-1.5 中被实例化到三个代表性方向:
●低资源 OCR:借鉴 SynthText / SynthDoG 思路构建多语种合成管线,最终维护了覆盖 331 种语言的解析数据;
●古文字 OCR:面向汉字「七体之变」,按历史文档的书写方向、版式、视觉风格合成解析数据,补齐罕见历史字形;
●多图问答:基于多页 PDF 生成跨页检索、多页比对、证据聚合类问答,并过滤掉单页即可作答的样本,确保「真的需要多图理解」。
三、训练配方升级:4K 分辨率 + 128K 上下文 + RL Recipe
在训练侧,HyOCR-1.5 沿用 HyOCR 的分阶段训练范式,但把目标从「构建通用 OCR 能力」转向「扩展能力边界、提升任务上限」,形成预训练 → SFT → RL 的完整链路。
●预训练(重规划 Stage 3):注入 Agentic Data Flow 产出的新能力数据、多图数据与历史 OCR 数据;同时把最大图像分辨率提升到 4K、上下文窗口扩展到 128K,让模型稳健适配高分辨率文档、长上下文与多页多图输入。
●SFT:从 1.0 的后训练数据出发彻底清洗,去除标注错误、格式不一致、图文不匹配等问题,并统一各任务的 prompt 接口,为 RL 打好干净、结构化的地基。
●RL(精心设计的强化Recipe):采用 IcePop(GRPO 风格)优化,设计三类互补奖励——面向文档解析的事实性奖励、面向通用问答的一致性评判奖励、以及抑制超长/重复输出的退化抑制奖励,共同把模型推向「更忠实、更强、更全面」。
图3:HyOCR-1.5 RL 框架概览。通过三个互补的奖励组件进行优化,旨在使通用 OCR 模型展现出更忠实、更强大且更全面的行为表现。
四、1B 的身板,打出越级的成绩
我们没有依赖单一 benchmark,而是构建了一棵能力导向的评测树,既检验从 1.0 继承的核心能力是否被进一步强化,也考察新拓展的边界能力是否真正被纳入模型。
① 文档解析:OmniDocBench v1.6 端到端第一梯队
在 OmniDocBench v1.6 上,HyOCR-1.5 取得 94.74 的 Overall 分数,在端到端 OCR 专家模型中达到 SOTA,尤其在表格(TEDS 93.67 / TEDS-S 94.71)与阅读顺序上表现突出——而这一切,是在保持轻量端到端架构的前提下实现的。
表 3:OmniDocBench v1.6 文档解析对比(节选)
② 古文字 OCR:Chronicles-OCR 上 1B 内 SOTA
在覆盖汉字「七体之变」的 Chronicles-OCR 上,HyOCR-1.5 在古早字体(甲骨/金文/篆书)平均分 0.54、成熟字体(隶/楷/行/草)平均分 0.79,大幅领先包括 GPT-5、Gemini 3.1 Pro、Kimi K2.5 在内的众多大模型,验证了古文字数据构造与训练策略的有效性。
③ 图表解析:1B 打出 8B 级水准
在细粒度图表解析基准 ChartArena 上,HyOCR-1.5 以 1B 的体量,取得 EN 48.9 / ZH 64.1 的平均分,达到甚至超越 8B 级模型的水平。
④ 多语种、多图、复杂表格:全面开花
●MORE(149 语种低资源解析):Overall 91.90,OCR 专家模型中 SOTA;
●TableVerse-5K(复杂表格):TEDS 78.23 / TEDS-S 84.84,专家 OCR 模型中最佳;
●DUDE(文档级多图问答):54.64,逼近通用多模态模型 Qwen3.5-0.8B 的 56.41;
●文本图像翻译(MMTIT / DoTA):多语种、多场景翻译能力进一步优化。
⑤ 幻觉抑制:更「忠于所见」
我们还特别提出了 CHAOS-Bench,专门评估模型是否「所见即所得」——在图像中把选定词改成无意义的扰动词,检验模型是否会忠实保留这些视觉上真实存在的字。HyOCR-1.5 以 14.15 的页均召回率取得最佳,说明它比现有模型更少被语言先验带偏;但绝对值仍偏低,也坦诚地指出了「忠实生成」这一方向仍待攻坚。
⑥ 不遗忘:核心能力稳中有升
在文本检测识别、信息抽取、视频字幕、OCRBench 等继承能力上,HyOCR-1.5相较HyOCR-1.0均稳定保持甚至提升。特别地,它新增了负样本处理能力:面对无文字图像,在 1000 张无文字内部测试集上的正确处理率达到 99.8%(1.0 版本为 78.1%),有效避免「凭空幻觉出检测框」。
五、为什么这件事重要?
HyOCR-1.5 想证明的,不是「把模型堆大就能更强」,而是一条更务实的路径:
●对部署者:一个 1B以内 的端到端模型,既能在服务器上以最快速度批量处理,也能装进个人电脑本地运行——「又快、又强、又轻」不再是三选二。
●对研究者:DFlash 证明了投机解码在长结构化 OCR 生成上的巨大价值;Agentic Data Flow 则提供了一种「以模型短板驱动数据生产」的可复用范式,进一步指向了未来由 Agent 主导的数据闭环与模型自进化路径。
●对应用侧:从密集文档、复杂表格图表,到多语种、古文字、多图问答与幻觉抑制,能力边界被系统性地向长尾场景推进。
一个真正实用的 OCR 模型,不该只是「更大的文档解析器」,而应是一个又快、又准、又能覆盖多元任务的统一端到端专家。
我们开源了全套模型权重与训练、推理代码,为社区提供可复现、可微调、可扩展的基础设施,推动 OCR 感知、文档理解与多任务建模的下一步。
The end
让 OCR 大模型「跑得更快、看得更准、功能更全」,从来不是单点优化,而是速度、能力与部署三者的协同。HyOCR-1.5 用 1B 的小身板,把这三条线同时向前推了一步——我们希望它能成为轻量端到端 OCR 走向真实世界的一块坚实基石。
📌 项目主页:https://github.com/Tencent-Hunyuan/HunyuanOCR
📌 论文:https://arxiv.org/pdf/2607.04884
📌 模型权重:https://huggingface.co/tencent/HunyuanOCR
欢迎学界、产业界共同推动轻量 OCR 与文档智能的下一步。
跳转微信打开
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み