AI News JAPAN

世界のAIニュースを最速で把握できるメディア

Advertisement

低価格GPU向け文書OCRモデル「Jina-OCR-v1」、毎秒2.57ページの高速処理を実現

公開:2026年9月6日, 最終更新:2026年9月6日

30秒サマリー

  • Jina AIが低予算GPU向け文書解析モデル「Jina-OCR-v1」をarXivで発表、モデルは公開済み
  • 「投機的デコーディング」技術により、NVIDIA L4などの廉価GPUでも通常比2倍の推論速度を達成
  • OmniDocBenchで91.14点、毎秒2.57ページのスループットで比較モデル中最高を記録

何が起きたか

Jina AIの研究チームは2026年9月2日、文書解析に特化したエンドツーエンドモデル「Jina-OCR-v1」に関する論文をarXivに投稿した。モデルはすでに公開されている。

同モデルはDeepSeek-OCRの圧縮ビジョンエンコーダと30億パラメータのMixture-of-Experts(MoE)デコーダを組み合わせた構成で、トークンあたり約5億7000万パラメータのみを起動する設計となっている。これに「FastMTP」と呼ばれる投機的デコーディングヘッドを組み合わせることで、1つのドラフトブロックをK=3の予測ステップで再帰的に共有し、推論を高速化する。検証は貪欲(greedy)方式で行われ、精度の劣化なく復号できるとされる。

ポスト学習では、数式・表・文書構造の正確性を段階的に評価する「密な検証可能報酬(Dense Verifiable Rewards)」を用いたGRPO(Group Relative Policy Optimization)強化学習を適用している。ベンチマークでは、OmniDocBench v1.6で91.14点、olmOCR-Benchで83.4点を記録。ページスループットは毎秒2.57ページで、論文中の比較対象モデルの中で最高値とされる。NVIDIA L4のような低予算GPUでは、FastMTPが通常の自己回帰デコーディングに比べ処理速度を2倍に高めると報告されている。

原典ハイライト

論文アブストラクトは「低予算GPUへの展開を前提に設計されたエンドツーエンド文書解析モデル」と定義し、NVIDIA L4でFastMTPが貪欲な自己回帰デコーディング比で2倍の速度を達成すると明記。OmniDocBench v1.6での91.14点と毎秒2.57ページのスループットが比較群中最高であることも示している。

出典: arXiv cs.CL(論文)

So What?(なぜ重要か)

高性能なOCR・文書解析をクラウドの高額GPU環境に頼らずオンプレミスや低コストGPUで実行できる可能性が示された。投機的デコーディングとMoEの組み合わせは、処理品質を落とさずに推論コストを削減する設計アプローチとして注目される。モデルが公開されているため、研究・商用双方での即時検証が可能な点も重要だ。

日本企業への示唆

大量の紙文書や帳票をデジタル化・構造化したい日本企業にとって、高額なGPUサーバーやAPIコストを抑えながら高精度OCRを内製化できる選択肢として検討価値がある。特に製造・金融・医療など文書処理量が多い業種では、NVIDIA L4クラスのGPUで本モデルを評価することがコスト試算の第一歩となりうる。ただし論文ベースの発表であり、実運用での日本語文書への対応精度や安定性は別途検証が必要だ。

背景・経緯

文書OCR・解析分野では大規模モデルの精度向上が進む一方、推論コストの高さがエンタープライズ導入の障壁となっている。Jina AIはテキスト埋め込みや検索関連のモデルを手掛ける企業で、今回はDeepSeek-OCRのアーキテクチャを活用しつつ、投機的デコーディングと強化学習を組み合わせた軽量・高速化アプローチを提示した。投稿者にはJina AIのHan Xiaoが含まれている。