Jina AI 發布 jina-ocr-v1:在低階 GPU 上實現更快的文件解析
Jina AI 發布 jina-ocr-v1 文件解析模型,結合投機解碼(speculative decoding)實現低成本高效能解析。
• Jina AI 推出了 jina-ocr-v1 文件解析模型,擁有 34 億總參數與每 Token 約 5.7 億的活躍解碼器參數。 • 該模型在 OmniDocBench v1.6 獲得 91.14 分,在 olmOCR-Bench 拿下 83.4 分,並以每秒 2.57 頁的速度成為測試系統中吞吐量最高者。 • 透過 FastMTP 推測式解碼(Speculative Decoding)技術,在 NVIDIA L4 GPU 上幾乎能將解碼速度翻倍且保持無損。 • 模型架構基於 DeepSeek-OCR 的壓縮視覺編碼器與專家混合(MoE)解碼器,並透過可驗證的獎勵機制進行後訓練。 • 支援輸出 Markdown 格式,其中表格使用 HTML、公式使用 LaTeX,並能處理英文與中文的元素級轉錄。 • 經由 Jina Reader API、OpenAI 相容端點或 Hugging Face 權重皆可快速部署與使用。
「透過精確的可驗證檢查獎勵與針對最終驗證器訓練的草稿頭,模型在不增加規模的情況下大幅提升了效能與解析速度。」
來源:Jina AI
閱讀原文 ↗