Mistral OCR 4:文件智能最先進 OCR,整合邊界框、區塊分類與多語言支援

Mistral OCR 4 發布,提供 SOTA OCR 能力,支持多語言,並可自託管,適合文檔智能、RAG 等應用。這是關於 OCR 工具的新發布,對於需要處理文檔數據的開發者來說是重要資訊。

Mistral 釋出 OCR 4,這是一款為文件智能設計的最新光學字符識別模型,其特色在於提供 邊界框區塊分類內聯置信度分數。 它超越了僅轉換為文字和表格的功能,返回 結構化的文件表示,讓下游系統能全面理解文件內容、元素位置、角色及模型的置信度。 主要亮點包括: • 支援 170 種語言 橫跨 10 個語系,特別在低資源語言上表現優異。 • 可在 單一容器 中進行 完全自我託管部署,滿足數據主權與合規性要求。 • 在獨立基準測試中展現 突破性效能,平均勝率達 72%,並在 OlmOCRBench 取得 85.20 的最高分。

Rogo 的 AI 工程師 Aidan Donohue 評價:「我們對 Mistral OCR 4 進行基準測試,發現其在圖表和數據密集的金融 QA 數據集上實現了同等準確性,而成本約降低 8 倍,延遲減少 17 倍。」 OCR 4 是 Mistral Search Toolkit 的擷取元件,為企業搜尋和 RAG 管線提供結構化輸出,支援語義分塊和代理所需的結構化內容。 儘管官方基準測試存在已知限制(例如與真實世界的對齊問題),此模型仍在內部多語言評估中,於所有八個語系組別中表現領先,證明其強大能力。


來源:Mistral News

閱讀原文 ↗
← 回首頁