2026 年 6 月 23 日,Mistral AI 發表 Mistral OCR 4(API 名稱 mistral-ocr-latest)。官方形容它是一個「小而專注」的模型,小到可以裝進單一容器執行,但重點在輸出:每個請求都以 Markdown 結構回傳,每個元素附帶邊界框座標、區塊類型分類(標題、表格、公式、簽名等),以及逐頁與逐字的信心分數。
這組欄位在 2026 年比 OCR 本身更重要。RAG 管線與代理工作流把文件當成主要輸入,能不能可靠地切塊、檢索、填表、自查品質,取決的正是座標與信心分數這類後設資訊。定價則是每千頁 4 美元,批次 API 對折為 2 美元。
從文字擷取到結構化輸出
規格面:支援 170 種語言、分為 10 個語言組,含喬治亞文、孟加拉文、泰米爾文與卡納達文等低資源語言;輸入接受 PDF、DOC、PPT 與 OpenDocument;輸出固定為 Markdown,附帶座標與區塊分類。官方也明確畫出界線:醫療診斷、法律判斷、高風險金融、安全關鍵與延遲敏感場景,以及非文件輸入,都不在設計範圍內。
同一個端點還有 Document AI 模式:可指定自訂 JSON Schema、用視覺語言模型標註圖片、下自訂提示詞,結構化輸出由 mistral-small-2603 生成。實務上等於把 OCR 與依 schema 抽取合併成一次 API 呼叫,省掉後面一整段後處理管線。
基準與人類偏好評測
官方證據分三層。人評以 600 多份文件、12 種以上語言做盲測排序,OCR 4 對所有受測對手的平均勝率為 72%。公開基準 OlmOCRBench 拿下 85.20,是受測模型中最高。內部多語基準 Crawl Multilingual 得分 0.98,八個語言組全數第一。OmniDocBench 的 93.07 則附帶但書:官方指該基準存在真值錯誤、LaTeX 等價與欄序問題,可能懲罰其實正確的輸出——讀廠商基準頁要讀到註腳,這裡是最好的例子。
客戶端的數字更實際。Rogo 的 Aidan Donohue 稱,相較主要代理式解析器「以約 8 倍更低的成本與 17 倍更低的延遲達到同等精度」;Anaqua 的 Ivan Mihailov 說每頁處理「約快 4 倍」;微軟的 Kimmi Grewal 則把 OCR 4 進駐 Microsoft Foundry 稱為雙方合作的重要里程碑。
價格與部署選擇
計費分三級:OCR API 每千頁 4 美元,Batch API 半價 2 美元,Document AI 每千頁 5 美元。取得管道除了 Mistral Studio 的 API 主控台,也上架 Amazon SageMaker 與 Microsoft Foundry,Snowflake 的 Parse Document 標示「即將推出」。有資料主權需求的企業可洽談自架部署;官方另排定 7 月 7 日的線上說明會。
對文件處理管線的意義
競爭框架已經位移:OCR 不再是辨識引擎的比賽,而是文件擷取 API 的比賽。邊界框讓下游可以重建版面,逐字信心分數讓進向量庫之前可以設品質閘門,Document AI 模式讓只需要發票、表單欄位的團隊少養一條後處理管線。
Hacker News 上 501 分、136 則討論,焦點有二:每千頁 4 美元對既有解析器定價的壓力,以及 OmniDocBench 但書引發的基準可信度論戰。對正在組 RAG 管線的團隊,合理的結論是把 OCR 4 當候選而非定論:用 Mistral 自己用的方法——在自己的文件集上跑盲測人評——再決定要不要把管線押上去。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
