Jina AI 推出 jina-ocr-v1:低成本 GPU 文件解析模型,支援 MoE 與投機解碼
Jina AI(現屬 Elastic)發布 jina-ocr-v1,這是一個 34 億參數的 MoE 模型,可將 PDF、掃描檔、表格與發票轉換為結構化 Markdown,同時在預算 GPU 上保持推論成本低廉。

Jina AI 宣布 jina-ocr-v1 正式上線,該文件解析模型能將 PDF、掃描圖像、表格、圖表與發票等資料轉換為結構化的 Markdown,並透過 Jina 與 Elastic 的整合,輕鬆部署於現有的搜尋與分析管線中。
模型擁有 34 億參數,但其專家混合模型(MoE)架構在每個 token 上僅啟用約 5.7 億參數。這種選擇性激活是降低低價 GPU 推論成本的核心機制。
高效視覺編碼
jina-ocr-v1 的編碼器將 1 024 × 1 024 像素的頁面壓縮為 256 個視覺 token;若啟用動態模式,最多可加入九個局部區塊,令 token 數上限提升至 1 156。彈性的 token 預算讓模型在處理複雜版面時保留細緻資訊,同時不會造成記憶體爆炸。
FastMTP 投機解碼
全新投機解碼頭 FastMTP 能預測未來三個 token,並以貪婪方式驗證。此方法保證最終輸出與傳統解碼器相同,同時將解碼步驟減半左右。
在 OmniDocBench v1.6 基準測試中,jina-ocr-v1 獲得 91.14 分,olmOCR‑Bench 取得 83.4 分。雖非品質最高,但其每美元吞吐量表現是主要賣點。
使用 Nvidia A100 40 GB GPU、並行度為 32 時,團隊測得每秒處理 2.57 頁。此吞吐量在內部比較的十四套系統中最高,顯示模型在高階硬體上亦具效率。
在單顆 Nvidia L4 GPU 上執行時,FastMTP 使 token 產生速率從 42.7 提升至 83.1 token/秒(eager 模式),提升約 1.95 倍,證明即使是低預算 GPU 只要採用正確的解碼策略,也能接近即時文件解析。
模型大小與授權
模型的 BF16 權重約佔 6.8 GB,於 Hugging Face 以 CC BY‑NC 4.0 授權發布。該授權允許學術與研究使用免費,商業部署則需另行與 Jina AI 簽訂協議。
- 34 億總參數
- ≈5.7 億每 token 活化參數
- 每頁 256‑至‑1 156 視覺 token
- FastMTP 投機解碼,3 token 前瞻
官方模型說明書列出支援 108 種語言。但開發者指出,嚴重退化的掃描仍是弱點,對於關鍵文件建議加入人工驗證步驟。
這個模型的輸入不只限於清晰的文字頁面。它可以處理 PDF、掃描影像、表格、圖表與發票,並把文字、公式、表格結構和閱讀順序一併整理成 Markdown。對建立文件搜尋或知識庫的團隊而言,單次處理能減少額外的格式修復步驟,但輸出仍應依文件的重要程度接受抽樣或人工檢查。
效率提升來自兩個不同層面。專家混合架構讓每個 token 只啟用部分參數,而 FastMTP 則在輸出階段預先提出三個 token,再由主解碼器逐一確認。驗證採用貪婪方式,因此啟用推測解碼只改變速度,不會改變最後產生的文字,這是文件轉錄特別重視的條件。
基準分數也需要和實際用途一起解讀。jina-ocr-v1 在兩個公開測試中並非最高分模型,但 Jina AI 把重點放在每秒頁數與較小的啟用參數量。若文件包含嚴重破損的舊掃描,品質限制仍然存在;若工作負載以大量一般 PDF 為主,吞吐量和硬體需求則可能比最後幾個品質分數更有價值。
對台灣企業的意義
對於需要處理大量多樣文件——如法律合約、發票、研究報告——的台灣企業而言,jina-ocr-v1 提供在中階 GPU(如 Nvidia L4)上即可運行的低成本解決方案。MoE 提升的參數效率與 FastMTP 投機解碼相結合,使吞吐量提升而不犧牲 Markdown 的精確度。企業因此能以極低的雲端運算費用自動化文件的初步擷取,僅對最具挑戰性的掃描留存人工審核,並可直接將輸出串接至 Elastic 為基礎的搜尋或分析平台。
資料來源
- jina-ocr-v1Jina AI · 2026年9月14日
- Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUsMarkTechPost · 2026年9月18日



