Jina AI 推出 jina-ocr-v1:低成本 GPU 文档解析模型,具备 MoE 与投机解码
Jina AI(现为 Elastic 子公司)发布 jina-ocr-v1,这款 34 亿参数的 MoE 模型能够将 PDF、扫描件、表格和发票转为结构化 Markdown,并在廉价 GPU 上保持低推理成本。

Jina AI 宣布推出 jina-ocr-v1,这是一款面向文档解析的模型,能够把 PDF、扫描图像、表格、图表以及发票等多种格式转化为结构化的 Markdown,便于后续搜索和分析。该模型作为 Jina 与 Elastic 深度集成的成果,支持直接嵌入现有的 Elastic 搜索管道,实现端到端的文档处理。
jina-ocr-v1 拥有 34 亿参数,但采用混合专家(MoE)架构,在每个 token 处理时仅激活约 5.7 亿参数。这种按需激活的机制是降低廉价 GPU 推理成本的关键所在,使得模型在资源受限的环境中仍能保持高效。
高效的视觉编码
模型的视觉编码器能够将最高 1024×1024 像素的页面压缩为 256 个视觉 token。启用动态模式后,系统会额外提取最多九个局部切块,使 token 数上限提升至 1156。灵活的 token 预算让模型在捕捉复杂布局细节的同时,避免了显存爆炸的风险。
FastMTP 投机解码
FastMTP 是一种新颖的投机解码头,能够提前预测三个 token 并采用贪婪方式进行验证。该方法在保证最终输出与传统解码器完全一致的前提下,将解码步数缩减约一半,大幅提升了解码速度。
在 OmniDocBench v1.6 基准测试中,jina-ocr-v1 获得 91.14 分;在 olmOCR‑Bench 中取得 83.4 分。虽然这些分数未能让模型在纯质量排名中居首,但其每美元吞吐量成为最突出的竞争优势。
在 Nvidia A100 40 GB GPU 上、并发度为 32 时,官方测得的处理速度为每秒 2.57 页。该吞吐量在内部对比的十四套系统中位居第一,凸显模型在高端硬件上的效率。
当在单卡 Nvidia L4 GPU 上运行时,FastMTP 将急切模式下的 token 生成率从 42.7 提升至 83.1 token/秒,提升幅度约为 1.95 倍。实验结果表明,即便是预算有限的 GPU,配合合适的解码策略,也能实现接近实时的文档解析。
模型规模与授权
jina-ocr-v1 的 BF16 权重约占 6.8 GB,托管在 Hugging Face 平台,采用 CC BY‑NC 4.0 许可证。该许可证允许学术研究和非商业用途免费使用,商业部署则需另行与 Jina AI 签订授权协议。
- 34 亿总参数
- ≈5.7 亿每 token 活动参数
- 每页 256‑1156 视觉 token
- FastMTP 投机解码,3 token 前瞻
官方模型卡显示 jina-ocr-v1 支持 108 种语言。然而,开发团队承认,对严重退化的扫描件仍存在识别薄弱环节,建议在关键文档上进行人工核验以确保准确性。
对中文及其他语言组织的意义
对于需要处理大量异构文档的企业——如合同、发票、科研论文等,jina-ocr-v1 提供了一种高性价比的解决方案,可在 Nvidia L4 等中档 GPU 上平稳运行。MoE 带来的参数效率与 FastMTP 投机解码的加速相结合,使得吞吐量显著提升而不牺牲 Markdown 的提取质量。
组织可以在云计算费用仅为传统方案的一小部分的情况下,实现文档提取的第一轮自动化,仅对最困难的扫描件进行人工审查,并将结构化结果直接写入基于 Elastic 的搜索或分析系统,实现端到端的业务流程优化。
本地部署方面,jina-ocr-v1 的模型文件体积适中,兼容主流的容器化平台,用户可在内部数据中心或私有云中自行托管,满足对数据安全和合规性的严格要求。
信息来源
- jina-ocr-v1Jina AI · 2026年9月14日
- Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUsMarkTechPost · 2026年9月18日



