Jina AI lança jina-ocr-v1, parser de documentos de baixo custo com MoE e decodificação especulativa
Jina AI, agora parte da Elastic, lançou o jina-ocr-v1, um modelo MoE de 3,4 bilhões de parâmetros que converte PDFs, imagens escaneadas, tabelas e notas fiscais em Markdown estruturado, mantendo custos de inferência baixos em GPUs econômicas.

A Jina AI, agora integrante da Elastic, anunciou a disponibilidade do jina‑ocr‑v1, um modelo especializado em parsing de documentos que converte PDFs, imagens escaneadas, tabelas, gráficos e notas fiscais em Markdown estruturado, facilitando a integração em pipelines de busca e análise já existentes.
Com 3,4 bilhões de parâmetros no total, o jina‑ocr‑v1 utiliza a arquitetura mixture‑of‑experts (MoE) para ativar apenas cerca de 570 milhões de parâmetros por token, o que reduz drasticamente o custo de inferência em GPUs de baixo custo.
Codificação visual eficiente
O codificador do modelo comprime uma página de 1 024 × 1 024 pixels em 256 tokens visuais; quando o modo dinâmico está habilitado, até nove blocos locais adicionais podem ser inseridos, elevando o total máximo para 1 156 tokens, permitindo a preservação de detalhes finos em layouts complexos sem sobrecarregar a memória.
Decodificação especulativa com FastMTP
FastMTP, o novo cabeçalho de decodificação especulativa, prevê três tokens à frente e os valida de forma gananciosa, garantindo que a saída final seja equivalente à de um decodificador convencional, mas com aproximadamente metade do número de passos de decodificação.
Nos benchmarks da suíte OmniDocBench v1.6, o jina‑ocr‑v1 alcançou pontuação 91,14, e no olmOCR‑Bench obteve 83,4, números que não o colocam no topo da qualidade pura, mas que destacam seu excelente throughput‑por‑dólar.
Em uma GPU Nvidia A100 de 40 GB, a equipe mediu velocidade de 2,57 páginas por segundo a um custo de US$ 32 por hora, o maior throughput entre os quatorze sistemas avaliados no estudo interno, evidenciando eficiência mesmo em hardware de ponta.
Quando executado em uma única GPU Nvidia L4, o FastMTP aumentou a taxa de geração de tokens de 42,7 para 83,1 tokens por segundo no modo eager, representando um ganho de 1,95× e demonstrando que GPUs de orçamento limitado podem alcançar parsing quase em tempo real com a estratégia correta.
Tamanho do modelo e licenciamento
Os pesos BF16 ocupam aproximadamente 6,8 GB e estão disponíveis no Hugging Face sob licença CC BY‑NC 4.0, permitindo uso acadêmico e de pesquisa sem custos, enquanto implantações comerciais exigem acordo separado com a Jina AI.
- 3,4 bilhões de parâmetros totais
- ≈570 milhões de parâmetros ativos por token
- 256‑a‑1 156 tokens visuais por página
- Decodificação especulativa FastMTP com olhar de 3 tokens
O modelo suporta 108 idiomas, conforme a ficha oficial, mas os desenvolvedores alertam que digitalizações muito degradadas ainda podem apresentar falhas e recomendam revisão humana para documentos críticos.
Impacto para organizações de língua portuguesa
Empresas que precisam ingerir grandes volumes de documentos heterogêneos — contratos, notas fiscais, artigos científicos — podem se beneficiar de uma solução econômica que roda em GPUs de médio porte como a Nvidia L4, combinando eficiência de parâmetros MoE e decodificação especulativa FastMTP para maximizar throughput sem sacrificar a fidelidade do Markdown extraído.
A estratégia permite automatizar a primeira fase de extração de documentos por uma fração do custo de computação em nuvem, reservando a revisão humana apenas para as digitalizações mais problemáticas e integrando a saída diretamente em stacks de busca ou análise baseados em Elastic.
Além disso, a compatibilidade com 108 idiomas facilita a adoção em ambientes multilíngues da América Latina, reduzindo a necessidade de múltiplos modelos específicos para cada língua.
A Jina AI também disponibiliza scripts de integração pré‑configurados para o Elastic Stack, simplificando a ingestão automática de PDFs e imagens escaneadas em índices de pesquisa que já suportam facetas, filtros e ranking avançado.
Para desenvolvedores, a documentação inclui exemplos de uso em Python e Java, bem como guias de otimização para GPUs de consumo, permitindo ajustes finos de batch size e modo dinâmico conforme a carga de trabalho.
No Brasil, a adoção precoce do jina‑ocr‑v1 já está sendo testada por startups fintech em São Paulo, que buscam reduzir custos de processamento de notas fiscais eletrônicas e contratos de prestação de serviços, aproveitando o modelo para gerar metadados estruturados que alimentam seus sistemas de compliance.
Fontes
- jina-ocr-v1Jina AI · 14 de setembro de 2026
- Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUsMarkTechPost · 18 de setembro de 2026



