Inteligência artificial, sem ruído.
Tutoriais5 min

Guia de Extração PDF-para-JSON com Modelos Open Source em 2026

Guia completo dos modelos open source para extração de PDF para JSON em 2026: Datalab lift, NuExtract 3, Docling, olmOCR 2, MinerU, Marker, DeepSeek-OCR e mais.

Guia de Extração PDF-para-JSON com Modelos Open Source em 2026

Grande parte dos dados corporativos ainda está trancada em PDFs, documentos escaneados e apresentações. Modelos de linguagem e agentes de IA não conseguem usar esses dados enquanto eles não estiverem estruturados como JSON. A extração de documentos com ferramentas open source se tornou o caminho padrão para fazer essa conversão com sua própria infraestrutura — sem depender de APIs proprietárias que cobram milhares de dólares por milhão de páginas.

Mas “PDF para JSON” esconde dois problemas diferentes. O primeiro é a extração baseada em schema: você define os campos esperados e o modelo preenche os valores — ideal para faturas, formulários e contratos. O segundo é o parsing de documentos: o modelo reconstrói a página inteira em JSON ou Markdown, preservando layout, ordem de leitura, tabelas e fórmulas — essencial para preparar corpora limpos para RAG e agentes.

Categoria 1: Extração estruturada por schema

Datalab lift

O lift é um modelo de visão de 9B parâmetros da Datalab, a mesma equipe por trás do Marker e do Surya. Você passa um schema JSON e o lift retorna valores que correspondem exatamente a ele, com decodificação restrita a schema que garante JSON válido. O modelo é baseado no Qwen 3.5 e roda localmente via Hugging Face ou em servidor vLLM.

Ele lida com documentos de múltiplas páginas em uma única passagem, incluindo valores que se estendem entre páginas. Vem com CLI, API Python e um “Schema Studio” em Streamlit para criar e testar schemas visualmente. No benchmark de 225 documentos da Datalab, o lift atinge 90,2% de acurácia por campo com latência média de 9,5 segundos. O código é Apache 2.0; os pesos usam licença OpenRAIL-M modificada, gratuita para pesquisa, uso pessoal e startups com menos de US$ 5 milhões em faturamento.

NuMind NuExtract 3

O NuExtract 3 é um modelo de visão-linguagem de 4B parâmetros que unifica duas tarefas em um único modelo: extração estruturada (documento para JSON) e extração de conteúdo (OCR para Markdown). Você fornece um template JSON descrevendo os campos que precisa. Treinado com aprendizado por reforço, o modelo incorpora raciocínio específico para extração, que pode ser ativado ou desativado por requisição. É multimodal, multilíngue e oferece API compatível com OpenAI via vLLM.

Categoria 2: Parsing de documentos para JSON e Markdown estruturados

IBM Docling

Nascido no IBM Research e agora hospedado pela LF AI & Data Foundation, o Docling faz parsing de PDF, DOCX, PPTX, XLSX, HTML e imagens. A saída inclui Markdown, HTML, JSON sem perdas e DocTags — um formato que preserva layout, ordem de leitura, tabelas e fórmulas em LaTeX. Roda localmente em ambientes air-gapped e integra com LangChain, LlamaIndex, Crew AI e Haystack. Licença MIT.

IBM Granite-Docling-258M

Um modelo compacto de apenas 258M parâmetros que realiza conversão de documentos em uma única passagem dentro dos pipelines Docling. Apesar do tamanho reduzido, lida com OCR, layout, tabelas, código e equações, com velocidade de aproximadamente 0,35 segundos por página em GPU A100. Licença Apache 2.0.

OpenDataLab MinerU

Desenvolvido pelo OpenDataLab e Shanghai AI Laboratory, o MinerU converte PDF, imagens, DOCX, PPTX e XLSX para Markdown e JSON. O modelo atual, MinerU2.5-Pro, foca no parsing de alta resolução para layouts complexos, incluindo tabelas entre páginas e gráficos. Recentemente mudou da licença AGPL-3.0 para a “MinerU Open Source License”, uma licença baseada na Apache 2.0 com condições adicionais, reduzindo o atrito para uso comercial.

Datalab Marker

O Marker é o pipeline da Datalab para converter documentos em Markdown, JSON, chunks e HTML, com suporte a PDF, imagens, PPTX, DOCX, XLSX, HTML e EPUB. Formata tabelas, formulários, equações, matemática inline, links e código. Uma flag opcional --use_llm adiciona um modelo de linguagem para melhorar tabelas e formulários. Pontua ~76,1 no benchmark olmOCR-Bench. Código GPL-3.0, pesos OpenRAIL-M.

Ai2 olmOCR 2

Modelo de visão-linguagem de 7B parâmetros especializado em OCR, do Allen Institute for AI. Converte PDFs em texto limpo e Markdown preservando ordem de leitura. Lida com tabelas, equações e manuscritos em layouts complexos de múltiplas colunas. Treinado com aprendizado por reforço usando recompensas verificáveis. Alcança 82,4 pontos no olmOCR-Bench com custo estimado de US$ 178 por milhão de páginas em GPUs próprias. Toolkit e pesos Apache 2.0.

DeepSeek DeepSeek-OCR

O modelo de OCR da DeepSeek introduz “compressão óptica de contexto”, que representa páginas ricas em texto como tokens de visão compactos, processando documentos longos com muito menos tokens que modelos de visão-linguagem típicos. Usa um decoder MoE de 3B (~570M parâmetros ativos por token) e suporta mais de 100 idiomas. A saída pode ser texto puro, Markdown, tabelas HTML ou JSON estruturado. Código MIT.

A opção generalista: Qwen3-VL

O Qwen3-VL da Alibaba não é um modelo específico para documentos, mas é a base sobre a qual muitos modelos de extração são construídos. Com tamanhos de 2B a 235B parâmetros e licença Apache 2.0 na maioria das versões, você pode prompting para retornar Markdown, JSON ou código. É uma opção flexível quando nenhum modelo especializado se encaixa perfeitamente, embora exija mais engenharia de prompt e ofereça menos garantias de formato.

Comparação e recomendações práticas

Nenhum benchmark isolado conta a história completa. O lift atinge 90,2% de acurácia por campo no benchmark de extração por schema da Datalab, enquanto o olmOCR 2 pontua 82,4 no benchmark de extração de conteúdo — métricas de suítes diferentes, não diretamente comparáveis. A recomendação mais importante: teste com seus próprios documentos antes de decidir.

Para extração de campos conhecidos (faturas, formulários), comece pelo lift ou NuExtract 3. Para parsing completo de documentos com layout complexo, Docling e olmOCR 2 são os pontos de partida mais sólidos. Se você precisa de uma solução rápida e leve, o Granite-Docling-258M é impressionante para seu tamanho. E se velocidade e custo são críticos, o DeepSeek-OCR com compressão óptica é uma opção inovadora que merece atenção.

A boa notícia é que o ecossistema open source de extração de documentos amadureceu significativamente. Há opções para praticamente todos os casos de uso, tamanhos de modelo e restrições de licenciamento — e a maioria roda em hardware que você já tem.


Descubra mais sobre noticiAI

Assine para receber nossas notícias mais recentes por e-mail.

R
Sobre o autorRedação Noticiai

Equipe editorial dedicada a explicar inteligência artificial com clareza, independência e contexto.