O que é o Marker 2
A Datalab lançou o Marker 2, uma reescrita completa do seu pipeline open source de conversão de documentos. A ferramenta transforma PDFs, imagens, PPTX, DOCX, XLSX, HTML e EPUB em markdown, JSON, HTML ou chunks textuais — tudo com qualidade de produção e velocidade impressionante.
O novo sistema foi reconstruído em torno de três componentes: o Surya OCR 2 (modelo de visão para reconhecimento de texto), um modelo de layout rápido de 20 milhões de parâmetros (que detecta colunas, tabelas e cabeçalhos mesmo em CPU) e um pdftext reescrito que é 3× mais rápido que a versão anterior.
Resultados no benchmark olmOCR
Os números vêm do olmOCR-bench, um benchmark independente mantido pelo Allen AI (Ai2) com 1.403 PDFs e aproximadamente 8.400 testes unitários cobrindo renderização matemática, estrutura de tabelas, ordem de leitura, cabeçalhos, rodapés e documentos escaneados antigos.
No modo balanced (GPU), o Marker 2 atingiu 76,0% de pontuação geral e 83,5% em PDFs born-digital, sustentando 2,9 páginas por segundo em uma única GPU B200. Isso é mais de 5× a vazão do MinerU (pipeline backend), que faz 72,7% a apenas 0,54 páginas por segundo.
Três modos de conversão
Diferente da versão anterior, o Marker 2 expõe três caminhos de conversão distintos:
- balanced — o Surya VLM processa o layout e re-executa OCR na página inteira quando o texto embarcado está ruim. Máxima qualidade, 76,0% no benchmark. Requer GPU.
- fast — detector de layout leve (rf-detr/onnx) + pdftext, com uso mínimo e cirúrgico do VLM. Pontua 66,6%, mas é muito mais barato. Roda em GPU ou CPU.
- –disable_ocr — extração pura da camada de texto, sem chamadas ao VLM. Roda inteiramente em CPU, 43,6% de pontuação, 23,7 páginas por segundo.
O sistema agora é device-aware: seleciona automaticamente balanced na GPU e fast em CPU/MPS, com opção de override via --mode.
Comparação direta com os concorrentes
| Ferramenta | Pontuação geral | Born-digital | Páginas/segundo | Hardware |
|---|---|---|---|---|
| Marker 2 (balanced) | 76,0% | 83,5% | 2,9 | B200 GPU |
| Marker 2 (fast) | 66,6% | — | 7,4 | B200 GPU |
| MinerU (pipeline) | 72,7% | 83,3% | 0,54 | B200 GPU |
| Docling | 50,3% | 64,0% | 2,1 | B200 GPU |
| LiteParse (OCR off) | 20,4% | — | 1721 | CPU |
Marker 2 vs MinerU: O MinerU é o concorrente arquiteturalmente mais próximo — ambos leem a camada de texto do PDF e aplicam OCR seletivamente. No score geral, o Marker lidera por 76,0 a 72,7. Em documentos born-digital, há empate técnico (83,5 vs 83,3). A diferença real está na vazão: 5,4× mais rápido com qualidade superior.
Marker 2 vs Docling: A maior diferença entre pipelines GPU. O Marker lidera por 76,0 a 50,3 no score geral e é 38% mais rápido (2,9 vs 2,1 pg/s). O Docling, porém, tem vantagens em governança: código MIT, origem no IBM Research e hospedagem na LF AI & Data Foundation. Sua lista de formatos de entrada também é mais ampla (inclui áudio e email).
Marker 2 vs LiteParse: São ferramentas com filosofias opostas. O LiteParse (Rust, da equipe LlamaIndex) atinge absurdos 1.721 páginas por segundo em CPU com OCR desligado — 73× o modo CPU do Marker. Mas pontua apenas 20,4% porque não tem modelo de layout: colapsa em qualquer coisa que não seja texto linear. O Marker com --disable_ocr ainda pontua 43,6% porque o modelo de layout de 20M parâmetros recupera estrutura mesmo sem GPU.
Licenciamento: atenção ao uso comercial
É aqui que as quatro ferramentas divergem mais para times comerciais:
- Marker 2: código Apache 2.0. Pesos dos modelos sob licença OpenRAIL-M modificada — gratuito para pesquisa, uso pessoal e startups com menos de US$ 5 milhões em faturamento. Uso comercial dos pesos exige licença paga.
- MinerU: licença própria baseada na Apache 2.0 com condições adicionais. Licença comercial necessária acima de 100M MAU ou US$ 20M de receita mensal.
- Docling: MIT para o código. Pesos dos modelos com licenças próprias (rastreadas nos pacotes originais).
- LiteParse: open source. LlamaParse é o caminho pago na nuvem para documentos complexos.
O que muda na prática
Para quem está avaliando qual ferramenta adotar, a decisão depende mais do perfil do seu corpus e da sua infraestrutura do que do score bruto:
- Alta qualidade + GPU disponível: Marker 2 balanced é a melhor opção entre pipelines, especialmente para documentos born-digital com matemática.
- Orçamento apertado ou CPU-only: Marker 2 fast ou –disable_ocr entrega estrutura decente sem GPU.
- Velocidade acima de tudo (texto linear): LiteParse é imbatível em vazão, mas não espere estrutura.
- Governança corporativa: Docling tem o licenciamento mais limpo (MIT) e o respaldo da Linux Foundation.
Alerta de breaking change: quem atualiza do Marker 1 precisa de Python 3.10+. A ferramenta de extração estruturada foi removida; o caminho recomendado é usar a API hospedada ou o fluxo --use_llm. O gerenciamento de pacotes migrou do Poetry para uv.
Descubra mais sobre noticiAI
Assine para receber nossas notícias mais recentes por e-mail.



