Como funciona
De um PDF destacado a um Markdown limpo em cinco passos — sem que o documento saia nunca do navegador.
-
Você envia o PDF
Arraste ou selecione um PDF com texto destacado. O arquivo é lido localmente pelo PDF.js: nada é transmitido — você pode testar até com seus documentos mais confidenciais.
-
O MarkOut escolhe o melhor caminho
Todo PDF — digital ou escaneado, com ou sem anotações — passa pela mesma pipeline neural: um modelo YOLO26 personalizado (ONNX auto-hospedado) detecta visualmente as áreas destacadas na página renderizada.
-
A ordem de leitura é reconstruída
As linhas de texto detectadas são organizadas com um algoritmo de layout gap-tree: parágrafos e colunas são identificados e cada destaque é atribuído à linha que o contém. O resultado é uma ordem de leitura correta — até para artigos acadêmicos com duas colunas.
-
O OCR reconhece o texto
Cada fragmento destacado é recortado (endireitado por linha) e reconhecido pelo PaddleOCR, executado localmente via WebAssembly — ou WebGPU no desktop para inferência de IA mais rápida. O modelo de reconhecimento cobre o inglês e os idiomas latinos mais comuns (it, fr, de, es, pt, nl…).
-
Você recebe um Markdown limpo
Os destaques são unidos em ordem de leitura em um documento Markdown: front-matter YAML com fonte e data, seções
## Página Ne IDs citáveis estáveis ([H12]) por linha — ideal para notas e fluxos LLM. Copie o resultado ou baixe o arquivo.md.
O que torna a saída confiável
- Uma pipeline para cada PDF — o mesmo fluxo de detecção YOLO + OCR roda em cada documento, escaneado ou digital: comportamento consistente, nenhum caminho oculto.
- Layout determinístico — o mesmo algoritmo dirige a pipeline e as visualizações de depuração: sem lógica oculta.
- Indicadores de qualidade — linhas que o OCR não consegue ler são marcadas (
⚠️ no text) em vez de descartadas silenciosamente, com uma seção de notas de extração. - Perfil de baixa memória — no mobile, as páginas são processadas uma a uma e os modelos são liberados no final.