Cómo funciona
De un PDF resaltado a un Markdown limpio en cinco pasos — sin que el documento salga jamás del navegador.
-
Subes el PDF
Arrastra o selecciona un PDF con texto resaltado. El archivo se lee localmente con PDF.js: no se transmite nada — puedes probar incluso con tus documentos más confidenciales.
-
MarkOut elige la mejor ruta
Todos los PDF — digitales o escaneados, con o sin anotaciones — pasan por la misma pipeline neuronal: un modelo YOLO26 personalizado (ONNX autoalojado) detecta visualmente las áreas resaltadas en la página renderizada.
-
Se reconstruye el orden de lectura
Las líneas de texto detectadas se organizan con un algoritmo de layout gap-tree: se identifican párrafos y columnas y cada resaltado se asigna a la línea que lo contiene. El resultado es un orden de lectura correcto — incluso para papers académicos de dos columnas.
-
El OCR reconoce el texto
Cada fragmento resaltado se recorta (enderezado por línea) y lo reconoce PaddleOCR, ejecutado localmente vía WebAssembly — o WebGPU en el escritorio para una inferencia de IA más rápida. El modelo de reconocimiento cubre el inglés y las lenguas latinas más comunes (it, fr, de, es, pt, nl…).
-
Obtienes un Markdown limpio
Los resaltados se fusionan en orden de lectura en un documento Markdown: front-matter YAML con fuente y fecha, secciones
## Página Ne IDs citables estables ([H12]) por línea — ideal para notas y flujos LLM. Copia el resultado o descarga el archivo.md.
Qué hace fiable la salida
- Una pipeline para cada PDF — el mismo flujo de detección YOLO + OCR se ejecuta en cada documento, escaneado o digital: comportamiento consistente, sin rutas ocultas.
- Layout determinista — el mismo algoritmo impulsa la pipeline y las vistas de depuración: sin lógica oculta.
- Indicadores de calidad — las líneas que el OCR no puede leer se marcan (
⚠️ no text) en lugar de descartarse en silencio, con una sección de notas de extracción. - Perfil de baja memoria — en móvil, las páginas se procesan una a una y los modelos se liberan al final.