Come funziona

Da un PDF evidenziato a un Markdown pulito in cinque passi — senza che il documento lasci mai il browser.

  1. Carichi il PDF

    Trascina o seleziona un PDF con testo evidenziato. Il file viene letto localmente da PDF.js: non viene trasmesso nulla — puoi provarlo anche con i documenti più riservati.

  2. MarkOut sceglie il percorso migliore

    Ogni PDF — digitale o scannerizzato, con o senza annotazioni — passa dalla stessa pipeline neurale: un modello YOLO26 custom (ONNX self-hosted) rileva visivamente le aree evidenziate sulla pagina renderizzata.

  3. L'ordine di lettura viene ricostruito

    Le righe di testo rilevate vengono organizzate con un algoritmo di layout gap-tree: paragrafi e colonne vengono identificati e ogni evidenziazione viene assegnata alla riga che la contiene. Il risultato è un ordine di lettura corretto — anche per i paper accademici a due colonne.

  4. L'OCR riconosce il testo

    Ogni frammento evidenziato viene ritagliato (deskew per riga) e riconosciuto da PaddleOCR, eseguito localmente via WebAssembly — o WebGPU sul desktop per un'inferenza AI più veloce. Il modello di riconoscimento copre l'inglese e le lingue latine più comuni (it, fr, de, es, pt, nl…).

  5. Ottieni un Markdown pulito

    Le evidenziazioni vengono unite in ordine di lettura in un documento Markdown: front-matter YAML con fonte e data, sezioni ## Pagina N e ID citabili stabili ([H12]) per riga — ideale per appunti e workflow LLM. Copia il risultato o scarica il file .md.

Cosa rende affidabile l'output

  • Una pipeline per ogni PDF — lo stesso flusso di rilevamento YOLO + OCR gira su ogni documento, scannerizzato o digitale: comportamento coerente, nessun percorso nascosto.
  • Layout deterministico — lo stesso algoritmo guida la pipeline e le viste di debug: nessuna logica nascosta.
  • Flag di qualità — le righe che l'OCR non riesce a leggere vengono marcate (⚠️ no text) invece di essere scartate in silenzio, con una sezione di note sull'estrazione.
  • Profilo a bassa memoria — su mobile le pagine vengono elaborate una alla volta e i modelli vengono rilasciati alla fine.
Trasparente per design. Nelle build di debug la UI mostra ogni passaggio: box YOLO, righe rilevate, regioni e stato OCR per frammento — così puoi verificare esattamente cosa è successo con il tuo PDF.
📄 Carica un PDF — è gratis