Comment ça marche
D'un PDF surligné à un Markdown propre en cinq étapes — sans que le document ne quitte jamais le navigateur.
-
Vous importez le PDF
Glissez ou sélectionnez un PDF avec du texte surligné. Le fichier est lu localement par PDF.js : rien n'est transmis — vous pouvez même tester avec vos documents les plus confidentiels.
-
MarkOut choisit le meilleur chemin
Chaque PDF — numérique ou scanné, avec ou sans annotations — passe par la même pipeline neuronale : un modèle YOLO26 personnalisé (ONNX auto-hébergé) détecte visuellement les zones surlignées sur la page rendue.
-
L'ordre de lecture est reconstruit
Les lignes de texte détectées sont organisées avec un algorithme de mise en page gap-tree : paragraphes et colonnes sont identifiés et chaque surlignage est assigné à la ligne qui le contient. Le résultat est un ordre de lecture correct — même pour les articles académiques à deux colonnes.
-
L'OCR reconnaît le texte
Chaque fragment surligné est recadré (redressé par ligne) et reconnu par PaddleOCR, exécuté localement via WebAssembly — ou WebGPU sur le bureau pour une inférence IA plus rapide. Le modèle de reconnaissance couvre l'anglais et les langues latines les plus courantes (it, fr, de, es, pt, nl…).
-
Vous obtenez un Markdown propre
Les surlignages sont fusionnés dans l'ordre de lecture en un document Markdown : front-matter YAML avec source et date, sections
## Page Net identifiants citables stables ([H12]) par ligne — idéal pour les notes et les workflows LLM. Copiez le résultat ou téléchargez le fichier.md.
Ce qui rend la sortie fiable
- Une pipeline pour chaque PDF — le même flux de détection YOLO + OCR s'exécute sur chaque document, scanné ou numérique : comportement cohérent, aucun chemin caché.
- Mise en page déterministe — le même algorithme pilote la pipeline et les vues de débogage : aucune logique cachée.
- Indicateurs de qualité — les lignes que l'OCR ne peut pas lire sont marquées (
⚠️ no text) au lieu d'être supprimées en silence, avec une section de notes d'extraction. - Profil basse mémoire — sur mobile, les pages sont traitées une par une et les modèles sont libérés à la fin.