Comment ça marche

D'un PDF surligné à un Markdown propre en cinq étapes — sans que le document ne quitte jamais le navigateur.

  1. Vous importez le PDF

    Glissez ou sélectionnez un PDF avec du texte surligné. Le fichier est lu localement par PDF.js : rien n'est transmis — vous pouvez même tester avec vos documents les plus confidentiels.

  2. MarkOut choisit le meilleur chemin

    Chaque PDF — numérique ou scanné, avec ou sans annotations — passe par la même pipeline neuronale : un modèle YOLO26 personnalisé (ONNX auto-hébergé) détecte visuellement les zones surlignées sur la page rendue.

  3. L'ordre de lecture est reconstruit

    Les lignes de texte détectées sont organisées avec un algorithme de mise en page gap-tree : paragraphes et colonnes sont identifiés et chaque surlignage est assigné à la ligne qui le contient. Le résultat est un ordre de lecture correct — même pour les articles académiques à deux colonnes.

  4. L'OCR reconnaît le texte

    Chaque fragment surligné est recadré (redressé par ligne) et reconnu par PaddleOCR, exécuté localement via WebAssembly — ou WebGPU sur le bureau pour une inférence IA plus rapide. Le modèle de reconnaissance couvre l'anglais et les langues latines les plus courantes (it, fr, de, es, pt, nl…).

  5. Vous obtenez un Markdown propre

    Les surlignages sont fusionnés dans l'ordre de lecture en un document Markdown : front-matter YAML avec source et date, sections ## Page N et identifiants citables stables ([H12]) par ligne — idéal pour les notes et les workflows LLM. Copiez le résultat ou téléchargez le fichier .md.

Ce qui rend la sortie fiable

  • Une pipeline pour chaque PDF — le même flux de détection YOLO + OCR s'exécute sur chaque document, scanné ou numérique : comportement cohérent, aucun chemin caché.
  • Mise en page déterministe — le même algorithme pilote la pipeline et les vues de débogage : aucune logique cachée.
  • Indicateurs de qualité — les lignes que l'OCR ne peut pas lire sont marquées (⚠️ no text) au lieu d'être supprimées en silence, avec une section de notes d'extraction.
  • Profil basse mémoire — sur mobile, les pages sont traitées une par une et les modèles sont libérés à la fin.
Transparent par conception. Dans les builds de débogage, l'interface montre chaque étape : boîtes YOLO, lignes détectées, régions et statut OCR par fragment — pour vérifier exactement ce qui s'est passé avec votre PDF.
📄 Importer un PDF — c'est gratuit