So funktioniert's

Vom markierten PDF zum sauberen Markdown in fünf Schritten — ohne dass das Dokument je den Browser verlässt.

  1. Du lädst das PDF hoch

    Ziehe ein PDF mit markiertem Text hinein oder wähle es aus. Die Datei wird lokal von PDF.js gelesen: Es wird nichts übertragen — du kannst es sogar mit deinen vertraulichsten Dokumenten testen.

  2. MarkOut wählt den besten Weg

    Jedes PDF — digital oder gescannt, mit oder ohne Anmerkungen — durchläuft dieselbe neuronale Pipeline: ein YOLO26-Custom-Modell (selbst gehostetes ONNX) erkennt die markierten Bereiche visuell auf der gerenderten Seite.

  3. Die Lesereihenfolge wird rekonstruiert

    Erkannte Textzeilen werden mit einem Gap-Tree-Layout-Algorithmus organisiert: Absätze und Spalten werden identifiziert und jede Markierung der sie enthaltenden Zeile zugeordnet. Das Ergebnis ist eine korrekte Lesereihenfolge — auch bei zweispaltigen wissenschaftlichen Papern.

  4. OCR erkennt den Text

    Jedes markierte Fragment wird zugeschnitten (pro Zeile deskewed) und von PaddleOCR erkannt, das lokal per WebAssembly läuft — auf dem Desktop per WebGPU für schnellere KI-Inferenz. Das Erkennungsmodell deckt Englisch und die häufigsten lateinischen Sprachen ab (it, fr, de, es, pt, nl…).

  5. Du bekommst sauberes Markdown

    Markierungen werden in Lesereihenfolge zu einem Markdown-Dokument zusammengeführt: YAML-Frontmatter mit Quelle und Datum, ## Seite N-Abschnitte und stabile zitierbare IDs ([H12]) pro Zeile — ideal für Notiz-Apps und LLM-Workflows. Kopiere das Ergebnis oder lade die .md-Datei herunter.

Was die Ausgabe zuverlässig macht

  • Eine Pipeline für jedes PDF — derselbe YOLO-Erkennungs- und OCR-Ablauf läuft für jedes Dokument, gescannt oder digital: konsistentes Verhalten, keine versteckten Pfade.
  • Deterministisches Layout — derselbe Algorithmus treibt Pipeline und Debug-Ansichten: keine versteckte Logik.
  • Qualitäts-Flags — Zeilen, die OCR nicht lesen kann, werden markiert (⚠️ no text), statt stillschweigend verworfen, mit einem Abschnitt zu Extraktionsnotizen.
  • Speicherschonendes Profil — auf Mobilgeräten werden Seiten einzeln verarbeitet und Modelle am Ende freigegeben.
Transparent by design. In Debug-Builds zeigt die UI jeden Schritt: YOLO-Boxen, erkannte Zeilen, Regionen und OCR-Status pro Fragment — so kannst du genau nachvollziehen, was mit deinem PDF passiert ist.
📄 PDF hochladen — kostenlos