Belin Doc IconBelin Doc

PDF in Markdown umwandeln: Was aus Überschriften und Tabellen wird

BelinDoc Team2026/08/22

Praxisleitfaden zum Umwandeln von PDF in Markdown für Obsidian, Notion, Logseq und RAG-Pipelines. Was aus Überschriften, Tabellen, Formeln und Bildern in der .md wird, warum die Lesereihenfolge bei zweispaltigen Papern kippt, welche Erkennungssprache Scans brauchen und wann Markdown das falsche Zielformat ist.

PDF in Markdown umwandeln: die kurze Antwort

Nutzen Sie ein Werkzeug, das eine Layoutanalyse durchführt statt nur Text zu extrahieren: PDF hochladen, die Sprache des Dokuments wählen, damit OCR es korrekt liest, und anschließend ein .zip herunterladen, das eine .md-Datei und einen Ordner images/ enthält. Überschriftenebenen, Listen, Tabellen, Codeblöcke und LaTeX-Formeln werden zu entsprechender Markdown-Syntax; Seitenschmuck wie Kopf- und Fußzeilen, Seitenzahlen und Spaltenumbrüche wird verworfen.

Woran die meisten scheitern, ist nicht das Werkzeug, sondern die Erwartung. Ein PDF speichert, wo Tinte auf einer Seite sitzt. Markdown speichert, was der Inhalt bedeutet. Dazwischen liegt keine Formatumwandlung, sondern eine Rekonstruktion – und manches lässt sich dabei wirklich nicht mitnehmen.

Eine dicht gesetzte PDF-Seite zerfällt in strukturiertes Markdown – Überschriften, Listen, eine Pipe-Tabelle und ein Codeblock –, während Abbildungen in einen eigenen Ordner ausgelagert werden


Warum „den Text aus dem PDF kopieren" nicht funktioniert

Text aus einem PDF zu kopieren und in eine .md einzufügen geht immer schief. Das liegt nicht am Werkzeug, sondern am Format selbst: In einem PDF gibt es die Begriffe Überschrift, Absatz und Tabelle überhaupt nicht.

Eine PDF-Seite ist eine Liste von Zeichenbefehlen – setze dieses Zeichen an diese Koordinate, ziehe eine Linie von hier nach dort. Was Sie als „Abschnittsüberschrift" lesen, ist lediglich Text, der zufällig größer und fetter ist. Was wie eine Tabelle aussieht, sind Textblöcke, die zufällig bündig stehen – mal mit Linien daneben, mal ohne.

Ein Werkzeug muss die Struktur also aus der Geometrie erschließen. Genau hier liegen die Qualitätsunterschiede zwischen den Anbietern, und deshalb glänzt dasselbe Werkzeug bei einem sauberen Bericht und scheitert an einem Fachartikel.

Vier Schlussfolgerungsprobleme, nach Schwierigkeit sortiert

  1. Lesereihenfolge. Bei einem zweispaltigen Paper liest naive Extraktion quer über beide Spalten und verschränkt zwei zusammenhanglose Sätze. Korrekt ist, die Spaltentrennung zu erkennen und jede Spalte von oben nach unten zu lesen.
  2. Überschriftenhierarchie. Das Werkzeug muss entscheiden, dass 16 pt fett ein ## ist und 13 pt fett ein ### – und zwar allein anhand der relativen Größen innerhalb dieses Dokuments, denn einen absoluten Maßstab gibt es nicht.
  3. Tabellen. Tabellen mit Linien sind vergleichsweise einfach. Eine Tabelle ohne Linien, die nur durch Ausrichtung besteht, muss allein aus der Geometrie der Leerräume rekonstruiert werden.
  4. Formeln. Mathematische Notation besteht aus platzierten Glyphen, mal in einer Mathematikschrift, mal als Bild. Daraus \frac{a}{b} zu gewinnen, ist eine ganz andere Größenordnung als einen Satz zu lesen.

Was die Umwandlung tatsächlich übersteht

Diese Tabelle ist der Teil des Artikels, den man sich merken sollte. Sie beschreibt, was Markdown als Format ausdrücken kann – also die tatsächliche Obergrenze, die kein Werkzeug überschreiten kann.

Element im PDFIn der Markdown-AusgabeVerlässlichkeit
AbschnittsüberschriftenEbenen ## / ###Hoch bei einheitlicher Typografie
FließtextabsätzeNormale AbsätzeHoch
Aufzählungen und NummerierungenListen mit - und 1.Hoch
CodeblöckeEingezäunte BlöckeHoch, wenn der Code dicktengleich gesetzt ist
Tabellen mit LinienGFM-Pipe-TabellenGut
Tabellen ohne LinienGFM-Pipe-TabellenMittel – Spaltengrenzen werden aus der Ausrichtung geschätzt
LaTeX-Formeln$...$ / $$...$$Gut bei Inline- und abgesetzter Mathematik, schwächer bei mehrzeiligen Umgebungen
Abbildungen und DiagrammeNach images/ ausgelagert, relativ verlinktExtraktion hoch, aber als Bitmap ist das Diagramm keine Datengrundlage mehr
FußnotenMeist in den Fließtext nahe der Referenz eingeebnetMittel
Kopf-/Fußzeilen, SeitenzahlenVerworfenAbsichtlich – Seitenschmuck, kein Inhalt
Mehrspaltiges LayoutAuf eine Spalte eingeebnetAbsichtlich – Markdown kennt keine Spalten
Schriften, Farben, exakte AbständeVerlorenMarkdown hat überhaupt keine Stilebene

Drei dieser Zeilen stehen mit Absicht auf „verworfen" oder „verloren". Hängt die Bedeutung Ihres Dokuments an Farbcodierung oder an einem zweispaltigen Satz, ist Markdown das falsche Ziel, und kein Werkzeug ändert daran etwas. Wandeln Sie stattdessen nach .docx um – siehe PDF in Word umwandeln.

Warum die Ausgabe ein .zip ist und keine .md

Eine Markdown-Datei kann kein Bild enthalten, sie kann nur darauf verweisen. Jede ehrliche Umwandlung eines bebilderten Dokuments muss daher mindestens zwei Dinge liefern: die Textdatei und die Bilder, auf die sie verweist.

Das PDF-zu-Markdown-Werkzeug von Belin Doc liefert ein .zip mit der .md neben einem Ordner images/; die relativen Pfade stehen bereits im Markdown. Entpacken Sie es in Ihren Wissensspeicher oder Ihr Repository, und die Bilder werden ohne manuelles Nachverlinken angezeigt.

Das ist wichtiger, als es klingt. Die häufigste Klage über PDF-zu-Markdown-Abläufe ist nicht schlechter Text, sondern 40 kaputte Bildlinks, nachdem Dateien verschoben wurden. Die Ordnerstruktur beim Export beizubehalten ist die Lösung.

Gescannte PDFs: Sprache vor der Umwandlung wählen

Ist Ihr PDF ein Scan – eine abfotografierte Buchseite, ein alter Vertrag, irgendetwas ohne Textebene –, gibt es keinen Text zu extrahieren. Er muss zuerst per OCR gelesen werden, und die Genauigkeit hängt stark davon ab, welches Schriftsystem und welche Sprache Sie vorgeben.

Belin Doc überlässt diese Wahl ausdrücklich Ihnen, statt zu raten. Das Werkzeug bietet 16 Sprach- und Schriftsystemoptionen, darunter vereinfachtes Chinesisch (mit einem separaten, genaueren Servermodell), traditionelles Chinesisch, Englisch, Japanisch, Koreanisch, Thailändisch, Griechisch, Tamil, Telugu und Kannada sowie Optionen auf Schriftsystemebene für Lateinisch, Arabisch, Kyrillisch, Ostslawisch und Devanagari.

Zwei praktische Hinweise:

  • Vor dem Hochladen wählen, nicht danach. Die Sprache wird mit dem Auftrag übermittelt; eine Änderung bedeutet erneutes Umwandeln.
  • Bei gemischten europäischen Sprachen die Schriftsystem-Option wählen. Für ein Dokument mit Französisch, Deutsch und Spanisch liefert latin in der Regel bessere Ergebnisse als jede Einzelsprache.

Wenn Sie nicht sicher sind, ob Ihr PDF ein Scan ist, erklärt unser Beitrag zu zweischichtigen PDFs, wie Sie das in Sekunden feststellen und warum manche „Text"-PDFs in Wahrheit Bilder sind.

Wann Markdown das falsche Zielformat ist

Hierüber ehrlich zu schreiben, nützt mehr als eine Funktionsliste.

Markdown eignet sich, wenn Sie Inhalte in ein Notizsystem (Obsidian, Notion, Logseq) überführen, Dokumente in eine RAG- oder Embedding-Pipeline geben, Dokumentation unter Versionskontrolle stellen oder schlicht Klartext wollen, den Sie in 20 Jahren noch öffnen können.

Markdown eignet sich nicht, wenn das Layout der Inhalt ist. Verträge, bei denen Nummerierung und Einzüge rechtliche Bedeutung tragen, Formulare, Rechnungen, technische Zeichnungen, Foliensätze und alles, was Sie jemandem in gesetzter, druckbarer Form zurückgeben müssen – all das verliert beim Einebnen etwas Wesentliches.

Überdenken sollten Sie es, wenn Ihr Dokument überwiegend aus Tabellen mit verbundenen Zellen besteht. Markdown-Tabellen können Zellen überhaupt nicht verbinden. Ein Werkzeug wird die Verbindung entweder auftrennen oder den Wert wiederholen – beides ist nicht das, was das Original meinte.

Für lange Fließtexte, die Sie lesen statt bearbeiten wollen, ist EPUB meist das bessere Ziel: Es passt sich Ihrem Bildschirm an und behält die Kapitelstruktur. Diese Abwägung behandelt PDF in EPUB umwandeln.

PDF in Markdown umwandeln – Schritt für Schritt

Schritt 1: Die Dokumentsprache wählen

Öffnen Sie das PDF-zu-Markdown-Werkzeug und stellen Sie die Sprachauswahl vor dem Hochladen passend ein. Bei digitalen PDFs mit echter Textebene fällt das kaum ins Gewicht; bei Scans ist es der wichtigste Einzelfaktor für die Qualität.

Schritt 2: PDF hochladen und Umwandlung starten

Laden Sie eine Datei mit bis zu 100 MB und 100 Seiten hoch. Eine Anmeldung ist nötig, da Umwandlungsverlauf und Download-Links an Ihr Konto gebunden sind. Die Umwandlung kostet 1 Übersetzungsguthaben pro Seite und wird zuerst vom monatlichen Freikontingent abgezogen – registrierte Konten erhalten 500 Freiseiten pro Monat aus demselben Guthaben wie die Dokumentübersetzung. Schlägt eine Umwandlung fehl, wird das Guthaben automatisch erstattet.

Schritt 3: Das ZIP herunterladen und in den Wissensspeicher entpacken

Lange und gescannte Dokumente dauern länger, weil jede Seite einzeln analysiert wird. Sie können den Tab schließen – Umwandlungen bleiben 24 Stunden in der Liste. Laden Sie das .zip herunter und entpacken Sie .md und den Ordner images/ gemeinsam in Ihren Notizspeicher oder Ihr Repository; die Bildlinks lösen sich dann von selbst auf.

Häufige Fragen (FAQ)

Enthält die Markdown-Ausgabe die Bilder aus dem PDF?

Ja. Bilder werden in einen Ordner images/ ausgelagert und aus dem Markdown mit relativen Pfaden referenziert – deshalb ist der Download ein .zip und keine nackte .md. Verschieben Sie Ordner und Markdown-Datei gemeinsam, dann bleiben die Links intakt.

Stimmt bei einem zweispaltigen Fachartikel die Lesereihenfolge?

Die Spaltenerkennung erfolgt über Layoutanalyse statt roher Textextraktion, deshalb werden zweispaltige Paper spaltenweise gelesen und nicht quer über die Seite. Der schwierigste Fall sind dichte Seiten, auf denen Spalten mit freistehenden Abbildungen und Randnotizen gemischt sind – prüfen Sie beim Korrekturlesen zuerst die Absatzübergänge rund um Abbildungen.

Lassen sich mathematische Formeln in bearbeitbares LaTeX umwandeln?

Inline- und abgesetzte Formeln werden in LaTeX zwischen $ und $$ umgewandelt und in Obsidian, Typora und den meisten Markdown-Editoren korrekt dargestellt. Am schwächsten sind mehrzeilige ausgerichtete Umgebungen und handgebaute Matrizen; hier lohnt eine manuelle Kontrolle.

Was kostet die Umwandlung von PDF in Markdown?

1 Übersetzungsguthaben pro Seite, zuerst vom monatlichen Freikontingent abgezogen – 500 Freiseiten pro Monat nach der Registrierung, gemeinsam mit der Dokumentübersetzung. Gescannte Seiten durchlaufen OCR, ohne Ihr separates OCR-Kontingent zu belasten, und fehlgeschlagene Umwandlungen werden automatisch erstattet. Vor dem Hochladen ist eine Anmeldung nötig.

Welche Grenzen gelten für Dateigröße und Seitenzahl?

Bis zu 100 MB und bis zu 100 Seiten pro Datei. Dokumente über 100 Seiten werden bereits beim Absenden abgelehnt statt mittendrin zu scheitern – teilen Sie sie vorher mit dem PDF-Splitter und wandeln Sie die Teile einzeln um.

Wie lange werden umgewandelte Dateien aufbewahrt?

Umwandlungsverlauf und Download-Links bleiben 24 Stunden verfügbar, danach werden die Dateien vom Server gelöscht. Laden Sie in diesem Zeitraum herunter, was Sie behalten möchten.

Verwandte Artikel