Belin Doc IconBelin Doc

Convertir un PDF en Markdown : ce que deviennent titres et tableaux

BelinDoc Team2026/08/22

Guide pratique pour convertir un PDF en Markdown et l'importer dans Obsidian, Notion, Logseq ou une chaîne RAG. Ce que deviennent titres, tableaux, formules et images dans le .md, pourquoi l'ordre de lecture se casse sur les articles à deux colonnes, quelle langue de reconnaissance choisir pour un scan, et quand Markdown n'est pas le bon format cible.

Convertir un PDF en Markdown : la réponse courte

Utilisez un outil qui procède à une analyse de mise en page plutôt qu'à une simple extraction de texte : déposez le PDF, choisissez la langue du document pour que l'OCR le lise correctement, puis téléchargez un .zip contenant un fichier .md et un dossier images/. Les niveaux de titre, les listes, les tableaux, les blocs de code et les formules LaTeX deviennent la syntaxe Markdown correspondante ; les ornements de page — en-têtes, pieds de page, numéros, ruptures de colonne — sont écartés.

Ce qui piège la plupart des gens n'est pas l'outil mais l'attente. Un PDF enregistre où l'encre se pose sur une page. Markdown enregistre ce que le contenu signifie. Entre les deux il n'y a pas un changement de format mais une reconstruction, et certaines choses ne peuvent réellement pas suivre.

Une page PDF densément composée se décompose en Markdown structuré — titres, listes, tableau en pipes et bloc de code — tandis que les figures sont extraites dans un dossier séparé


Pourquoi « copier le texte du PDF » ne marche pas

Copier le texte d'un PDF pour le coller dans un .md échoue toujours, et la raison n'a rien à voir avec l'outil employé : un PDF ne connaît ni titre, ni paragraphe, ni tableau.

Une page PDF est une liste d'instructions de dessin — place ce glyphe à cette coordonnée, trace une ligne d'ici à là. Ce que vous lisez comme un « titre de section » n'est qu'un texte qui se trouve être plus grand et plus gras. Ce qui ressemble à un tableau n'est qu'un ensemble de blocs de texte qui se trouvent alignés, parfois avec des lignes tracées à proximité, parfois sans.

L'outil doit donc déduire la structure à partir de la géométrie. C'est précisément là que se joue la différence de qualité entre convertisseurs, et c'est pourquoi le même outil réussit parfaitement un rapport propre et massacre un article de revue.

Quatre problèmes de déduction, du plus simple au plus difficile

  1. L'ordre de lecture. Sur un article à deux colonnes, une extraction naïve lit en travers des deux colonnes et entrelace deux phrases sans rapport. Il faut détecter la séparation des colonnes et lire chacune de haut en bas.
  2. La hiérarchie des titres. L'outil doit décider que du 16 pt gras est un ## et du 13 pt gras un ###, en s'appuyant uniquement sur les tailles relatives à l'intérieur de ce document, faute d'échelle absolue.
  3. Les tableaux. Un tableau à filets est relativement simple. Un tableau sans filets, tenu par le seul alignement, doit être reconstitué à partir de la géométrie des blancs.
  4. Les formules. La notation mathématique est un ensemble de glyphes positionnés, parfois dans une police mathématique, parfois sous forme d'image. En tirer \frac{a}{b} relève d'une tout autre difficulté que lire une phrase.

Ce qui survit réellement à la conversion

Ce tableau est la partie de l'article à garder sous la main. Il décrit ce que Markdown est capable d'exprimer, c'est-à-dire le plafond réel qu'aucun outil ne peut dépasser.

Élément dans le PDFDans la sortie MarkdownFiabilité
Titres de sectionNiveaux ## / ###Élevée si la typographie est cohérente
Paragraphes du corpsParagraphes simplesÉlevée
Listes à puces / numérotéesListes - et 1.Élevée
Blocs de codeBlocs délimitésÉlevée si le code est en police à chasse fixe
Tableaux à filetsTableaux GFM en pipesBonne
Tableaux sans filetsTableaux GFM en pipesMoyenne — les limites de colonnes sont déduites de l'alignement
Formules LaTeX$...$ / $$...$$Bonne en ligne et en display, plus faible sur les environnements alignés multilignes
Figures et graphiquesExtraits vers images/, référencés en chemin relatifExtraction fiable, mais devenu bitmap le graphique n'est plus une donnée
Notes de bas de pageGénéralement aplaties dans le corps, près de l'appelMoyenne
En-têtes, pieds de page, numérosÉcartésVolontaire : ornement de page, pas contenu
Mise en page multicolonneAplatie en une colonneVolontaire : Markdown ignore les colonnes
Polices, couleurs, espacements exactsPerdusMarkdown n'a aucune couche de style

Trois de ces lignes portent volontairement la mention « écartés » ou « perdus ». Si le sens de votre document dépend d'un code couleur ou d'une composition à deux colonnes, Markdown est la mauvaise cible et aucun outil n'y remédiera. Convertissez plutôt en .docx — voir Convertir un PDF en Word.

Pourquoi le téléchargement est un .zip et non un .md

Un fichier Markdown ne peut pas contenir d'image, il peut seulement pointer vers elle. Toute conversion honnête d'un document illustré doit donc produire au moins deux choses : le fichier texte et les images auxquelles il renvoie.

L'outil PDF vers Markdown de Belin Doc renvoie un .zip contenant le .md à côté d'un dossier images/, les chemins relatifs étant déjà inscrits dans le Markdown. Décompressez-le dans votre coffre de notes ou votre dépôt et les images s'affichent, sans avoir à recréer les liens.

C'est plus important qu'il n'y paraît. La plainte la plus fréquente à propos des flux PDF vers Markdown ne concerne pas la qualité du texte, mais quarante liens d'images cassés après avoir déplacé des fichiers. Préserver l'arborescence à l'export est la solution.

PDF scannés : choisir la langue avant de convertir

Si votre PDF est un scan — page de livre photographiée, vieux contrat, tout fichier sans couche de texte —, il n'y a aucun texte à extraire : il faut d'abord le lire par OCR. Or la précision de l'OCR dépend fortement de l'écriture et de la langue qu'on lui indique.

Belin Doc vous laisse ce choix explicitement plutôt que de le deviner. Le convertisseur propose 16 options de langue et d'écriture : chinois simplifié (avec un modèle serveur distinct plus précis), chinois traditionnel, anglais, japonais, coréen, thaï, grec, tamoul, télougou et kannada, ainsi que des options au niveau de l'écriture pour le latin, l'arabe, le cyrillique, le slave oriental et la devanagari.

Deux remarques pratiques :

  • Choisissez avant le téléversement, pas après. La langue est envoyée avec la tâche de conversion ; la modifier impose de reconvertir.
  • Pour un mélange de langues européennes, choisissez l'écriture. Sur un document mêlant français, allemand et espagnol, l'option latin donne en général de meilleurs résultats que n'importe quelle langue prise isolément.

Si vous ignorez si votre PDF est un scan, notre article sur les PDF à double couche explique comment le vérifier en quelques secondes, et pourquoi certains PDF « texte » sont en réalité des images.

Quand Markdown est la mauvaise cible

Être honnête là-dessus rend plus service qu'une liste de fonctionnalités.

Markdown convient lorsque vous transférez du contenu vers un système de notes (Obsidian, Notion, Logseq), alimentez une chaîne RAG ou d'embeddings, placez de la documentation sous gestion de versions, ou souhaitez du texte brut encore ouvrable dans vingt ans.

Markdown ne convient pas lorsque la mise en page est le contenu : contrats où la numérotation des clauses et les retraits ont une portée juridique, formulaires, factures, plans techniques, présentations, et tout ce que vous devez rendre à quelqu'un dans un état composé et imprimable — tout cela perd quelque chose d'essentiel à l'aplatissement.

Réfléchissez-y à deux fois si votre document est surtout constitué de tableaux à cellules fusionnées. Les tableaux Markdown ne gèrent pas du tout la fusion de cellules : l'outil scindera la fusion ou répétera la valeur, et ni l'un ni l'autre ne correspond au sens de l'original.

Pour un texte long que vous comptez lire plutôt qu'éditer, l'EPUB est en général une meilleure cible : il s'adapte à votre écran tout en conservant la structure des chapitres. Cet arbitrage est traité dans Convertir un PDF en EPUB.

Convertir un PDF en Markdown, étape par étape

Étape 1 : choisir la langue du document

Ouvrez l'outil PDF vers Markdown et réglez le sélecteur de langue avant de téléverser. Pour un PDF natif doté d'une vraie couche de texte, l'effet est mineur ; pour un scan, c'est le facteur qui pèse le plus sur la qualité.

Étape 2 : téléverser et lancer la conversion

Déposez un fichier d'au plus 100 Mo et 100 pages. Une connexion au compte est nécessaire, l'historique et les liens de téléchargement y étant rattachés. La conversion coûte 1 crédit de traduction par page, prélevé d'abord sur le quota mensuel gratuit — 500 pages offertes par mois après inscription, sur le même solde que la traduction de documents. En cas d'échec, les crédits sont restitués automatiquement.

Étape 3 : télécharger le zip et le décompresser dans votre coffre

Les documents longs et les scans prennent plus de temps, chaque page étant analysée séparément. Vous pouvez fermer l'onglet : les conversions restent listées 24 heures. Téléchargez le .zip et décompressez ensemble le .md et le dossier images/ dans votre coffre de notes ou votre dépôt ; les liens d'images se résolvent alors d'eux-mêmes.

Questions fréquentes (FAQ)

La sortie Markdown contient-elle les images du PDF ?

Oui. Les images sont extraites dans un dossier images/ et référencées depuis le Markdown par des chemins relatifs, ce qui explique que le téléchargement soit un .zip et non un simple .md. Déplacez le dossier et le fichier ensemble et les liens restent intacts.

L'ordre de lecture est-il correct sur un article universitaire à deux colonnes ?

La détection des colonnes repose sur l'analyse de mise en page et non sur une extraction brute : les articles à deux colonnes sont donc lus colonne par colonne et non en travers de la page. Le cas le plus difficile reste les pages denses mêlant colonnes, figures flottantes et notes marginales — à la relecture, contrôlez d'abord les enchaînements de paragraphes autour des figures.

Les formules mathématiques deviennent-elles du LaTeX modifiable ?

Les formules en ligne et en display sont converties en LaTeX délimité par $ et $$, et s'affichent correctement dans Obsidian, Typora et la plupart des éditeurs Markdown. Les environnements alignés multilignes et les matrices construites à la main constituent le point faible : une vérification manuelle s'impose.

Combien coûte la conversion d'un PDF en Markdown ?

1 crédit de traduction par page, prélevé d'abord sur le quota mensuel gratuit — 500 pages par mois après inscription, partagé avec la traduction de documents. Les pages scannées passent par l'OCR sans consommer votre quota OCR distinct, et les conversions échouées sont remboursées automatiquement. Une connexion est requise avant le téléversement.

Quelles sont les limites de taille et de pagination ?

Jusqu'à 100 Mo et 100 pages par fichier. Les documents de plus de 100 pages sont refusés à l'envoi plutôt que d'échouer à mi-parcours : découpez-les d'abord avec l'outil de découpe PDF, puis convertissez chaque partie.

Combien de temps les fichiers convertis sont-ils conservés ?

L'historique et les liens de téléchargement restent accessibles 24 heures, après quoi les fichiers sont supprimés du serveur. Téléchargez dans ce délai ce que vous souhaitez conserver.

Articles similaires