Belin Doc IconBelin Doc

Конвертировать PDF в Markdown: что станет с заголовками и таблицами

BelinDoc Team2026/08/22

Практическое руководство по конвертации PDF в Markdown для Obsidian, Notion, Logseq и RAG-конвейеров. Во что превращаются заголовки, таблицы, формулы и изображения в .md, почему ломается порядок чтения в двухколоночных статьях, какой язык распознавания выбрать для скана и когда Markdown — неподходящий формат.

Как конвертировать PDF в Markdown: короткий ответ

Используйте инструмент, который выполняет анализ вёрстки, а не просто извлекает текст: загрузите PDF, выберите язык документа, чтобы OCR прочитал его правильно, и скачайте .zip с одним файлом .md и папкой images/. Уровни заголовков, списки, таблицы, блоки кода и формулы LaTeX превращаются в соответствующий синтаксис Markdown; служебные элементы страницы — колонтитулы, номера страниц, разрывы колонок — отбрасываются.

Большинство спотыкается не об инструмент, а об ожидания. PDF хранит, где на странице лежит краска. Markdown хранит, что этот текст означает. Между ними не смена формата, а восстановление, и кое-что действительно не переносится.

Плотно свёрстанная страница PDF распадается на структурированный Markdown — заголовки, списки, таблицу и блок кода, — а иллюстрации выносятся в отдельную папку


Почему «скопировать текст из PDF» не работает

Скопировать текст из PDF и вставить в .md — всегда получится каша, и причина не в инструменте, а в самом формате: в PDF нет понятий «заголовок», «абзац» и «таблица».

Страница PDF — это список команд рисования: помести этот глиф в такую-то координату, проведи линию отсюда сюда. То, что вы читаете как «заголовок раздела», — просто текст, который случайно крупнее и жирнее. То, что выглядит таблицей, — набор текстовых блоков, случайно выстроившихся в столбцы, иногда с линиями рядом, иногда без них.

Значит, инструмент вынужден выводить структуру из геометрии. Именно здесь и лежит разница в качестве между конвертерами, и именно поэтому один и тот же инструмент безупречно справляется с чистым отчётом и разваливает журнальную статью.

Четыре задачи вывода структуры, от простой к сложной

  1. Порядок чтения. В двухколоночной статье наивное извлечение читает поперёк обеих колонок и переплетает два не связанных между собой предложения. Правильно — определить разделение колонок и читать каждую сверху вниз.
  2. Иерархия заголовков. Инструмент должен решить, что 16 pt полужирный — это ##, а 13 pt полужирный — ###, опираясь только на относительные размеры внутри этого документа, поскольку абсолютной шкалы не существует.
  3. Таблицы. Таблица с линейками сравнительно проста. Таблицу без линеек, которая держится только на выравнивании, приходится восстанавливать исключительно по геометрии пробелов.
  4. Формулы. Математическая запись — это набор размещённых глифов, иногда в математическом шрифте, иногда вовсе картинкой. Извлечь оттуда \frac{a}{b} — задача совсем другого класса, чем прочитать предложение.

Что действительно переживает конвертацию

Эта таблица — самая полезная часть статьи. В ней описано, что способен выразить сам формат Markdown, то есть реальный потолок, который не превзойдёт ни один инструмент.

Элемент в PDFВ MarkdownНадёжность
Заголовки разделовУровни ## / ###Высокая при единообразной типографике
Абзацы основного текстаОбычные абзацыВысокая
Маркированные и нумерованные спискиСписки - и 1.Высокая
Блоки кодаОгороженные блокиВысокая, если код набран моноширинным шрифтом
Таблицы с линейкамиТаблицы GFMХорошая
Таблицы без линеекТаблицы GFMСредняя: границы колонок выводятся из выравнивания
Формулы LaTeX$...$ / $$...$$Хорошо для строчных и выключных, хуже для многострочных окружений
Иллюстрации и графикиВыносятся в images/, ссылка по относительному путиИзвлечение надёжное, но растровый график перестаёт быть данными
СноскиОбычно уплощаются в основной текст рядом со ссылкойСредняя
Колонтитулы и номера страницОтбрасываютсяНамеренно: это оформление страницы, а не содержание
Многоколоночная вёрсткаУплощается в одну колонкуНамеренно: в Markdown нет колонок
Шрифты, цвета, точные отступыТеряютсяВ Markdown вообще нет слоя оформления

Три строки помечены «отбрасываются» и «теряются» намеренно. Если смысл вашего документа держится на цветовом кодировании или двухколоночной вёрстке, Markdown — неверная цель, и никакой инструмент этого не исправит. В таком случае конвертируйте в .docx — см. Конвертировать PDF в Word.

Почему скачивается .zip, а не .md

Файл Markdown не может содержать изображение — он может только ссылаться на него. Поэтому любая честная конвертация иллюстрированного документа обязана выдать минимум две вещи: текстовый файл и изображения, на которые он ссылается.

Инструмент PDF в Markdown от Belin Doc отдаёт .zip, где рядом с .md лежит папка images/, а относительные пути уже прописаны в тексте. Распакуйте архив в своё хранилище заметок или репозиторий — изображения отобразятся сразу, вручную переподключать ничего не нужно.

Это важнее, чем кажется. Самая частая жалоба на процессы PDF → Markdown вовсе не о качестве текста, а о сорока битых ссылках на картинки после того, как файлы переложили. Сохранение структуры папок при экспорте и есть решение.

Сканы: выберите язык распознавания до конвертации

Если ваш PDF — скан (сфотографированная страница книги, старый договор, любой файл без текстового слоя), извлекать нечего: сначала текст нужно прочитать через OCR. А точность OCR сильно зависит от того, подсказали ли вы, какую письменность и какой язык ожидать.

Belin Doc отдаёт этот выбор пользователю, а не угадывает. Конвертер предлагает 16 вариантов языка и письменности: упрощённый китайский (с отдельной, более точной серверной моделью), традиционный китайский, английский, японский, корейский, тайский, греческий, тамильский, телугу и каннада, а также варианты уровня письменности — латиница, арабица, кириллица, восточнославянская и деванагари.

Два практических замечания:

  • Выбирайте до загрузки, а не после. Язык отправляется вместе с задачей; чтобы изменить его, придётся конвертировать заново.
  • Для смеси европейских языков выбирайте письменность. В документе, где перемешаны французский, немецкий и испанский, вариант latin обычно даёт лучший результат, чем любой отдельный язык.

Если вы не уверены, скан ли ваш PDF, в материале о двухслойных PDF описано, как это определить за несколько секунд и почему часть «текстовых» PDF на деле является изображениями.

Когда Markdown — неподходящая цель

Честно сказать об этом полезнее, чем перечислять возможности.

Markdown подходит, когда вы переносите материалы в систему заметок (Obsidian, Notion, Logseq), подаёте документы в RAG или конвейер эмбеддингов, кладёте документацию под контроль версий или просто хотите простой текст, который откроется и через двадцать лет.

Markdown не подходит, когда вёрстка и есть содержание: договоры, где нумерация пунктов и отступы имеют юридическую силу, бланки, счета, технические чертежи, презентации и всё, что нужно вернуть человеку в свёрстанном, готовом к печати виде — при уплощении всё это теряет нечто существенное.

Стоит подумать ещё раз, если основа документа — таблицы с объединёнными ячейками. Таблицы Markdown вообще не поддерживают объединение ячеек: инструмент либо разобьёт объединение, либо продублирует значение, и ни то ни другое не соответствует оригиналу.

Для длинного текста, который вы собираетесь читать, а не править, лучшая цель обычно EPUB: он подстраивается под экран и сохраняет структуру глав. Этот выбор разобран в Конвертировать PDF в EPUB.

Как конвертировать PDF в Markdown: пошагово

Шаг 1: выберите язык документа

Откройте инструмент PDF в Markdown и до загрузки установите в селекторе язык вашего документа. Для электронных PDF с настоящим текстовым слоем это почти не влияет на результат; для сканов это главный фактор качества.

Шаг 2: загрузите PDF и запустите конвертацию

Ограничение на файл — 100 МБ и 100 страниц. Нужен вход в аккаунт Belin Doc: история конвертаций и ссылки на скачивание привязаны к нему. Конвертация стоит 1 кредит перевода за страницу и списывается сначала из месячного бесплатного лимита — 500 бесплатных страниц в месяц после регистрации, с того же баланса, что и перевод документов. При сбое кредиты возвращаются автоматически.

Шаг 3: скачайте zip и распакуйте в хранилище заметок

Длинные документы и сканы обрабатываются дольше, так как каждая страница анализируется отдельно. Вкладку можно закрыть: конвертации остаются в списке 24 часа. Скачайте .zip и распакуйте .md и папку images/ вместе в хранилище заметок или репозиторий — ссылки на изображения заработают сами.

Частые вопросы (FAQ)

Попадут ли в Markdown изображения из PDF?

Да. Изображения извлекаются в папку images/ и подключаются из Markdown относительными путями — поэтому скачивается .zip, а не голый .md. Переносите папку вместе с файлом Markdown, и ссылки останутся рабочими.

Будет ли верным порядок чтения в двухколоночной научной статье?

Колонки определяются анализом вёрстки, а не грубым извлечением текста, поэтому двухколоночные статьи читаются по колонкам, а не поперёк страницы. Самый трудный случай — плотные полосы, где колонки соседствуют с плавающими иллюстрациями и врезками; при вычитке в первую очередь проверяйте стыки абзацев вокруг иллюстраций.

Превращаются ли формулы в редактируемый LaTeX?

Строчные и выключные формулы конвертируются в LaTeX, ограниченный $ и $$, и корректно отображаются в Obsidian, Typora и большинстве редакторов Markdown. Самое слабое место — многострочные выровненные окружения и матрицы, собранные вручную; их стоит проверить глазами.

Сколько стоит конвертация PDF в Markdown?

1 кредит перевода за страницу, списывается сначала из месячного бесплатного лимита — 500 страниц в месяц после регистрации, общий баланс с переводом документов. Сканированные страницы проходят OCR, не расходуя отдельный лимит OCR, а неудачные конвертации возвращаются автоматически. Перед загрузкой нужно войти в аккаунт.

Какие ограничения по размеру файла и числу страниц?

До 100 МБ и до 100 страниц на файл. Документы длиннее 100 страниц отклоняются при отправке, а не падают на середине: сначала разделите их инструментом разделения PDF и конвертируйте части по отдельности.

Как долго хранятся сконвертированные файлы?

История конвертаций и ссылки на скачивание доступны 24 часа, после чего файлы удаляются с сервера. Скачайте нужное в течение этого времени.

Похожие статьи