Как конвертировать PDF в Markdown: короткий ответ
Используйте инструмент, который выполняет анализ вёрстки, а не просто извлекает текст: загрузите PDF, выберите язык документа, чтобы OCR прочитал его правильно, и скачайте .zip с одним файлом .md и папкой images/. Уровни заголовков, списки, таблицы, блоки кода и формулы LaTeX превращаются в соответствующий синтаксис Markdown; служебные элементы страницы — колонтитулы, номера страниц, разрывы колонок — отбрасываются.
Большинство спотыкается не об инструмент, а об ожидания. PDF хранит, где на странице лежит краска. Markdown хранит, что этот текст означает. Между ними не смена формата, а восстановление, и кое-что действительно не переносится.

Почему «скопировать текст из PDF» не работает
Скопировать текст из PDF и вставить в .md — всегда получится каша, и причина не в инструменте, а в самом формате: в PDF нет понятий «заголовок», «абзац» и «таблица».
Страница PDF — это список команд рисования: помести этот глиф в такую-то координату, проведи линию отсюда сюда. То, что вы читаете как «заголовок раздела», — просто текст, который случайно крупнее и жирнее. То, что выглядит таблицей, — набор текстовых блоков, случайно выстроившихся в столбцы, иногда с линиями рядом, иногда без них.
Значит, инструмент вынужден выводить структуру из геометрии. Именно здесь и лежит разница в качестве между конвертерами, и именно поэтому один и тот же инструмент безупречно справляется с чистым отчётом и разваливает журнальную статью.
Четыре задачи вывода структуры, от простой к сложной
- Порядок чтения. В двухколоночной статье наивное извлечение читает поперёк обеих колонок и переплетает два не связанных между собой предложения. Правильно — определить разделение колонок и читать каждую сверху вниз.
- Иерархия заголовков. Инструмент должен решить, что 16 pt полужирный — это
##, а 13 pt полужирный —###, опираясь только на относительные размеры внутри этого документа, поскольку абсолютной шкалы не существует. - Таблицы. Таблица с линейками сравнительно проста. Таблицу без линеек, которая держится только на выравнивании, приходится восстанавливать исключительно по геометрии пробелов.
- Формулы. Математическая запись — это набор размещённых глифов, иногда в математическом шрифте, иногда вовсе картинкой. Извлечь оттуда
\frac{a}{b}— задача совсем другого класса, чем прочитать предложение.
Что действительно переживает конвертацию
Эта таблица — самая полезная часть статьи. В ней описано, что способен выразить сам формат Markdown, то есть реальный потолок, который не превзойдёт ни один инструмент.
| Элемент в PDF | В Markdown | Надёжность |
|---|---|---|
| Заголовки разделов | Уровни ## / ### | Высокая при единообразной типографике |
| Абзацы основного текста | Обычные абзацы | Высокая |
| Маркированные и нумерованные списки | Списки - и 1. | Высокая |
| Блоки кода | Огороженные блоки | Высокая, если код набран моноширинным шрифтом |
| Таблицы с линейками | Таблицы GFM | Хорошая |
| Таблицы без линеек | Таблицы GFM | Средняя: границы колонок выводятся из выравнивания |
| Формулы LaTeX | $...$ / $$...$$ | Хорошо для строчных и выключных, хуже для многострочных окружений |
| Иллюстрации и графики | Выносятся в images/, ссылка по относительному пути | Извлечение надёжное, но растровый график перестаёт быть данными |
| Сноски | Обычно уплощаются в основной текст рядом со ссылкой | Средняя |
| Колонтитулы и номера страниц | Отбрасываются | Намеренно: это оформление страницы, а не содержание |
| Многоколоночная вёрстка | Уплощается в одну колонку | Намеренно: в Markdown нет колонок |
| Шрифты, цвета, точные отступы | Теряются | В Markdown вообще нет слоя оформления |
Три строки помечены «отбрасываются» и «теряются» намеренно. Если смысл вашего документа держится на цветовом кодировании или двухколоночной вёрстке, Markdown — неверная цель, и никакой инструмент этого не исправит. В таком случае конвертируйте в .docx — см. Конвертировать PDF в Word.
Почему скачивается .zip, а не .md
Файл Markdown не может содержать изображение — он может только ссылаться на него. Поэтому любая честная конвертация иллюстрированного документа обязана выдать минимум две вещи: текстовый файл и изображения, на которые он ссылается.
Инструмент PDF в Markdown от Belin Doc отдаёт .zip, где рядом с .md лежит папка images/, а относительные пути уже прописаны в тексте. Распакуйте архив в своё хранилище заметок или репозиторий — изображения отобразятся сразу, вручную переподключать ничего не нужно.
Это важнее, чем кажется. Самая частая жалоба на процессы PDF → Markdown вовсе не о качестве текста, а о сорока битых ссылках на картинки после того, как файлы переложили. Сохранение структуры папок при экспорте и есть решение.
Сканы: выберите язык распознавания до конвертации
Если ваш PDF — скан (сфотографированная страница книги, старый договор, любой файл без текстового слоя), извлекать нечего: сначала текст нужно прочитать через OCR. А точность OCR сильно зависит от того, подсказали ли вы, какую письменность и какой язык ожидать.
Belin Doc отдаёт этот выбор пользователю, а не угадывает. Конвертер предлагает 16 вариантов языка и письменности: упрощённый китайский (с отдельной, более точной серверной моделью), традиционный китайский, английский, японский, корейский, тайский, греческий, тамильский, телугу и каннада, а также варианты уровня письменности — латиница, арабица, кириллица, восточнославянская и деванагари.
Два практических замечания:
- Выбирайте до загрузки, а не после. Язык отправляется вместе с задачей; чтобы изменить его, придётся конвертировать заново.
- Для смеси европейских языков выбирайте письменность. В документе, где перемешаны французский, немецкий и испанский, вариант
latinобычно даёт лучший результат, чем любой отдельный язык.
Если вы не уверены, скан ли ваш PDF, в материале о двухслойных PDF описано, как это определить за несколько секунд и почему часть «текстовых» PDF на деле является изображениями.
Когда Markdown — неподходящая цель
Честно сказать об этом полезнее, чем перечислять возможности.
Markdown подходит, когда вы переносите материалы в систему заметок (Obsidian, Notion, Logseq), подаёте документы в RAG или конвейер эмбеддингов, кладёте документацию под контроль версий или просто хотите простой текст, который откроется и через двадцать лет.
Markdown не подходит, когда вёрстка и есть содержание: договоры, где нумерация пунктов и отступы имеют юридическую силу, бланки, счета, технические чертежи, презентации и всё, что нужно вернуть человеку в свёрстанном, готовом к печати виде — при уплощении всё это теряет нечто существенное.
Стоит подумать ещё раз, если основа документа — таблицы с объединёнными ячейками. Таблицы Markdown вообще не поддерживают объединение ячеек: инструмент либо разобьёт объединение, либо продублирует значение, и ни то ни другое не соответствует оригиналу.
Для длинного текста, который вы собираетесь читать, а не править, лучшая цель обычно EPUB: он подстраивается под экран и сохраняет структуру глав. Этот выбор разобран в Конвертировать PDF в EPUB.
Как конвертировать PDF в Markdown: пошагово
Шаг 1: выберите язык документа
Откройте инструмент PDF в Markdown и до загрузки установите в селекторе язык вашего документа. Для электронных PDF с настоящим текстовым слоем это почти не влияет на результат; для сканов это главный фактор качества.
Шаг 2: загрузите PDF и запустите конвертацию
Ограничение на файл — 100 МБ и 100 страниц. Нужен вход в аккаунт Belin Doc: история конвертаций и ссылки на скачивание привязаны к нему. Конвертация стоит 1 кредит перевода за страницу и списывается сначала из месячного бесплатного лимита — 500 бесплатных страниц в месяц после регистрации, с того же баланса, что и перевод документов. При сбое кредиты возвращаются автоматически.
Шаг 3: скачайте zip и распакуйте в хранилище заметок
Длинные документы и сканы обрабатываются дольше, так как каждая страница анализируется отдельно. Вкладку можно закрыть: конвертации остаются в списке 24 часа. Скачайте .zip и распакуйте .md и папку images/ вместе в хранилище заметок или репозиторий — ссылки на изображения заработают сами.
Частые вопросы (FAQ)
Попадут ли в Markdown изображения из PDF?
Да. Изображения извлекаются в папку images/ и подключаются из Markdown относительными путями — поэтому скачивается .zip, а не голый .md. Переносите папку вместе с файлом Markdown, и ссылки останутся рабочими.
Будет ли верным порядок чтения в двухколоночной научной статье?
Колонки определяются анализом вёрстки, а не грубым извлечением текста, поэтому двухколоночные статьи читаются по колонкам, а не поперёк страницы. Самый трудный случай — плотные полосы, где колонки соседствуют с плавающими иллюстрациями и врезками; при вычитке в первую очередь проверяйте стыки абзацев вокруг иллюстраций.
Превращаются ли формулы в редактируемый LaTeX?
Строчные и выключные формулы конвертируются в LaTeX, ограниченный $ и $$, и корректно отображаются в Obsidian, Typora и большинстве редакторов Markdown. Самое слабое место — многострочные выровненные окружения и матрицы, собранные вручную; их стоит проверить глазами.
Сколько стоит конвертация PDF в Markdown?
1 кредит перевода за страницу, списывается сначала из месячного бесплатного лимита — 500 страниц в месяц после регистрации, общий баланс с переводом документов. Сканированные страницы проходят OCR, не расходуя отдельный лимит OCR, а неудачные конвертации возвращаются автоматически. Перед загрузкой нужно войти в аккаунт.
Какие ограничения по размеру файла и числу страниц?
До 100 МБ и до 100 страниц на файл. Документы длиннее 100 страниц отклоняются при отправке, а не падают на середине: сначала разделите их инструментом разделения PDF и конвертируйте части по отдельности.
Как долго хранятся сконвертированные файлы?
История конвертаций и ссылки на скачивание доступны 24 часа, после чего файлы удаляются с сервера. Скачайте нужное в течение этого времени.

