PDF转Markdown怎么转:直接给结论
把 PDF 转成 Markdown,要用会做版面分析的转换工具、而不是单纯抽文字:上传 PDF,先选好文档的识别语言,转换完成后得到一个 .zip,里面是一个 .md 文件加一个 images/ 图片文件夹。标题层级、列表、表格、代码块、LaTeX 公式都会变成对应的 Markdown 语法;页眉页脚、页码、分栏这些「版面装饰」会被直接丢掉。
大多数人踩坑不是踩在工具上,是踩在预期上。PDF 记录的是墨水落在纸的哪个位置,Markdown 记录的是这段内容是什么。两者之间不是格式转换,是重建——有些东西是真的转不过去的。

为什么「直接复制 PDF 里的文字」不行
从 PDF 里复制文字粘进 .md,结果一定是乱的。这跟你用什么工具无关,跟 PDF 这个格式本身有关:PDF 里根本没有「标题」「段落」「表格」这些概念。
一页 PDF 本质是一串绘图指令——把这个字符画在这个坐标、从这里画一条线到那里。你眼里的「小节标题」,在文件里只是一段恰好更大更粗的文字。你眼里的表格,只是一堆恰好对齐的文字块,有时旁边画了线,有时连线都没有。
所以转换工具必须从几何位置反推结构。各家工具的差距全在这一步,这也解释了为什么同一个工具处理干净的报告很漂亮、处理期刊论文就一塌糊涂。
四个推断难题,按难度排序
- 阅读顺序。 双栏排版的论文,粗暴抽取会横着读、把左右两栏毫不相干的两句话交错拼在一起。正确做法是先识别出分栏,再逐栏从上往下读。
- 标题层级。 工具得判断出「16pt 加粗」是
##、「13pt 加粗」是###——而且只能靠这一篇文档内部的相对字号来判断,因为没有绝对标准。 - 表格。 有框线的表格相对好办。没有框线、纯靠对齐撑起来的表格,只能从空白区域的几何关系里把列边界还原出来。
- 公式。 数学符号是一个个定位摆放的字形,有时用数学字体,有时干脆是一张图。要从这里还原出
\frac{a}{b},跟识别一句话完全不是一个难度。
到底哪些内容能转过来
这张表是本文最值得收藏的部分。它写的是 Markdown 这个格式本身能表达什么,也就是所有工具的能力天花板——没有哪家能突破它。
| PDF 里的元素 | 转成 Markdown 后 | 可靠程度 |
|---|---|---|
| 小节标题 | ## / ### 层级 | 排版规范的文档很稳 |
| 正文段落 | 普通段落 | 稳 |
| 有序 / 无序列表 | - 和 1. 列表 | 稳 |
| 代码块 | 围栏代码块 | 代码用等宽字体排的话很稳 |
| 有框线的表格 | GFM 管道表格 | 较好 |
| 无框线表格 | GFM 管道表格 | 一般,列边界靠对齐推断 |
| LaTeX 公式 | $...$ / $$...$$ | 行内和行间公式较好,多行对齐环境偏弱 |
| 插图、图表 | 抽到 images/,正文用相对路径引用 | 抽取很稳,但图表变成位图后不再是数据 |
| 脚注 | 一般被拍平到引用位置附近的正文里 | 一般 |
| 页眉 / 页脚 / 页码 | 丢弃 | 有意为之,属于版面装饰不是内容 |
| 分栏排版 | 拍平成单栏 | 有意为之,Markdown 没有分栏 |
| 字体、颜色、精确间距 | 丢失 | Markdown 根本没有样式层 |
最后三行标「丢弃」和「丢失」是故意的。如果你这份文档的意思依赖颜色标注或者双栏版式,那 Markdown 就是错的目标格式,换任何工具都救不了。这种情况该转 .docx,见PDF转Word。
为什么下载下来是 zip 而不是一个 md 文件
Markdown 文件装不下图片,它只能指向图片。所以但凡原文有插图,一次诚实的 PDF 转 Markdown 就必须产出至少两样东西:文本文件,和它引用的那些图。
Belin Doc 的 PDF转Markdown工具给的是一个 .zip,里面 .md 和 images/ 文件夹并排放着,正文里的相对路径已经写好了。解压到你的知识库或仓库里,图片直接就能显示,不用手动重新挂一遍。
这件事比听起来重要。PDF 转 Markdown 工作流里最常见的抱怨不是文字转得差,是挪了下文件之后 40 个图片链接全断了。导出时保住目录结构,就是解法。
扫描件:转之前先把识别语言选对
如果你的 PDF 是扫描件——拍的书页、老合同、任何没有文字层的东西——那里面压根没有文字可抽,必须先靠 OCR 认出来。而 OCR 的准确率高度依赖于你有没有告诉它该按哪种文字来认。
Belin Doc 把这个选择直接交给用户,而不是靠猜。转换器提供 16 种语言与文字体系选项,包括简体中文(另有一个精度更高的服务端模型)、繁体中文、英语、日语、韩语、泰语、希腊语、泰米尔语、泰卢固语、卡纳达语,以及拉丁、阿拉伯、西里尔、东斯拉夫、天城文这几种按文字体系划分的选项。
两个实操要点:
- 上传前就选好,不要转完再改。 语言是跟着转换任务一起提交的,改了只能重转一次。
- 混合欧洲语言选文字体系那档。 一份法语德语西班牙语混排的文档,选
latin通常比选其中任何单一语言效果好。
不确定自己的 PDF 是不是扫描件,可以看什么是双层PDF,里面讲了几秒钟判断的方法,以及为什么有些「文字版」PDF 其实是图片。
什么时候不该转 Markdown
把这件事说清楚,比列一堆功能有用。
该转的场景:内容要进笔记系统(Obsidian、Notion、Logseq)、要喂给 RAG 或向量化流水线、文档要进 Git 做版本管理、或者你想要一份二十年后还能打开的纯文本。
不该转的场景:版式本身就是内容的时候。条款编号和缩进带法律效力的合同、表单、发票、工程图纸、幻灯片,以及任何你需要以「排好版、能直接打印」的状态交回去的东西——拍平之后都会丢掉要紧的部分。
还要再想想的场景:文档主体是带合并单元格的表格。Markdown 表格根本不支持合并单元格,工具要么把合并拆开、要么把值重复填一遍,两种都不是原文的意思。
如果是长篇正文、你的目的是「读」而不是「改」,EPUB 通常是更合适的目标——它能随屏幕重排,同时保住章节结构。这个取舍见PDF转EPUB。
PDF转Markdown操作步骤
第一步:先选文档语言
打开 PDF转Markdown工具,上传之前先把语言选择器调成你文档的语言。对有真实文字层的电子版 PDF 这一步影响不大;对扫描件,它是决定成品质量的最大单一因素。
第二步:上传并开始转换
单个文件上限 100 MB、100 页。需要先登录 Belin Doc 账号——转换记录和下载链接是挂在账号上的。转换按 1 页 1 个翻译额度计费,优先从每月免费额度里扣:注册后每月有 500 页免费额度,和文档翻译共用同一份余额。转换失败会自动退还额度。
第三步:下载 zip 解压进你的知识库
页数多的和扫描件会慢一些,因为每页都要单独分析。可以直接关掉页面——转换记录会在列表里保留 24 小时。下载 .zip,把 .md 和 images/ 文件夹一起解压到笔记库或仓库里,图片链接自己就通了。
常见问题(FAQ)
转出来的 Markdown 里有图片吗?
有。图片会被抽取到 images/ 文件夹,正文里用相对路径引用——这也是为什么下载的是 .zip 而不是一个光秃秃的 .md。挪动文件时把文件夹和 md 一起挪,链接就不会断。
双栏排版的论文,阅读顺序能对吗?
分栏是靠版面分析识别的,不是粗暴抽文字,所以双栏论文会逐栏读、不会横着串行。最难的是那种分栏里还插着浮动图表和边注的密集版面——校对时优先看图表前后的段落衔接。
数学公式能转成可编辑的 LaTeX 吗?
行内和行间公式会转成用 $ 与 $$ 包裹的 LaTeX,在 Obsidian、Typora 和大多数 Markdown 编辑器里能正常渲染。多行对齐环境和手工搭的矩阵是最弱的一块,建议人工核一遍。
PDF转Markdown要花多少钱?
按 1 页 1 个翻译额度计费,优先从免费额度里扣——注册后每月 500 页免费额度,与文档翻译共用同一份余额。扫描件走 OCR 但不额外消耗单独的 OCR 额度,转换失败自动退还。上传前需要先登录。
文件大小和页数有什么限制?
单文件不超过 100 MB、不超过 100 页。超过 100 页会在提交时就被拦下,不会跑到一半才失败——可以先用 PDF拆分切开再分别转换。
转好的文件能保存多久?
转换记录和下载链接保留 24 小时,之后文件会从服务器删除。要留的内容请在这个窗口内下载。

