Belin Doc IconBelin Doc

PDF转Markdown怎么转:标题、表格、公式各变成什么

BelinDoc Team2026/08/22

PDF转MD导入Obsidian、Notion、Logseq或喂给RAG知识库的实用指南。标题、表格、公式、图片转成Markdown后各是什么样,双栏论文的阅读顺序为什么会乱,扫描件要先选哪种识别语言,以及什么情况下Markdown根本不是合适的目标格式。

PDF转Markdown怎么转:直接给结论

把 PDF 转成 Markdown,要用会做版面分析的转换工具、而不是单纯抽文字:上传 PDF,先选好文档的识别语言,转换完成后得到一个 .zip,里面是一个 .md 文件加一个 images/ 图片文件夹。标题层级、列表、表格、代码块、LaTeX 公式都会变成对应的 Markdown 语法;页眉页脚、页码、分栏这些「版面装饰」会被直接丢掉。

大多数人踩坑不是踩在工具上,是踩在预期上。PDF 记录的是墨水落在纸的哪个位置,Markdown 记录的是这段内容是什么。两者之间不是格式转换,是重建——有些东西是真的转不过去的。

排版密集的 PDF 页面被拆解成结构化 Markdown:标题、列表、管道表格与代码块,插图另存到独立的图片文件夹


为什么「直接复制 PDF 里的文字」不行

从 PDF 里复制文字粘进 .md,结果一定是乱的。这跟你用什么工具无关,跟 PDF 这个格式本身有关:PDF 里根本没有「标题」「段落」「表格」这些概念。

一页 PDF 本质是一串绘图指令——把这个字符画在这个坐标、从这里画一条线到那里。你眼里的「小节标题」,在文件里只是一段恰好更大更粗的文字。你眼里的表格,只是一堆恰好对齐的文字块,有时旁边画了线,有时连线都没有。

所以转换工具必须从几何位置反推结构。各家工具的差距全在这一步,这也解释了为什么同一个工具处理干净的报告很漂亮、处理期刊论文就一塌糊涂。

四个推断难题,按难度排序

  1. 阅读顺序。 双栏排版的论文,粗暴抽取会横着读、把左右两栏毫不相干的两句话交错拼在一起。正确做法是先识别出分栏,再逐栏从上往下读。
  2. 标题层级。 工具得判断出「16pt 加粗」是 ##、「13pt 加粗」是 ###——而且只能靠这一篇文档内部的相对字号来判断,因为没有绝对标准。
  3. 表格。 有框线的表格相对好办。没有框线、纯靠对齐撑起来的表格,只能从空白区域的几何关系里把列边界还原出来。
  4. 公式。 数学符号是一个个定位摆放的字形,有时用数学字体,有时干脆是一张图。要从这里还原出 \frac{a}{b},跟识别一句话完全不是一个难度。

到底哪些内容能转过来

这张表是本文最值得收藏的部分。它写的是 Markdown 这个格式本身能表达什么,也就是所有工具的能力天花板——没有哪家能突破它。

PDF 里的元素转成 Markdown 后可靠程度
小节标题## / ### 层级排版规范的文档很稳
正文段落普通段落
有序 / 无序列表-1. 列表
代码块围栏代码块代码用等宽字体排的话很稳
有框线的表格GFM 管道表格较好
无框线表格GFM 管道表格一般,列边界靠对齐推断
LaTeX 公式$...$ / $$...$$行内和行间公式较好,多行对齐环境偏弱
插图、图表抽到 images/,正文用相对路径引用抽取很稳,但图表变成位图后不再是数据
脚注一般被拍平到引用位置附近的正文里一般
页眉 / 页脚 / 页码丢弃有意为之,属于版面装饰不是内容
分栏排版拍平成单栏有意为之,Markdown 没有分栏
字体、颜色、精确间距丢失Markdown 根本没有样式层

最后三行标「丢弃」和「丢失」是故意的。如果你这份文档的意思依赖颜色标注或者双栏版式,那 Markdown 就是错的目标格式,换任何工具都救不了。这种情况该转 .docx,见PDF转Word

为什么下载下来是 zip 而不是一个 md 文件

Markdown 文件装不下图片,它只能指向图片。所以但凡原文有插图,一次诚实的 PDF 转 Markdown 就必须产出至少两样东西:文本文件,和它引用的那些图。

Belin Doc 的 PDF转Markdown工具给的是一个 .zip,里面 .mdimages/ 文件夹并排放着,正文里的相对路径已经写好了。解压到你的知识库或仓库里,图片直接就能显示,不用手动重新挂一遍。

这件事比听起来重要。PDF 转 Markdown 工作流里最常见的抱怨不是文字转得差,是挪了下文件之后 40 个图片链接全断了。导出时保住目录结构,就是解法。

扫描件:转之前先把识别语言选对

如果你的 PDF 是扫描件——拍的书页、老合同、任何没有文字层的东西——那里面压根没有文字可抽,必须先靠 OCR 认出来。而 OCR 的准确率高度依赖于你有没有告诉它该按哪种文字来认

Belin Doc 把这个选择直接交给用户,而不是靠猜。转换器提供 16 种语言与文字体系选项,包括简体中文(另有一个精度更高的服务端模型)、繁体中文、英语、日语、韩语、泰语、希腊语、泰米尔语、泰卢固语、卡纳达语,以及拉丁、阿拉伯、西里尔、东斯拉夫、天城文这几种按文字体系划分的选项。

两个实操要点:

  • 上传前就选好,不要转完再改。 语言是跟着转换任务一起提交的,改了只能重转一次。
  • 混合欧洲语言选文字体系那档。 一份法语德语西班牙语混排的文档,选 latin 通常比选其中任何单一语言效果好。

不确定自己的 PDF 是不是扫描件,可以看什么是双层PDF,里面讲了几秒钟判断的方法,以及为什么有些「文字版」PDF 其实是图片。

什么时候不该转 Markdown

把这件事说清楚,比列一堆功能有用。

该转的场景:内容要进笔记系统(Obsidian、Notion、Logseq)、要喂给 RAG 或向量化流水线、文档要进 Git 做版本管理、或者你想要一份二十年后还能打开的纯文本。

不该转的场景:版式本身就是内容的时候。条款编号和缩进带法律效力的合同、表单、发票、工程图纸、幻灯片,以及任何你需要以「排好版、能直接打印」的状态交回去的东西——拍平之后都会丢掉要紧的部分。

还要再想想的场景:文档主体是带合并单元格的表格。Markdown 表格根本不支持合并单元格,工具要么把合并拆开、要么把值重复填一遍,两种都不是原文的意思。

如果是长篇正文、你的目的是「读」而不是「改」,EPUB 通常是更合适的目标——它能随屏幕重排,同时保住章节结构。这个取舍见PDF转EPUB

PDF转Markdown操作步骤

第一步:先选文档语言

打开 PDF转Markdown工具,上传之前先把语言选择器调成你文档的语言。对有真实文字层的电子版 PDF 这一步影响不大;对扫描件,它是决定成品质量的最大单一因素。

第二步:上传并开始转换

单个文件上限 100 MB、100 页。需要先登录 Belin Doc 账号——转换记录和下载链接是挂在账号上的。转换按 1 页 1 个翻译额度计费,优先从每月免费额度里扣:注册后每月有 500 页免费额度,和文档翻译共用同一份余额。转换失败会自动退还额度。

第三步:下载 zip 解压进你的知识库

页数多的和扫描件会慢一些,因为每页都要单独分析。可以直接关掉页面——转换记录会在列表里保留 24 小时。下载 .zip,把 .mdimages/ 文件夹一起解压到笔记库或仓库里,图片链接自己就通了。

常见问题(FAQ)

转出来的 Markdown 里有图片吗?

有。图片会被抽取到 images/ 文件夹,正文里用相对路径引用——这也是为什么下载的是 .zip 而不是一个光秃秃的 .md。挪动文件时把文件夹和 md 一起挪,链接就不会断。

双栏排版的论文,阅读顺序能对吗?

分栏是靠版面分析识别的,不是粗暴抽文字,所以双栏论文会逐栏读、不会横着串行。最难的是那种分栏里还插着浮动图表和边注的密集版面——校对时优先看图表前后的段落衔接。

数学公式能转成可编辑的 LaTeX 吗?

行内和行间公式会转成用 $$$ 包裹的 LaTeX,在 Obsidian、Typora 和大多数 Markdown 编辑器里能正常渲染。多行对齐环境和手工搭的矩阵是最弱的一块,建议人工核一遍。

PDF转Markdown要花多少钱?

按 1 页 1 个翻译额度计费,优先从免费额度里扣——注册后每月 500 页免费额度,与文档翻译共用同一份余额。扫描件走 OCR 但额外消耗单独的 OCR 额度,转换失败自动退还。上传前需要先登录。

文件大小和页数有什么限制?

单文件不超过 100 MB、不超过 100 页。超过 100 页会在提交时就被拦下,不会跑到一半才失败——可以先用 PDF拆分切开再分别转换。

转好的文件能保存多久?

转换记录和下载链接保留 24 小时,之后文件会从服务器删除。要留的内容请在这个窗口内下载。

推荐阅读