PDF轉Markdown怎麼轉:直接給結論
把 PDF 轉成 Markdown,要用會做版面分析的轉換工具、而不是單純抽文字:上傳 PDF,先選好檔案的辨識語言,轉換完成後得到一個 .zip,裡面是一個 .md 檔案加一個 images/ 圖片資料夾。標題層級、清單、表格、程式碼區塊、LaTeX 公式都會變成對應的 Markdown 語法;頁首頁尾、頁碼、分欄這些「版面裝飾」會被直接丟掉。
大多數人踩坑不是踩在工具上,是踩在預期上。PDF 記錄的是墨水落在紙的哪個位置,Markdown 記錄的是這段內容是什麼。兩者之間不是格式轉換,是重建——有些東西是真的轉不過去的。

為什麼「直接複製 PDF 裡的文字」不行
從 PDF 裡複製文字貼進 .md,結果一定是亂的。這跟你用什麼工具無關,跟 PDF 這個格式本身有關:PDF 裡根本沒有「標題」「段落」「表格」這些概念。
一頁 PDF 本質是一串繪圖指令——把這個字元畫在這個座標、從這裡畫一條線到那裡。你眼裡的「小節標題」,在檔案裡只是一段恰好更大更粗的文字。你眼裡的表格,只是一堆恰好對齊的文字區塊,有時旁邊畫了線,有時連線都沒有。
所以轉換工具必須從幾何位置反推結構。各家工具的差距全在這一步,這也解釋了為什麼同一個工具處理乾淨的報告很漂亮、處理期刊論文就一塌糊塗。
四個推斷難題,按難度排序
- 閱讀順序。 雙欄排版的論文,粗暴抽取會橫著讀、把左右兩欄毫不相干的兩句話交錯拼在一起。正確做法是先辨識出分欄,再逐欄從上往下讀。
- 標題層級。 工具得判斷出「16pt 粗體」是
##、「13pt 粗體」是###——而且只能靠這一份檔案內部的相對字級來判斷,因為沒有絕對標準。 - 表格。 有框線的表格相對好辦。沒有框線、純靠對齊撐起來的表格,只能從空白區域的幾何關係裡把欄邊界還原出來。
- 公式。 數學符號是一個個定位擺放的字形,有時用數學字型,有時乾脆是一張圖。要從這裡還原出
\frac{a}{b},跟辨識一句話完全不是一個難度。
到底哪些內容能轉過來
這張表是本文最值得收藏的部分。它寫的是 Markdown 這個格式本身能表達什麼,也就是所有工具的能力天花板——沒有哪家能突破它。
| PDF 裡的元素 | 轉成 Markdown 後 | 可靠程度 |
|---|---|---|
| 小節標題 | ## / ### 層級 | 排版規範的檔案很穩 |
| 內文段落 | 普通段落 | 穩 |
| 有序 / 無序清單 | - 和 1. 清單 | 穩 |
| 程式碼區塊 | 圍籬程式碼區塊 | 程式碼用等寬字型排的話很穩 |
| 有框線的表格 | GFM 管線表格 | 較好 |
| 無框線表格 | GFM 管線表格 | 一般,欄邊界靠對齊推斷 |
| LaTeX 公式 | $...$ / $$...$$ | 行內和行間公式較好,多行對齊環境偏弱 |
| 插圖、圖表 | 抽到 images/,內文用相對路徑引用 | 抽取很穩,但圖表變成點陣圖後不再是資料 |
| 註腳 | 一般被壓平到引用位置附近的內文裡 | 一般 |
| 頁首 / 頁尾 / 頁碼 | 丟棄 | 有意為之,屬於版面裝飾不是內容 |
| 分欄排版 | 壓平成單欄 | 有意為之,Markdown 沒有分欄 |
| 字型、顏色、精確間距 | 遺失 | Markdown 根本沒有樣式層 |
最後三行標「丟棄」和「遺失」是故意的。如果你這份檔案的意思依賴顏色標註或者雙欄版式,那 Markdown 就是錯的目標格式,換任何工具都救不了。這種情況該轉 .docx,見PDF轉Word。
為什麼下載下來是 zip 而不是一個 md 檔案
Markdown 檔案裝不下圖片,它只能指向圖片。所以但凡原檔有插圖,一次誠實的 PDF 轉 Markdown 就必須產出至少兩樣東西:文字檔,和它引用的那些圖。
Belin Doc 的 PDF轉Markdown工具給的是一個 .zip,裡面 .md 和 images/ 資料夾並排放著,內文裡的相對路徑已經寫好了。解壓縮到你的知識庫或儲存庫裡,圖片直接就能顯示,不用手動重新掛一遍。
這件事比聽起來重要。PDF 轉 Markdown 工作流裡最常見的抱怨不是文字轉得差,是挪了一下檔案之後 40 個圖片連結全斷了。匯出時保住目錄結構,就是解法。
掃描檔:轉之前先把辨識語言選對
如果你的 PDF 是掃描檔——拍的書頁、舊合約、任何沒有文字層的東西——那裡面根本沒有文字可抽,必須先靠 OCR 認出來。而 OCR 的準確率高度依賴於你有沒有告訴它該按哪種文字來認。
Belin Doc 把這個選擇直接交給使用者,而不是靠猜。轉換器提供 16 種語言與文字體系選項,包括簡體中文(另有一個精度更高的伺服器端模型)、繁體中文、英語、日語、韓語、泰語、希臘語、坦米爾語、泰盧固語、坎那達語,以及拉丁、阿拉伯、西里爾、東斯拉夫、天城文這幾種按文字體系劃分的選項。
兩個實務要點:
- 上傳前就選好,不要轉完再改。 語言是跟著轉換任務一起送出的,改了只能重轉一次。
- 混合歐洲語言選文字體系那一檔。 一份法語德語西班牙語混排的檔案,選
latin通常比選其中任何單一語言效果好。
不確定自己的 PDF 是不是掃描檔,可以看什麼是雙層 PDF,裡面講了幾秒鐘判斷的方法,以及為什麼有些「文字版」PDF 其實是圖片。
什麼時候不該轉 Markdown
把這件事說清楚,比列一堆功能有用。
該轉的場景:內容要進筆記系統(Obsidian、Notion、Logseq)、要餵給 RAG 或向量化流水線、文件要進 Git 做版本管理、或者你想要一份二十年後還能開啟的純文字。
不該轉的場景:版式本身就是內容的時候。條款編號和縮排帶法律效力的合約、表單、發票、工程圖面、簡報,以及任何你需要以「排好版、能直接列印」的狀態交回去的東西——壓平之後都會丟掉要緊的部分。
還要再想想的場景:檔案主體是帶合併儲存格的表格。Markdown 表格根本不支援合併儲存格,工具要麼把合併拆開、要麼把值重複填一遍,兩種都不是原檔的意思。
如果是長篇內文、你的目的是「讀」而不是「改」,EPUB 通常是更合適的目標——它能隨螢幕重排,同時保住章節結構。這個取捨見PDF轉EPUB。
PDF轉Markdown操作步驟
第一步:先選檔案語言
打開 PDF轉Markdown工具,上傳之前先把語言選擇器調成你檔案的語言。對有真實文字層的電子檔這一步影響不大;對掃描檔,它是決定成品品質的最大單一因素。
第二步:上傳並開始轉換
單一檔案上限 100 MB、100 頁。需要先登入 Belin Doc 帳號——轉換紀錄和下載連結是掛在帳號上的。轉換按 1 頁 1 個翻譯額度計費,優先從每月免費額度裡扣:註冊後每月有 500 頁免費額度,和文件翻譯共用同一份餘額。轉換失敗會自動退還額度。
第三步:下載 zip 解壓縮進你的知識庫
頁數多的和掃描檔會慢一些,因為每頁都要單獨分析。可以直接關掉頁面——轉換紀錄會在清單裡保留 24 小時。下載 .zip,把 .md 和 images/ 資料夾一起解壓縮到筆記庫或儲存庫裡,圖片連結自己就通了。
常見問題(FAQ)
轉出來的 Markdown 裡有圖片嗎?
有。圖片會被抽取到 images/ 資料夾,內文裡用相對路徑引用——這也是為什麼下載的是 .zip 而不是一個光禿禿的 .md。挪動檔案時把資料夾和 md 一起挪,連結就不會斷。
雙欄排版的論文,閱讀順序能對嗎?
分欄是靠版面分析辨識的,不是粗暴抽文字,所以雙欄論文會逐欄讀、不會橫著串行。最難的是那種分欄裡還插著浮動圖表和邊註的密集版面——校對時優先看圖表前後的段落銜接。
數學公式能轉成可編輯的 LaTeX 嗎?
行內和行間公式會轉成用 $ 與 $$ 包裹的 LaTeX,在 Obsidian、Typora 和大多數 Markdown 編輯器裡能正常算繪。多行對齊環境和手工搭的矩陣是最弱的一塊,建議人工核一遍。
PDF轉Markdown要花多少錢?
按 1 頁 1 個翻譯額度計費,優先從免費額度裡扣——註冊後每月 500 頁免費額度,與文件翻譯共用同一份餘額。掃描檔走 OCR 但不額外消耗單獨的 OCR 額度,轉換失敗自動退還。上傳前需要先登入。
檔案大小和頁數有什麼限制?
單一檔案不超過 100 MB、不超過 100 頁。超過 100 頁會在送出時就被擋下,不會跑到一半才失敗——可以先用 PDF 分割切開再分別轉換。
轉好的檔案能保存多久?
轉換紀錄和下載連結保留 24 小時,之後檔案會從伺服器刪除。要留的內容請在這個時間窗內下載。

