PDF를 마크다운으로 변환하는 방법: 결론부터
PDF를 마크다운으로 변환할 때는 단순 텍스트 추출이 아니라 레이아웃 분석을 하는 도구를 써야 합니다. PDF를 올리고 OCR이 제대로 읽도록 문서 언어를 먼저 고른 뒤 변환하면, .md 파일 하나와 images/ 폴더가 담긴 .zip을 받습니다. 제목 단계·목록·표·코드 블록·LaTeX 수식은 대응하는 마크다운 문법이 되고, 머리글·바닥글·쪽 번호·단 구성 같은 "지면 장식"은 버려집니다.
대부분의 사람이 걸려 넘어지는 지점은 도구가 아니라 기대치입니다. PDF가 기록하는 것은 잉크가 종이 어디에 놓이는가이고, 마크다운이 기록하는 것은 그 내용이 무엇인가입니다. 둘 사이는 형식 변환이 아니라 재구성이며, 정말로 옮길 수 없는 것이 존재합니다.

"PDF에서 글자를 복사하면" 안 되는 이유
PDF에서 글자를 복사해 .md에 붙이면 반드시 깨집니다. 이는 쓰는 도구와 무관하고 PDF라는 형식 자체에 이유가 있습니다. PDF에는 "제목", "문단", "표"라는 개념이 아예 없습니다.
PDF 페이지는 그리기 명령의 나열입니다. 이 글자를 이 좌표에 놓아라, 여기서 저기까지 선을 그어라. 당신이 "절 제목"으로 읽는 것은 파일 안에서는 그저 조금 크고 굵은 글자열입니다. 표로 보이는 것은 우연히 줄이 맞은 글자 덩어리이며, 옆에 선이 그어져 있을 때도 없을 때도 있습니다.
그래서 변환 도구는 기하학적 배치로부터 구조를 역추론해야 합니다. 도구들의 품질 차이는 전부 이 지점에 있고, 같은 도구가 깔끔한 보고서에서는 훌륭하고 학술 논문에서는 무너지는 이유도 이것입니다.
난이도 순으로 본 네 가지 추론 과제
- 읽는 순서. 2단 조판 논문에서 단순 추출은 좌우 단을 가로질러 읽어 서로 무관한 두 문장을 번갈아 엮습니다. 올바른 처리는 단 분할을 먼저 찾아내고 각 단을 위에서 아래로 읽는 것입니다.
- 제목 단계. 16pt 굵은 글씨가
##이고 13pt 굵은 글씨가###이라고 판단해야 하는데, 절대 기준이 없으므로 이 문서 안에서의 상대적 크기만이 단서입니다. - 표. 괘선이 있는 표는 비교적 쉽습니다. 괘선 없이 정렬만으로 유지되던 표는 여백의 기하학에서 열 경계를 복원해야 합니다.
- 수식. 수학 기호는 좌표에 배치된 글리프의 모음이며 수식용 글꼴일 때도, 아예 이미지일 때도 있습니다. 거기서
\frac{a}{b}를 복원하는 것은 문장을 읽는 것과 전혀 다른 난이도입니다.
실제로 무엇이 넘어오는가
이 표가 이 글에서 가장 저장해 둘 만한 부분입니다. 여기 적힌 것은 마크다운이라는 형식이 표현할 수 있는 범위, 즉 모든 도구의 상한이며 이를 넘어서는 제품은 없습니다.
| PDF의 요소 | 마크다운에서의 모습 | 신뢰도 |
|---|---|---|
| 절 제목 | ## / ### 단계 | 조판이 일관된 문서에서 높음 |
| 본문 문단 | 일반 문단 | 높음 |
| 글머리·번호 목록 | -와 1. 목록 | 높음 |
| 코드 블록 | 펜스 코드 블록 | 고정폭 글꼴로 조판되었다면 높음 |
| 괘선 있는 표 | GFM 파이프 표 | 양호 |
| 괘선 없는 표 | GFM 파이프 표 | 보통, 열 경계는 정렬에서 추정 |
| LaTeX 수식 | $...$ / $$...$$ | 인라인·디스플레이는 양호, 여러 줄 정렬 환경은 약함 |
| 그림·도표 | images/로 추출, 상대 경로로 참조 | 추출은 안정적이나 비트맵이 된 도표는 더 이상 데이터가 아님 |
| 각주 | 참조 위치 근처 본문으로 평탄화되는 경우가 많음 | 보통 |
| 머리글·바닥글·쪽 번호 | 버려짐 | 의도된 동작. 내용이 아니라 지면 장식 |
| 단 구성 | 한 단으로 평탄화 | 의도된 동작. 마크다운에 단 구성은 없음 |
| 글꼴·색·정확한 자간 | 소실 | 마크다운에 스타일 층이 아예 없음 |
마지막 세 줄이 "버려짐", "소실"인 것은 의도적입니다. 문서의 의미가 색 구분이나 2단 조판에 기대고 있다면 마크다운은 잘못된 목적지이며 어떤 도구로도 해결되지 않습니다. 그런 경우는 .docx로 가야 합니다. PDF 워드 변환을 참고하세요.
내려받는 것이 .md가 아니라 .zip인 이유
마크다운 파일은 이미지를 담을 수 없고 가리킬 수만 있습니다. 따라서 그림이 있는 문서를 정직하게 변환하면 결과물은 반드시 둘 이상이 됩니다. 텍스트 파일과, 그것이 참조하는 이미지들입니다.
Belin Doc의 PDF 마크다운 변환 도구는 .md와 images/ 폴더를 나란히 담은 .zip을 돌려주며, 본문의 상대 경로는 이미 적혀 있습니다. 노트 보관함이나 저장소에 풀어 놓으면 이미지가 바로 표시되고 링크를 다시 걸 필요가 없습니다.
이는 들리는 것보다 중요합니다. PDF → 마크다운 작업 흐름에서 가장 흔한 불만은 글자 품질이 아니라 파일을 옮긴 뒤 이미지 링크 40개가 한꺼번에 끊기는 것입니다. 내보낼 때 폴더 구조를 유지하는 것이 해결책입니다.
스캔본: 변환 전에 인식 언어를 고른다
PDF가 스캔본이라면 — 찍은 책장, 오래된 계약서, 텍스트 레이어가 없는 파일 — 추출할 글자가 없으므로 먼저 OCR로 읽어야 합니다. 그리고 OCR 정확도는 어떤 문자 체계와 언어로 읽어야 하는지 알려 주었는지에 크게 좌우됩니다.
Belin Doc은 이 선택을 추측하지 않고 사용자에게 맡깁니다. 변환기는 16가지 언어·문자 체계를 제공하며, 간체 중국어(정확도가 더 높은 서버 모델 별도 제공), 번체 중국어, 영어, 일본어, 한국어, 태국어, 그리스어, 타밀어, 텔루구어, 칸나다어와 함께 라틴·아랍·키릴·동슬라브·데바나가리라는 문자 체계 단위 선택지가 있습니다.
실무 요령이 둘 있습니다.
- 변환 후가 아니라 업로드 전에 고른다. 언어는 변환 작업과 함께 제출되므로 바꾸려면 다시 변환해야 합니다.
- 유럽 언어가 섞였다면 문자 체계를 고른다. 프랑스어·독일어·스페인어가 섞인 문서에서는 단일 언어보다
latin이 대체로 더 낫습니다.
스캔본인지 판단이 서지 않으면 이중 레이어 PDF란에 몇 초 만에 확인하는 방법과, 일부 "텍스트판" PDF가 사실은 이미지인 이유를 정리해 두었습니다.
마크다운이 목적지로 부적절한 경우
기능을 나열하는 것보다 이 점을 정직하게 쓰는 편이 유용합니다.
적합한 경우: 내용을 노트 시스템(Obsidian·Notion·Logseq)으로 옮길 때, RAG나 임베딩 파이프라인에 넣을 때, 문서를 버전 관리에 둘 때, 20년 뒤에도 열리는 평문이 필요할 때.
부적합한 경우: 레이아웃 자체가 내용일 때. 조항 번호와 들여쓰기가 법적 의미를 갖는 계약서, 양식, 청구서, 공정 도면, 슬라이드, 그리고 "조판된 채 인쇄 가능한 상태"로 누군가에게 돌려줘야 하는 모든 것 — 평탄화하면 본질적인 무언가를 잃습니다.
다시 생각해 볼 경우: 문서의 주된 부분이 병합 셀이 있는 표일 때. 마크다운 표는 셀 병합을 전혀 지원하지 않습니다. 도구는 병합을 쪼개거나 값을 반복하는데, 둘 다 원문의 뜻이 아닙니다.
"편집"이 아니라 "읽기"가 목적인 긴 글이라면 EPUB이 더 적합한 목적지입니다. 장 구조를 유지한 채 화면 폭에 맞춰 재배치되기 때문입니다. 그 맞바꿈은 PDF EPUB 변환에서 다룹니다.
PDF 마크다운 변환 절차
1단계: 문서 언어를 고른다
PDF 마크다운 변환 도구를 열고 업로드 전에 언어 선택기를 문서에 맞춥니다. 실제 텍스트 레이어가 있는 전자 문서에서는 영향이 크지 않지만, 스캔본에서는 결과 품질을 좌우하는 가장 큰 단일 요인입니다.
2단계: 업로드하고 변환을 시작한다
파일 하나의 상한은 100 MB, 100페이지입니다. 변환 기록과 내려받기 링크가 계정에 연결되므로 Belin Doc 로그인이 필요합니다. 변환은 1페이지당 번역 크레딧 1이며 매월 무료 한도에서 먼저 차감됩니다(가입하면 매월 500페이지, 문서 번역과 같은 잔액). 변환이 실패하면 크레딧은 자동 반환됩니다.
3단계: zip을 내려받아 보관함에 푼다
분량이 많거나 스캔본이면 페이지마다 따로 분석하므로 오래 걸립니다. 변환 기록은 목록에 24시간 남으니 탭을 닫아도 됩니다. .zip을 내려받아 .md와 images/ 폴더를 함께 노트 보관함이나 저장소에 풀면 이미지 링크가 그대로 연결됩니다.
자주 묻는 질문 (FAQ)
변환된 마크다운에 PDF의 이미지가 들어 있나요?
들어 있습니다. 이미지는 images/ 폴더로 추출되고 마크다운에서 상대 경로로 참조됩니다. 내려받는 것이 맨 .md가 아니라 .zip인 이유가 이것입니다. 옮길 때 폴더와 마크다운을 함께 옮기면 링크는 끊기지 않습니다.
2단 조판 학술 논문도 읽는 순서가 맞나요?
단 구성은 단순 텍스트 추출이 아니라 레이아웃 분석으로 인식하므로, 2단 논문은 가로지르지 않고 단별로 읽힙니다. 가장 어려운 것은 단 안에 그림과 방주가 떠 있는 빽빽한 지면이므로, 교정할 때는 그림 앞뒤 문단의 연결부터 확인하세요.
수식을 편집 가능한 LaTeX으로 바꿀 수 있나요?
인라인과 디스플레이 수식은 $와 $$로 감싼 LaTeX으로 변환되어 Obsidian·Typora를 비롯한 대부분의 마크다운 편집기에서 정상적으로 렌더링됩니다. 여러 줄 정렬 환경과 손으로 짠 행렬이 가장 약한 부분이라 사람이 한 번 확인할 값어치가 있습니다.
PDF 마크다운 변환 비용은 얼마인가요?
1페이지당 번역 크레딧 1이며 매월 무료 한도에서 먼저 차감됩니다(가입하면 매월 500페이지, 문서 번역과 공유하는 잔액). 스캔 페이지는 OCR을 거치지만 별도의 OCR 한도는 쓰지 않고, 실패한 변환은 자동 반환됩니다. 업로드 전에 로그인이 필요합니다.
파일 크기와 쪽수 상한은 얼마인가요?
파일당 100 MB, 100페이지까지입니다. 100페이지를 넘는 문서는 중간에 실패하는 대신 제출 시점에 거부되므로, 먼저 PDF 분할로 나눈 뒤 조각별로 변환하세요.
변환한 파일은 얼마나 보관되나요?
변환 기록과 내려받기 링크는 24시간 유지되며, 이후 파일은 서버에서 삭제됩니다. 남겨야 할 것은 그 안에 내려받으세요.

