PDF에서 텍스트 추출하기 — 스캔 PDF와 구분하는 법
작성일:
보고서나 계약서 PDF의 내용을 다른 문서에 옮기려고 복사했는데 줄마다 끊기거나, 아예 글자가 선택되지 않은 경험이 있을 겁니다. 이유를 알면 해결 방법도 분명해집니다.
PDF에는 두 종류가 있습니다
1. 텍스트 PDF
워드, 한글, 엑셀, 웹 브라우저 등에서 “PDF로 저장”해서 만든 PDF입니다. 글자가 **실제 문자 정보(텍스트 레이어)**로 들어 있어서 선택·검색·복사가 됩니다.
2. 스캔 PDF (이미지 PDF)
종이 문서를 스캐너나 휴대폰으로 찍어 만든 PDF입니다. 각 페이지가 사진 한 장이라 글자처럼 보여도 컴퓨터에게는 그림일 뿐입니다. 글자를 선택할 수 없고, 검색도 되지 않습니다.
구분하는 법: PDF 뷰어에서 Ctrl+F로 페이지에 보이는 단어를 검색해 보세요. 찾아지면 텍스트 PDF, 찾아지지 않으면 스캔 PDF일 가능성이 큽니다. 글자를 드래그했을 때 선택 영역이 생기지 않는 것도 스캔 PDF의 특징입니다.
텍스트 PDF에서 깔끔하게 추출하기
PDF → TXT 변환기에 파일을 넣고 변환하기를 누르면 모든 페이지의 글자가 텍스트 파일로 저장됩니다.
변환기는 PDF 안의 글자 조각을 위치에 따라 이어 붙입니다.
- 같은 줄의 글자는 한 줄로 이어집니다.
- 일반적인 줄 간격으로 내려가면 줄바꿈을 넣습니다.
- 문단 사이처럼 간격이 넓으면 빈 줄을 넣어 문단을 구분합니다.
옵션 → 페이지 사이에서 “페이지 번호 표시”를 고르면 --- 2 ---처럼 페이지 경계를 표시해 줘서, 원문의 몇 쪽인지 찾기 쉽습니다.
한글·일본어·중국어 PDF도 지원합니다. 동아시아 문자가 들어간 PDF는 글자를 해석하는 데 별도의 문자 매핑 정보(CMap)가 필요한데, 변환기에 이 정보가 포함되어 있습니다.
추출 결과가 기대와 다를 때
| 증상 | 이유와 해결 |
|---|---|
| “텍스트 정보가 없다”는 안내 | 스캔 PDF입니다. 아래 “스캔 PDF는?“을 참고하세요 |
| 두 단으로 된 논문의 글이 섞임 | PDF에는 “단” 정보가 없어 위치 순서로 읽기 때문입니다. 단별로 영역을 나눠 복사하는 것이 더 정확할 수 있습니다 |
| 표가 칸 구분 없이 한 줄로 나옴 | PDF의 표는 선과 글자를 따로 그려 둔 것이라 칸 정보가 없습니다 |
| 글자가 이상한 기호로 나옴 | 글꼴이 특수하게 포함된 PDF입니다. 원본 문서(워드 등)가 있다면 그쪽에서 추출하는 것이 정확합니다 |
원본 파일이 있다면 원본에서 추출하세요
PDF는 “인쇄된 모양”을 저장하는 형식이라 문단·표 구조가 사라져 있습니다. 같은 문서의 워드 파일이 있다면 DOCX → TXT로 추출하는 편이 문단과 표가 훨씬 정확합니다.
스캔 PDF는?
스캔 PDF에서 글자를 얻으려면 그림 속 글자를 읽어 내는 **OCR(광학 문자 인식)**이 필요합니다. 이 사이트는 아직 OCR을 지원하지 않습니다. 그동안은 다음 방법을 쓸 수 있습니다.
- 휴대폰의 기본 기능을 이용하기: 많은 스마트폰 카메라·사진 앱이 사진 속 글자를 인식해 복사하는 기능을 제공합니다. PDF → PNG로 페이지를 이미지로 바꾼 뒤 이용할 수 있습니다.
- 스캐너 프로그램의 “검색 가능한 PDF” 옵션으로 다시 스캔하기
정리
PDF 텍스트 추출이 되지 않는다면 먼저 스캔 PDF인지 확인하세요. 텍스트 PDF라면 PDF → TXT 변환기로 줄과 문단을 정리해 한 번에 추출할 수 있고, 원본 워드 파일이 있다면 그쪽에서 추출하는 것이 가장 정확합니다.