Skip to content
FreeConvertter

PDF에서 텍스트 추출하기 — 스캔 PDF와 구분하는 법

작성일:

보고서나 계약서 PDF의 내용을 다른 문서에 옮기려고 복사했는데 줄마다 끊기거나, 아예 글자가 선택되지 않은 경험이 있을 겁니다. 이유를 알면 해결 방법도 분명해집니다.

PDF에는 두 종류가 있습니다

1. 텍스트 PDF

워드, 한글, 엑셀, 웹 브라우저 등에서 “PDF로 저장”해서 만든 PDF입니다. 글자가 **실제 문자 정보(텍스트 레이어)**로 들어 있어서 선택·검색·복사가 됩니다.

2. 스캔 PDF (이미지 PDF)

종이 문서를 스캐너나 휴대폰으로 찍어 만든 PDF입니다. 각 페이지가 사진 한 장이라 글자처럼 보여도 컴퓨터에게는 그림일 뿐입니다. 글자를 선택할 수 없고, 검색도 되지 않습니다.

구분하는 법: PDF 뷰어에서 Ctrl+F로 페이지에 보이는 단어를 검색해 보세요. 찾아지면 텍스트 PDF, 찾아지지 않으면 스캔 PDF일 가능성이 큽니다. 글자를 드래그했을 때 선택 영역이 생기지 않는 것도 스캔 PDF의 특징입니다.

텍스트 PDF에서 깔끔하게 추출하기

PDF → TXT 변환기에 파일을 넣고 변환하기를 누르면 모든 페이지의 글자가 텍스트 파일로 저장됩니다.

변환기는 PDF 안의 글자 조각을 위치에 따라 이어 붙입니다.

  • 같은 줄의 글자는 한 줄로 이어집니다.
  • 일반적인 줄 간격으로 내려가면 줄바꿈을 넣습니다.
  • 문단 사이처럼 간격이 넓으면 빈 줄을 넣어 문단을 구분합니다.

옵션 → 페이지 사이에서 “페이지 번호 표시”를 고르면 --- 2 ---처럼 페이지 경계를 표시해 줘서, 원문의 몇 쪽인지 찾기 쉽습니다.

한글·일본어·중국어 PDF도 지원합니다. 동아시아 문자가 들어간 PDF는 글자를 해석하는 데 별도의 문자 매핑 정보(CMap)가 필요한데, 변환기에 이 정보가 포함되어 있습니다.

추출 결과가 기대와 다를 때

증상 이유와 해결
“텍스트 정보가 없다”는 안내 스캔 PDF입니다. 아래 “스캔 PDF는?“을 참고하세요
두 단으로 된 논문의 글이 섞임 PDF에는 “단” 정보가 없어 위치 순서로 읽기 때문입니다. 단별로 영역을 나눠 복사하는 것이 더 정확할 수 있습니다
표가 칸 구분 없이 한 줄로 나옴 PDF의 표는 선과 글자를 따로 그려 둔 것이라 칸 정보가 없습니다
글자가 이상한 기호로 나옴 글꼴이 특수하게 포함된 PDF입니다. 원본 문서(워드 등)가 있다면 그쪽에서 추출하는 것이 정확합니다

원본 파일이 있다면 원본에서 추출하세요

PDF는 “인쇄된 모양”을 저장하는 형식이라 문단·표 구조가 사라져 있습니다. 같은 문서의 워드 파일이 있다면 DOCX → TXT로 추출하는 편이 문단과 표가 훨씬 정확합니다.

스캔 PDF는?

스캔 PDF에서 글자를 얻으려면 그림 속 글자를 읽어 내는 **OCR(광학 문자 인식)**이 필요합니다. 이 사이트는 아직 OCR을 지원하지 않습니다. 그동안은 다음 방법을 쓸 수 있습니다.

  • 휴대폰의 기본 기능을 이용하기: 많은 스마트폰 카메라·사진 앱이 사진 속 글자를 인식해 복사하는 기능을 제공합니다. PDF → PNG로 페이지를 이미지로 바꾼 뒤 이용할 수 있습니다.
  • 스캐너 프로그램의 “검색 가능한 PDF” 옵션으로 다시 스캔하기

정리

PDF 텍스트 추출이 되지 않는다면 먼저 스캔 PDF인지 확인하세요. 텍스트 PDF라면 PDF → TXT 변환기로 줄과 문단을 정리해 한 번에 추출할 수 있고, 원본 워드 파일이 있다면 그쪽에서 추출하는 것이 가장 정확합니다.

이 가이드에서 쓰는 도구

관련 가이드