본문 바로가기

PDF 텍스트 추출

PDF 속 글자를 줄과 문단 그대로 꺼냅니다. 클립보드에 바로 복사하거나 .txt 파일로 다운로드하세요. 아무것도 저장하지 않습니다.

  • 저장되지 않음
  • 대기열 없음, 기다림 없음
  • 회원가입 없음, 워터마크 없음

사용 방법

1

PDF 추가

PDF를 페이지에 끌어다 놓으세요. 곧바로 한 페이지씩 추출이 시작됩니다.

2

확인하고 다듬기

편집 가능한 상자에 텍스트가 나타납니다. 페이지 구분 표시를 켜거나 끄고, 저장하기 전에 원하는 부분을 수정하세요.

3

복사 또는 다운로드

전체를 클립보드에 복사하거나 .txt 파일로 다운로드하세요.

글자는 어디에서 오고, 어떤 순서로 나오는가

PDF 속 글자는 텍스트로 저장되어 있지 않습니다. 내장된 글꼴을 가리키는 글리프 번호로 저장되며, 이를 다시 문자로 바꾸려면 각 글리프가 어떤 문자인지 알려 주는 파일 안의 표가 필요합니다. 대부분의 프로그램은 이 표를 넣습니다. 넣지 않은 경우(일부 디자인 소프트웨어가 만드는 축소된 글꼴 서브셋이 흔한 원인입니다)에는 화면에서는 완벽해 보여도 추출하면 알 수 없는 문자열이 나옵니다. 읽는 데 필요한 정보가 애초에 기록되지 않았기 때문입니다. 어떤 추출 도구도 이를 고칠 수 없습니다. 어려운 문제가 아니라 데이터가 없는 것입니다.

결과를 믿기 전에 확인해야 할 것은 읽는 순서입니다. 텍스트는 페이지가 그려지는 순서, 즉 PDF를 만든 소프트웨어가 내보낸 순서대로 나오며, 이는 사람이 읽는 순서와 다른 경우가 많습니다. 2단 페이지는 PDF가 어떻게 생성되었느냐에 따라 왼쪽 단과 오른쪽 단이 제대로 나뉘어 나오기도 하고, 두 단의 줄이 번갈아 섞여 나오기도 합니다. 머리글, 바닥글, 페이지 번호, 사이드바는 그려진 위치 그대로, 대개 본문 한가운데에 끼어듭니다.

몇 가지 작은 현상은 당황하기보다 알아 두는 편이 좋습니다. 합자는 글꼴이 실제로 사용한 한 글자로 나오기 때문에 “find”가 f와 i가 아닌 하나의 글리프로 나올 수 있고, 그러면 “find”를 단순 검색했을 때 찾지 못합니다. 줄 끝에서 하이픈으로 나뉜 단어는 파일 안에서도 실제로 나뉘어 있으므로 하이픈이 그대로 남습니다. 또한 곧은 따옴표가 둥근 따옴표로 되어 있는 경우가 많아, 텍스트를 코드나 CSV에 넣을 때 문제가 될 수 있습니다.

스캔한 페이지에서는 아무것도 나오지 않으며, 이 도구는 빈 파일을 건네는 대신 그 사실을 알려 줍니다. 문서를 찍은 사진에는 글자가 없고 픽셀만 있기 때문입니다. 윤곽선으로 변환된 텍스트도 마찬가지입니다. 디자이너가 어디서나 똑같이 인쇄되도록 일부러 하는 작업인데, 그 시점부터는 사실상 그림입니다. 두 경우 모두 추출이 아니라 OCR이 필요합니다.

다른 작업이 필요할 때

단 구성이 중요하다면 Poppler의 pdftotext -layout in.pdf out.txt가 브라우저로 할 수 있는 어떤 방법보다 낫습니다. 실제 공백으로 시각적 간격을 재현하기 때문에 단은 단대로, 표는 읽을 수 있는 표 모양대로 유지됩니다. pdftotext -raw는 반대로 그려진 순서를 손대지 않고 그대로 내보내는데, 스크립트에서는 가끔 이쪽이 필요합니다.

수백 개 파일에서 텍스트를 뽑아야 한다면 mutool draw -F txt와 Python의 pdfplumber를 기반으로 삼으세요. 특히 pdfplumber는 모든 글자를 좌표, 글꼴, 크기와 함께 넘겨주므로 머리글과 바닥글을 짐작이 아닌 위치로 걸러 낼 수 있습니다. 이 페이지로는 할 수 없는 작업이며, 대량 처리에서 중요한 것이 바로 이 부분입니다.

자주 묻는 질문

문단과 줄바꿈이 유지되나요?

네. PDF에는 문단이라는 개념이 아예 없고 좌표 위의 글자만 있습니다. 그래서 같은 기준선에 놓인 단어를 한 줄로 묶고, 세로 간격이 넓어지는 곳에서 새 문단을 시작하는 방식으로 텍스트를 다시 구성합니다. 결과는 한 덩어리로 이어진 글이 아니라 원본처럼 읽힙니다.

제 PDF가 어딘가에 저장되나요?

아니요. 텍스트는 사용자의 브라우저가 직접 읽으며 어디로도 전송되지 않습니다. 페이지가 로드된 뒤 인터넷 연결을 끊어도 그대로 작동합니다.

PDF에 텍스트가 없다고 나와요. 왜 그런가요?

스캔본이나 사진이기 때문입니다. 페이지가 하나의 그림이고, 그림에는 추출할 텍스트가 없습니다. 이미지 자체에서 글자를 읽어 내는 PDF OCR을 사용하세요.

다운로드하기 전에 텍스트를 편집할 수 있나요?

네. 상자 안의 내용은 자유롭게 편집할 수 있으며, 보이는 그대로 저장됩니다.

표나 다단 레이아웃은 어떻게 되나요?

단은 PDF가 그리는 순서대로 읽힙니다. 대개는 맞지만, 복잡한 다단 레이아웃에서는 줄이 뒤섞일 수 있습니다. 표는 격자가 아니라 텍스트 줄로 나옵니다. 표가 필요하다면 PDF 엑셀 변환을 사용하세요.

참고: 일반 텍스트에는 서식이 없습니다. 굵게, 글자 크기, 색상, 이미지, 표 구조는 정의상 모두 빠집니다. 실제 글자가 아니라 벡터 윤곽선으로 그려진 텍스트(로고나 일부 디자인 PDF에서 흔함)는 OCR 없이는 어떤 도구로도 추출할 수 없습니다.

내 웹사이트에 이 도구 넣기

블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.