PDF 텍스트 추출
PDF 속 글자를 줄과 문단 그대로 꺼냅니다. 클립보드에 바로 복사하거나 .txt 파일로 다운로드하세요. 아무것도 저장하지 않습니다.
- 저장되지 않음
- 대기열 없음, 기다림 없음
- 회원가입 없음, 워터마크 없음
사용 방법
PDF 추가
PDF를 페이지에 끌어다 놓으세요. 곧바로 한 페이지씩 추출이 시작됩니다.
확인하고 다듬기
편집 가능한 상자에 텍스트가 나타납니다. 페이지 구분 표시를 켜거나 끄고, 저장하기 전에 원하는 부분을 수정하세요.
복사 또는 다운로드
전체를 클립보드에 복사하거나 .txt 파일로 다운로드하세요.
글자는 어디에서 오고, 어떤 순서로 나오는가
PDF 속 글자는 텍스트로 저장되어 있지 않습니다. 내장된 글꼴을 가리키는 글리프 번호로 저장되며, 이를 다시 문자로 바꾸려면 각 글리프가 어떤 문자인지 알려 주는 파일 안의 표가 필요합니다. 대부분의 프로그램은 이 표를 넣습니다. 넣지 않은 경우(일부 디자인 소프트웨어가 만드는 축소된 글꼴 서브셋이 흔한 원인입니다)에는 화면에서는 완벽해 보여도 추출하면 알 수 없는 문자열이 나옵니다. 읽는 데 필요한 정보가 애초에 기록되지 않았기 때문입니다. 어떤 추출 도구도 이를 고칠 수 없습니다. 어려운 문제가 아니라 데이터가 없는 것입니다.
결과를 믿기 전에 확인해야 할 것은 읽는 순서입니다. 텍스트는 페이지가 그려지는 순서, 즉 PDF를 만든 소프트웨어가 내보낸 순서대로 나오며, 이는 사람이 읽는 순서와 다른 경우가 많습니다. 2단 페이지는 PDF가 어떻게 생성되었느냐에 따라 왼쪽 단과 오른쪽 단이 제대로 나뉘어 나오기도 하고, 두 단의 줄이 번갈아 섞여 나오기도 합니다. 머리글, 바닥글, 페이지 번호, 사이드바는 그려진 위치 그대로, 대개 본문 한가운데에 끼어듭니다.
몇 가지 작은 현상은 당황하기보다 알아 두는 편이 좋습니다. 합자는 글꼴이 실제로 사용한 한 글자로 나오기 때문에 “find”가 f와 i가 아닌 하나의 글리프로 나올 수 있고, 그러면 “find”를 단순 검색했을 때 찾지 못합니다. 줄 끝에서 하이픈으로 나뉜 단어는 파일 안에서도 실제로 나뉘어 있으므로 하이픈이 그대로 남습니다. 또한 곧은 따옴표가 둥근 따옴표로 되어 있는 경우가 많아, 텍스트를 코드나 CSV에 넣을 때 문제가 될 수 있습니다.
스캔한 페이지에서는 아무것도 나오지 않으며, 이 도구는 빈 파일을 건네는 대신 그 사실을 알려 줍니다. 문서를 찍은 사진에는 글자가 없고 픽셀만 있기 때문입니다. 윤곽선으로 변환된 텍스트도 마찬가지입니다. 디자이너가 어디서나 똑같이 인쇄되도록 일부러 하는 작업인데, 그 시점부터는 사실상 그림입니다. 두 경우 모두 추출이 아니라 OCR이 필요합니다.
다른 작업이 필요할 때
단 구성이 중요하다면 Poppler의 pdftotext -layout in.pdf out.txt가 브라우저로 할 수 있는 어떤 방법보다 낫습니다. 실제 공백으로 시각적 간격을 재현하기 때문에 단은 단대로, 표는 읽을 수 있는 표 모양대로 유지됩니다. pdftotext -raw는 반대로 그려진 순서를 손대지 않고 그대로 내보내는데, 스크립트에서는 가끔 이쪽이 필요합니다.
수백 개 파일에서 텍스트를 뽑아야 한다면 mutool draw -F txt와 Python의 pdfplumber를 기반으로 삼으세요. 특히 pdfplumber는 모든 글자를 좌표, 글꼴, 크기와 함께 넘겨주므로 머리글과 바닥글을 짐작이 아닌 위치로 걸러 낼 수 있습니다. 이 페이지로는 할 수 없는 작업이며, 대량 처리에서 중요한 것이 바로 이 부분입니다.
자주 묻는 질문
문단과 줄바꿈이 유지되나요?
네. PDF에는 문단이라는 개념이 아예 없고 좌표 위의 글자만 있습니다. 그래서 같은 기준선에 놓인 단어를 한 줄로 묶고, 세로 간격이 넓어지는 곳에서 새 문단을 시작하는 방식으로 텍스트를 다시 구성합니다. 결과는 한 덩어리로 이어진 글이 아니라 원본처럼 읽힙니다.
제 PDF가 어딘가에 저장되나요?
아니요. 텍스트는 사용자의 브라우저가 직접 읽으며 어디로도 전송되지 않습니다. 페이지가 로드된 뒤 인터넷 연결을 끊어도 그대로 작동합니다.
PDF에 텍스트가 없다고 나와요. 왜 그런가요?
스캔본이나 사진이기 때문입니다. 페이지가 하나의 그림이고, 그림에는 추출할 텍스트가 없습니다. 이미지 자체에서 글자를 읽어 내는 PDF OCR을 사용하세요.
다운로드하기 전에 텍스트를 편집할 수 있나요?
네. 상자 안의 내용은 자유롭게 편집할 수 있으며, 보이는 그대로 저장됩니다.
표나 다단 레이아웃은 어떻게 되나요?
단은 PDF가 그리는 순서대로 읽힙니다. 대개는 맞지만, 복잡한 다단 레이아웃에서는 줄이 뒤섞일 수 있습니다. 표는 격자가 아니라 텍스트 줄로 나옵니다. 표가 필요하다면 PDF 엑셀 변환을 사용하세요.
참고: 일반 텍스트에는 서식이 없습니다. 굵게, 글자 크기, 색상, 이미지, 표 구조는 정의상 모두 빠집니다. 실제 글자가 아니라 벡터 윤곽선으로 그려진 텍스트(로고나 일부 디자인 PDF에서 흔함)는 OCR 없이는 어떤 도구로도 추출할 수 없습니다.
내 웹사이트에 이 도구 넣기
블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.