스캔한 PDF를 검색 가능하게 만들기
스캔본에서 글자를 읽어 페이지 위에 보이지 않게 얹습니다. 문서 모양은 그대로이고, 검색하고 선택하고 복사할 수 있게 될 뿐입니다. 비뚤게 또는 옆으로 스캔된 페이지는 바르게 세웁니다.
- 저장되지 않음
- 대기열 없음, 기다림 없음
- 회원가입 없음, 워터마크 없음
사용 방법
스캔한 PDF 추가
파일을 끌어다 놓으세요. 이미 텍스트 레이어가 있는지 확인해, OCR이 오히려 역효과라면 알려 드립니다.
언어 확인
첫 페이지를 읽고 어떤 언어를 찾았는지 알려 드립니다. 직접 골라야 한다면 120개가 넘는 언어 중에서 선택할 수 있습니다.
다운로드
스캔 이미지 뒤에 숨은 텍스트 레이어가 더해진, 같은 문서를 받습니다.
그대로인 페이지 위에 보이지 않는 레이어 하나
스캔 이미지는 원래 그대로 유지됩니다. 추가되는 것은 보이지 않는 렌더링 모드로 그린 텍스트 레이어입니다. 실제 글자가 그림 속 단어 위에 단어 단위로 자리 잡고, 화면에 절대 그려지지 않도록 표시됩니다. 시각적으로 바뀐 것이 없으니 페이지는 똑같아 보이고, 문장을 선택하면 보이지 않는 텍스트가 보이는 글자와 같은 자리에 있으므로 하이라이트가 정확한 단어에 놓입니다. 검색 가능한 스캔본을 만드는 표준 방식이며, 그래서 결과물은 여전히 문서를 찍은 사진이면서도 검색, 복사, 색인이 가능합니다.
페이지의 두 가지는 일부러 바로잡습니다. 어차피 읽으려면 필요했기 때문입니다. 옆으로 스캔된 페이지는 똑바로 세우고, 급지기를 비뚤게 통과한 페이지는 반듯하게 폅니다. 그래서 결과물이 원본보다 깔끔한 경우가 많습니다. 페이지 크기는 통일하지 않고 원본 PDF 그대로 유지하므로, 크기가 섞인 문서는 그대로 남고 아무것도 크기가 바뀌지 않습니다.
정확도는 거의 전적으로 스캔 품질에 달려 있으며, 그 차이는 작지 않습니다. 인쇄된 글자를 300 DPI로 깨끗하게 스캔하면 매우 높은 정확도로 읽힙니다. 같은 페이지를 150 DPI로 스캔하면 눈에 띄게 떨어지고, 어두운 곳에서 비스듬히 찍은 사진은 완전히 다른 이야기입니다. 스캔을 직접 할 수 있다면 중요한 설정은 그레이스케일 300 DPI입니다. 그보다 높은 해상도는 거의 도움이 되지 않고, 낮은 해상도는 곧바로 결과를 망칩니다. 작은 글씨, 좁은 줄 간격, 색 배경, 복사본의 복사본, 도장이나 손글씨가 있는 부분은 모두 어떤 소프트웨어로도 완전히 해결되지 않는 방식으로 더 어렵습니다.
무엇을 일부러 빼는지도 무엇을 넣는지만큼 중요합니다. 사진, 로고, 서명, 장식 그래픽은 읽지 않고 무시합니다. 그림에서 억지로 글자를 뽑아내면 그럴듯한 엉터리 텍스트가 생기고, 그것이 모든 검색 결과에 나타나기 때문입니다. 중국어, 일본어, 한국어 단어는 인식은 되지만, 이를 담을 수 있는 글꼴이 추가될 때까지 빈칸으로 쓰는 대신 텍스트 레이어에서 빼고 개수를 알려 드립니다. 이 도구는 문서를 다시 조판하지 않습니다. 페이지 위의 글자는 여전히 그림이며, 이를 편집 가능한 텍스트로 바꾸려면 워드로 변환하세요.
다른 작업이 필요할 때
이 페이지는 OCRmyPDF 곁의 간편한 대안일 뿐이며, OCRmyPDF는 무료입니다. ocrmypdf --deskew --rotate-pages in.pdf out.pdf 는 더 세밀하게 제어하면서 같은 작업을 하고, --optimize 3 으로 결과물을 줄이고, --redo-ocr 로 잘못된 기존 레이어를 교체하고, --output-type pdfa 로 같은 과정에서 보존용 파일을 만들 수 있습니다. 수천 페이지도 처리하고, 폴더 감시 방식으로 실행되며, 도서관과 문서 보관소가 실제로 쓰는 도구입니다.
옛 인쇄물, 특이한 레이아웃, 복잡한 표처럼 까다로운 자료라면 Google, Amazon, Microsoft의 클라우드 서비스가 범용 인식으로는 읽지 못하는 페이지를 읽어 냅니다. 훨씬 많은 자료로 학습했기 때문입니다. 이는 실제 성능 차이이므로 알아 둘 가치가 있습니다. 동시에 문서를 제3자에게 보낸다는 뜻이기도 한데, 이 페이지가 피하려는 바로 그 거래입니다. 그러니 부서질 듯한 고서에는 맞는 선택이고, 한 상자 분량의 의료 기록에는 틀린 선택입니다.
자주 묻는 질문
처리 후 페이지 모양이 달라지나요?
더 반듯해질 뿐입니다. 1도쯤 비뚤게 스캔되었거나 옆으로 누운 페이지는 똑바로 세웁니다. 스캔 이미지는 그대로 두고, 인식한 단어를 보이지 않는 잉크로 그 위에 얹습니다. 화면에 그려지지도, 인쇄되지도 않습니다. 달라지는 점은 Ctrl+F로 검색이 된다는 것입니다.
제 문서가 어딘가에 저장되나요?
아니요. 인식 과정에서 아무것도 저장하지 않습니다. 인식 엔진과 언어 팩은 어떤 언어를 처음 쓸 때 이 사이트에서 받아 오며, 문서 자체는 기기를 떠나지 않습니다.
정확도는 어느 정도인가요?
인쇄된 글자를 깨끗하게 스캔했다면 매우 높습니다. 흐린 사진, 손글씨, 특이한 글꼴은 정확도를 떨어뜨립니다. 기울기는 읽기 전에 바로잡습니다. 괘선이 있는 표는 셀 단위로 읽으므로 양식의 항목명과 값이 뒤섞이지 않습니다.
어떤 언어가 되나요?
영어, 벵골어, 힌디어, 우르두어, 아랍어, 스페인어, 프랑스어, 중국어, 일본어, 한국어를 포함해 120개가 넘습니다. 문자는 페이지에서 감지하며, 같은 문자를 쓰는 언어가 여럿이면 브라우저 언어를 기준으로 정하고, 이는 바꿀 수 있습니다.
텍스트 레이어에서 일부 단어가 빠져 있어요. 왜 그런가요?
텍스트 레이어에는 내장 글꼴로 쓸 수 있는 글자만 담을 수 있습니다. 벵골 문자, 데바나가리 문자, 아랍 문자, 태국 문자 등 스물네 개 남짓한 문자는 전용 글꼴이 있지만, 중국어, 일본어, 한국어는 아직 없어서 해당 단어는 빈칸으로 저장하는 대신 개수를 알려 드립니다. PDF 워드 변환의 OCR 기능을 쓰면 그 텍스트를 모두 받을 수 있습니다.
시간은 얼마나 걸리나요?
페이지당 몇 초입니다. 서버 팜이 아니라 여러분의 기기가 직접 읽기 때문입니다. 진행 상황은 페이지별로 표시됩니다.
참고: 중국어, 일본어, 한국어 단어는 해당 글꼴이 추가될 때까지 빈칸으로 저장하는 대신 텍스트 레이어에서 빼고 개수를 알려 드립니다. 인식 엔진이 아는 나머지 모든 문자는 기록됩니다. 사진, 로고, 서명은 엉뚱한 텍스트가 되지 않도록 무시합니다. 손글씨는 어떤 범용 OCR 도구로도 안정적으로 인식되지 않습니다.
내 웹사이트에 이 도구 넣기
블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.