본문 바로가기

스캔한 PDF에서 검색이 안 되는 이유

파일 안에 글자가 없기 때문입니다. 파일에 실제로 무엇이 들어 있는지 알면 모든 증상이 설명되고, 얼마나 잘 고칠 수 있는지를 결정하는 단 하나의 설정도 보입니다.

최종 검토:

파일 안에 글자가 없습니다

PDF는 화면에서는 똑같아 보이는 전혀 다른 두 가지를 담을 수 있습니다. Word에서 내보낸 문서에는 텍스트, 즉 위치와 글꼴을 가진 실제 문자들이 들어 있습니다. 그래서 문장을 선택하고, 이름을 검색하고, 문단을 복사할 수 있습니다. 스캔한 문서에는 페이지를 찍은 사진이 들어 있습니다. 도로 표지판을 찍은 사진에 픽셀밖에 없는 것과 똑같이, 여기에도 픽셀밖에 없습니다.

모든 증상은 이 한 가지 사실에서 나옵니다. 일치시킬 것이 없으니 검색 결과가 없습니다. 선택할 텍스트가 없으니 텍스트 선택이 안 되고, 커서가 그림 위에 사각형을 그릴 뿐입니다. 복사해도 아무것도 나오지 않습니다. 이미지는 무겁고 글자는 가볍기 때문에 분량에 비해 파일이 큽니다. 그리고 Word로 변환하면 빈 문서가 나오거나, 그림 한 장이 붙은 문서가 나옵니다.

빠른 확인법: 마우스로 단어 하나를 선택해 보세요. 텍스트 커서가 나타나고 단어가 강조되면 실제 텍스트가 있는 것입니다. 사각형이 그려지면 그림입니다.

OCR이 실제로 더하는 것

광학 문자 인식(OCR)은 그림 속 모양을 읽고 어떤 글자인지 알아냅니다. 유용한 부분은 그다음입니다. 인식된 단어가 이미지 속 단어 위에 위치를 맞춘 보이지 않는 텍스트로 PDF에 다시 기록됩니다. 시각적으로는 아무것도 바뀌지 않았으니 페이지는 원래 모습 그대로지만, 이제 검색하고, 선택하고, 복사하고, 색인할 수 있습니다.

일부러 보수적으로 설계한 방식이며, 문서에는 이것이 옳습니다. 아무것도 다시 조판하지 않으므로 계약서는 서명한 계약서 모습 그대로이고, 원래 스캔본이 시각적 기록으로 남습니다. PDF OCR은 이 작업을 한 번에 처리하며, 인식하려면 어차피 필요했기 때문에 보통 페이지 기울기와 방향도 바로잡습니다.

검색 가능한 문서가 아니라 편집 가능한 문서가 필요하다면, 그것은 전혀 다르고 훨씬 어려운 작업입니다. 텍스트를 추출하고, 레이아웃을 추정하고, 결과를 문단과 표로 다시 짜야 합니다. PDF 워드 변환이 이 일을 하며, 텍스트 레이어와 달리 결과를 항상 검토해야 합니다.

모든 것을 결정하는 설정: 300 DPI

인식 정확도는 소프트웨어보다 스캔 품질에 훨씬 크게 좌우되며, 가장 중요한 숫자는 해상도입니다. 300 DPI가 표준이며, 임의로 정한 숫자가 아닙니다. 일반 본문 글자에 약 30픽셀의 높이를 주는데, 이는 비슷한 글자 모양을 구별하는 데 필요한 최소치보다 넉넉하게 많습니다.

150 DPI에서는 정확도가 눈에 띄게 떨어지고, 오류도 알아채기 어려운 종류가 됩니다. 1을 l로, 5를 S로, rn을 m으로 읽는 식입니다. 그보다 낮으면 빠르게 나빠집니다. 300을 넘겨도 도움이 되는 경우는 드물고 파일만 훨씬 커집니다. 600 DPI는 아주 작은 글씨나 상태가 나쁜 원본에만 쓸 가치가 있습니다.

다른 촬영 설정 세 가지도 거의 비슷하게 중요합니다. 흑백이 아닌 회색조로 스캔하세요. 딱 잘라 나누는 흑백 처리는 글자의 가는 부분을 없애 버립니다. 센서와 평행하게 똑바로 놓으세요. 비스듬히 찍은 페이지는 위치에 따라 글자 모양이 달라집니다. 그리고 조명을 고르게 하세요. 위에서 페이지를 찍다가 내 그림자가 드리우는 것이 전형적인 실패입니다.

어떤 OCR도 읽지 못하는 것

이 점을 솔직하게 알면 시간을 크게 아낄 수 있습니다. 이어 쓴 필기체는 범용 OCR이 인식하지 못하며, 그 이유는 노력의 문제가 아니라 구조적인 것입니다. 인쇄체를 읽는 방식은 글자 사이의 경계를 찾는 것인데, 필기체에는 그 경계가 없습니다. 또박또박 쓴 글자, 정자체 대문자, 양식의 칸 안에 쓴 글자는 대개 잘 인식됩니다. 사이에 간격이 있는 따로 떨어진 모양이기 때문입니다.

사진의 일부인 텍스트, 즉 간판이나 제품 위의 글자, 복잡한 배경 위의 글자는 종이 위의 텍스트보다 훨씬 어렵고, 장식이 심한 글꼴은 더 어렵습니다. 복사본을 다시 복사한 문서는 글자를 구별해 주는 가는 획을 잃습니다. 도장, 메모, 형광펜 표시가 있는 문서는 그 표시가 글자와 겹치는 곳마다 인식이 나빠집니다.

좋은 도구는 얼마나 확신하는지 알려 주며, 그 수치는 활용하라고 있는 것입니다. 문맥으로 읽을 수 있는 문장 중간의 낮은 신뢰도는, 계좌 번호 속 숫자 하나의 낮은 신뢰도보다 훨씬 덜 중요합니다. 위험한 오류는 확신에 찬 오류입니다. 아무것도 그것을 표시해 주지 않기 때문입니다.

단순한 편의 이상의 문제인 이유

텍스트 레이어가 없는 스캔 문서 보관소는 사실상 잃어버린 것과 같습니다. 아무것도 그것을 검색할 수 없고, 색인할 수 없으며, 어떤 컴플라이언스 시스템도 그 안에서 이름을 찾을 수 없고, 어떤 화면 낭독기도 소리 내어 읽을 수 없습니다. 많은 법역에서는 이 때문에 그런 문서를 공개하는 것이 불편함을 넘어 법적인 문제가 됩니다.

처음부터 올바른 설정으로 스캔하기를 고집할 가치가 있는 이유도 여기에 있습니다. 문서 한 상자를 다시 스캔하는 비용은 처음에 제대로 스캔하는 비용보다 훨씬 크며, 아무리 처리해도 애초에 담기지 않은 디테일은 되살릴 수 없습니다.

자주 묻는 질문

OCR은 실제로 얼마나 정확한가요?

일반 인쇄 텍스트를 깨끗하게 300 DPI로 스캔했다면 매우 정확합니다. 오류가 일상적이지 않고 가끔 생기는 수준입니다. 어두운 곳에서 비스듬히 찍은 휴대폰 사진이라면 극적으로 나빠집니다. 어떤 소프트웨어를 고르느냐보다 스캔 품질이 훨씬 중요합니다.

OCR을 하면 문서 모양이 바뀌나요?

아니요. 인식된 텍스트는 기존 이미지 위에 보이지 않게 더해지므로 페이지는 원래 모습 그대로입니다. 처리 과정에서 보통 페이지 기울기와 방향을 바로잡는데, 이는 비뚤어진 스캔본을 달라 보이게 하기보다 더 보기 좋게 만듭니다.

OCR 후에 텍스트를 편집할 수 있나요?

PDF 안에서는 안 됩니다. 보이는 페이지는 여전히 그림이고, 텍스트 레이어는 그 위에 보이지 않게 얹혀 있습니다. 편집 가능한 문서가 필요하다면 인식된 문서를 Word로 변환하고, 결과를 검토할 각오를 하세요.

OCR로 손글씨도 인식되나요?

또박또박 떨어뜨려 쓴 글자와 작성된 양식은 대개 인식됩니다. 이어 쓴 글씨는 어떤 범용 OCR 도구로도 안 됩니다. 글자가 서로 이어져 찾을 경계가 없기 때문입니다. 손글씨에 특화해 학습한 도구가 더 잘하지만, 대신 페이지를 제3자에게 보내야 합니다.

검색 가능한 PDF가 왜 이렇게 커졌나요?

거의 변하지 않아야 정상입니다. 텍스트 레이어는 페이지당 몇 KB 수준입니다. 크게 늘었다면 페이지를 그대로 두지 않고 다시 렌더링했을 가능성이 높으니 확인해 볼 만합니다. 텍스트 레이어의 핵심은 원본 이미지를 손대지 않고 보존한다는 점이니까요.