PDF 워드 변환
어떤 PDF든 편집 가능한 워드 문서로 바꿉니다. 이미지도 포함되며, 원본 페이지를 그대로 재현하는 “원본 모양 그대로” 모드와 스캔본용 OCR이 내장되어 있습니다. 아무것도 저장하지 않으며, 파일은 보관되지 않습니다.
- 저장되지 않음
- 대기열 없음, 기다림 없음
- 회원가입 없음, 워터마크 없음
사용 방법
PDF 추가
PDF를 페이지에 끌어다 놓으세요. 도구가 자동으로 파일을 확인하고, 스캔본이면 OCR을 켭니다.
모드 선택
기본값인 “편집 가능한 텍스트”는 PDF와 페이지가 일대일로 대응하는 일반 워드 문서를 만듭니다. 문단, 제목, 굵게와 기울임, 링크와 이미지가 들어가고, 각 페이지는 원래 크기와 여백, 줄 간격을 유지하므로 PDF의 12페이지가 문서의 12페이지가 됩니다. 파일 용량도 PDF와 비슷합니다. “원본 모양 그대로”는 페이지 그림 위에 모든 줄을 원래 위치에 고정합니다. 인쇄용으로는 PDF를 그대로 재현하지만, 편집하기 어렵고 용량이 몇 배 큽니다. 스캔본이면 OCR이 저절로 켜지고, 첫 페이지에서 언어를 알아내며, 비뚤게 스캔된 페이지를 바로잡습니다.
변환 후 다운로드
“워드로 변환”을 클릭하고, 제목과 문단이 정리된 깔끔한 .docx를 다운로드해 바로 편집하세요.
깔끔하게 변환되는 것과 그렇지 않은 것
PDF는 좌표에 글리프를 기록합니다. 문단이 없고, 누군가 일부러 태그를 달지 않았다면 제목도 없습니다. 그래서 둘 다 읽어 내는 것이 아니라 추론합니다. 같은 기준선에 있는 단어는 한 줄이 되고, 세로 간격이 벌어지면 새 문단이 시작되며, 문서 본문 크기 중앙값의 약 1.6배로 설정된 짧은 줄은 제목 1, 1.3배는 제목 2가 됩니다. 이 마지막 규칙은 편집을 시작하기 전에 알아 두면 좋습니다. 제목이 굵기만 하고 본문보다 크지 않은 문서는 본문 텍스트로 들어오며, Word의 탐색 창은 비어 있게 됩니다.
링크가 유지된다는 점에 많은 분이 놀랍니다. 텍스트 위의 링크 주석은 실제 워드 하이퍼링크가 되고, 12페이지로 이동하던 목차 항목이나 상호 참조는 그 페이지 맨 위에 심어 둔 책갈피로 가는 내부 링크가 됩니다. 그래서 변환 후에도 목차가 작동합니다.
전혀 읽히지 않는 것이 두 가지 있습니다. 입력된 PDF 양식의 답변은 페이지가 아니라 필드 객체에 있으므로 “편집 가능한 텍스트”에서는 아예 나타나지 않습니다. “원본 모양 그대로”에서는 페이지 그림의 일부이므로 보이지만, 편집할 수 있는 텍스트는 아닙니다. 주석과 스탬프도 같은 종류의 객체라서 같은 결과가 됩니다. 또 “원본 모양 그대로”에서는 그래픽을 144 DPI로 한 번 렌더링하고 그 위에 실제 텍스트를 놓으므로, PDF에서 벡터였던 로고나 차트가 .docx에서는 그림이 되며 확대하면 그 차이가 드러납니다.
다른 작업이 필요할 때
워드 문서가 아니라 글자만 필요하다면 Poppler의 pdftotext -layout file.pdf가 더 빠르고 예측 가능하며, 공백으로 단을 구분해 주고, PDF를 다른 곳에 넣을 때 흔히 쓰는 방법입니다. 그리고 PDF가 애초에 Word 파일로 만들어졌다면 만든 사람에게 .docx를 요청하세요. 모든 역변환은 좌표로부터 재구성한 결과이며, 재구성이 아닌 것은 원본뿐입니다.
표는 이 도구를 포함해 모든 PDF 변환기의 약점입니다. 문서 대부분이 표이고 숫자가 중요하다면, Tabula와 Camelot은 무료이고 바로 그 문제를 위해 만들어졌으며 범용 변환기보다 잘 처리합니다.
자주 묻는 질문
변환할 때 PDF가 저장되나요?
아니요. 두 변환 모드 모두 아무것도 저장하지 않으며, 파일은 보관되지 않습니다. OCR을 쓰면 처음 한 번 인식 엔진과 언어 팩을 이 사이트에서 내려받지만, 문서 자체는 어디로도 전송되지 않습니다.
스캔한 PDF나 문서를 찍은 사진도 변환할 수 있나요?
네. OCR을 켜면(스캔본을 감지하면 도구가 자동으로 제안합니다) 페이지 이미지에서 텍스트를 읽습니다. 언어는 페이지에서 감지하며, 영어, 벵골어, 힌디어, 우르두어, 아랍어, 스페인어, 중국어를 포함해 120개 이상을 지원합니다. 추측이 틀리면 직접 고를 수 있습니다. 괘선이 있는 양식은 “편집 가능한 텍스트” 모드에서 실제 워드 표로 변환됩니다.
OCR은 얼마나 정확한가요?
인쇄된 텍스트를 깨끗하게 스캔한 경우 정확도가 매우 높습니다. 흐릿한 사진, 손글씨, 특이한 글꼴에서는 품질이 떨어집니다. 선명하고 반듯하며 밝게 스캔할수록 결과가 가장 좋습니다.
서식과 이미지가 유지되나요?
네. “원본 모양 그대로”는 각 페이지를 원래 크기로 유지하며 두 겹으로 다시 만듭니다. 모든 사진, 로고, 색 띠, 벡터 그래픽은 PDF가 그리는 모습 그대로 재현되고, 그 위에 실제 텍스트가 원래 위치에 원래 색상, 굵기, 제목 그대로 놓입니다. “편집 가능한 텍스트”는 대신 PDF와 페이지 단위로 대응하며 깔끔한 문단과 제목, 읽는 순서대로 배치된 이미지를 다시 만듭니다. 많이 편집할 계획이라면 이쪽이 더 좋습니다.
어떤 워드 형식으로 받나요?
Microsoft Word, Google Docs, LibreOffice를 비롯한 모든 최신 편집기에서 열리는 표준 .docx 파일입니다.
페이지나 파일 제한이 있나요?
정해진 제한은 없습니다. OCR은 사용자의 기기가 직접 읽기 때문에 페이지당 몇 초가 걸리므로, 아주 긴 스캔본은 그만큼 오래 걸릴 뿐입니다. 진행 표시기가 현재 위치를 정확히 보여 줍니다.
참고: PDF는 자체 글꼴을 내장하는데 Word는 이를 쓸 수 없으므로 글꼴은 비슷한 글꼴로 대체됩니다. 그래서 “원본 모양 그대로”는 픽셀 단위로 똑같지는 않고 거의 똑같으며, 줄이 원본보다 약간 넓거나 좁을 수 있습니다. 텍스트 PDF의 표는 워드 표가 아니라 위치가 지정된 텍스트로 변환됩니다. 스캔본에서는 괘선이 있는 표는 워드 표가 되지만 괘선이 없는 표는 위치가 지정된 텍스트로 남습니다. OCR은 사진, 로고, 장식 그래픽이 깨진 글자가 되지 않도록 일부러 무시하고, 손글씨와 도장은 그림으로 남기며, 페이지당 몇 초가 걸립니다.
내 웹사이트에 이 도구 넣기
블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.