편집 후에도 실제로 남는 것
PDF는 한 가지로 이루어져 있지 않습니다. 눈에 보이는 페이지 내용 외에도 개요(책갈피), 양식 필드와 그 값, 화면 낭독기를 위한 태그 구조, 첨부 파일, 디지털 서명, 문서 메타데이터를 담고 있습니다. 대부분의 온라인 도구는 이 중 여러 가지를 말없이 버리고, 사용자는 나중에야 알게 됩니다.
저희 도구가 하는 일은 이렇습니다. 경계는 생각보다 분명합니다. 합치기, 분할, 페이지 추출은 완전히 새 문서를 만들고 그 안에 페이지를 복사합니다. *페이지 위에* 있는 모든 것은 그대로 옮겨집니다. 텍스트, 이미지, 벡터 그래픽은 다시 압축하거나 크기를 바꾸지 않고 복사하므로 페이지는 겉보기에 똑같습니다. 하지만 *문서* 수준에 있는 것은 모두 남겨집니다. 책갈피 개요, 양식 사전, 화면 낭독기가 따라가는 태그 구조, 문서 언어, 제목과 작성자 필드가 그렇습니다. 그래서 합치거나 분할한 파일에는 책갈피가 전혀 없습니다. 첫 번째 파일의 것도, 다른 어떤 것도 없습니다. 양식의 입력란은 그려져 있어도 더 이상 입력 가능한 필드가 아닐 수 있습니다. 개요를 유지하는 것이 중요하다면, qpdf는 합칠 때 기본 문서의 카탈로그를 유지합니다. 브라우저에서 실행되는 도구 중에는 그렇게 하는 것이 없습니다.
입력 파일 사이에 리소스를 공유하지도 않습니다. 사람들이 의외라고 느끼는 결과가 여기서 나옵니다. 같은 글꼴이 포함된 보고서 두 개를 합치면 글꼴이 두 번 포함되므로, 합친 파일은 더 작아지는 게 아니라 대략 두 파일을 더한 크기가 됩니다. 회전은 이 모든 것의 예외입니다. 새 문서를 만드는 대신 문서를 불러와 다시 저장하면서 페이지의 회전 값만 바꾸므로, 손실이 없고 되돌릴 수 있으며 개요, 양식, 태그, 메타데이터가 그대로 유지됩니다.
용량 줄이기는 무언가를 포기하는 유일한 작업이며, 무엇을 포기하는지 솔직하게 밝힙니다. 이미지는 더 낮은 품질로 다시 인코딩하고, 텍스트와 벡터 그래픽은 건드리지 않습니다. 그래서 텍스트만 있는 보고서는 거의 줄지 않고, 스캔한 브로슈어는 90%까지 줄어들 수 있습니다.
디지털 서명은 어떤 편집에서도 유지되지 않습니다. 설계상 그렇습니다. 서명은 문서의 정확한 바이트를 대상으로 하므로, 서명된 PDF를 합치거나 분할하거나 회전하거나 용량을 줄이면 서명이 무효가 됩니다. 도구의 버그가 아니라 형식이 제대로 작동하는 것이며, 세상 어떤 PDF 편집기도 이를 피할 수 없습니다.
브라우저가 정말 알맞지 않은 경우
이 도구들은 파일을 안전하게 지키기 위해 만들어졌고, 그에 따른 대가가 있습니다. 작업 도중에 알게 되기보다 여기서 미리 말씀드리는 편이 낫다고 생각합니다.
아주 큰 파일. 모든 것을 기기의 메모리에 올려 두기 때문에, 한계는 요금제가 아니라 탭이 쓸 수 있는 메모리입니다. 노트북에서는 수백 MB도 무난하지만 휴대폰은 더 일찍 한계에 부딪힙니다. 서버 기반 도구는 저희가 열 수 없는 2 GB 파일도 스트리밍으로 처리할 수 있습니다.
스캔한 페이지. PDF가 종이를 찍은 사진이라면 그 안에는 찾을 텍스트가 없습니다. 저희 OCR 도구는 검색하고 복사할 수 있을 만큼 잘 읽어 내지만, 해당 언어와 레이아웃에 맞게 학습된 전용 데스크톱 OCR 프로그램이 더 낫고, 어느 쪽도 복잡한 표를 완벽하게 재구성하지는 못합니다.
정확한 인쇄 재현. 별색, 오버프린트, 트래핑, ICC 렌더링 의도는 전문 인쇄 전처리 소프트웨어의 영역입니다. 파일에 이미 있는 색상 데이터는 보존하지만, 관리하지는 않습니다.
일괄 처리와 자동화. 이 도구들은 사람이 클릭할 때 실행됩니다. 청구서 4,000개를 정해진 일정에 따라 변환하는 것은 서버의 명령줄 도구가 할 일입니다. Ghostscript, qpdf, pdfcpu는 모두 무료이며, 어떤 웹 페이지보다 이 작업을 잘합니다.
비슷해 보이는 도구 중 고르기
PDF 합치기와 PDF 페이지 순서 변경. 합치기는 파일 전체를 이어 붙이며 파일 순서를 정할 수 있습니다. 순서 변경은 문서 하나 안에서 작동하며 페이지를 하나씩 끌어서 옮길 수 있습니다. 여러 파일을 합치면서 *동시에* 페이지를 섞으려면 두 단계가 필요합니다. 먼저 합치고, 그다음 순서를 바꾸세요.
PDF 분할과 PDF 페이지 추출. 분할은 문서 하나를 여러 문서로 나눕니다. 추출은 선택한 페이지를 새 파일 하나로 뽑아내고 원본은 그대로 둡니다.
PDF 비밀번호 해제와 제한 해제. 비밀번호 해제는 비밀번호가 있어야 하며 암호화를 제거합니다. 제한은 소유자가 설정한 인쇄 금지, 복사 금지 같은 플래그로, 권고 사항일 뿐이라 비밀번호 없이 해제할 수 있습니다. 어느 쪽도 열람 권한이 없는 문서에 들어가는 방법이 아닙니다.
PDF 워드 변환과 PDF 텍스트 추출. PDF 워드 변환은 문단, 제목, 표를 편집 가능한 Word 내용으로 다시 만들며, 복잡한 레이아웃에서는 완벽하지 않을 수 있습니다. 텍스트 추출은 서식 없이 글자만 그대로 가져오며, 검색이나 분석, 다른 프로그램에 넣을 때 필요한 것이 바로 이것입니다.