벵골어 PDF를 워드로 변환
공문, 양식, 책의 한 장, 스캔본 같은 벵골어 PDF를 편집할 수 있는 .docx로 바꿉니다. 합자와 모음 기호는 올바른 순서로 들어가고, 스캔 페이지에는 벵골어로 설정된 OCR이 적용됩니다. 아무것도 저장하지 않습니다.
- 저장되지 않음
- 대기열 없음, 기다림 없음
- 회원가입 없음, 워터마크 없음
사용 방법
PDF 추가
텍스트 PDF든 스캔본이든 됩니다. 도구가 첫 페이지를 살펴 스캔본이면 OCR을 켜며, 인식기는 이미 벵골어로 설정되어 있습니다.
모드 선택
“편집 가능한 텍스트”는 페이지가 일대일로 대응하는 일반 워드 문서를 만듭니다. “원본 모양 그대로”는 페이지 그림 위에 모든 줄을 원래 위치에 고정하며, 편집보다 인쇄용입니다.
변환 후 다운로드
제목, 문단, 이미지, 링크가 들어간 Unicode 벵골어 글꼴의 .docx입니다.
벵골어 PDF는 무엇이 다른가
재배열이 핵심입니다. PDF 텍스트 레이어는 글리프를 그리는 순서로 담고 있고, 벵골어 셰이핑 엔진은 자음 앞에 붙는 모음 기호(ি, ে, ৈ)를 자음보다 먼저 그리며 ো와 ৌ를 자음 양쪽의 글리프 두 개로 나눕니다. 그래서 단순 추출기에서 나오는 텍스트는 페이지에 “স্বাভাবিক”라고 적혀 있어도 “স্ব␃াভািবক”가 됩니다. 각 줄은 다른 어떤 처리보다 먼저 논리 순서로 되돌립니다. 모음 기호는 묶음 뒤에, 레프는 그것이 올라앉는 묶음 앞에 র্로, 두 부분 모음은 하나의 코드 포인트로. OCR 출력에는 이 과정이 필요 없습니다. 엔진이 이미 논리 순서로 내놓기 때문입니다.
제목, 문단, 링크, 이미지, 페이지 나누기는 일반 PDF 워드 변환 페이지와 똑같이 판단합니다. 같은 기준선의 단어는 한 줄이 되고, 간격이 벌어지면 새 문단이 시작되며, 본문 크기의 1.6배인 짧은 줄은 제목이 되고, 링크 주석은 워드 하이퍼링크가 됩니다. “원본 모양 그대로”는 페이지 그래픽을 144 DPI로 렌더링하고 그 위에 실제 텍스트를 놓으며, “편집 가능한 텍스트”는 읽는 순서대로 깔끔한 문단을 다시 만듭니다.
벵골 숫자는 벵골 숫자로 유지되고, 이메일 주소나 참조 번호처럼 페이지에 있는 라틴 문자 단어는 라틴 문자로 남습니다. 스캔본에서는 벵골어 팩이 로드되므로, 영어 레터헤드가 있는 벵골어 페이지는 벵골어는 올바르게 읽되 레터헤드는 벵골어 모양의 엉터리로 읽힐 수 있습니다. 영어가 중요하다면 언어 목록에서 영어를 추가하세요.
다른 작업이 필요할 때
Word 파일로 만든 PDF는 재구성을 기다리는 파일일 뿐이니, 가능하다면 .docx를 요청하세요. 그리고 Bijoy .docx는 PDF로 인쇄해 다시 변환하기보다 Bijoy Unicode 변환으로 변환하는 편이 낫습니다. 키 입력은 오류 하나 없이 변환되고, 서식이 유지되며, 픽셀에서 다시 읽어 내는 것이 없습니다.
스캔한 벵골어 책 아카이브라면, 벵골어 모델이 있는 데스크톱 OCR 도구가 폴더를 밤새 읽어 내고 OCRmyPDF가 각 PDF의 모양을 바꾸지 않고 검색 가능한 레이어를 넣어 줍니다. 수백 개 파일에는 그런 도구가 맞고, 이 페이지는 한 개를 위한 것입니다.
자주 묻는 질문
제 PDF가 저장되나요?
아니요. 아무것도 저장하지 않으며, 파일은 보관되지 않습니다. 스캔본이면 인식 엔진과 벵골어 팩을 이 사이트에서 한 번 받아 와 다음을 위해 보관하지만, 문서 자체는 어디로도 전송되지 않습니다.
PDF에서 꺼낸 벵골어는 왜 대개 맞춤법이 틀려 보이나요?
PDF는 글리프를 그려진 순서로 저장하는데, 벵골어에서는 그것이 보이는 순서이기 때문입니다. 이카르는 뒤따르는 자음보다 먼저 그려지고, ো의 두 부분은 자음 양쪽에 놓입니다. 대부분의 변환기는 그 순서를 그대로 베껴 내므로 বাংলাদেশ는 모음 기호가 엉뚱한 글자 앞에 붙어 나오고, 모든 단어가 맞춤법 검사기로는 고칠 수 없는 방식으로 틀립니다. 이 변환기는 기호를 Unicode가 원하는 자리로 되돌립니다. 이 사이트에서 만든 것을 포함해 모든 벵골어 PDF에 필요한 재배열입니다.
Bijoy 문서로 만든 PDF도 처리하나요?
PDF에 SutonnyMJ 텍스트 레이어가 있다면 파일에 그렇게 들어 있으므로 텍스트는 Bijoy 키 입력으로 나옵니다. 결과를 Bijoy Unicode 변환에 넣으면 서식이 유지됩니다. PDF가 스캔본이면 OCR이 그림을 읽어 바로 Unicode를 내놓습니다.
벵골어 스캔본의 OCR은 얼마나 좋은가요?
인쇄된 벵골어를 300 dpi로 깨끗하게 스캔한 것은 잘 읽히고, 바랜 복사본과 휴대폰 사진은 합자를 놓칩니다. 이 페이지에서는 언어가 벵골어로 고정되어 있어 라틴 문자 레터헤드나 참조 번호 때문에 페이지 전체가 영어로 읽히는 일이 없습니다. 비뚤게 스캔된 페이지는 먼저 바로잡습니다.
어떤 워드 형식으로 받나요?
Word, Google Docs, LibreOffice에서 열리는, Unicode 벵골어 글꼴로 설정된 표준 .docx입니다. 텍스트는 진짜 Unicode라서 검색이 되고 Avro나 Ridmik으로 이어서 입력할 수 있습니다.
표와 양식은 어떻게 되나요?
스캔본의 괘선 있는 양식은 “편집 가능한 텍스트” 모드에서 실제 워드 표로 나옵니다. 텍스트 PDF의 표는 모든 PDF 워드 변환기와 마찬가지로 위치가 지정된 텍스트로 나오며, 스프레드시트가 필요하다면 PDF 엑셀 변환이 더 알맞습니다.
참고: 글꼴은 대체됩니다. .docx는 PDF 자체의 글꼴이 아니라 Unicode 벵골어 글꼴을 쓰므로 모양은 똑같지 않고 비슷합니다. Bijoy 글꼴로 조판된 텍스트 PDF는 Bijoy 키 입력으로 변환되어 나중에 Bijoy Unicode 변환이 필요합니다. OCR은 사진과 로고를 무시하고, 손글씨는 그림으로 남기며, 읽는 데 페이지당 몇 초가 걸립니다.
내 웹사이트에 이 도구 넣기
블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.