사진 속 벵골어를 텍스트로
책 페이지 사진, 스캔본, 스크린샷을 올리면 벵골어 텍스트를 Unicode로 돌려받습니다. 검색과 편집이 가능하고 바로 붙여 넣을 수 있습니다. 인식기는 사진이 도착하기 전에 이미 벵골어로 설정되어 있어 감지할 것도 고를 것도 없습니다. 사진은 저장하지 않습니다.
- 저장되지 않음
- 대기열 없음, 기다림 없음
- 회원가입 없음, 워터마크 없음
사용 방법
사진 추가
책 페이지 사진, 오래된 공문, 스캔한 증명서, 벵골어 텍스트 스크린샷 모두 됩니다. JPG, PNG, WebP, HEIC, TIFF를 지원하며, 비스듬히 찍은 사진은 먼저 기울기를 바로잡습니다.
읽기
벵골어가 이미 선택되어 있습니다. 양식이나 레터헤드처럼 페이지에 영어도 있다면 목록에서 추가하면 둘 다 읽습니다.
Unicode로 복사
원본이 어떤 글꼴로 인쇄되었든 텍스트는 Unicode로 나옵니다. SutonnyMJ로 된 공문도 “evsjv‡`k”가 아니라 평범한 벵골어로 읽힙니다. 레이아웃을 유지하거나 줄을 이은 뒤 복사하거나 다운로드하세요.
벵골어 인식에서 달라지는 점
벵골어 모델은 글자가 아니라 묶음 단위로 읽습니다. ক্ষ나 ন্ত্র 같은 합자는 페이지에서 하나의 모양이고, 모델은 그것이 무엇인지와 Unicode로 어떻게 분해되는지를 모두 판단해야 합니다. 그래서 벵골어의 오인식은 글자 자체가 틀리기보다 합자가 틀리거나 모음 기호가 다른 글자에 붙는 형태로 나타나는 것이 보통입니다. 출력은 Unicode가 기대하는 순서입니다. 모음 기호는 자음 묶음 뒤에 오고, 레프는 그것이 올라앉는 묶음 앞에 র + 하산타로 쓰이며, 두 부분 모음은 하나의 코드 포인트로 나옵니다. 모든 검색창, 맞춤법 검사기, 글꼴이 기대하는 순서이며, Bijoy 타이피스트가 입력하는 보이는 순서와는 반대입니다.
일반 인식기가 하는 일은 여기서도 모두 합니다. 종이의 조명을 고르게 하고, 페이지를 똑바로 돌리고, 괘선이 있는 표는 항목명과 값이 뒤섞이지 않도록 셀 단위로 읽으며, 결과는 페이지 레이아웃 그대로 또는 문단으로 이어서 돌려줍니다. 벵골 숫자로 인쇄된 숫자는 벵골 숫자로 읽고, ০১২와 012가 섞인 양식은 둘 다 유지합니다.
벵골어 모델은 다른 언어와 공유하지 않지만, 사진에는 레터헤드, 참조 번호, 서명란 같은 영어가 함께 있을 수 있고, 한 언어는 다른 언어를 엉터리로 읽습니다. 목록에서 영어를 추가하면 두 팩으로 페이지를 읽어 각 단어를 인쇄된 문자 체계 그대로 유지합니다.
다른 작업이 필요할 때
파일로 아직 남아 있는 Bijoy 문서는 사진으로 찍기보다 변환하는 편이 낫습니다. OCR은 픽셀에서 텍스트를 다시 만들어 내므로 가장 좋은 페이지에서도 1,000자 중 몇 자는 틀립니다. Bijoy Unicode 변환은 키 입력에서 텍스트를 다시 만들어 하나도 틀리지 않고, 굵게와 표도 유지합니다. 파일이 사라졌을 때만 페이지를 찍으세요.
책 한 권이나 스캔 아카이브 전체라면 데스크톱 도구가 맞습니다. 같은 벵골어 모델을 쓰는 명령줄 OCR 도구는 폴더 하나를 밤새 읽어 내고, OCRmyPDF는 그 안의 모든 PDF에 검색 가능한 텍스트 레이어를 넣어 줍니다. 이 페이지는 눈앞의 한 페이지를 위한 것입니다.
자주 묻는 질문
제 사진이 어딘가에 저장되나요?
아니요. 언어 팩은 해당 언어를 처음 사용할 때 이 사이트에서 받아 옵니다. 사진 자체는 저장되지도, 어디로 전송되지도 않으므로 Wi-Fi를 꺼도 작동합니다.
벵골어를 얼마나 잘 읽나요?
SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi 같은 흔한 서체로 인쇄된 벵골어(책이나 신문)를 정면에서 초점을 맞춰 찍었다면 잘 읽히고, 흐리거나 바랜 페이지에서는 합자가 간혹 틀립니다. 오류는 이 문자 체계 특유의 것입니다. 모델이 그 모양으로 본 적 없는 글자에 붙은 레프나 모음 기호, 작게 인쇄된 합자가 그렇습니다. 300 dpi로 깨끗하게 스캔한 것이 휴대폰 사진보다, 햇빛 아래서 찍은 휴대폰 사진이 형광등 아래서 찍은 것보다 잘 읽힙니다.
Bijoy 문서에도 쓸 수 있나요?
네, 가장 유용한 용도 중 하나입니다. OCR은 글꼴의 코드 포인트가 아니라 글자의 그림을 읽으므로, SutonnyMJ로 입력한 페이지가 바로 Unicode 벵골어로 나옵니다. 변환이 필요 없습니다. 아직 Bijoy 상태인 Word 파일(그림이 아닌 텍스트)이라면 대신 Bijoy Unicode 변환을 쓰세요. 서식이 유지되고 인식 오류도 없습니다.
왜 벵골어만 별도 페이지인가요?
감지에는 시간이 들고, 다른 문자 체계보다 벵골어를 더 자주 틀리기 때문입니다. 라틴 문자 레터헤드, 도장, 숫자가 있는 페이지는 영어로 읽혀 확신에 찬 엉터리 페이지가 나올 수 있습니다. 사진이 도착하기 전에 언어를 정해 두면 페이지를 여는 순간 벵골어 팩이 내려받기를 시작하고, 인식기가 잘못된 언어를 오디션하는 일도 없습니다. 일반 이미지 텍스트 추출 페이지는 감지를 켠 채 같은 일을 하며, 어떤 언어의 사진이든 처리합니다.
손글씨도 읽을 수 있나요?
또박또박 쓴 인쇄체는 가끔 읽히지만, 이어 쓴 손글씨는 벵골어든 다른 어떤 문자든 읽히지 않습니다. 모든 일반 OCR 도구가 그렇습니다. 손글씨 인식 페이지는 그 점을 분명히 밝히고 인식한 결과를 보여 줍니다.
스캔한 PDF는 어떻게 하나요?
문서 전체에는 벵골어 PDF 워드 변환을 쓰세요. 모든 페이지를 같은 방식으로 읽어 .docx로 만들어 줍니다. 이 페이지는 사진 한 장을 위한 것입니다.
참고: 인쇄된 글자만 지원하며, 이어 쓴 손글씨는 인식되지 않습니다. 장식적인 벵골어 서체, 사진 위의 글자, 심하게 바랜 인쇄물은 군데군데 빠집니다. 아삼어는 별도 팩이므로 아삼어 페이지라면 목록에서 추가하세요. 결과는 일반 텍스트이며 굵게, 색, 사진 자체는 옮겨지지 않습니다.
내 웹사이트에 이 도구 넣기
블로그, 수업 페이지, 도움말 글 어디에나 무료로 넣을 수 있습니다. 코드 한 줄만 붙여 넣으면 방문자가 페이지에서 바로 사용할 수 있습니다.