从图片中识别孟加拉文
对准一页书的照片、一份扫描件或一张截图,就能拿回Unicode格式的孟加拉文——可搜索、可编辑、可直接粘贴。图片到来之前识别器就已设为孟加拉文,无需检测,也无需选择。您的图片绝不存储。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加图片
一页书的照片、一份旧通告、一张扫描的证书,或一张孟加拉文截图。JPG、PNG、WebP、HEIC和TIFF都可以;斜着拍的照片会先摆正。
交给它识别
孟加拉文已预先选定。如果页面上还有英文——表单、信头——从列表中加上英文,两种文字都会被识别。
复制为Unicode
无论原件用什么字体印刷,识别结果都是Unicode:一份SutonnyMJ排版的通告读出来是正常的孟加拉文,而不是"evsjv‡`k"。可以保留版式或合并各行,然后复制或下载。
孟加拉文对识别的影响
孟加拉文模型按字符簇而不是按单个字母来识别。像ক্ষ或ন্ত্র这样的连字在页面上是一个整体形状,模型既要判断它是什么,又要判断它如何分解为Unicode——所以孟加拉文的误识别通常表现为错误的连字,或元音符号落在错误的字母上,而不是直接认错一个字母。输出按Unicode要求的顺序排列:元音符号跟在它所属的辅音簇之后,reph写成র + hasanta放在它所依附的字符簇之前,两部分元音合为一个码位。这是所有搜索框、拼写检查和字体所期望的顺序,而它与Bijoy打字员使用的视觉顺序恰好相反。
普通识别器所做的一切这里也都会做:均衡纸张光线、摆正页面、带框线的表格逐格读取以免标签和数值连在一起,结果可以按页面原有版式返回,也可以合并成段落。印成孟加拉文数字的数字会按孟加拉文数字读出;混用০১২和012的表单会两者都保留。
孟加拉文的模型不与任何其他语言共用,但图片上仍可能有英文——信头、编号、签名栏——一种语言会把另一种读成乱码。从列表中添加英文后,页面会用两个语言包一起识别,每个词都保留在它原本印刷所用的文字里。
如果您需要的是别的
还以文件形式存在的Bijoy文档,与其拍照不如直接转换。OCR从像素重建文字,即使在最好的页面上也会每千个字符错几个;Bijoy转Unicode转换器从按键重建文字,一个都不会错,还能保留粗体和表格。只有在文件已经丢失时才去拍页面。
整本书或整个扫描件档案,适合用桌面工具:使用同一孟加拉文模型的命令行OCR工具能在一夜之间读完一个文件夹,OCRmyPDF则能给其中每个PDF加上可搜索的文字层。本页面是为您眼前的这一页准备的。
常见问题
我的图片会被存储吗?
不会。首次使用某种语言时,会从本站下载该语言包;图片本身绝不存储,也不会发送到任何地方,所以断开Wi-Fi也能使用。
识别孟加拉文的效果如何?
用常见字体——SutonnyMJ、Nikosh、Kalpurush、SolaimanLipi,或是书籍、报纸——印刷的孟加拉文,正对拍摄、对焦清晰时识别效果很好,模糊或褪色的页面上偶尔会错一个连字。错误都带有这种文字的特点:模型没见过那种形状的reph或元音符号落在了错误的字母上,以及印得很小的连字。300 dpi的清晰扫描件比手机照片识别得好,日光下的手机照片又比日光灯下拍的好。
对Bijoy文档有效吗?
有效,而且这是它最好的用途之一。OCR读的是字母的图像,而不是字体的码位,所以一页用SutonnyMJ输入的文字会直接输出为Unicode孟加拉文——无需转换。如果Word文件还是Bijoy格式(是文本,不是图片),请改用Bijoy转Unicode:它能保留格式,而且不会有识别错误。
为什么孟加拉文要单独一个页面?
因为语言检测既花时间,又比其他文字更容易把孟加拉文弄错:一页带拉丁字母信头、印章或编号的文件可能被当成英文来读,结果就是满满一页自信的乱码。在图片到来之前就设定好语言,意味着页面一打开,孟加拉文语言包就开始下载,识别器也永远不会去试错误的语言。普通的图片转文字页面做的是同样的工作,只是开着检测,适用于任何语言的图片。
能识别手写字吗?
工整分开的印刷体手写有时可以;连笔手写则不行,孟加拉文和其他任何文字都一样——所有通用OCR工具都是如此。手写文字识别页面会明确说明这一点,并展示它能识别出多少。
扫描版PDF怎么办?
整份文档请用孟加拉文PDF转Word:它以同样的方式读取每一页,并给您一个.docx。本页面只处理一张图片。
小贴士: 仅限印刷文字:连笔手写无法识别。装饰性的孟加拉文字体、印在照片上的文字和严重褪色的印刷品,识别结果会残缺不全。阿萨姆文是单独的语言包——如果页面是阿萨姆文,请从列表中添加。结果为纯文本:粗体、颜色和图片本身都不会保留。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。