将孟加拉文PDF转换为Word
把孟加拉文PDF——通告、表单、书的章节、扫描件——转成可编辑的.docx,连字和元音符号顺序正确,扫描页的OCR预设为孟加拉文。不存储任何文件。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加PDF
文字版PDF或扫描件都可以。工具会查看第一页,遇到扫描件就开启OCR;识别器已预设为孟加拉文。
选择模式
“可编辑文本”生成一份普通的Word文档,逐页对应。“外观一致”把每一行固定在原位,叠放在页面图像之上,适合打印而不适合编辑。
转换并下载
一份使用Unicode孟加拉文字体的.docx,包含标题、段落、图片和链接。
孟加拉文PDF有什么不同
重排就是全部的关键。PDF文字层按绘制顺序保存字形,而孟加拉文的字形引擎会把前置元音符号(ি、ে、ৈ)画在辅音之前,并把ো和ৌ拆成辅音两侧的两个字形;所以普通提取工具取出的是"স্ব␃াভািবক",而页面上写的是"স্বাভাবিক"。在其他任何处理之前,每一行都会先恢复为逻辑顺序——元音符号在其字符簇之后,reph写成র্放在它所依附的字符簇之前,两部分元音合为一个码位。OCR的输出不需要这一步,因为识别引擎本来就输出逻辑顺序。
标题、段落、链接、图片和分页的判断方式与通用的PDF转Word页面完全相同:共享同一基线的文字组成一行,间距变大就开始新段落,字号为正文1.6倍的短行是标题,链接批注变成Word超链接。“外观一致”以144 DPI渲染页面图像,并把真实文字叠放在上方;“可编辑文本”按阅读顺序重建干净的段落。
孟加拉文数字保留为孟加拉文数字,页面上的拉丁字母单词——电子邮件地址、编号——保持拉丁字母。处理扫描件时加载的是孟加拉文语言包,所以一页带英文信头的孟加拉文能正确读出孟加拉文部分,信头却可能被读成孟加拉文模样的乱码;如果英文内容重要,请在语言列表中添加英文。
如果您需要的是别的
由Word文件生成的PDF,转回来注定是一次重建;能要到.docx原件就去要。Bijoy格式的.docx也更适合用Bijoy转Unicode转换,而不是先打印成PDF再转回来——按键字符的转换一个都不会错,格式得以保留,也没有任何内容需要从像素重新识别。
整个孟加拉文扫描图书档案,适合用带孟加拉文模型的桌面OCR工具一夜之间读完一个文件夹,再由OCRmyPDF给每个PDF加上可搜索的文字层而不改变外观——这才是处理成百上千个文件的正确工具,而本页面只处理一个。
常见问题
会存储我的PDF吗?
不会。不存储任何文件;您的文件绝不会被保留。处理扫描件时,识别引擎和孟加拉文语言包会从本网站加载一次并保留供下次使用——您的文档本身绝不会被发送到任何地方。
为什么从PDF里取出的孟加拉文通常都是错字?
因为PDF按绘制顺序存储字形,而孟加拉文的绘制顺序是视觉顺序:i-kar(ি)画在它所跟随的辅音之前,ো的两半分列辅音两侧。大多数转换器把这个顺序原样复制出来,于是বাংলাদেশ的元音符号跑到了错误的字母前面,每个词都拼错,而且拼写检查也修不好。本转换器会把这些符号放回Unicode要求的位置——每一个孟加拉文PDF都需要这样的重排,包括本站生成的PDF。
能处理由Bijoy文档生成的PDF吗?
如果PDF的文字层是SutonnyMJ,输出的就是Bijoy按键字符,因为文件里存的就是这些;把结果再经过Bijoy转Unicode,格式会得以保留。如果PDF是扫描件,OCR读取图像,直接给出Unicode。
孟加拉文扫描件的OCR效果如何?
印刷孟加拉文的清晰300 dpi扫描件识别效果很好;褪色的复印件和手机照片会丢失连字。本页面的语言固定为孟加拉文,所以拉丁字母的信头或编号不会把整页的识别带偏到英文。扫歪的页面会先摆正。
得到的是什么Word格式?
标准的.docx,使用Unicode孟加拉文字体,可在Word、Google Docs和LibreOffice中打开。文字是真正的Unicode:可以搜索,也可以用Avro或Ridmik继续输入。
表格和表单怎么办?
扫描件中带框线的表单在“可编辑文本”模式下会变成真正的Word表格。文字版PDF中的表格会输出为定位文字,和所有PDF转Word工具一样——需要电子表格的话,PDF转Excel是更好的工具。
小贴士: 字体会被替换:.docx使用Unicode孟加拉文字体,而不是PDF自带的字体,所以外观是接近而非完全一致。用Bijoy字体排版的文字版PDF会转换为Bijoy按键字符,之后还需要经过Bijoy转Unicode转换器。OCR会忽略照片和Logo,把手写内容保留为图片,每页需要几秒钟,因为识别工作由您自己的设备完成。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。