提取图片中的文字
从照片、扫描件或截图中读出文字,得到可编辑、可搜索、可粘贴的文本。图片绝不存储。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加图片
JPG、PNG、WebP、GIF、BMP、iPhone的HEIC或扫描仪的TIFF都可以。斜着拍的照片会先摆正、均衡光线,再进行识别。
确认语言
系统会从图片中判断文字体系,并为您选定语言。如果猜错了,或图片中包含多种语言,可以从120多种语言中选择。
复制或下载
可以保留版式,让行和栏保持原位;也可以把各行合并成连贯的段落,方便粘贴到别处。
图片是怎样被识别的
识别所需的尺寸是根据笔画而不是文件来测量的。系统会从图片本身估算一行文字的高度,再把整张图缩放到一行约34像素——太小的截图最多放大到4倍,巨大的照片则会缩小,两种情况下最长边都有上限。所以一张900万像素的菜单照片,并不比一张清晰的小图更准确;最短边不足约300像素的图片会完全跳过语言检测,直接按拉丁字母识别。在此之前,系统会分块估算字迹背后的纸张底色并将其除去,以均衡光线;再测量整页高度上的倾斜并将页面转正;最后用一个全局阈值把结果转为黑白。
选择语言靠的是“试读”而不是“查表”,因为通常所说的检测器其实并不检测语言。第一轮只报告文字体系和旋转角度,别无其他;文字体系缩小了候选范围,共用同一文字体系的语言则由您浏览器的语言设置来决胜负,然后每个候选语言都会真正去识别一份缩小的图片副本,并按产生了多少高置信度的词来打分。胜出者再识别真实页面,识别出的文字还会被再次检查——看变音符号、特征字母组合、常见短词——判断换一种语言是否会更好。“选错语言只会得到一个自信满满的空白页”背后就是这套机制:试读的意义正在于用您的图片来检验猜测,而不是直接断言。
关于输出内容,有一点值得了解。识别把握不大的段落会被直接舍弃,而不是显示出来,所以图片里看得到的文字,可能在结果中完全缺失,而不是以乱码的形式出现。被判定为图片或噪点的区块,以及不含任何字母或数字的孤立符号,也是如此。普通的低置信度单词不会被剔除,所以段落内部的误识别会保留下来,需要您自己留意。如果置信度数值还不错,但页面上有一大块文字就是不见了,原因就在这里。
如果您需要的是别的
本工具不存储任何文件,但它是本站唯一一个首次使用需要等待下载的工具:识别引擎本身有几MB,每个语言包还要再下载1到5 MB,均从本站获取,之后会保留供下次使用。识别一页值得等这一下,定期处理两千份扫描件就不值得了——那应该交给桌面OCR工具,例如OCRmyPDF,一条命令就能给整个文件夹加上文字层,无需下载,也不用点来点去。
有三件事这里根本不会尝试,提前知道比事后发现省事。透视不会被校正——页面会测量旋转角度并转正,但从侧面拍的照片仍保持梯形,所以多花一秒从正上方拍摄是值得的。区分字迹和纸张的阈值对整张图只有一个值,而不是分区域设定,所以一半处于阴影中的页面,即使均衡了光线,较暗的那一半仍会丢失;与其和它较劲,不如在均匀光线下重拍。另外,靠空格而不是框线排版的表格没有线可找,会被当作分栏正文来读取,粘贴进电子表格后能否对齐全凭运气。
常见问题
识别准确吗?
对于正对拍摄、对焦清晰的印刷文字,非常准确——每千个字符只错几个。模糊、反光、对比度低和不常见的字体都会降低准确率,页面会直接告诉您识别的把握有多大,不用您去猜。如果这个数值偏低,问题通常出在图片上:多一点光、少一点倾斜、让文字占满画面,大多就能解决。
我的图片会被存储吗?
不会。首次使用某种语言时,会从本站下载该语言包;图片本身绝不存储,也不会发送到任何地方,所以断开Wi-Fi也能使用。
能识别哪些语言?
120多种,包括英语、孟加拉语、印地语、乌尔都语、阿拉伯语、西班牙语、法语、德语、葡萄牙语、俄语、中文、日语和韩语。文字体系直接从图片中判断;若多种语言共用同一种文字——拉丁字母、西里尔字母、阿拉伯字母、天城文——则以您浏览器的语言设置为准,您也随时可以更改。
能保留分栏和表格吗?
可以,只要您选择保留。带框线的表格会被识别出来并逐格读取,标签不会和数值连在一起,结果以制表符分隔的行输出,可直接粘贴进电子表格。分栏的正文会按阅读顺序读取,而不是横着一行读到底。如果选择合并各行,就会有意舍弃这些结构——当您要重新排版一段文字时,这正是您想要的。
能识别手写字吗?
工整、字字分开的印刷体手写——比如表格上的大写字母——往往可以识别。连笔手写则不行,这里不行,其他通用OCR工具也不行;老实说,那是另一类问题,需要另一种方法。我们另有一个手写识别页面,会明确说明这一点,并展示它能识别出多少。
支持哪些图片格式?
JPG、PNG、WebP、GIF、BMP和SVG由浏览器本身解码,另外还支持iPhone的HEIC和扫描仪的TIFF。手机竖拍的照片方向会是正的,因为会先应用相机写入的方向标记。
为什么有些字识别错了?
几乎总是图片的问题,而不是文字的问题:页面上有一道反光、手的阴影、相机抖动,或者屏幕上的文字太小,每个字母只有寥寥几个像素。识别前图片会先均衡光线,并缩放到最适合识别的大小,但再怎么处理也变不出相机没有拍到的细节。
有大小限制吗?
只受您设备自身内存的限制。不存储任何文件,所以不存在服务器限制。特别大的照片会缩小到识别所需的大小——超过一定程度后,像素再多也只会增加开销,不会提高准确率。
小贴士: 任何通用OCR工具都无法可靠识别连笔手写,本工具也不例外。印在图片上的文字、高度艺术化的字体以及对比度很低的内容,识别结果会残缺不全。结果为纯文本:字体、颜色、粗体和斜体都不会保留,图片本身也不会。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。