识别图片中的手写文字
字字分开的手写印刷体——手工填写的表格、大写字母、字迹工整的便条——往往能识别。连笔字则不行,本工具和其他任何通用OCR工具都做不到;本页面会告诉您属于哪种情况,而不是瞎猜。
- 绝不存储
- 无需排队,无需等待
- 无需注册,无水印
使用方法
添加图片
手写内容的照片或扫描件。拍得越正、光线越好,识别出的内容就越多。
查看识别效果
识别引擎自己的置信度会显示在文字旁边,因为对手写来说,这个数值才是有用的部分。数值低说明识别很吃力,下方的文字应视为草稿。
复制值得保留的内容
把文字拿去修改,这通常比全部重新输入快得多。
哪些能识别,哪些确实不能
这里不能识别连笔手写,页面会直接告诉您,而不是返回看似合理的乱码。这是本页最重要的一句话。识别印刷体的原理是找出字母之间的边界,再逐个匹配形状——而连笔字没有边界,因为字母是一笔连贯写成的,其形状还会随所连接的字母而变化。这是一个本质上不同的问题,而不是同一问题的更难版本。
能识别、而且往往识别得不错的,是字字分开的手写印刷体:大写字母、一格一字填写的表格、认真写下的购物清单、工程或建筑图纸上的字体。这些是彼此之间有空隙的独立形状,和印刷体属于同一类问题,只是变化更多。表格格子是最理想的情况,因为格子已经替您把字分开了。
无论哪种情况,手写识别的准确率都远低于印刷体,所以结果是需要修改的草稿,而不是可以直接相信的答案。页面会显示识别的置信度,这个数值是拿来用的:账号中某个数字的置信度低,远比一句能靠上下文读懂的话中间置信度低更要紧。真正危险的是那些高置信度的错误——1被识别成7、5被识别成S——因为没有任何标记提醒,而两种读法都说得通。
想要更好的结果,主要靠图片。平整、光线均匀、正对而非斜着拍摄、对焦清晰,并且在相机允许的范围内拍得尽量大。深色墨水写在无横线的素色纸上,比铅笔写在方格纸上更容易识别,因为网格线本身也是笔画。输出为纯文本——没有版式、没有颜色,也不会标出哪些内容被划掉了。
如果您需要的是别的
对于真正的连笔字,老实说,托管服务能识别本工具识别不了的内容。Google Cloud Vision、Azure AI Vision和Amazon Textract处理连笔手写的水平,是任何本地运行的工具都望尘莫及的,因为它们用多得多的素材训练过。但这意味着要把您的页面发送给第三方,而这恰恰是本站存在就是为了避免的取舍——对一张菜谱卡片来说是合理的选择,对病历或日记来说就不是了。
专门针对历史文献和档案,Transkribus就是为此而生的,真正的档案馆都在用:它可以针对某一种笔迹进行训练,正因如此,几百年前的手稿才得以被识读。而如果只有一两页,直接打字往往比修改一份糟糕的识别结果更快——在选择后者之前,值得实事求是地估算一下。
常见问题
能识别我的手写字吗?
如果字母彼此分开、大致端正——大写字母、手工填写的表格、认真书写的印刷体——往往可以,结果值得修改而不必重新输入。如果是连笔字,几乎肯定不行。这不是本页面的局限;通用OCR工具是用印刷字体训练的,识别的是字母形状,而连笔字没有可供识别的独立字母形状。
那这个页面为什么存在?
因为“OCR能识别手写吗”是一个真实的问题,也有一个真实的答案,而大多数声称能做到的工具,做的其实和这里一模一样的通用OCR,只是不说而已。手写印刷体的表格确实很常见,也确实能识别。给您看置信度、对连笔字直言不讳,比给出一个自信满满的错误答案更有用。
怎样才能获得最佳效果?
光线充足、页面上没有阴影,相机正对而不是斜着拍,文字占满画面,深色墨水写在素色纸上。横线纸或方格纸也可以。铅笔比钢笔难识别,因为铅笔字是灰色而不是黑色。
我的图片会被存储吗?
不会。首次使用某种语言时,会从本站下载该语言包;图片本身绝不存储,也不会发送到任何地方,所以断开Wi-Fi也能使用。
能识别其他语言的手写字吗?
同样支持120多种语言,但限制只会更大而不是更小:识别引擎是用各文字体系的印刷字体训练的,所以手写印刷体的孟加拉语或阿拉伯语,比手写印刷体的英语更难识别。不妨试一试,看看置信度。
有没有能正确识别连笔字的工具?
能应对连笔字的手写识别,需要专门用手写样本训练,好用的那些都运行在服务器上,而不是浏览器标签页里。我们宁愿如实为您指明方向,也不愿假装一个印刷体识别引擎能做到。
小贴士: 不支持识别连笔手写——这是印刷体识别引擎,页面会如实说明,而不是返回看似合理的乱码。手写印刷体、大写字母和已填写的表格往往可以识别。无论哪种情况,手写识别的准确率都远低于印刷体,因此请把结果当作需要修改的草稿。
把这个工具放到您的网站上
博客、课程页面或帮助文章均可免费使用。粘贴一段代码,访客就能直接在您的页面上使用。