扫描件怎么变成能编辑的文字?手打了两页卷子才想起来,微信里就藏着免费OCR

开学第二周,班主任在群里发话,让家长把娃上学期的错题整理成电子版,摸底测验要用。我拍着胸脯把活接了,对着手机里拍的四张卷子打开Word,一个字一个字往里敲。两道应用题打完,40分钟没了,脖子也僵了。娃在旁边探头看了一眼,来了句:爸,这字不是长按就能抠出来吗?
行吧,被小学生上了一课。扫描这活我不算生,家里那台墨仓一体机平时证件、体检报告都是它扫的,怎么把纸变成图片我之前写过一篇扫描的完整攻略。但纸变成图片之后,图片里的字怎么变成能编辑的文字,这一步我一直没正经琢磨过。那天晚上我把三条免费路子全跑了一遍,第二回整理剩下六张卷子,前后十分钟。
先看手里的文件是哪种,别一上来就识别
这步省不得,我第一回就是没分清文件类型白白折腾。手上的东西无非三种。
第一种是照片和截图,JPG、PNG,一张一张的图,这没歧义,想抠字只能靠识别。第二种是PDF,但PDF要拆成两路人看:用鼠标在文字上拖一下,能拉出选区、能复制的,这是文字版,人家本来就是拿文字排出来的,选中Ctrl+C就完事,根本轮不到识别登场;拖不出选区、或者一点就把整页当成一张图选中的,这是扫描版,本质是图片套了个PDF的壳,跟照片一个待遇。第三种是纸质原件,那得先拍或者扫成电子图,这步用打印机或者手机就能办。
| 手里的东西 | 怎么判断 | 该走的路 |
| 照片、截图 | 一看就是图 | 文字识别 |
| 文字版PDF | 鼠标能选中字 | 直接复制,不用识别 |
| 扫描版PDF | 选中就是整页一块 | 文字识别 |
| 纸质原件 | 纸 | 先拍成图,再识别 |
判断就一招:能选中的不叫识别,叫复制。识别这工具,只伺候图片和装成PDF的图片。
第一条路:微信长按「提取文字」,应急的天花板
这条路什么都不用装。微信里点开那张图——照片发到文件传输助手,或者翻聊天记录里的原图都行——把图点大,手指长按,菜单里就躺着「提取文字」四个字。一秒钟出结果,全文选中、复制、转发随便挑,免费,不限次数,连网络都不挑。
我拿娃的卷子实测:一张拍得正、光线足的卷子,600来字,识别完通读一遍,错了4处。错的还都是熟面孔——数字1认成小写字母l,0认成大写O,一个顿号丢了,还有一处的「己」认成了「已」。规律很明显:中文正文基本全对,栽跟头全栽在数字、字母、标点这一层。所以识别完别直接交差,花一分钟通读,火力集中在数字和标点上,尤其是要填进表格里的数。
短板同样明显。一次只能处理一张,手头二十几张的时候,点开、长按、复制、切窗口、粘贴,一套下来能点到人手抽筋。表格更是它的死穴,卷子上那个8行6列的课程表,识别出来塌成一行一行的文字,竖线没了,哪格对哪列得自己拿脑子重新拼一遍。
定位说清楚:一两张图救急,微信这条路方便到没有对手。量一大,它就顶不住了。
第二条路:表格多、要排版,白描这类专项工具上场
手机上装个白描,这是认表格的。还是那张课程表,相册里长按进批量模式,识别完点「表格识别」,直接还原成一个能导出的表格,8行6列横平竖直,我粘到Excel里基本没怎么动手修。给它拍图的时候把纸摆正、四条边都收进画面,还原的成功率还能再高一截。
代价是免费额度:一天5次识别、1次批量,会员十几块钱能解锁。我这种一学期集中干一回活的,免费额度其实够用;天天要扫合同的那种办公场景,充个会员比什么都省事。另外记住一个细节,它走的是云端识别,图要先传到人家服务器上算完再传回来——速度快是快,但这个细节先搁在心里,下一节要考。
顺手补一句,现在不少手机相册自己也带了这功能,安卓几家在图片界面有个「T」字样的识别入口,点一下框住就复制,效果跟微信一个量级。手边有就直接用,不用分个高低。
第三条路:证件、合同这些敏感件,我只走离线的Umi-OCR
第三条路是我最后留下当主力的。Umi-OCR,开源、免费、离线,Windows上跑,内核是PaddleOCR。这几个词挨个说分量:开源免费,意味着没有会员、没有次数限制、没有水印;离线,意味着图不出这台电脑——身份证、户口本、购房合同、银行流水这类东西,我原则上不让它们上任何云端,包括上一节那个好用的App。
用法简单到过分。装完是个小窗口,把图拖进去就出字;一沓子也不怕,全选了一起拖进去,它自己排队跑。我那32页的说明书扫描件,拖进去泡了杯水回来,全好了,输出成一个能直接粘贴的文本。
还有个我没想到的高频用法是「截图OCR」:设个快捷键,屏幕上任何地方——网页里不让复制的图片文字、视频里的字幕、弹出来的报错框——快捷键一按框住,字直接进剪贴板,比拍照再传手机少两步,现在查报错信息我全靠它。扫描版PDF也能整个拖进去,一本给你排成文本。速度上批量识别吃CPU,我家书房那台老台式机一页两三秒,说不上快,但架不住它不用人守着,睡前拖进去,早上收货。
手写体和数学公式,先降低预期再动手
三条路随便挑,有两类东西都得先打预防针。
手写体是第一坑。娃的错题本上老师手写的批语,我试着识别了一段,出来的东西一半要靠上下文猜,「的地得」连环错,连成一个自己都不认识的句子。爷爷那辈的钢笔字更没戏,扫描件的字迹一淡,识别直接摆烂。手写的资料,人眼慢慢敲反而是效率最高的,机器只适合认印刷体和清晰的打印字。
数学公式是第二坑。乘号、根号、分数线的上下结构,识别出来不是问号就是一串乱码,x的平方能给你写成x2,看着像那么回事,粘进Word全露馅。错题本里的公式部分我的办法就一个:老老实实手敲,或者用输入法自带的公式面板。跟机器较这个劲,不值。
顺带一提,竖排字、艺术字、背景花哨的图片也都会掉准确率。我翻出几张老照片,背面有爷爷用铅笔写的拍摄日期,竖排的,试了三张全废。那批照片我后来拿旧平板做了个挂在玄关的电子相框慢慢翻,背面的字就留给人眼认了,认不全当个念想也好。
什么文件走什么路,照着这张表抄
| 你手里的活 | 推荐走哪条 | 理由 |
| 一两张图,抠几行字 | 微信提取文字 | 零安装,免费不限次 |
| 带表格的课程表、排班表 | 白描 | 表格还原是看家本领 |
| 证件、合同、银行流水 | Umi-OCR | 离线识别,图不出电脑 |
| 几十页的扫描件批量处理 | Umi-OCR | 拖进去排队,不用人守 |
| 手写批语、数学公式 | 自己敲 | 识别错误率太高,修比敲慢 |
顺序理一遍:拿到东西先试着用鼠标选字,能选中直接复制收工;不能选中的,看看是什么货——一两张图微信长按解决;有表格的上白描;碰上证件合同或者一沓子扫描件,打开Umi-OCR拖进去。识别完的文本一定通读一遍,盯着数字和标点核,这一分钟省不得。
收尾交代下那本错题本的下场:识别、校对、排版完,我把它存成PDF,用手机连打印机直接打了一份给娃带去学校,纸上的错题绕了一圈又回到纸上,就是这一圈,省下了我两个晚上的手打时间。

发表评论