你手里有一份纸质合同、一页书本复印件或者一张拍得挺清楚的表格照片。用手机扫了一下存成了PDF。打开看字迹清晰排版整齐但当你试图用鼠标去框选文字光标变成十字怎么也拖不出蓝色高亮。复制不了搜索不了想引用其中一句话只能对着屏幕手打。这个场景太常见了而且几乎每个人第一次遇到的时候都会疑惑——明明看着是文字为什么选不中原因很简单。你看到的那些“文字”对于电脑来说其实是一张黑白照片。就像你用手机拍了一页书照片里有字但你在相册里长按照片文字能复制吗不能。PDF的扫描件本质上就是一张张照片拼成的文档。它没有文字编码只有像素点。要让照片里的文字“活”过来能被选中、复制、搜索需要经过一道处理工序。这个工序你肯定听过——文字识别通常简称为OCR。这个功能在很多处理PDF的软件里都有但大部分藏得比较深不在主界面上。你打开这个PDF之后不要去找“复制”按钮而是去找菜单栏或者工具栏里有没有“文字识别”、“OCR识别”、“扫描件优化”、“增强页面”之类的选项。点进去之后通常会让你选择一个语言比如中文、英文、或者中英混合。选对语言对识别准确率影响很大选了中文识别准确率可能到98%如果默认是英文有些中文字就会被认成乱码。识别过程一般需要几十秒到几分钟取决于文件页数和电脑性能。等进度条走完你再试试点选文字会发现鼠标光标变了可以框选了可以复制了甚至可以用搜索框在全文中查找关键词了。但这里面有个细节很多人不知道。识别完成之后如果你直接点保存文件体积通常会增大不少。因为原来只有图片信息现在多了一层“文字层”——它被叠在图片上面你看不到但搜索和复制依赖的就是这一层。如果识别完你发现文字还是选不中可能是你用的软件在识别之后没有自动把文字层和图片层合并保存。你需要手动点一下“保存”或者“应用更改”关闭后再重新打开文字层才会生效。还有一个容易踩的坑识别出来的文字复制粘贴到其他文档里有时候会出现错字。比如“日”和“曰”、“已”和“己”、“7”和“1”扫描清晰度不高或者纸张褶皱的时候机器容易认错。粘贴完之后最好快速扫一遍把明显不对的字改过来。如果你需要把扫描件PDF转成Word而不是仅仅复制一段文字那也是先走OCR这一步。但转出来之后排版可能会跟原文不一样。段落会重新排列文本框会变成普通文字表格可能变成散落的文字和数字需要手动整理一下。如果你的扫描件是纯文字格式没有复杂表格和图片排版保留得会好一些。如果是那种带表格的扫描件转出来之后表格大概率会乱需要重新画。另外还有一个情况如果你手头的是一个几十页的扫描件PDF但你只需要其中两页的文字内容不用整本识别。在PDF里找到页面缩略图选中你需要的那几页单独导出成一个新的PDF只对这个新文件做识别。这样速度快很多生成的文件体积也小。识别完之后的文字是可以搜索的。你在阅读器里按CtrlF输入关键词能跳到对应的页面和普通PDF一样。这对于查阅厚厚的历史文档、合同档案、学术论文非常方便。最后再提醒一句如果扫描件本身拍得歪歪扭扭、光线昏暗、有阴影遮挡任何识别工具都帮不上忙。识别的前提是图片清晰。如果文字本身就看不清机器也不可能比你“看清”更多。所以如果有重要的纸质文件要转成可编辑PDF扫描的时候尽量保证光线均匀、纸张平整、手机端稳后面识别出来的准确率会高出不少。