2026-09-16 · 约 6 分钟读完
PDF 提取文字,3 种免费方案怎么选
从 PDF 里把文字弄出来,有人一秒搞定有人折腾半小时。差别在于是否判断了 PDF 类型。本文给出三种方案的适用边界和实操步骤。
第一步永远是判断类型
用阅读器打开,试着用鼠标划过一段文字。能选中就是文字型 PDF,里面的字符是真实编码,提取出来就是干净的文本。选不中就是扫描件,本质是一张张图片,必须走 OCR。
这一步只需要三秒,但能省掉大量无效尝试。很多人拿着扫描件反复换提取工具,怎么试都是空结果,就是跳过了这一步。
方案一:文字型 PDF 直接提取
文字型 PDF 的提取几乎是即时的,效果也好。需要注意的只有两点:一是分栏排版可能被按行合并,读起来串行;二是页眉页脚会被当成正文混进来,提取后需要清理。
如果提取结果是一大段没有换行的文字,说明工具按视觉行来切分了。这时候手动补段落,或者换一个按文本块输出的工具,都能改善。
方案二:扫描件先 OCR 再整理
扫描件的提取效果几乎完全取决于图片质量。三百 DPI、摆正、无阴影的扫描件识别准确率很高;歪斜、模糊、有反光的照片就难说了。
一个容易被忽略的技巧是:先给图片做一次黑白化提高对比度,再送去识别,准确率往往能提升一截。文字和背景的对比度越高,识别引擎越省力。
方案三:只需要一部分时的取巧办法
如果只要文档里的某几页或者某张表格,别整份处理。先按页码范围抽出来,只对这几页做识别,速度快得多,也不容易在大文件上中途失败。
表格要特别处理。普通 OCR 会把表格拍成一行行文字,列之间的关系全丢。需要保留表格结构的,要用专门的表格识别,输出成表格文件而不是纯文本。
提取完别忘了这两步
一是核对数字。识别引擎对形近字和数字最容易出错,涉及金额、身份证号、电话号码的地方必须逐字核对。二是统计字数,确认提取完整——如果原文三千字只提出一千五,说明有页面漏了或者识别失败。