扫描 PDF 识别
先把扫描版 PDF 逐页渲染成图像再识别文字,输出按页分段的文本,适合把纸质合同、书籍扫描件转成电子版。
支持单个 PDF,最多 100 页
工具操作区
选择扫描版 PDF(文字无法选中的那种)
扫描件识别较慢,页数多时建议分批或限定范围。
首次识别会在本地加载识别引擎与语言包(约 6MB,已自托管不走外网),之后浏览器会缓存,后续识别很快。
使用说明
- 1
上传 PDF
选择扫描版文件。
- 2
选择清晰度
渲染倍数越高识别越准,但也会更慢。
- 3
逐页识别
系统会按页排队处理并显示进度。
- 4
导出文本
结果按页分段,可直接复制或下载。
输出说明:输出 TXT 文本,按页标记
常见问题
相关工具推荐
提取 PDF 文字
抽取 PDF 中的文字层并导出为纯文本,自动合并断行保留段落结构,方便复制二次编辑,无需安装任何阅读器。
图片文字识别
识别照片与截图中的中英文,输出可编辑文本,中文模型在本地加载运行,识别过程不联网,适合整理文档和引用资料。
PDF 转图片
把 PDF 每一页导出为 JPG 或 PNG 图片,可设置输出清晰度,支持打包下载,适合把文档内容放进 PPT 或公众号推文。
批量图片识别
一次拖入多张图片排队识别,结果可以合并成一个文本文件,也可以逐张导出,适合整理纸质档案和多页资料。
表格识别转 Excel
识别图片中的表格结构并还原行列关系,导出为可直接用 Excel 打开的 CSV 文件,适合录入发票清单和统计数据。
票据截图取字
针对发票、购物小票、快递单优化的识别流程,自动规整金额、日期与编号字段,方便报销录入和数据整理。
觉得好用?关注 新锋潮 获取更多实用技巧