PDF 文字识别 — 扫描件转文字,在线免费 OCR
免费 PDF OCR:从扫描件或纯图片 PDF 中提取文字,每次最多 20 页,直接在浏览器中识别。首次使用时会从 CDN 加载 OCR 引擎。
浏览器内转换 · 无需注册
PDF 最大 30 MB,每次最多识别 20 页。
也支持图片(PNG、JPG、WebP、AVIF):拖到这里即可。
也可以按 Ctrl+V(Mac 上为 ⌘V)直接粘贴截图。
首次使用时,浏览器会从公共 CDN 下载 OCR 引擎和所选语言的数据(数 MB)并缓存。你的图片本身不会上传。
使用方法
- 选择一个扫描版 PDF(最大 30 MB)。
- 选择文字语言和要识别的页码,例如 1-3, 5(每次最多 20 页)。
- 点击“提取文字”,然后编辑、复制结果,或下载为 .txt 文件。
示例
一份 3 页的扫描合同,页码 1-3 → 可编辑文字 "--- 第 1 页 ---\nAGREEMENT\nThis agreement is made…\n\n--- 第 2 页 ---\n…",保存为 contract.txt。
功能与限制
页面以约 200 DPI 渲染,并在浏览器中用 tesseract.js 逐页识别;PDF 不会上传。OCR 引擎和语言数据首次使用时从公共 CDN(jsDelivr)下载并缓存。
如果 PDF 中已有可选中的文字,请直接复制;OCR 用于扫描件或纯图片页面。不支持有密码保护的 PDF,输出为纯文本,不保留排版。
FAQ
怎样免费把扫描版 PDF 转成文字?
选择 PDF,选好语言和页码(每次最多 20 页),点击“提取文字”。完全免费,无需账号,在浏览器中运行。文档较长时,换下一段页码再识别一次。
能识别竖排的日文或中文 PDF 吗?
可以。选择“日语(竖排)”“简体中文(竖排)”或“繁体中文(竖排)”。横排文字请使用普通的日语或中文选项。
为什么结果是空的或错误很多?
OCR 需要清晰的印刷文字。扫描分辨率低、手写、特殊字体或语言设置不对都会降低准确率。请确认语言与文档一致,并尝试更清晰的扫描件。
相关工具
格式参考资料
工具页面更新日期: