跳到主要内容

PDF 文字识别 — 扫描件转文字,在线免费 OCR

免费 PDF OCR:从扫描件或纯图片 PDF 中提取文字,每次最多 20 页,直接在浏览器中识别。首次使用时会从 CDN 加载 OCR 引擎。

浏览器内转换 · 无需注册

PDF 最大 30 MB,每次最多识别 20 页。

也支持图片(PNG、JPG、WebP、AVIF):拖到这里即可。

也可以按 Ctrl+V(Mac 上为 ⌘V)直接粘贴截图。

首次使用时,浏览器会从公共 CDN 下载 OCR 引擎和所选语言的数据(数 MB)并缓存。你的图片本身不会上传。

使用方法

  1. 选择一个扫描版 PDF(最大 30 MB)。
  2. 选择文字语言和要识别的页码,例如 1-3, 5(每次最多 20 页)。
  3. 点击“提取文字”,然后编辑、复制结果,或下载为 .txt 文件。

示例

一份 3 页的扫描合同,页码 1-3 → 可编辑文字 "--- 第 1 页 ---\nAGREEMENT\nThis agreement is made…\n\n--- 第 2 页 ---\n…",保存为 contract.txt。

功能与限制

页面以约 200 DPI 渲染,并在浏览器中用 tesseract.js 逐页识别;PDF 不会上传。OCR 引擎和语言数据首次使用时从公共 CDN(jsDelivr)下载并缓存。

如果 PDF 中已有可选中的文字,请直接复制;OCR 用于扫描件或纯图片页面。不支持有密码保护的 PDF,输出为纯文本,不保留排版。

FAQ

怎样免费把扫描版 PDF 转成文字?

选择 PDF,选好语言和页码(每次最多 20 页),点击“提取文字”。完全免费,无需账号,在浏览器中运行。文档较长时,换下一段页码再识别一次。

能识别竖排的日文或中文 PDF 吗?

可以。选择“日语(竖排)”“简体中文(竖排)”或“繁体中文(竖排)”。横排文字请使用普通的日语或中文选项。

为什么结果是空的或错误很多?

OCR 需要清晰的印刷文字。扫描分辨率低、手写、特殊字体或语言设置不对都会降低准确率。请确认语言与文档一致,并尝试更清晰的扫描件。

格式参考资料

工具页面更新日期: