跳到主要内容

PDF 转文本 — 提取文字为 TXT,免上传

在浏览器中把 PDF 的文字层提取为纯文本。根据文字位置重建行和段落;可复制或下载为 .txt 文件。无需上传。

浏览器内转换 · 无需注册

单个 PDF,最大 30 MB、200 页;在本机处理

使用方法

  1. 选择一个文字可选中的 PDF。
  2. 输入要读取的页面,例如 1-3, 5,并选择是否标记分页。
  3. 点击“提取文字”,然后复制结果或下载为 UTF-8 编码的 .txt 文件。

示例

一份 2 页报告 → "--- 第 1 页 ---

季度报告

第一段……",段落之间有空行。

功能与限制

文字通过 pdf.js 从 PDF 自身的文字层获取。同一基线上的内容合为一行,词间空隙变为空格,较大的行距开始新段落。多栏页面的栏可能混在一起,表格中较宽的空隙保留为三个空格。

支持中文、日文和韩文。扫描页没有文字层,因此结果为空;工具会列出这些页面并提供 PDF 文字识别的链接。PDF 在你的设备上读取。

FAQ

为什么提取出的文字是空的?

这个 PDF 很可能是扫描件或一组图片,里面是文字的图像而不是字符。请改用 PDF 文字识别来识别文字。

为什么有些词连在一起或断行奇怪?

PDF 存储的是带位置的文字片段,而不是句子。空格和换行是根据这些位置推断的,因此特殊字体、字距或分栏可能导致结果不完美。

可以从有密码保护的 PDF 中提取文字吗?

不能直接提取。如果你知道密码,请先用“PDF 解密”移除密码,再从解密后的副本中提取文字。

格式参考资料

工具页面更新日期: