PDF 转文本 — 提取文字为 TXT,免上传
在浏览器中把 PDF 的文字层提取为纯文本。根据文字位置重建行和段落;可复制或下载为 .txt 文件。无需上传。
浏览器内转换 · 无需注册
单个 PDF,最大 30 MB、200 页;在本机处理
使用方法
- 选择一个文字可选中的 PDF。
- 输入要读取的页面,例如 1-3, 5,并选择是否标记分页。
- 点击“提取文字”,然后复制结果或下载为 UTF-8 编码的 .txt 文件。
示例
一份 2 页报告 → "--- 第 1 页 --- 季度报告 第一段……",段落之间有空行。
功能与限制
文字通过 pdf.js 从 PDF 自身的文字层获取。同一基线上的内容合为一行,词间空隙变为空格,较大的行距开始新段落。多栏页面的栏可能混在一起,表格中较宽的空隙保留为三个空格。
支持中文、日文和韩文。扫描页没有文字层,因此结果为空;工具会列出这些页面并提供 PDF 文字识别的链接。PDF 在你的设备上读取。
FAQ
为什么提取出的文字是空的?
这个 PDF 很可能是扫描件或一组图片,里面是文字的图像而不是字符。请改用 PDF 文字识别来识别文字。
为什么有些词连在一起或断行奇怪?
PDF 存储的是带位置的文字片段,而不是句子。空格和换行是根据这些位置推断的,因此特殊字体、字距或分栏可能导致结果不完美。
可以从有密码保护的 PDF 中提取文字吗?
不能直接提取。如果你知道密码,请先用“PDF 解密”移除密码,再从解密后的副本中提取文字。
相关工具
格式参考资料
工具页面更新日期: