PDF テキスト抽出 — TXT に変換、アップロード不要
ブラウザで PDF のテキストレイヤーをプレーンテキストとして抽出。文字の位置から行と段落を復元し、コピーまたは .txt でダウンロードできます。
ブラウザ内で変換 · 登録不要
PDF 1件・30 MB / 200ページまで・端末内で処理
使い方
- テキストを選択できる PDF を選びます。
- 読み取るページ(例:1-3, 5)を入力し、ページ区切りを入れるかどうかを選びます。
- 「テキストを抽出」を選び、結果をコピーするか UTF-8 の .txt ファイルとしてダウンロードします。
変換例
2 ページのレポート → "--- 1 ページ --- 四半期報告 最初の段落…"(段落の間に空行)。
仕様と制限
テキストは pdf.js を使って PDF 自体のテキストレイヤーから取得します。同じベースライン上の要素は 1 行になり、単語間の隙間はスペースに、広い行間で新しい段落になります。段組みのページでは列が混ざることがあり、表の広い隙間は 3 つのスペースとして残ります。
日本語・中国語・韓国語のテキストに対応しています。スキャンしたページにはテキストレイヤーがないため空になります。ツールはそのページを一覧表示し、PDF 文字起こしへのリンクを示します。PDF は端末内で読み込まれます。
FAQ
抽出したテキストが空なのはなぜですか?
その PDF はおそらくスキャンか画像の集まりで、文字ではなく文字の画像が入っています。代わりに PDF 文字起こしでテキストを認識してください。
単語がつながったり、変なところで改行されたりするのはなぜですか?
PDF は文ではなく、位置を指定したテキストの断片を保存しています。スペースや改行はその位置から推定するため、特殊なフォント、カーニング、段組みでは結果が不完全になることがあります。
パスワード付き PDF からテキストを抽出できますか?
そのままではできません。パスワードがわかる場合は先に「PDF パスワード解除」で解除し、解除したコピーからテキストを抽出してください。
関連ツール
形式の参考資料
ツールページの更新日: