本文へスキップ

PDF テキスト抽出 — TXT に変換、アップロード不要

ブラウザで PDF のテキストレイヤーをプレーンテキストとして抽出。文字の位置から行と段落を復元し、コピーまたは .txt でダウンロードできます。

ブラウザ内で変換 · 登録不要

PDF 1件・30 MB / 200ページまで・端末内で処理

使い方

  1. テキストを選択できる PDF を選びます。
  2. 読み取るページ(例:1-3, 5)を入力し、ページ区切りを入れるかどうかを選びます。
  3. 「テキストを抽出」を選び、結果をコピーするか UTF-8 の .txt ファイルとしてダウンロードします。

変換例

2 ページのレポート → "--- 1 ページ ---

四半期報告

最初の段落…"(段落の間に空行)。

仕様と制限

テキストは pdf.js を使って PDF 自体のテキストレイヤーから取得します。同じベースライン上の要素は 1 行になり、単語間の隙間はスペースに、広い行間で新しい段落になります。段組みのページでは列が混ざることがあり、表の広い隙間は 3 つのスペースとして残ります。

日本語・中国語・韓国語のテキストに対応しています。スキャンしたページにはテキストレイヤーがないため空になります。ツールはそのページを一覧表示し、PDF 文字起こしへのリンクを示します。PDF は端末内で読み込まれます。

FAQ

抽出したテキストが空なのはなぜですか?

その PDF はおそらくスキャンか画像の集まりで、文字ではなく文字の画像が入っています。代わりに PDF 文字起こしでテキストを認識してください。

単語がつながったり、変なところで改行されたりするのはなぜですか?

PDF は文ではなく、位置を指定したテキストの断片を保存しています。スペースや改行はその位置から推定するため、特殊なフォント、カーニング、段組みでは結果が不完全になることがあります。

パスワード付き PDF からテキストを抽出できますか?

そのままではできません。パスワードがわかる場合は先に「PDF パスワード解除」で解除し、解除したコピーからテキストを抽出してください。

形式の参考資料

ツールページの更新日: