PDF のテキストを .txt に書き出す
文書からテキストを取り出し、検索・貼り付け・他のツールへの受け渡しができるプレーンな .txt にします。先に正直な制限を 1 つ。読み取れるのはファイルにすでにあるテキストだけで、スキャンに対して OCR は行いません。
アカウント不要。サーバー側のファイルサイズ制限なし。一度読み込めばオフラインでも動作します。
PDF からプレーンテキストのファイルへ

文書をドロップ
ページが描画されるので、何かを取り出す前に、読み込んだファイルが正しいかどうかを確認できます。

テキストが必要なページだけを残す
残りを削除しておけば、表紙から付録までひと続きの文字の塊になることなく、出力が必要な範囲に絞られます。

.txt ファイルとして書き出す
テキストはページ順にプレーンテキストとして書き出されます。レイアウトや表、段組みは再現されません。取り出せるのは言葉であって、デザインではありません。
できることと、できないこと
そのまま貼り付けられるプレーンテキスト
マークアップも書式もない .txt ファイルです。検索したり、引用したり、別のプログラムに渡したりするには、これが一番使いやすい形です。
スキャンについて曖昧にしません
ここに OCR はありません。画像だけのページからは何も抽出されず、しかもどのページが空だったかが明示されます。理由の分からない短いファイルを渡されることはありません。
先にページを選べます
書き出す前に不要なページを削除すれば、.txt には文書全体ではなく目当ての箇所だけが入ります。
機密文書は動かしません
テキスト抽出は、契約書や報告書、明細書など、これから読み解こうとしている文書に対して行うのが普通です。そのどれもアップロードされません。
PDF のテキスト抽出についてよくある質問
スキャンした PDF から空のファイルしか出ないのはなぜですか?
スキャンはページの写真であって、テキストではないからです。抽出が読み取るのは PDF が持つテキストレイヤーで、スキャンや写真のページにはそれがありません。画像の中の文字を認識するのは OCR で、このツールはあえて OCR を行わず、そうしたページを推測で埋めずに空として報告します。
自分の PDF に本物のテキストが入っているかを見分けるには?
どのビューアーでもよいので開いて、カーソルで 1 行を選択してみてください。文字がハイライトされるなら抽出できます。画像の上に選択範囲の四角が出るだけなら、取り出せるものはありません。
文書のレイアウトは保たれますか?
いいえ。出力はページ順に並んだプレーンテキストです。段組みや表、ヘッダーは連続した行として出てくるため、複雑なレイアウトのページでは順序が入り組んで読めることがあります。
文書の一部だけからテキストを抽出できますか?
はい。書き出す前に不要なページを削除してください。ページ内での範囲選択はできないため、指定できる最小単位は 1 ページです。
合字やアクセント付きの文字は正しく扱われますか?
たいていは問題ありません。テキストはファイルに符号化されたとおりに出てくるため、きちんと作られた PDF はきれいに抽出できます。古いツールで作られ、フォントの符号化が壊れている文書では文字化けすることがあり、これは後からどの抽出ツールでも修復できません。
テキスト抽出のために文書はアップロードされますか?
いいえ。pdf.js がブラウザ内でテキストレイヤーを読み取り、.txt もその場で書き出します。どこにも送信されません。分析する価値のある文書に対して使うことが多いだけに、この点は重要です。