PDFPDF Organizer
無料 · アップロード不要 · プレーンな .txt で出力

PDF のテキストを .txt に書き出す

文書からテキストを取り出し、検索・貼り付け・他のツールへの受け渡しができるプレーンな .txt にします。先に正直な制限を 1 つ。読み取れるのはファイルにすでにあるテキストだけで、スキャンに対して OCR は行いません。

アカウント不要。サーバー側のファイルサイズ制限なし。一度読み込めばオフラインでも動作します。

PDF からプレーンテキストのファイルへ

PDF ファイルのドラッグ&ドロップ領域
1

文書をドロップ

ページが描画されるので、何かを取り出す前に、読み込んだファイルが正しいかどうかを確認できます。

並べ替えと回転が行われているページのグリッド
2

テキストが必要なページだけを残す

残りを削除しておけば、表紙から付録までひと続きの文字の塊になることなく、出力が必要な範囲に絞られます。

フルサイズのページプレビューモーダル
3

.txt ファイルとして書き出す

テキストはページ順にプレーンテキストとして書き出されます。レイアウトや表、段組みは再現されません。取り出せるのは言葉であって、デザインではありません。

できることと、できないこと

そのまま貼り付けられるプレーンテキスト

マークアップも書式もない .txt ファイルです。検索したり、引用したり、別のプログラムに渡したりするには、これが一番使いやすい形です。

スキャンについて曖昧にしません

ここに OCR はありません。画像だけのページからは何も抽出されず、しかもどのページが空だったかが明示されます。理由の分からない短いファイルを渡されることはありません。

先にページを選べます

書き出す前に不要なページを削除すれば、.txt には文書全体ではなく目当ての箇所だけが入ります。

機密文書は動かしません

テキスト抽出は、契約書や報告書、明細書など、これから読み解こうとしている文書に対して行うのが普通です。そのどれもアップロードされません。

PDF のテキスト抽出についてよくある質問

スキャンした PDF から空のファイルしか出ないのはなぜですか?

スキャンはページの写真であって、テキストではないからです。抽出が読み取るのは PDF が持つテキストレイヤーで、スキャンや写真のページにはそれがありません。画像の中の文字を認識するのは OCR で、このツールはあえて OCR を行わず、そうしたページを推測で埋めずに空として報告します。

自分の PDF に本物のテキストが入っているかを見分けるには?

どのビューアーでもよいので開いて、カーソルで 1 行を選択してみてください。文字がハイライトされるなら抽出できます。画像の上に選択範囲の四角が出るだけなら、取り出せるものはありません。

文書のレイアウトは保たれますか?

いいえ。出力はページ順に並んだプレーンテキストです。段組みや表、ヘッダーは連続した行として出てくるため、複雑なレイアウトのページでは順序が入り組んで読めることがあります。

文書の一部だけからテキストを抽出できますか?

はい。書き出す前に不要なページを削除してください。ページ内での範囲選択はできないため、指定できる最小単位は 1 ページです。

合字やアクセント付きの文字は正しく扱われますか?

たいていは問題ありません。テキストはファイルに符号化されたとおりに出てくるため、きちんと作られた PDF はきれいに抽出できます。古いツールで作られ、フォントの符号化が壊れている文書では文字化けすることがあり、これは後からどの抽出ツールでも修復できません。

テキスト抽出のために文書はアップロードされますか?

いいえ。pdf.js がブラウザ内でテキストレイヤーを読み取り、.txt もその場で書き出します。どこにも送信されません。分析する価値のある文書に対して使うことが多いだけに、この点は重要です。

テキストを取り出しましょう

PDF をアップロードせずに作る、プレーンな .txt ファイル。

今すぐテキストを抽出