PDFPDF Organizer
Zdarma · Bez nahrávání · Na výstupu prostý TXT

Extrahovat text z PDF do souboru TXT

Vytáhněte text z dokumentu do prostého souboru .txt, ve kterém můžete vyhledávat, vkládat ho jinam nebo ho předat dál. Jedno omezení rovnou na rovinu: nástroj čte text, který v souboru už je, a na skenech nespouští OCR.

Bez účtu. Bez serverových limitů velikosti souborů. Po načtení funguje offline.

Z PDF do prostého textového souboru

Oblast pro přetažení souborů PDF
1

Vložte dokument

Stránky se vykreslí, abyste si ověřili, že jste načetli správný soubor, ještě než z něj začnete cokoli tahat.

Mřížka stránek, jejichž pořadí se mění a které se otáčejí
2

Nechte jen stránky, ze kterých text potřebujete

Zbytek smažte a výstup zůstane soustředěný, místo aby dorazil jako jedna zeď textu od obálky po přílohy.

Okno náhledu stránky v plné velikosti
3

Vyexportujte soubor .txt

Text se zapíše v pořadí stránek jako prostý text. Rozvržení, tabulky ani sloupce se nerekonstruují — jde o slova, ne o grafickou úpravu.

Co nástroj umí a co ne

Prostý text připravený k vložení

Soubor .txt bez značkování a bez formátování, přesně to, co potřebujete k vyhledávání, citování nebo předání jinému programu.

O skenech jasně, ne mlhavě

Žádné OCR tu není. Stránka složená jen z obrázku nevrátí nic — a vy se přesně dozvíte, které stránky zůstaly prázdné, místo abyste dostali krátký soubor bez vysvětlení.

Stránky si vyberte předem

Smažte před exportem stránky, které nepotřebujete, a v .txt bude ta pasáž, o kterou vám šlo, ne celý dokument.

Důvěrné dokumenty zůstanou na místě

Extrakce textu se obvykle pouští na něčem, co se má analyzovat — na smlouvě, zprávě, výpisu z účtu. Nic z toho se nikam nenahrává.

Extrakce textu z PDF — na co se lidé ptají

Proč z mého naskenovaného PDF vypadl prázdný soubor?

Protože sken je obrázek stránky, ne text. Extrakce čte textovou vrstvu, kterou PDF nese, a naskenovaná nebo vyfocená stránka žádnou nemá. Rozpoznávat písmena uvnitř obrázku znamená OCR, které tento nástroj záměrně nedělá — takové stránky raději nahlásí jako prázdné, než aby hádal.

Jak poznám, jestli v mém PDF je skutečný text?

Otevřete ho v libovolné čtečce a zkuste kurzorem označit řádek. Když se text zvýrazní, půjde vytáhnout. Když dostanete jen obdélník výběru přes obrázek, není z čeho brát.

Zachová se rozvržení dokumentu?

Ne. Výstupem je prostý text v pořadí stránek. Vícesloupcová sazba, tabulky a záhlaví vyjdou jako řádky za sebou, což u stránky se složitým rozvržením může působit přeházeně.

Můžu vytáhnout text jen z části dokumentu?

Ano — před exportem smažte stránky, které nechcete. Výběr uvnitř stránky k dispozici není, takže nejmenší jednotkou je celá stránka.

Zvládne to ligatury a znaky s diakritikou?

Většinou ano. Text vypadne tak, jak ho soubor zakódoval, takže dobře vyrobená PDF se extrahují čistě. Dokumenty ze starších nástrojů s rozbitým kódováním písem mohou vydat podivné znaky a to už žádný extraktor zpětně nespraví.

Nahrává se můj dokument kvůli extrakci textu?

Ne. Textovou vrstvu čte pdf.js uvnitř vašeho prohlížeče a .txt tam i zapisuje. Nic se nikam neodesílá, což je podstatné, protože tohle se běžně pouští na dokumentech, které stojí za analýzu.

Dostaňte ten text ven

Prostý soubor .txt, vyrobený bez nahrávání PDF.

Extrahovat text