Extrahovat text z PDF do souboru TXT
Vytáhněte text z dokumentu do prostého souboru .txt, ve kterém můžete vyhledávat, vkládat ho jinam nebo ho předat dál. Jedno omezení rovnou na rovinu: nástroj čte text, který v souboru už je, a na skenech nespouští OCR.
Bez účtu. Bez serverových limitů velikosti souborů. Po načtení funguje offline.
Z PDF do prostého textového souboru

Vložte dokument
Stránky se vykreslí, abyste si ověřili, že jste načetli správný soubor, ještě než z něj začnete cokoli tahat.

Nechte jen stránky, ze kterých text potřebujete
Zbytek smažte a výstup zůstane soustředěný, místo aby dorazil jako jedna zeď textu od obálky po přílohy.

Vyexportujte soubor .txt
Text se zapíše v pořadí stránek jako prostý text. Rozvržení, tabulky ani sloupce se nerekonstruují — jde o slova, ne o grafickou úpravu.
Co nástroj umí a co ne
Prostý text připravený k vložení
Soubor .txt bez značkování a bez formátování, přesně to, co potřebujete k vyhledávání, citování nebo předání jinému programu.
O skenech jasně, ne mlhavě
Žádné OCR tu není. Stránka složená jen z obrázku nevrátí nic — a vy se přesně dozvíte, které stránky zůstaly prázdné, místo abyste dostali krátký soubor bez vysvětlení.
Stránky si vyberte předem
Smažte před exportem stránky, které nepotřebujete, a v .txt bude ta pasáž, o kterou vám šlo, ne celý dokument.
Důvěrné dokumenty zůstanou na místě
Extrakce textu se obvykle pouští na něčem, co se má analyzovat — na smlouvě, zprávě, výpisu z účtu. Nic z toho se nikam nenahrává.
Extrakce textu z PDF — na co se lidé ptají
Proč z mého naskenovaného PDF vypadl prázdný soubor?
Protože sken je obrázek stránky, ne text. Extrakce čte textovou vrstvu, kterou PDF nese, a naskenovaná nebo vyfocená stránka žádnou nemá. Rozpoznávat písmena uvnitř obrázku znamená OCR, které tento nástroj záměrně nedělá — takové stránky raději nahlásí jako prázdné, než aby hádal.
Jak poznám, jestli v mém PDF je skutečný text?
Otevřete ho v libovolné čtečce a zkuste kurzorem označit řádek. Když se text zvýrazní, půjde vytáhnout. Když dostanete jen obdélník výběru přes obrázek, není z čeho brát.
Zachová se rozvržení dokumentu?
Ne. Výstupem je prostý text v pořadí stránek. Vícesloupcová sazba, tabulky a záhlaví vyjdou jako řádky za sebou, což u stránky se složitým rozvržením může působit přeházeně.
Můžu vytáhnout text jen z části dokumentu?
Ano — před exportem smažte stránky, které nechcete. Výběr uvnitř stránky k dispozici není, takže nejmenší jednotkou je celá stránka.
Zvládne to ligatury a znaky s diakritikou?
Většinou ano. Text vypadne tak, jak ho soubor zakódoval, takže dobře vyrobená PDF se extrahují čistě. Dokumenty ze starších nástrojů s rozbitým kódováním písem mohou vydat podivné znaky a to už žádný extraktor zpětně nespraví.
Nahrává se můj dokument kvůli extrakci textu?
Ne. Textovou vrstvu čte pdf.js uvnitř vašeho prohlížeče a .txt tam i zapisuje. Nic se nikam neodesílá, což je podstatné, protože tohle se běžně pouští na dokumentech, které stojí za analýzu.