Extrahovanie textu z PDF do súboru .txt
Dostaňte text z dokumentu do obyčajného súboru .txt, ktorý sa dá prehľadávať, vkladať alebo posunúť ďalej. Jedno úprimné obmedzenie hneď na úvod: číta sa text, ktorý už v súbore je, a na skenoch sa nespúšťa OCR.
Bez účtu. Bez serverových obmedzení veľkosti súborov. Po načítaní funguje offline.
Z PDF do obyčajného textového súboru

Vložte dokument
Strany sa vykreslia, aby ste si ešte pred vyťahovaním overili, že ste načítali správny súbor.

Nechajte len strany, z ktorých text potrebujete
Zvyšok zmažte a výstup zostane sústredený namiesto toho, aby prišiel ako jedna stena textu od obálky po prílohu.

Vyexportujte súbor .txt
Text sa zapíše v poradí strán ako obyčajný text. Rozloženie, tabuľky ani stĺpce sa nerekonštruujú – toto sú slová, nie dizajn.
Čo tento nástroj robí a čo nie
Obyčajný text, pripravený na vloženie
Súbor .txt bez značiek a bez formátovania, čo je presne to, čo chcete na vyhľadávanie, citovanie alebo posunutie do iného programu.
Jasne o skenoch, nie vyhýbavo
Žiadne OCR tu nie je. Strana, ktorá je len obrázok, nevydá nič – a dozviete sa presne, ktoré strany prišli prázdne, namiesto krátkeho súboru bez vysvetlenia.
Najprv si vyberte strany
Zmažte strany, ktoré nepotrebujete, a .txt bude obsahovať tú časť, o ktorú vám šlo, nie celý dokument.
Dôverné dokumenty zostanú na mieste
Text sa vyťahuje zvyčajne z niečoho, čo sa analyzuje – zo zmluvy, zo správy, z výpisu. Nič z toho sa nenahráva.
Vyťahovanie textu z PDF – časté otázky
Prečo mi naskenovaný PDF vydal prázdny súbor?
Lebo sken je fotka strany, nie text. Vyťahovanie číta textovú vrstvu, ktorú si PDF nesie, a naskenovaná či odfotená strana žiadnu nemá. Rozpoznávanie písmen vnútri obrázka je OCR, ktoré tento nástroj zámerne nerobí – tie strany radšej ohlási ako prázdne, než by hádal.
Ako zistím, či môj PDF obsahuje skutočný text?
Otvorte ho v ľubovoľnej čítačke a skúste kurzorom označiť riadok. Ak sa text zvýrazní, dá sa vytiahnuť. Ak dostanete len obdĺžnik výberu cez obrázok, nie je čo vyťahovať.
Zachová sa rozloženie dokumentu?
Nie. Výstupom je obyčajný text v poradí strán. Viacstĺpcové rozloženia, tabuľky a hlavičky vyjdú ako riadky za sebou, čo pri strane so zložitým rozložením môže pôsobiť poprehadzovane.
Môžem vytiahnuť text len z časti dokumentu?
Áno – pred exportom zmažte strany, ktoré nechcete. Výber vnútri strany tu nie je, takže najmenšou jednotkou je celá strana.
Zvládne to ligatúry a znaky s diakritikou?
Zvyčajne áno. Text vychádza tak, ako ho súbor zakódoval, takže dobre vyrobené PDF sa vyťahujú čisto. Dokumenty zo starších nástrojov s pokazeným kódovaním písiem môžu vydať zvláštne znaky a to už nespraví poriadok žiadny extraktor.
Nahráva sa môj dokument kvôli vytiahnutiu textu?
Nie. pdf.js prečíta textovú vrstvu vo vašom prehliadači a .txt zapíše priamo tam. Nikam sa nič neodosiela, čo je dôležité, keďže sa to bežne spúšťa na dokumentoch hodných analýzy.