PDFPDF Organizer
Zadarmo · Bez nahrávania · Na výstupe .txt

Extrahovanie textu z PDF do súboru .txt

Dostaňte text z dokumentu do obyčajného súboru .txt, ktorý sa dá prehľadávať, vkladať alebo posunúť ďalej. Jedno úprimné obmedzenie hneď na úvod: číta sa text, ktorý už v súbore je, a na skenoch sa nespúšťa OCR.

Bez účtu. Bez serverových obmedzení veľkosti súborov. Po načítaní funguje offline.

Z PDF do obyčajného textového súboru

Oblasť na presúvanie a vkladanie súborov PDF
1

Vložte dokument

Strany sa vykreslia, aby ste si ešte pred vyťahovaním overili, že ste načítali správny súbor.

Mriežka strán, ktorých poradie sa mení a ktoré sa otáčajú
2

Nechajte len strany, z ktorých text potrebujete

Zvyšok zmažte a výstup zostane sústredený namiesto toho, aby prišiel ako jedna stena textu od obálky po prílohu.

Okno náhľadu strany v plnej veľkosti
3

Vyexportujte súbor .txt

Text sa zapíše v poradí strán ako obyčajný text. Rozloženie, tabuľky ani stĺpce sa nerekonštruujú – toto sú slová, nie dizajn.

Čo tento nástroj robí a čo nie

Obyčajný text, pripravený na vloženie

Súbor .txt bez značiek a bez formátovania, čo je presne to, čo chcete na vyhľadávanie, citovanie alebo posunutie do iného programu.

Jasne o skenoch, nie vyhýbavo

Žiadne OCR tu nie je. Strana, ktorá je len obrázok, nevydá nič – a dozviete sa presne, ktoré strany prišli prázdne, namiesto krátkeho súboru bez vysvetlenia.

Najprv si vyberte strany

Zmažte strany, ktoré nepotrebujete, a .txt bude obsahovať tú časť, o ktorú vám šlo, nie celý dokument.

Dôverné dokumenty zostanú na mieste

Text sa vyťahuje zvyčajne z niečoho, čo sa analyzuje – zo zmluvy, zo správy, z výpisu. Nič z toho sa nenahráva.

Vyťahovanie textu z PDF – časté otázky

Prečo mi naskenovaný PDF vydal prázdny súbor?

Lebo sken je fotka strany, nie text. Vyťahovanie číta textovú vrstvu, ktorú si PDF nesie, a naskenovaná či odfotená strana žiadnu nemá. Rozpoznávanie písmen vnútri obrázka je OCR, ktoré tento nástroj zámerne nerobí – tie strany radšej ohlási ako prázdne, než by hádal.

Ako zistím, či môj PDF obsahuje skutočný text?

Otvorte ho v ľubovoľnej čítačke a skúste kurzorom označiť riadok. Ak sa text zvýrazní, dá sa vytiahnuť. Ak dostanete len obdĺžnik výberu cez obrázok, nie je čo vyťahovať.

Zachová sa rozloženie dokumentu?

Nie. Výstupom je obyčajný text v poradí strán. Viacstĺpcové rozloženia, tabuľky a hlavičky vyjdú ako riadky za sebou, čo pri strane so zložitým rozložením môže pôsobiť poprehadzovane.

Môžem vytiahnuť text len z časti dokumentu?

Áno – pred exportom zmažte strany, ktoré nechcete. Výber vnútri strany tu nie je, takže najmenšou jednotkou je celá strana.

Zvládne to ligatúry a znaky s diakritikou?

Zvyčajne áno. Text vychádza tak, ako ho súbor zakódoval, takže dobre vyrobené PDF sa vyťahujú čisto. Dokumenty zo starších nástrojov s pokazeným kódovaním písiem môžu vydať zvláštne znaky a to už nespraví poriadok žiadny extraktor.

Nahráva sa môj dokument kvôli vytiahnutiu textu?

Nie. pdf.js prečíta textovú vrstvu vo vašom prehliadači a .txt zapíše priamo tam. Nikam sa nič neodosiela, čo je dôležité, keďže sa to bežne spúšťa na dokumentoch hodných analýzy.

Dostaňte ten text von

Obyčajný súbor .txt, vyrobený bez nahrávania PDF.

Vytiahnuť text