PDFPDF Organizer
Gratuit · Fără încărcare · Rezultat .txt simplu

Extrage textul dintr-un fișier PDF

Scoate textul dintr-un document într-un fișier .txt simplu, în care poți căuta, pe care îl poți lipi sau pe care îl poți da mai departe altui program. O limitare spusă din capul locului: citește textul deja existent în fișier și nu face OCR pe scanări.

Fără cont. Fără limite de dimensiune impuse de un server. Funcționează offline după încărcare.

De la PDF la un fișier text simplu

Zonă de tragere și plasare pentru fișiere PDF
1

Plasează documentul

Paginile sunt randate ca să poți confirma că ai adăugat fișierul corect înainte să scoți ceva din el.

Grilă de pagini care sunt reordonate și rotite
2

Păstrează doar paginile din care vrei textul

Șterge-le pe celelalte, iar rezultatul rămâne concentrat, în loc să vină ca un zid de text de la copertă până la anexă.

Fereastră de previzualizare a paginii la dimensiune completă
3

Exportă un fișier .txt

Textul este scris în ordinea paginilor, ca text simplu. Aspectul, tabelele și coloanele nu sunt reconstruite — acestea sunt cuvintele, nu designul.

Ce face și ce nu face

Text simplu, gata de lipit

Un fișier .txt fără marcaje și fără formatare, exact ce îți trebuie pentru căutare, pentru citare sau ca să-l dai altui program.

Clar în privința scanărilor, nu vag

Aici nu există OCR. O pagină care conține doar imagine nu dă nimic — iar tu afli exact care pagini au ieșit goale, în loc să primești un fișier scurt fără nicio explicație.

Alege paginile mai întâi

Șterge paginile de care nu ai nevoie înainte de export, iar fișierul .txt va conține secțiunea pe care o urmăreai, nu tot documentul.

Documentele confidențiale rămân pe loc

Extragerea textului se aplică de obicei unui lucru care este analizat — un contract, un raport, un extras de cont. Nimic din toate acestea nu este încărcat.

Extragerea textului dintr-un PDF — întrebări frecvente

De ce PDF-ul meu scanat a produs un fișier gol?

Pentru că o scanare este o poză a unei pagini, nu text. Extragerea citește stratul de text pe care îl are un PDF, iar o pagină scanată sau fotografiată nu are niciunul. Recunoașterea literelor dintr-o imagine se numește OCR, iar acest instrument nu o face intenționat — raportează acele pagini ca goale, în loc să ghicească.

Cum îmi dau seama dacă PDF-ul meu are text adevărat?

Deschide-l în orice cititor și încearcă să selectezi un rând cu cursorul. Dacă textul se evidențiază, se va extrage. Dacă obții doar un dreptunghi de selecție peste o imagine, nu este nimic de scos.

Se păstrează aspectul documentului?

Nu. Rezultatul este text simplu, în ordinea paginilor. Aspectele pe mai multe coloane, tabelele și antetele ies ca rânduri succesive, care pot părea în altă ordine la o pagină cu aspect complicat.

Pot extrage text doar dintr-o parte a documentului?

Da — șterge paginile pe care nu le vrei înainte de export. Nu există selecție în interiorul paginii, așa că unitatea minimă este o pagină întreagă.

Ligaturile și diacriticele sunt tratate corect?

De obicei, da. Textul iese așa cum l-a codificat fișierul, deci PDF-urile bine făcute se extrag curat. Documentele produse de programe vechi, cu codificări de font stricate, pot da caractere ciudate, iar niciun extractor nu poate repara asta ulterior.

Documentul meu este încărcat ca să i se extragă textul?

Nu. pdf.js citește stratul de text în browserul tău și scrie tot acolo fișierul .txt. Nimic nu este trimis nicăieri, ceea ce contează, având în vedere că asta se rulează de obicei pe documente care merită analizate.

Scoate textul afară

Un fișier .txt simplu, produs fără să încarci PDF-ul.

Extrage textul