PDFPDF Organizer
Gratis · Nessun caricamento · Esce un .txt semplice

Estrarre il testo da un PDF

Tira fuori il testo di un documento in un file .txt che puoi cercare, incollare o dare in pasto a un altro programma. Un limite dichiarato subito: legge il testo già presente nel file e non applica OCR alle scansioni.

Nessun account. Nessun limite di dimensione imposto da un server. Funziona offline una volta caricata.

Dal PDF a un file di testo semplice

Area di trascinamento per i file PDF
1

Trascina il documento

Le pagine vengono disegnate così puoi confermare di aver caricato il file giusto prima di tirarne fuori qualcosa.

Griglia di pagine che vengono riordinate e ruotate
2

Tieni solo le pagine da cui ti serve il testo

Elimina le altre e il risultato resta mirato, invece di arrivare come un muro di testo dalla copertina all'appendice.

Finestra di anteprima della pagina a grandezza piena
3

Esporta un file .txt

Il testo viene scritto nell'ordine delle pagine, in formato semplice. Impaginazione, tabelle e colonne non vengono ricostruite: qui ci sono le parole, non la grafica.

Cosa fa e cosa non fa questo strumento

Testo semplice, pronto da incollare

Un file .txt senza marcatori e senza formattazione, che è esattamente ciò che serve per cercare, citare o passare il contenuto a un altro programma.

Chiaro sulle scansioni, non vago

Qui non c'è OCR. Una pagina fatta solo di immagine non restituisce niente, e ti viene detto esattamente quali pagine sono risultate vuote, invece di consegnarti un file corto senza spiegazioni.

Scegli prima le pagine

Elimina le pagine che non ti servono prima di esportare e il .txt conterrà la sezione che cercavi invece dell'intero documento.

I documenti riservati restano dove sono

L'estrazione del testo si applica di solito a qualcosa da analizzare: un contratto, una relazione, un estratto conto. Niente di tutto ciò viene caricato.

Estrazione del testo: le domande più frequenti

Perché il mio PDF scansionato ha prodotto un file vuoto?

Perché una scansione è la fotografia di una pagina, non testo. L'estrazione legge il livello di testo che il PDF contiene, e una pagina scansionata o fotografata non ne ha. Riconoscere le lettere dentro un'immagine è OCR, che questo strumento volutamente non fa: segnala quelle pagine come vuote invece di tirare a indovinare.

Come capisco se il mio PDF contiene testo vero?

Aprilo in un lettore qualsiasi e prova a selezionare una riga con il cursore. Se il testo si evidenzia, verrà estratto. Se ottieni solo un rettangolo di selezione sopra un'immagine, non c'è niente da tirare fuori.

L'impaginazione del documento viene mantenuta?

No. Il risultato è testo semplice nell'ordine delle pagine. Layout a più colonne, tabelle e intestazioni escono come righe in sequenza, che su una pagina dall'impaginazione complessa possono risultare fuori ordine.

Posso estrarre il testo solo da una parte del documento?

Sì: elimina le pagine che non vuoi prima di esportare. Non esiste una selezione dentro la pagina, quindi l'unità minima è la pagina intera.

Legature e lettere accentate vengono gestite correttamente?

Di solito sì. Il testo esce come il file lo ha codificato, quindi i PDF fatti bene si estraggono in modo pulito. I documenti prodotti da strumenti vecchi con codifiche dei font difettose possono dare caratteri strani, e nessun estrattore può ripararlo a posteriori.

Il mio documento viene caricato per estrarne il testo?

No. pdf.js legge il livello di testo dentro il tuo browser e lì scrive il .txt. Non viene inviato niente da nessuna parte, il che conta parecchio visto che di solito si lavora su documenti che vale la pena analizzare.

Porta fuori il testo

Un file .txt semplice, prodotto senza caricare il PDF.

Estrai il testo ora