Estrarre il testo da un PDF
Tira fuori il testo di un documento in un file .txt che puoi cercare, incollare o dare in pasto a un altro programma. Un limite dichiarato subito: legge il testo già presente nel file e non applica OCR alle scansioni.
Nessun account. Nessun limite di dimensione imposto da un server. Funziona offline una volta caricata.
Dal PDF a un file di testo semplice

Trascina il documento
Le pagine vengono disegnate così puoi confermare di aver caricato il file giusto prima di tirarne fuori qualcosa.

Tieni solo le pagine da cui ti serve il testo
Elimina le altre e il risultato resta mirato, invece di arrivare come un muro di testo dalla copertina all'appendice.

Esporta un file .txt
Il testo viene scritto nell'ordine delle pagine, in formato semplice. Impaginazione, tabelle e colonne non vengono ricostruite: qui ci sono le parole, non la grafica.
Cosa fa e cosa non fa questo strumento
Testo semplice, pronto da incollare
Un file .txt senza marcatori e senza formattazione, che è esattamente ciò che serve per cercare, citare o passare il contenuto a un altro programma.
Chiaro sulle scansioni, non vago
Qui non c'è OCR. Una pagina fatta solo di immagine non restituisce niente, e ti viene detto esattamente quali pagine sono risultate vuote, invece di consegnarti un file corto senza spiegazioni.
Scegli prima le pagine
Elimina le pagine che non ti servono prima di esportare e il .txt conterrà la sezione che cercavi invece dell'intero documento.
I documenti riservati restano dove sono
L'estrazione del testo si applica di solito a qualcosa da analizzare: un contratto, una relazione, un estratto conto. Niente di tutto ciò viene caricato.
Estrazione del testo: le domande più frequenti
Perché il mio PDF scansionato ha prodotto un file vuoto?
Perché una scansione è la fotografia di una pagina, non testo. L'estrazione legge il livello di testo che il PDF contiene, e una pagina scansionata o fotografata non ne ha. Riconoscere le lettere dentro un'immagine è OCR, che questo strumento volutamente non fa: segnala quelle pagine come vuote invece di tirare a indovinare.
Come capisco se il mio PDF contiene testo vero?
Aprilo in un lettore qualsiasi e prova a selezionare una riga con il cursore. Se il testo si evidenzia, verrà estratto. Se ottieni solo un rettangolo di selezione sopra un'immagine, non c'è niente da tirare fuori.
L'impaginazione del documento viene mantenuta?
No. Il risultato è testo semplice nell'ordine delle pagine. Layout a più colonne, tabelle e intestazioni escono come righe in sequenza, che su una pagina dall'impaginazione complessa possono risultare fuori ordine.
Posso estrarre il testo solo da una parte del documento?
Sì: elimina le pagine che non vuoi prima di esportare. Non esiste una selezione dentro la pagina, quindi l'unità minima è la pagina intera.
Legature e lettere accentate vengono gestite correttamente?
Di solito sì. Il testo esce come il file lo ha codificato, quindi i PDF fatti bene si estraggono in modo pulito. I documenti prodotti da strumenti vecchi con codifiche dei font difettose possono dare caratteri strani, e nessun estrattore può ripararlo a posteriori.
Il mio documento viene caricato per estrarne il testo?
No. pdf.js legge il livello di testo dentro il tuo browser e lì scrive il .txt. Non viene inviato niente da nessuna parte, il che conta parecchio visto che di solito si lavora su documenti che vale la pena analizzare.