Εξαγωγή κειμένου από ένα PDF σε .txt
Βγάλτε το κείμενο ενός εγγράφου σε ένα απλό αρχείο .txt που μπορείτε να αναζητήσετε, να επικολλήσετε ή να δώσετε σε κάτι άλλο. Ένας ειλικρινής περιορισμός εξαρχής: διαβάζεται το κείμενο που υπάρχει ήδη μέσα στο αρχείο και δεν εκτελείται OCR στις σαρώσεις.
Χωρίς λογαριασμό. Χωρίς όρια μεγέθους αρχείου από διακομιστή. Λειτουργεί εκτός σύνδεσης μόλις φορτωθεί.
Από PDF σε ένα απλό αρχείο κειμένου

Αποθέστε το έγγραφο
Οι σελίδες αποδίδονται ώστε να επιβεβαιώσετε ότι φορτώσατε το σωστό αρχείο πριν βγάλετε οτιδήποτε από αυτό.

Κρατήστε μόνο τις σελίδες που σας ενδιαφέρουν
Διαγράψτε τις υπόλοιπες και η έξοδος μένει στοχευμένη, αντί να φτάνει ως ένας τοίχος κειμένου από το εξώφυλλο ως το παράρτημα.

Εξάγετε ένα αρχείο .txt
Το κείμενο γράφεται με τη σειρά των σελίδων ως απλό κείμενο. Η διάταξη, οι πίνακες και οι στήλες δεν ανακατασκευάζονται — αυτά είναι τα λόγια, όχι ο σχεδιασμός.
Τι κάνει και τι δεν κάνει αυτό το εργαλείο
Απλό κείμενο, έτοιμο για επικόλληση
Ένα αρχείο .txt χωρίς σήμανση και χωρίς μορφοποίηση, που είναι ακριβώς αυτό που θέλετε για αναζήτηση, παράθεση ή τροφοδοσία σε άλλο πρόγραμμα.
Ξεκάθαρα για τις σαρώσεις, χωρίς ασάφειες
Εδώ δεν υπάρχει OCR. Μια σελίδα μόνο με εικόνα δεν αποδίδει τίποτα — και σας λέμε ακριβώς ποιες σελίδες γύρισαν κενές, αντί να λάβετε ένα κοντό αρχείο χωρίς καμία εξήγηση.
Διαλέξτε πρώτα τις σελίδες
Διαγράψτε τις σελίδες που δεν χρειάζεστε πριν από την εξαγωγή, και το .txt θα περιέχει την ενότητα που θέλατε αντί για ολόκληρο το έγγραφο.
Τα εμπιστευτικά έγγραφα μένουν στη θέση τους
Η εξαγωγή κειμένου εφαρμόζεται συνήθως σε κάτι που αναλύεται — ένα συμβόλαιο, μια αναφορά, ένα αντίγραφο κίνησης. Τίποτα από αυτά δεν μεταφορτώνεται.
Ερωτήσεις για την εξαγωγή κειμένου από PDF
Γιατί το σαρωμένο PDF μου έβγαλε κενό αρχείο;
Επειδή μια σάρωση είναι φωτογραφία μιας σελίδας, όχι κείμενο. Η εξαγωγή διαβάζει το επίπεδο κειμένου που κουβαλά ένα PDF, και μια σαρωμένη ή φωτογραφημένη σελίδα δεν έχει. Η αναγνώριση γραμμάτων μέσα σε εικόνα είναι OCR, κάτι που αυτό το εργαλείο σκόπιμα δεν κάνει — αναφέρει αυτές τις σελίδες ως κενές αντί να μαντεύει.
Πώς καταλαβαίνω αν το PDF μου έχει πραγματικό κείμενο;
Ανοίξτε το σε οποιοδήποτε πρόγραμμα ανάγνωσης και δοκιμάστε να επιλέξετε μια γραμμή με τον δρομέα. Αν το κείμενο επισημαίνεται, θα εξαχθεί. Αν παίρνετε μόνο ένα ορθογώνιο επιλογής πάνω από μια εικόνα, δεν υπάρχει τίποτα να βγει.
Διατηρείται η διάταξη του εγγράφου;
Όχι. Η έξοδος είναι απλό κείμενο με τη σειρά των σελίδων. Οι διατάξεις πολλών στηλών, οι πίνακες και οι κεφαλίδες βγαίνουν ως διαδοχικές γραμμές, που μπορεί να διαβάζονται εκτός σειράς σε μια σελίδα με σύνθετη διάταξη.
Μπορώ να εξαγάγω κείμενο μόνο από ένα μέρος του εγγράφου;
Ναι — διαγράψτε τις σελίδες που δεν θέλετε πριν από την εξαγωγή. Δεν υπάρχει επιλογή μέσα στη σελίδα, οπότε η μικρότερη μονάδα είναι μια ολόκληρη σελίδα.
Αποδίδονται σωστά τα συμπλέγματα και οι τονισμένοι χαρακτήρες;
Συνήθως ναι. Το κείμενο βγαίνει όπως το κωδικοποίησε το αρχείο, οπότε τα καλοφτιαγμένα PDF εξάγονται καθαρά. Έγγραφα από παλαιότερα προγράμματα με χαλασμένη κωδικοποίηση γραμματοσειρών μπορεί να δώσουν παράξενους χαρακτήρες, και κανένα εργαλείο εξαγωγής δεν το επιδιορθώνει εκ των υστέρων.
Μεταφορτώνεται το έγγραφό μου για να εξαχθεί το κείμενο;
Όχι. Το pdf.js διαβάζει το επίπεδο κειμένου μέσα στο πρόγραμμα περιήγησής σας και γράφει εκεί το .txt. Τίποτα δεν στέλνεται πουθενά, κάτι που μετράει δεδομένου ότι αυτό εκτελείται συνήθως σε έγγραφα που αξίζει να αναλυθούν.