PDFPDF Organizer
Gratuit · Sans envoi · Sortie en .txt

Extraire le texte d'un PDF

Sortez le texte d'un document dans un fichier .txt que vous pouvez chercher, coller ou donner à un autre programme. Une limite annoncée d'emblée : l'outil lit le texte déjà présent dans le fichier et n'applique aucun OCR aux scans.

Sans compte. Aucune limite de taille imposée par un serveur. Fonctionne hors ligne une fois chargée.

Du PDF à un fichier en texte brut

Zone de glisser-déposer pour les fichiers PDF
1

Déposez le document

Les pages sont affichées pour que vous confirmiez avoir chargé le bon fichier avant d'en tirer quoi que ce soit.

Grille de pages en cours de réorganisation et de rotation
2

Ne gardez que les pages qui vous intéressent

Supprimez les autres : la sortie reste ciblée au lieu d'arriver sous forme d'un mur de texte allant de la couverture à l'annexe.

Fenêtre d’aperçu de page en taille réelle
3

Exportez un fichier .txt

Le texte est écrit dans l'ordre des pages, en texte brut. La mise en page, les tableaux et les colonnes ne sont pas reconstitués : ce sont les mots, pas la maquette.

Ce que l'outil fait, et ce qu'il ne fait pas

Du texte brut, prêt à coller

Un fichier .txt sans balisage ni mise en forme, exactement ce qu'il faut pour rechercher, citer ou alimenter un autre programme.

Clair sur les scans, jamais évasif

Il n'y a pas d'OCR ici. Une page uniquement composée d'images ne rend rien, et on vous indique précisément quelles pages sont revenues vides, au lieu de vous livrer un fichier court sans explication.

Choisissez les pages d'abord

Supprimez les pages inutiles avant l'export : le .txt contient alors la section que vous visiez plutôt que le document entier.

Les documents confidentiels ne bougent pas

On extrait surtout le texte de ce que l'on veut analyser : un contrat, un rapport, un relevé. Rien de tout cela n'est envoyé ailleurs.

Extraction de texte : les questions fréquentes

Pourquoi mon PDF scanné a-t-il produit un fichier vide ?

Parce qu'un scan est une photo de page, pas du texte. L'extraction lit la couche de texte que porte un PDF, et une page scannée ou photographiée n'en a aucune. Reconnaître des lettres à l'intérieur d'une image relève de l'OCR, que cet outil ne fait délibérément pas : il signale ces pages comme vides plutôt que de deviner.

Comment savoir si mon PDF contient du vrai texte ?

Ouvrez-le dans n'importe quel lecteur et essayez de sélectionner une ligne avec le curseur. Si le texte se surligne, il s'extraira. Si vous n'obtenez qu'un rectangle de sélection posé sur une image, il n'y a rien à récupérer.

La mise en page du document est-elle conservée ?

Non. La sortie est du texte brut dans l'ordre des pages. Les mises en page multi-colonnes, les tableaux et les en-têtes ressortent en lignes successives, ce qui peut se lire dans le désordre pour une page à la maquette complexe.

Puis-je extraire le texte d'une partie seulement du document ?

Oui, supprimez les pages dont vous ne voulez pas avant l'export. Il n'y a pas de sélection à l'intérieur d'une page : la plus petite unité reste la page entière.

Les ligatures et les caractères accentués sont-ils bien gérés ?

En général oui. Le texte ressort tel que le fichier l'a encodé, donc les PDF bien faits s'extraient proprement. Les documents produits par de vieux outils aux encodages de police cassés peuvent donner des caractères étranges, et aucun extracteur ne peut réparer cela après coup.

Mon document est-il envoyé pour en extraire le texte ?

Non. pdf.js lit la couche de texte dans votre navigateur et y écrit le fichier .txt. Rien n'est transmis nulle part, ce qui compte d'autant plus que l'on fait cela sur des documents qui méritent une analyse.

Récupérez le texte de ce document

Un simple fichier .txt, produit sans envoyer le PDF.

Extraire le texte