Udtræk teksten fra en PDF
Træk teksten ud af et dokument og over i en almindelig .txt-fil, du kan søge i, sætte ind eller sende videre til noget andet. Én ærlig begrænsning med det samme: det er den tekst, der allerede ligger i filen, der læses, og der køres ikke OCR på scanninger.
Ingen konto. Ingen serverbaserede grænser for filstørrelse. Virker offline, når den er indlæst.
Fra PDF til en ren tekstfil

Læg dokumentet ind
Siderne gengives, så du kan bekræfte, at du har indlæst den rigtige fil, før du trækker noget ud af den.

Behold kun de sider, du skal have tekst fra
Slet resten, så resultatet holder fokus i stedet for at komme som én mur af tekst fra forside til bilag.

Eksportér en .txt-fil
Teksten skrives ud i sidernes rækkefølge som ren tekst. Layout, tabeller og spalter genskabes ikke — det er ordene, ikke designet.
Hvad værktøjet kan, og hvad det ikke kan
Ren tekst, klar til at sætte ind
En .txt-fil uden opmærkning og uden formatering, hvilket er præcis det, du vil have, når der skal søges, citeres eller sendes videre til et andet program.
Klar besked om scanninger
Der er ingen OCR her. En side, der kun er et billede, giver intet — og du får at vide, præcis hvilke sider der kom tomme tilbage, i stedet for at stå med en kort fil uden forklaring.
Vælg siderne først
Slet de sider, du ikke skal bruge, før du eksporterer, så .txt-filen indeholder det afsnit, du var ude efter, frem for hele dokumentet.
Fortrolige dokumenter bliver, hvor de er
Tekstudtræk bruges typisk på noget, der skal analyseres — en kontrakt, en rapport, et regnskab. Intet af det bliver uploadet.
Spørgsmål om tekstudtræk fra PDF
Hvorfor gav min scannede PDF en tom fil?
Fordi en scanning er et billede af en side, ikke tekst. Udtrækket læser det tekstlag, en PDF bærer med sig, og en scannet eller fotograferet side har ingen. At genkende bogstaver inde i et billede er OCR, og det gør værktøjet bevidst ikke — det melder de sider som tomme frem for at gætte.
Hvordan ser jeg, om min PDF indeholder rigtig tekst?
Åbn den i en vilkårlig læser, og prøv at markere en linje med musen. Bliver teksten fremhævet, kan den trækkes ud. Får du kun en markeringsfirkant hen over et billede, er der intet at hente.
Bevares dokumentets layout?
Nej. Resultatet er ren tekst i sidernes rækkefølge. Spalteopsætning, tabeller og sidehoveder kommer ud som linjer efter hinanden, hvilket kan læses i forkert orden på en side med kompliceret layout.
Kan jeg udtrække tekst fra kun en del af dokumentet?
Ja — slet de sider, du ikke vil have, før du eksporterer. Der er ingen markering inde i en side, så den mindste enhed er en hel side.
Håndteres ligaturer og bogstaver med accenter korrekt?
Som regel. Teksten kommer ud, som filen har kodet den, så velbyggede PDF-filer udtrækkes rent. Dokumenter fra ældre programmer med defekte fontkodninger kan give mærkelige tegn, og det kan ingen udtrækker reparere bagefter.
Bliver mit dokument uploadet for at få teksten ud?
Nej. pdf.js læser tekstlaget inde i din browser og skriver .txt-filen samme sted. Intet sendes nogen steder hen, og det betyder noget, når det typisk er dokumenter, der er værd at analysere.