Trekk ut teksten fra en PDF
Hent teksten ut av et dokument til en ren .txt-fil du kan søke i, lime inn eller mate videre til noe annet. Én ærlig begrensning med én gang: dette leser tekst som allerede finnes i filen, og kjører ikke OCR på skanninger.
Ingen konto. Ingen filstørrelsesgrenser fra en server. Fungerer offline når den er lastet inn.
Fra PDF til en ren tekstfil

Slipp inn dokumentet
Sidene gjengis, så du kan bekrefte at du har lastet inn riktig fil før du henter noe ut av den.

Behold bare sidene du trenger tekst fra
Slett resten, så holder resultatet seg fokusert i stedet for å komme som én vegg av tekst fra forside til vedlegg.

Eksporter en .txt-fil
Teksten skrives ut i sidenes rekkefølge som ren tekst. Layout, tabeller og spalter gjenskapes ikke — dette er ordene, ikke designet.
Hva dette gjør, og hva det ikke gjør
Ren tekst, klar til å limes inn
En .txt-fil uten markering og uten formatering, som er akkurat det du vil ha når du skal søke, sitere eller mate teksten inn i et annet program.
Tydelig om skanninger, ikke vagt
Det finnes ingen OCR her. En side med bare bilder gir ingenting — og du får vite nøyaktig hvilke sider som kom tilbake tomme, i stedet for å sitte igjen med en kort fil uten forklaring.
Velg sidene først
Slett sidene du ikke trenger før du eksporterer, så inneholder .txt-filen den delen du var ute etter, i stedet for hele dokumentet.
Konfidensielle dokumenter blir liggende
Tekstuttrekk brukes som regel på noe som skal analyseres — en kontrakt, en rapport, en kontoutskrift. Ingenting av det lastes opp.
Spørsmål folk stiller om tekstuttrekk fra PDF
Hvorfor ga den skannede PDF-en min en tom fil?
Fordi en skanning er et bilde av en side, ikke tekst. Uttrekket leser tekstlaget en PDF bærer med seg, og en skannet eller fotografert side har ikke noe slikt lag. Å kjenne igjen bokstaver inne i et bilde er OCR, og det gjør dette verktøyet bevisst ikke — det melder fra om at sidene er tomme, i stedet for å gjette.
Hvordan vet jeg om PDF-en min inneholder ekte tekst?
Åpne den i en hvilken som helst leser og prøv å markere en linje med markøren. Blir teksten uthevet, lar den seg trekke ut. Får du bare en markeringsboks over et bilde, finnes det ingenting å hente.
Blir layouten i dokumentet bevart?
Nei. Resultatet er ren tekst i sidenes rekkefølge. Spalter, tabeller og topptekster kommer ut som linjer etter hverandre, noe som kan leses i feil rekkefølge på en side med komplisert layout.
Kan jeg trekke ut tekst fra bare en del av dokumentet?
Ja — slett sidene du ikke vil ha før du eksporterer. Det finnes ingen markering inne i en side, så den minste enheten er en hel side.
Håndteres ligaturer og bokstaver med aksent riktig?
Som regel. Teksten kommer ut slik filen kodet den, så godt lagde PDF-er trekkes ut rent. Dokumenter fra eldre programmer med ødelagt skriftkoding kan gi rare tegn, og ingen uttrekker kan reparere det i etterkant.
Blir dokumentet mitt lastet opp for å trekke ut teksten?
Nei. pdf.js leser tekstlaget inne i nettleseren din og skriver .txt-filen der. Ingenting sendes noe sted, og det betyr mye, siden dette vanligvis kjøres på dokumenter det er verdt å analysere.