PDFPDF Organizer
Gratis · Zonder upload · Gewoon .txt eruit

Tekst uit een PDF halen

Haal de tekst uit een document naar een gewoon .txt-bestand dat je kunt doorzoeken, plakken of ergens anders in voeren. Eén eerlijke beperking vooraf: dit leest tekst die al in het bestand zit en voert geen OCR uit op scans.

Geen account. Geen serverlimieten op bestandsgrootte. Werkt offline zodra het geladen is.

Van PDF naar een gewoon tekstbestand

Sleepgebied voor PDF-bestanden
1

Sleep het document erin

De pagina's worden gerenderd zodat je kunt bevestigen dat je het juiste bestand hebt geladen voordat je er iets uit haalt.

Raster met pagina's die worden herordend en gedraaid
2

Houd alleen de pagina's over waarvan je tekst wilt

Verwijder de rest, dan blijft de uitvoer gericht in plaats van dat je één muur tekst krijgt van omslag tot bijlage.

Voorbeeldvenster van een pagina op ware grootte
3

Exporteer een .txt-bestand

De tekst wordt in paginavolgorde als platte tekst weggeschreven. Lay-out, tabellen en kolommen worden niet gereconstrueerd — dit zijn de woorden, niet het ontwerp.

Wat dit wel en niet doet

Platte tekst, klaar om te plakken

Een .txt-bestand zonder opmaak en zonder markup, precies wat je wilt om te zoeken, te citeren of door een ander programma te laten inlezen.

Duidelijk over scans, niet vaag

Er is hier geen OCR. Een pagina met alleen een afbeelding levert niets op — en je krijgt precies te horen welke pagina's leeg terugkwamen, in plaats van een kort bestand zonder uitleg.

Kies eerst de pagina's

Verwijder de pagina's die je niet nodig hebt vóór de export, dan bevat de .txt het gedeelte waar je op uit was in plaats van het hele document.

Vertrouwelijke documenten blijven waar ze zijn

Tekst haal je meestal uit iets dat geanalyseerd wordt — een contract, een rapport, een afschrift. Daar wordt niets van geüpload.

Tekst uit een PDF halen — vragen die mensen stellen

Waarom leverde mijn gescande PDF een leeg bestand op?

Omdat een scan een foto van een pagina is en geen tekst. Extractie leest de tekstlaag die een PDF bij zich draagt, en een gescande of gefotografeerde pagina heeft die niet. Letters herkennen binnen een afbeelding is OCR, en dat doet deze tool bewust niet — hij meldt die pagina's als leeg in plaats van te gokken.

Hoe weet ik of er echte tekst in mijn PDF zit?

Open hem in een willekeurige lezer en probeer een regel met de cursor te selecteren. Licht de tekst op, dan komt hij er ook uit. Krijg je alleen een selectiekader over een afbeelding, dan valt er niets uit te halen.

Blijft de lay-out van het document behouden?

Nee. De uitvoer is platte tekst in paginavolgorde. Kolommen, tabellen en kopregels komen er als opeenvolgende regels uit, wat bij een pagina met een ingewikkelde lay-out door elkaar kan lopen.

Kan ik tekst uit maar een deel van het document halen?

Ja — verwijder de pagina's die je niet wilt vóór de export. Selecteren binnen een pagina kan niet, dus de kleinste eenheid is een hele pagina.

Worden ligaturen en letters met accenten goed verwerkt?

Meestal wel. De tekst komt eruit zoals het bestand hem heeft gecodeerd, dus goed gemaakte PDF's leveren nette uitvoer. Documenten uit oudere programma's met kapotte lettertypecoderingen kunnen rare tekens geven, en dat kan geen enkele extractor achteraf repareren.

Wordt mijn document geüpload om de tekst eruit te halen?

Nee. pdf.js leest de tekstlaag in je browser en schrijft de .txt daar weg. Er wordt niets verzonden, wat telt omdat dit meestal wordt gebruikt op documenten die het analyseren waard zijn.

Haal die tekst eruit

Een gewoon .txt-bestand, gemaakt zonder de PDF te uploaden.

Nu extraheren