Extrahera text från PDF till en .txt-fil
Plocka ut texten ur ett dokument till en vanlig .txt-fil som du kan söka i, klistra in eller mata vidare till något annat. En ärlig begränsning direkt: verktyget läser text som redan finns i filen och kör ingen OCR på skanningar.
Inget konto. Inga filstorleksgränser från en server. Fungerar offline när den väl laddats.
Från PDF till en vanlig textfil

Släpp in dokumentet
Sidorna renderas så att du hinner bekräfta att du läst in rätt fil innan du plockar ut något ur den.

Behåll bara de sidor du vill ha text från
Ta bort resten, så förblir resultatet fokuserat i stället för att komma som en enda vägg av text från pärm till bilaga.

Exportera en .txt-fil
Texten skrivs ut i sidordning som vanlig text. Layout, tabeller och spalter återskapas inte — det här är orden, inte formgivningen.
Vad verktyget gör och inte gör
Vanlig text, redo att klistra in
En .txt-fil utan uppmärkning och utan formatering, vilket är precis vad du vill ha för att söka, citera eller mata in i ett annat program.
Tydligt om skanningar, inte svävande
Det finns ingen OCR här. En sida som bara är en bild ger ingenting — och du får veta exakt vilka sidor som kom tillbaka tomma, i stället för att få en kort fil utan förklaring.
Välj sidorna först
Ta bort de sidor du inte behöver innan du exporterar, så innehåller .txt-filen det avsnitt du var ute efter i stället för hela dokumentet.
Konfidentiella dokument stannar kvar
Textextrahering körs oftast på något som ska analyseras — ett avtal, en rapport, ett kontoutdrag. Ingenting av det laddas upp.
Vanliga frågor om textextrahering ur PDF
Varför gav min skannade PDF en tom fil?
För att en skanning är en bild av en sida, inte text. Extraheringen läser det textlager en PDF bär med sig, och en skannad eller fotograferad sida har inget. Att känna igen bokstäver inuti en bild är OCR, som det här verktyget medvetet inte gör — det rapporterar de sidorna som tomma i stället för att gissa.
Hur vet jag om min PDF innehåller riktig text?
Öppna den i valfri läsare och försök markera en rad med markören. Om texten markeras går den att extrahera. Om du bara får en markeringsruta över en bild finns det ingenting att plocka ut.
Bevaras dokumentets layout?
Nej. Resultatet är vanlig text i sidordning. Flerspaltiga layouter, tabeller och sidhuvuden kommer ut som rader efter varandra, vilket kan läsas i fel ordning på en sida med komplicerad layout.
Kan jag extrahera text från bara en del av dokumentet?
Ja — ta bort de sidor du inte vill ha innan du exporterar. Det går inte att markera inuti en sida, så minsta enhet är en hel sida.
Hanteras ligaturer och tecken med accent korrekt?
Oftast. Texten kommer ut som filen kodade den, så välgjorda PDF-filer extraheras rent. Dokument från äldre program med trasiga teckensnittskodningar kan ge konstiga tecken, och ingen extraherare kan reparera det i efterhand.
Laddas mitt dokument upp för att texten ska extraheras?
Nej. pdf.js läser textlagret inne i din webbläsare och skriver .txt-filen där. Ingenting skickas någonstans, vilket spelar roll eftersom det här normalt körs på dokument som är värda att analysera.