PDFPDF Organizer
Gratis · Ingen uppladdning · Vanlig .txt ut

Extrahera text från PDF till en .txt-fil

Plocka ut texten ur ett dokument till en vanlig .txt-fil som du kan söka i, klistra in eller mata vidare till något annat. En ärlig begränsning direkt: verktyget läser text som redan finns i filen och kör ingen OCR på skanningar.

Inget konto. Inga filstorleksgränser från en server. Fungerar offline när den väl laddats.

Från PDF till en vanlig textfil

Dra-och-släpp-yta för PDF-filer
1

Släpp in dokumentet

Sidorna renderas så att du hinner bekräfta att du läst in rätt fil innan du plockar ut något ur den.

Rutnät med sidor som ordnas om och roteras
2

Behåll bara de sidor du vill ha text från

Ta bort resten, så förblir resultatet fokuserat i stället för att komma som en enda vägg av text från pärm till bilaga.

Förhandsvisningsfönster för sida i full storlek
3

Exportera en .txt-fil

Texten skrivs ut i sidordning som vanlig text. Layout, tabeller och spalter återskapas inte — det här är orden, inte formgivningen.

Vad verktyget gör och inte gör

Vanlig text, redo att klistra in

En .txt-fil utan uppmärkning och utan formatering, vilket är precis vad du vill ha för att söka, citera eller mata in i ett annat program.

Tydligt om skanningar, inte svävande

Det finns ingen OCR här. En sida som bara är en bild ger ingenting — och du får veta exakt vilka sidor som kom tillbaka tomma, i stället för att få en kort fil utan förklaring.

Välj sidorna först

Ta bort de sidor du inte behöver innan du exporterar, så innehåller .txt-filen det avsnitt du var ute efter i stället för hela dokumentet.

Konfidentiella dokument stannar kvar

Textextrahering körs oftast på något som ska analyseras — ett avtal, en rapport, ett kontoutdrag. Ingenting av det laddas upp.

Vanliga frågor om textextrahering ur PDF

Varför gav min skannade PDF en tom fil?

För att en skanning är en bild av en sida, inte text. Extraheringen läser det textlager en PDF bär med sig, och en skannad eller fotograferad sida har inget. Att känna igen bokstäver inuti en bild är OCR, som det här verktyget medvetet inte gör — det rapporterar de sidorna som tomma i stället för att gissa.

Hur vet jag om min PDF innehåller riktig text?

Öppna den i valfri läsare och försök markera en rad med markören. Om texten markeras går den att extrahera. Om du bara får en markeringsruta över en bild finns det ingenting att plocka ut.

Bevaras dokumentets layout?

Nej. Resultatet är vanlig text i sidordning. Flerspaltiga layouter, tabeller och sidhuvuden kommer ut som rader efter varandra, vilket kan läsas i fel ordning på en sida med komplicerad layout.

Kan jag extrahera text från bara en del av dokumentet?

Ja — ta bort de sidor du inte vill ha innan du exporterar. Det går inte att markera inuti en sida, så minsta enhet är en hel sida.

Hanteras ligaturer och tecken med accent korrekt?

Oftast. Texten kommer ut som filen kodade den, så välgjorda PDF-filer extraheras rent. Dokument från äldre program med trasiga teckensnittskodningar kan ge konstiga tecken, och ingen extraherare kan reparera det i efterhand.

Laddas mitt dokument upp för att texten ska extraheras?

Nej. pdf.js läser textlagret inne i din webbläsare och skriver .txt-filen där. Ingenting skickas någonstans, vilket spelar roll eftersom det här normalt körs på dokument som är värda att analysera.

Få ut texten

En vanlig .txt-fil, skapad utan att PDF:en laddas upp.

Extrahera text nu