PDFPDF Organizer
Ingyenes · Feltöltés nélkül · Egyszerű .txt kimenet

Szöveg kinyerése a PDF-ből .txt fájlba

Szedd ki a dokumentum szövegét egy egyszerű .txt fájlba, amiben kereshetsz, amit bemásolhatsz vagy továbbadhatsz egy másik programnak. Egy őszinte korlát rögtön az elején: ez azt a szöveget olvassa ki, ami már a fájlban van, és nem futtat OCR-t a szkenneken.

Nincs fiók. Nincsenek szerveroldali fájlméretkorlátok. Betöltés után offline is működik.

A PDF-től az egyszerű szövegfájlig

Fogd és vidd terület PDF fájlokhoz
1

Húzd be a dokumentumot

Az oldalak megjelennek, hogy még a kinyerés előtt ellenőrizhesd: tényleg a megfelelő fájlt töltötted be.

Oldalak rácsa átrendezés és forgatás közben
2

Csak azokat az oldalakat hagyd meg, amikből szöveg kell

A többit töröld, és a kimenet fókuszált marad ahelyett, hogy a borítótól a függelékig egyetlen szövegfalként érkezne meg.

Teljes méretű oldal-előnézeti ablak
3

Exportálj .txt fájlt

A szöveg oldalsorrendben, egyszerű szövegként íródik ki. Az elrendezést, a táblázatokat és a hasábokat nem állítja helyre – ez a szavakról szól, nem a tördelésről.

Mit tud és mit nem tud ez az eszköz

Egyszerű szöveg, azonnal beilleszthető

Egy .txt fájl jelölés és formázás nélkül – pontosan az, amire kereséshez, idézéshez vagy egy másik programnak való átadáshoz szükséged van.

Világos beszéd a szkennekről, nem mellébeszélés

Itt nincs OCR. Egy csak képet tartalmazó oldal semmit nem ad vissza – és pontosan megmondjuk, mely oldalak jöttek vissza üresen, ahelyett hogy magyarázat nélkül kapnál egy rövid fájlt.

Előbb válaszd ki az oldalakat

Töröld az exportálás előtt a felesleges oldalakat, és a .txt azt a részt fogja tartalmazni, amit kerestél, nem az egész dokumentumot.

A bizalmas dokumentumok a helyükön maradnak

Szöveget rendszerint olyasmiből nyerünk ki, amit elemezni akarunk: szerződésből, jelentésből, kivonatból. Ezekből semmi nem kerül feltöltésre.

Kérdések a szövegkinyerésről

Miért lett üres a fájl a beszkennelt PDF-emből?

Mert a szkenn az oldal fényképe, nem szöveg. A kinyerés azt a szövegréteget olvassa ki, amit a PDF magában hordoz, egy beszkennelt vagy lefotózott oldalnak pedig ilyenje nincs. A betűk felismerése a képen belül az OCR, amit ez az eszköz szándékosan nem végez el – inkább üresként jelenti ezeket az oldalakat, mint hogy találgasson.

Hogyan derítem ki, van-e valódi szöveg a PDF-emben?

Nyisd meg bármelyik olvasóban, és próbálj meg kijelölni egy sort a kurzorral. Ha a szöveg kiemelődik, ki fog jönni. Ha csak egy kijelölő téglalapot húzol a kép fölé, nincs mit kiszedni belőle.

Megmarad a dokumentum elrendezése?

Nem. A kimenet egyszerű szöveg, oldalsorrendben. A több hasábos elrendezések, a táblázatok és az élőfejek egymás utáni sorokként jönnek ki, ami egy bonyolult tördelésű oldalnál akár összekeveredhet.

Ki tudom nyerni a szöveget a dokumentum egy részéből?

Igen – töröld az exportálás előtt azokat az oldalakat, amikre nincs szükséged. Oldalon belüli kijelölés nincs, így a legkisebb egység a teljes oldal.

Rendben kezeli a ligatúrákat és az ékezetes betűket?

Általában igen. A szöveg úgy jön ki, ahogy a fájl kódolta, így a rendesen elkészített PDF-ek tisztán kinyerhetők. A régebbi programokkal, hibás betűtípus-kódolással készült dokumentumok furcsa karaktereket adhatnak, és ezt utólag egyetlen kinyerő sem tudja megjavítani.

Feltöltődik a dokumentumom a szöveg kinyeréséhez?

Nem. A szövegréteget a pdf.js olvassa ki a böngésződben, és a .txt is ott készül el. Semmi nem megy sehova – ami sokat számít, hiszen ezt jellemzően elemzésre szánt dokumentumokon futtatod.

Szedd ki belőle a szöveget

Egyszerű .txt fájl, a PDF feltöltése nélkül.

Szöveg kinyerése