Szöveg kinyerése a PDF-ből .txt fájlba
Szedd ki a dokumentum szövegét egy egyszerű .txt fájlba, amiben kereshetsz, amit bemásolhatsz vagy továbbadhatsz egy másik programnak. Egy őszinte korlát rögtön az elején: ez azt a szöveget olvassa ki, ami már a fájlban van, és nem futtat OCR-t a szkenneken.
Nincs fiók. Nincsenek szerveroldali fájlméretkorlátok. Betöltés után offline is működik.
A PDF-től az egyszerű szövegfájlig

Húzd be a dokumentumot
Az oldalak megjelennek, hogy még a kinyerés előtt ellenőrizhesd: tényleg a megfelelő fájlt töltötted be.

Csak azokat az oldalakat hagyd meg, amikből szöveg kell
A többit töröld, és a kimenet fókuszált marad ahelyett, hogy a borítótól a függelékig egyetlen szövegfalként érkezne meg.

Exportálj .txt fájlt
A szöveg oldalsorrendben, egyszerű szövegként íródik ki. Az elrendezést, a táblázatokat és a hasábokat nem állítja helyre – ez a szavakról szól, nem a tördelésről.
Mit tud és mit nem tud ez az eszköz
Egyszerű szöveg, azonnal beilleszthető
Egy .txt fájl jelölés és formázás nélkül – pontosan az, amire kereséshez, idézéshez vagy egy másik programnak való átadáshoz szükséged van.
Világos beszéd a szkennekről, nem mellébeszélés
Itt nincs OCR. Egy csak képet tartalmazó oldal semmit nem ad vissza – és pontosan megmondjuk, mely oldalak jöttek vissza üresen, ahelyett hogy magyarázat nélkül kapnál egy rövid fájlt.
Előbb válaszd ki az oldalakat
Töröld az exportálás előtt a felesleges oldalakat, és a .txt azt a részt fogja tartalmazni, amit kerestél, nem az egész dokumentumot.
A bizalmas dokumentumok a helyükön maradnak
Szöveget rendszerint olyasmiből nyerünk ki, amit elemezni akarunk: szerződésből, jelentésből, kivonatból. Ezekből semmi nem kerül feltöltésre.
Kérdések a szövegkinyerésről
Miért lett üres a fájl a beszkennelt PDF-emből?
Mert a szkenn az oldal fényképe, nem szöveg. A kinyerés azt a szövegréteget olvassa ki, amit a PDF magában hordoz, egy beszkennelt vagy lefotózott oldalnak pedig ilyenje nincs. A betűk felismerése a képen belül az OCR, amit ez az eszköz szándékosan nem végez el – inkább üresként jelenti ezeket az oldalakat, mint hogy találgasson.
Hogyan derítem ki, van-e valódi szöveg a PDF-emben?
Nyisd meg bármelyik olvasóban, és próbálj meg kijelölni egy sort a kurzorral. Ha a szöveg kiemelődik, ki fog jönni. Ha csak egy kijelölő téglalapot húzol a kép fölé, nincs mit kiszedni belőle.
Megmarad a dokumentum elrendezése?
Nem. A kimenet egyszerű szöveg, oldalsorrendben. A több hasábos elrendezések, a táblázatok és az élőfejek egymás utáni sorokként jönnek ki, ami egy bonyolult tördelésű oldalnál akár összekeveredhet.
Ki tudom nyerni a szöveget a dokumentum egy részéből?
Igen – töröld az exportálás előtt azokat az oldalakat, amikre nincs szükséged. Oldalon belüli kijelölés nincs, így a legkisebb egység a teljes oldal.
Rendben kezeli a ligatúrákat és az ékezetes betűket?
Általában igen. A szöveg úgy jön ki, ahogy a fájl kódolta, így a rendesen elkészített PDF-ek tisztán kinyerhetők. A régebbi programokkal, hibás betűtípus-kódolással készült dokumentumok furcsa karaktereket adhatnak, és ezt utólag egyetlen kinyerő sem tudja megjavítani.
Feltöltődik a dokumentumom a szöveg kinyeréséhez?
Nem. A szövegréteget a pdf.js olvassa ki a böngésződben, és a .txt is ott készül el. Semmi nem megy sehova – ami sokat számít, hiszen ezt jellemzően elemzésre szánt dokumentumokon futtatod.