Pura teksti PDF-tiedostosta
Poimi dokumentin teksti pelkäksi .txt-tiedostoksi, jota voit hakea, liittää tai syöttää eteenpäin. Yksi rehellinen rajoitus heti alkuun: tämä lukee tekstiä, joka on jo tiedostossa, eikä suorita OCR:ää skannauksille.
Ei tiliä. Ei palvelimen asettamia tiedostokokorajoja. Toimii offline-tilassa latauksen jälkeen.
PDF:stä pelkäksi tekstitiedostoksi

Pudota dokumentti sisään
Sivut renderöidään, jotta voit varmistaa ladanneesi oikean tiedoston ennen kuin poimit siitä mitään.

Jätä jäljelle vain ne sivut, joista tarvitset tekstin
Poista loput, niin lopputulos pysyy rajattuna eikä saavu yhtenä tekstiseinänä kannesta liitteisiin.

Vie .txt-tiedosto
Teksti kirjoitetaan ulos sivujärjestyksessä pelkkänä tekstinä. Asettelua, taulukoita ja palstoja ei rakenneta uudelleen — tässä ovat sanat, ei ulkoasu.
Mitä tämä tekee ja mitä ei
Pelkkää tekstiä, valmiina liitettäväksi
.txt-tiedosto ilman merkkausta ja muotoilua — juuri sitä haluat hakemiseen, lainaamiseen tai toiseen ohjelmaan syöttämiseen.
Selvää puhetta skannauksista, ei kiertelyä
OCR:ää ei ole. Pelkkää kuvaa sisältävä sivu ei tuota mitään — ja saat tarkan tiedon siitä, mitkä sivut palautuivat tyhjinä, sen sijaan että saisit lyhyen tiedoston ilman selitystä.
Valitse sivut ensin
Poista tarpeettomat sivut ennen vientiä, niin .txt sisältää juuri sen osan, jota hait, eikä koko dokumenttia.
Luottamukselliset dokumentit pysyvät paikallaan
Tekstin purkua käytetään yleensä johonkin analysoitavaan — sopimukseen, raporttiin, tiliotteeseen. Mitään siitä ei lähetetä.
Usein kysyttyä tekstin purkamisesta PDF:stä
Miksi skannatusta PDF:stä tuli tyhjä tiedosto?
Koska skannaus on kuva sivusta, ei tekstiä. Purku lukee sen tekstikerroksen, jota PDF kantaa mukanaan, ja skannatulla tai valokuvatulla sivulla sitä ei ole. Kirjainten tunnistaminen kuvan sisältä on OCR:ää, jota tämä työkalu ei tarkoituksella tee — se raportoi nämä sivut tyhjinä sen sijaan, että arvailisi.
Mistä tiedän, onko PDF-tiedostossani oikeaa tekstiä?
Avaa se missä tahansa lukuohjelmassa ja yritä valita rivi kursorilla. Jos teksti korostuu, se myös purkautuu. Jos saat vain valintasuorakulmion kuvan päälle, poimittavaa ei ole.
Säilyykö dokumentin asettelu?
Ei. Lopputulos on pelkkää tekstiä sivujärjestyksessä. Monipalstaiset asettelut, taulukot ja otsikot tulevat ulos peräkkäisinä riveinä, mikä voi monimutkaisella sivulla lukeutua väärässä järjestyksessä.
Voinko purkaa tekstin vain osasta dokumenttia?
Kyllä — poista tarpeettomat sivut ennen vientiä. Sivun sisäistä valintaa ei ole, joten pienin yksikkö on kokonainen sivu.
Käsitelläänkö ligatuurit ja tarkkeelliset kirjaimet oikein?
Yleensä kyllä. Teksti tulee ulos sellaisena kuin tiedosto on sen koodannut, joten hyvin tehdyt PDF-tiedostot purkautuvat siististi. Vanhemmilla työkaluilla tuotetut dokumentit, joissa on rikkinäiset fonttikoodaukset, voivat tuottaa outoja merkkejä, eikä yksikään purkaja pysty korjaamaan sitä jälkikäteen.
Lähetetäänkö dokumenttini jonnekin tekstin purkamista varten?
Ei. pdf.js lukee tekstikerroksen selaimesi sisällä ja kirjoittaa .txt-tiedoston siellä. Mitään ei lähetetä minnekään, millä on merkitystä, koska tätä ajetaan yleensä dokumenteille, joita kannattaa analysoida.