PDFPDF Organizer
Ilmainen · Ei lähetystä · Ulos pelkkä .txt

Pura teksti PDF-tiedostosta

Poimi dokumentin teksti pelkäksi .txt-tiedostoksi, jota voit hakea, liittää tai syöttää eteenpäin. Yksi rehellinen rajoitus heti alkuun: tämä lukee tekstiä, joka on jo tiedostossa, eikä suorita OCR:ää skannauksille.

Ei tiliä. Ei palvelimen asettamia tiedostokokorajoja. Toimii offline-tilassa latauksen jälkeen.

PDF:stä pelkäksi tekstitiedostoksi

PDF-tiedostojen vedä ja pudota -alue
1

Pudota dokumentti sisään

Sivut renderöidään, jotta voit varmistaa ladanneesi oikean tiedoston ennen kuin poimit siitä mitään.

Ruudukko sivuista, joita järjestetään uudelleen ja käännetään
2

Jätä jäljelle vain ne sivut, joista tarvitset tekstin

Poista loput, niin lopputulos pysyy rajattuna eikä saavu yhtenä tekstiseinänä kannesta liitteisiin.

Täysikokoinen sivun esikatseluikkuna
3

Vie .txt-tiedosto

Teksti kirjoitetaan ulos sivujärjestyksessä pelkkänä tekstinä. Asettelua, taulukoita ja palstoja ei rakenneta uudelleen — tässä ovat sanat, ei ulkoasu.

Mitä tämä tekee ja mitä ei

Pelkkää tekstiä, valmiina liitettäväksi

.txt-tiedosto ilman merkkausta ja muotoilua — juuri sitä haluat hakemiseen, lainaamiseen tai toiseen ohjelmaan syöttämiseen.

Selvää puhetta skannauksista, ei kiertelyä

OCR:ää ei ole. Pelkkää kuvaa sisältävä sivu ei tuota mitään — ja saat tarkan tiedon siitä, mitkä sivut palautuivat tyhjinä, sen sijaan että saisit lyhyen tiedoston ilman selitystä.

Valitse sivut ensin

Poista tarpeettomat sivut ennen vientiä, niin .txt sisältää juuri sen osan, jota hait, eikä koko dokumenttia.

Luottamukselliset dokumentit pysyvät paikallaan

Tekstin purkua käytetään yleensä johonkin analysoitavaan — sopimukseen, raporttiin, tiliotteeseen. Mitään siitä ei lähetetä.

Usein kysyttyä tekstin purkamisesta PDF:stä

Miksi skannatusta PDF:stä tuli tyhjä tiedosto?

Koska skannaus on kuva sivusta, ei tekstiä. Purku lukee sen tekstikerroksen, jota PDF kantaa mukanaan, ja skannatulla tai valokuvatulla sivulla sitä ei ole. Kirjainten tunnistaminen kuvan sisältä on OCR:ää, jota tämä työkalu ei tarkoituksella tee — se raportoi nämä sivut tyhjinä sen sijaan, että arvailisi.

Mistä tiedän, onko PDF-tiedostossani oikeaa tekstiä?

Avaa se missä tahansa lukuohjelmassa ja yritä valita rivi kursorilla. Jos teksti korostuu, se myös purkautuu. Jos saat vain valintasuorakulmion kuvan päälle, poimittavaa ei ole.

Säilyykö dokumentin asettelu?

Ei. Lopputulos on pelkkää tekstiä sivujärjestyksessä. Monipalstaiset asettelut, taulukot ja otsikot tulevat ulos peräkkäisinä riveinä, mikä voi monimutkaisella sivulla lukeutua väärässä järjestyksessä.

Voinko purkaa tekstin vain osasta dokumenttia?

Kyllä — poista tarpeettomat sivut ennen vientiä. Sivun sisäistä valintaa ei ole, joten pienin yksikkö on kokonainen sivu.

Käsitelläänkö ligatuurit ja tarkkeelliset kirjaimet oikein?

Yleensä kyllä. Teksti tulee ulos sellaisena kuin tiedosto on sen koodannut, joten hyvin tehdyt PDF-tiedostot purkautuvat siististi. Vanhemmilla työkaluilla tuotetut dokumentit, joissa on rikkinäiset fonttikoodaukset, voivat tuottaa outoja merkkejä, eikä yksikään purkaja pysty korjaamaan sitä jälkikäteen.

Lähetetäänkö dokumenttini jonnekin tekstin purkamista varten?

Ei. pdf.js lukee tekstikerroksen selaimesi sisällä ja kirjoittaa .txt-tiedoston siellä. Mitään ei lähetetä minnekään, millä on merkitystä, koska tätä ajetaan yleensä dokumenteille, joita kannattaa analysoida.

Ota teksti talteen

Pelkkä .txt-tiedosto, tuotettuna ilman PDF:n lähettämistä.

Pura teksti nyt