Ekstrak teks daripada PDF ke fail .txt
Tarik teks daripada dokumen ke dalam fail .txt biasa yang boleh anda cari, tampal atau suapkan ke program lain. Satu batasan yang kami nyatakan awal-awal: ini membaca teks yang sedia ada dalam fail, dan tidak menjalankan OCR pada imbasan.
Tiada akaun. Tiada had saiz fail daripada pelayan. Berfungsi luar talian selepas dimuatkan.
Daripada PDF kepada fail teks biasa

Lepaskan dokumen anda
Halaman dipaparkan supaya anda boleh mengesahkan fail yang betul dimuatkan sebelum menarik apa-apa daripadanya.

Kekalkan halaman yang teksnya diperlukan
Padam yang selebihnya, dan hasilnya kekal fokus, bukan tiba sebagai satu dinding teks dari muka depan hingga lampiran.

Eksport fail .txt
Teks ditulis mengikut susunan halaman sebagai teks biasa. Reka letak, jadual dan lajur tidak dibina semula — ini perkataannya, bukan reka bentuknya.
Apa yang alat ini buat dan tidak buat
Teks biasa, sedia ditampal
Fail .txt tanpa penanda dan tanpa pemformatan, iaitu apa yang anda perlukan untuk mencari, memetik atau menyuapkannya ke program lain.
Jelas tentang imbasan, bukan berselindung
Tiada OCR di sini. Halaman yang hanya imej tidak menghasilkan apa-apa — dan anda diberitahu halaman mana yang kembali kosong, bukan sekadar menerima fail pendek tanpa penjelasan.
Pilih halamannya terlebih dahulu
Padam halaman yang tidak diperlukan sebelum eksport, dan fail .txt mengandungi bahagian yang anda cari, bukan seluruh dokumen.
Dokumen sulit kekal di tempatnya
Pengekstrakan teks biasanya digunakan pada sesuatu yang sedang dianalisis — kontrak, laporan, penyata. Tiada satu pun daripadanya dimuat naik.
Soalan lazim tentang pengekstrakan teks PDF
Kenapa PDF imbasan saya menghasilkan fail kosong?
Kerana imbasan ialah gambar sesebuah halaman, bukan teks. Pengekstrakan membaca lapisan teks yang dibawa PDF, dan halaman yang diimbas atau difoto tiada lapisan itu. Mengecam huruf di dalam imej ialah OCR, yang sengaja tidak dilakukan alat ini — ia melaporkan halaman tersebut sebagai kosong dan bukan meneka.
Bagaimana saya tahu PDF saya mempunyai teks sebenar?
Buka dalam mana-mana pembaca dan cuba pilih satu baris dengan kursor. Jika teks itu diserlahkan, ia boleh diekstrak. Jika anda hanya mendapat segi empat pilihan di atas imej, tiada apa-apa untuk ditarik keluar.
Adakah reka letak dokumen dikekalkan?
Tidak. Hasilnya ialah teks biasa mengikut susunan halaman. Reka letak berbilang lajur, jadual dan pengepala keluar sebagai baris berturutan, yang boleh terbaca tidak kena urutan bagi halaman yang reka letaknya rumit.
Bolehkah saya ekstrak teks daripada sebahagian dokumen sahaja?
Boleh — padam halaman yang tidak dikehendaki sebelum eksport. Tiada pemilihan di dalam halaman, jadi unit terkecil ialah satu halaman penuh.
Adakah ligatur dan huruf beraksen dikendalikan dengan betul?
Biasanya ya. Teks keluar seperti yang dikodkan oleh fail itu, jadi PDF yang dibuat dengan baik diekstrak dengan bersih. Dokumen daripada alat lama dengan pengekodan fon yang rosak boleh menghasilkan aksara pelik, dan tiada pengekstrak yang mampu membaikinya selepas itu.
Adakah dokumen saya dimuat naik untuk mengekstrak teksnya?
Tidak. pdf.js membaca lapisan teks di dalam pelayar anda dan menulis fail .txt di situ juga. Tiada apa-apa dihantar ke mana-mana, dan itu penting kerana ini biasanya dijalankan pada dokumen yang berbaloi dianalisis.