PDFPDF Organizer
Gratis · Tanpa unggah · Keluaran .txt biasa

Ambil teks dari sebuah file PDF

Tarik teks dari sebuah dokumen menjadi file .txt biasa yang bisa Anda cari, tempel, atau berikan ke program lain. Satu batasan yang jujur di depan: alat ini membaca teks yang memang sudah ada di dalam file, dan tidak menjalankan OCR pada hasil pindai.

Tanpa akun. Tanpa batasan ukuran file dari server. Berfungsi offline setelah dimuat.

Dari PDF menjadi file teks biasa

Area seret dan lepas untuk file PDF
1

Lepaskan dokumennya

Halaman dirender lebih dulu supaya Anda yakin memuat file yang benar sebelum menarik apa pun darinya.

Kisi halaman yang sedang disusun ulang dan diputar
2

Sisakan hanya halaman yang teksnya Anda butuhkan

Hapus sisanya, dan hasilnya tetap fokus alih-alih datang sebagai tembok teks dari sampul sampai lampiran.

Jendela pratinjau halaman ukuran penuh
3

Ekspor file .txt

Teks ditulis sesuai urutan halaman sebagai teks biasa. Tata letak, tabel, dan kolom tidak disusun ulang — ini soal kata-katanya, bukan tampilannya.

Apa yang bisa dan tidak bisa dilakukan alat ini

Teks biasa, siap ditempel

Sebuah file .txt tanpa markup dan tanpa format, persis yang Anda butuhkan untuk mencari, mengutip, atau memasukkannya ke program lain.

Terus terang soal hasil pindai

Di sini tidak ada OCR. Halaman yang hanya berupa gambar tidak menghasilkan apa pun — dan Anda diberi tahu persis halaman mana yang kembali kosong, bukan sekadar menerima file pendek tanpa penjelasan.

Pilih halamannya lebih dulu

Hapus halaman yang tidak Anda perlukan sebelum mengekspor, dan file .txt akan berisi bagian yang Anda cari, bukan seluruh dokumen.

Dokumen rahasia tetap di tempatnya

Ekstraksi teks biasanya dipakai pada sesuatu yang sedang dianalisis — kontrak, laporan, rekening koran. Tidak satu pun dari itu diunggah.

Pertanyaan seputar mengekstrak teks dari PDF

Kenapa PDF hasil pindai saya menghasilkan file kosong?

Karena hasil pindai adalah foto sebuah halaman, bukan teks. Ekstraksi membaca lapisan teks yang dibawa sebuah PDF, dan halaman hasil pindai atau foto tidak punya lapisan itu. Mengenali huruf di dalam gambar adalah OCR, yang sengaja tidak dilakukan alat ini — halaman seperti itu dilaporkan kosong alih-alih ditebak isinya.

Bagaimana cara tahu PDF saya benar-benar berisi teks?

Buka di pembaca mana pun dan coba pilih satu baris dengan kursor. Kalau teksnya tersorot, teks itu akan terekstrak. Kalau yang muncul hanya kotak seleksi di atas gambar, tidak ada yang bisa ditarik.

Apakah tata letak dokumennya dipertahankan?

Tidak. Keluarannya adalah teks biasa sesuai urutan halaman. Tata letak multikolom, tabel, dan header keluar sebagai baris berurutan, yang bisa terbaca tidak berurutan pada halaman dengan tata letak rumit.

Bisakah mengekstrak teks dari sebagian dokumen saja?

Bisa — hapus halaman yang tidak Anda inginkan sebelum mengekspor. Tidak ada pemilihan di dalam halaman, jadi satuan terkecilnya adalah satu halaman utuh.

Apakah ligatur dan huruf beraksen ditangani dengan benar?

Biasanya ya. Teks keluar sebagaimana file itu mengodekannya, jadi PDF yang dibuat dengan baik terekstrak bersih. Dokumen dari perangkat lunak lama dengan pengodean font yang rusak bisa menghasilkan karakter aneh, dan tidak ada pengekstrak yang bisa memperbaikinya setelah kejadian.

Apakah dokumen saya diunggah untuk diekstrak teksnya?

Tidak. pdf.js membaca lapisan teks di dalam browser Anda dan menulis file .txt di sana juga. Tidak ada yang dikirim ke mana pun — dan itu penting, mengingat ini biasanya dijalankan pada dokumen yang layak dianalisis.

Keluarkan teksnya

Sebuah file .txt biasa, dibuat tanpa mengunggah PDF.

Ekstrak teks sekarang