PDFPDF Organizer
ฟรี · ไม่ต้องอัปโหลด · ได้ไฟล์ .txt ธรรมดา

ดึงข้อความออกจากไฟล์ PDF

ดึงข้อความจากเอกสารออกมาเป็นไฟล์ .txt ธรรมดาที่คุณค้นหา วาง หรือส่งต่อให้โปรแกรมอื่นได้ ขอบอกข้อจำกัดกันตรง ๆ ตั้งแต่ต้น: เครื่องมือนี้อ่านข้อความที่มีอยู่ในไฟล์อยู่แล้ว และไม่ทำ OCR กับเอกสารสแกน

ไม่ต้องมีบัญชี ไม่มีข้อจำกัดขนาดไฟล์จากเซิร์ฟเวอร์ ใช้งานออฟไลน์ได้เมื่อโหลดเสร็จแล้ว

จากไฟล์ PDF สู่ไฟล์ข้อความธรรมดา

พื้นที่ลากและวางสำหรับไฟล์ PDF
1

วางเอกสารลงไป

หน้าจะถูกเรนเดอร์ให้เห็น เพื่อให้คุณยืนยันได้ว่าโหลดไฟล์ถูกตัวก่อนจะดึงอะไรออกมา

ตารางหน้าที่กำลังถูกจัดเรียงและหมุน
2

เก็บไว้เฉพาะหน้าที่ต้องการข้อความ

ลบที่เหลือทิ้ง ผลลัพธ์จะได้ตรงประเด็น แทนที่จะมาเป็นกำแพงข้อความตั้งแต่หน้าปกยันภาคผนวก

หน้าต่างดูตัวอย่างหน้าขนาดเต็ม
3

ส่งออกเป็นไฟล์ .txt

ข้อความถูกเขียนออกมาเรียงตามลำดับหน้าในรูปแบบข้อความธรรมดา เลย์เอาต์ ตาราง และคอลัมน์จะไม่ถูกสร้างขึ้นใหม่ — นี่คือตัวอักษร ไม่ใช่การจัดหน้า

สิ่งที่เครื่องมือนี้ทำได้และทำไม่ได้

ข้อความธรรมดา พร้อมวางใช้ได้ทันที

ไฟล์ .txt ที่ไม่มีมาร์กอัปและไม่มีการจัดรูปแบบ ซึ่งเป็นสิ่งที่คุณต้องการสำหรับการค้นหา อ้างอิง หรือส่งต่อให้โปรแกรมอื่น

พูดชัดเรื่องเอกสารสแกน ไม่กำกวม

ที่นี่ไม่มี OCR หน้าที่เป็นรูปภาพล้วนจะไม่ได้ข้อความใด ๆ — และคุณจะได้รู้ชัดเจนว่าหน้าไหนบ้างที่ออกมาว่างเปล่า แทนที่จะได้ไฟล์สั้น ๆ มาโดยไม่มีคำอธิบาย

เลือกหน้าก่อนได้

ลบหน้าที่ไม่ต้องการออกก่อนส่งออก แล้วไฟล์ .txt จะมีเฉพาะส่วนที่คุณตามหา ไม่ใช่ทั้งเอกสาร

เอกสารลับยังอยู่ที่เดิม

การดึงข้อความมักใช้กับสิ่งที่กำลังถูกวิเคราะห์ — สัญญา รายงาน ใบแจ้งยอด ไม่มีอะไรในนั้นถูกอัปโหลดเลย

คำถามที่พบบ่อยเรื่องการดึงข้อความจาก PDF

ทำไมไฟล์ PDF ที่สแกนมาถึงได้ไฟล์เปล่า?

เพราะเอกสารสแกนคือรูปถ่ายของหน้ากระดาษ ไม่ใช่ข้อความ การดึงข้อความอ่านชั้นข้อความที่ไฟล์ PDF มีอยู่ ส่วนหน้าที่สแกนหรือถ่ายรูปมานั้นไม่มีชั้นนั้นเลย การอ่านตัวอักษรจากในรูปภาพคือ OCR ซึ่งเครื่องมือนี้ตั้งใจไม่ทำ — มันจะรายงานว่าหน้าเหล่านั้นว่างเปล่า แทนที่จะเดาให้

จะรู้ได้อย่างไรว่าไฟล์ PDF ของฉันมีข้อความจริง ๆ?

เปิดในโปรแกรมอ่านตัวไหนก็ได้ แล้วลองใช้เคอร์เซอร์เลือกข้อความสักบรรทัด ถ้าข้อความไฮไลต์ขึ้นมา แปลว่าดึงออกมาได้ แต่ถ้าได้แค่กรอบสี่เหลี่ยมคลุมรูปภาพ ก็แปลว่าไม่มีอะไรให้ดึง

การจัดหน้าของเอกสารถูกรักษาไว้หรือไม่?

ไม่ ผลลัพธ์เป็นข้อความธรรมดาเรียงตามลำดับหน้า เลย์เอาต์แบบหลายคอลัมน์ ตาราง และหัวกระดาษจะออกมาเป็นบรรทัดต่อ ๆ กัน ซึ่งอาจอ่านสลับลำดับได้ในหน้าที่จัดวางซับซ้อน

ดึงข้อความเฉพาะบางส่วนของเอกสารได้ไหม?

ได้ ลบหน้าที่ไม่ต้องการออกก่อนส่งออก แต่ไม่มีการเลือกเฉพาะบางส่วนภายในหน้า หน่วยที่เล็กที่สุดจึงเป็นหนึ่งหน้าเต็ม

ตัวอักษรควบและอักขระที่มีเครื่องหมายกำกับออกมาถูกต้องไหม?

ส่วนใหญ่ถูก ข้อความออกมาตามที่ไฟล์เข้ารหัสไว้ ไฟล์ PDF ที่ทำมาดีจึงดึงออกมาได้สะอาด ส่วนเอกสารที่สร้างจากโปรแกรมรุ่นเก่าที่การเข้ารหัสฟอนต์เสีย อาจได้อักขระประหลาด และไม่มีตัวดึงข้อความตัวไหนซ่อมตรงนั้นย้อนหลังได้

เอกสารของฉันถูกอัปโหลดเพื่อดึงข้อความหรือไม่?

ไม่ pdf.js อ่านชั้นข้อความในเบราว์เซอร์ของคุณและเขียนไฟล์ .txt ที่นั่นเลย ไม่มีอะไรถูกส่งไปที่ไหน ซึ่งสำคัญมาก เพราะงานแบบนี้มักทำกับเอกสารที่มีค่าพอจะเอาไปวิเคราะห์

เอาข้อความออกมาให้ได้

ไฟล์ .txt ธรรมดา ที่ผลิตโดยไม่ต้องอัปโหลดไฟล์ PDF

ดึงข้อความเลย