ดึงข้อความออกจากไฟล์ PDF
ดึงข้อความจากเอกสารออกมาเป็นไฟล์ .txt ธรรมดาที่คุณค้นหา วาง หรือส่งต่อให้โปรแกรมอื่นได้ ขอบอกข้อจำกัดกันตรง ๆ ตั้งแต่ต้น: เครื่องมือนี้อ่านข้อความที่มีอยู่ในไฟล์อยู่แล้ว และไม่ทำ OCR กับเอกสารสแกน
ไม่ต้องมีบัญชี ไม่มีข้อจำกัดขนาดไฟล์จากเซิร์ฟเวอร์ ใช้งานออฟไลน์ได้เมื่อโหลดเสร็จแล้ว
จากไฟล์ PDF สู่ไฟล์ข้อความธรรมดา

วางเอกสารลงไป
หน้าจะถูกเรนเดอร์ให้เห็น เพื่อให้คุณยืนยันได้ว่าโหลดไฟล์ถูกตัวก่อนจะดึงอะไรออกมา

เก็บไว้เฉพาะหน้าที่ต้องการข้อความ
ลบที่เหลือทิ้ง ผลลัพธ์จะได้ตรงประเด็น แทนที่จะมาเป็นกำแพงข้อความตั้งแต่หน้าปกยันภาคผนวก

ส่งออกเป็นไฟล์ .txt
ข้อความถูกเขียนออกมาเรียงตามลำดับหน้าในรูปแบบข้อความธรรมดา เลย์เอาต์ ตาราง และคอลัมน์จะไม่ถูกสร้างขึ้นใหม่ — นี่คือตัวอักษร ไม่ใช่การจัดหน้า
สิ่งที่เครื่องมือนี้ทำได้และทำไม่ได้
ข้อความธรรมดา พร้อมวางใช้ได้ทันที
ไฟล์ .txt ที่ไม่มีมาร์กอัปและไม่มีการจัดรูปแบบ ซึ่งเป็นสิ่งที่คุณต้องการสำหรับการค้นหา อ้างอิง หรือส่งต่อให้โปรแกรมอื่น
พูดชัดเรื่องเอกสารสแกน ไม่กำกวม
ที่นี่ไม่มี OCR หน้าที่เป็นรูปภาพล้วนจะไม่ได้ข้อความใด ๆ — และคุณจะได้รู้ชัดเจนว่าหน้าไหนบ้างที่ออกมาว่างเปล่า แทนที่จะได้ไฟล์สั้น ๆ มาโดยไม่มีคำอธิบาย
เลือกหน้าก่อนได้
ลบหน้าที่ไม่ต้องการออกก่อนส่งออก แล้วไฟล์ .txt จะมีเฉพาะส่วนที่คุณตามหา ไม่ใช่ทั้งเอกสาร
เอกสารลับยังอยู่ที่เดิม
การดึงข้อความมักใช้กับสิ่งที่กำลังถูกวิเคราะห์ — สัญญา รายงาน ใบแจ้งยอด ไม่มีอะไรในนั้นถูกอัปโหลดเลย
คำถามที่พบบ่อยเรื่องการดึงข้อความจาก PDF
ทำไมไฟล์ PDF ที่สแกนมาถึงได้ไฟล์เปล่า?
เพราะเอกสารสแกนคือรูปถ่ายของหน้ากระดาษ ไม่ใช่ข้อความ การดึงข้อความอ่านชั้นข้อความที่ไฟล์ PDF มีอยู่ ส่วนหน้าที่สแกนหรือถ่ายรูปมานั้นไม่มีชั้นนั้นเลย การอ่านตัวอักษรจากในรูปภาพคือ OCR ซึ่งเครื่องมือนี้ตั้งใจไม่ทำ — มันจะรายงานว่าหน้าเหล่านั้นว่างเปล่า แทนที่จะเดาให้
จะรู้ได้อย่างไรว่าไฟล์ PDF ของฉันมีข้อความจริง ๆ?
เปิดในโปรแกรมอ่านตัวไหนก็ได้ แล้วลองใช้เคอร์เซอร์เลือกข้อความสักบรรทัด ถ้าข้อความไฮไลต์ขึ้นมา แปลว่าดึงออกมาได้ แต่ถ้าได้แค่กรอบสี่เหลี่ยมคลุมรูปภาพ ก็แปลว่าไม่มีอะไรให้ดึง
การจัดหน้าของเอกสารถูกรักษาไว้หรือไม่?
ไม่ ผลลัพธ์เป็นข้อความธรรมดาเรียงตามลำดับหน้า เลย์เอาต์แบบหลายคอลัมน์ ตาราง และหัวกระดาษจะออกมาเป็นบรรทัดต่อ ๆ กัน ซึ่งอาจอ่านสลับลำดับได้ในหน้าที่จัดวางซับซ้อน
ดึงข้อความเฉพาะบางส่วนของเอกสารได้ไหม?
ได้ ลบหน้าที่ไม่ต้องการออกก่อนส่งออก แต่ไม่มีการเลือกเฉพาะบางส่วนภายในหน้า หน่วยที่เล็กที่สุดจึงเป็นหนึ่งหน้าเต็ม
ตัวอักษรควบและอักขระที่มีเครื่องหมายกำกับออกมาถูกต้องไหม?
ส่วนใหญ่ถูก ข้อความออกมาตามที่ไฟล์เข้ารหัสไว้ ไฟล์ PDF ที่ทำมาดีจึงดึงออกมาได้สะอาด ส่วนเอกสารที่สร้างจากโปรแกรมรุ่นเก่าที่การเข้ารหัสฟอนต์เสีย อาจได้อักขระประหลาด และไม่มีตัวดึงข้อความตัวไหนซ่อมตรงนั้นย้อนหลังได้
เอกสารของฉันถูกอัปโหลดเพื่อดึงข้อความหรือไม่?
ไม่ pdf.js อ่านชั้นข้อความในเบราว์เซอร์ของคุณและเขียนไฟล์ .txt ที่นั่นเลย ไม่มีอะไรถูกส่งไปที่ไหน ซึ่งสำคัญมาก เพราะงานแบบนี้มักทำกับเอกสารที่มีค่าพอจะเอาไปวิเคราะห์