PDFPDF Organizer
Miễn phí · Không tải lên · Kết quả là tệp .txt thuần

Trích xuất văn bản từ PDF ra tệp .txt

Rút văn bản trong một tài liệu ra thành tệp .txt thuần để bạn tìm kiếm, dán đi hay đưa vào một chương trình khác. Nói thẳng một hạn chế ngay từ đầu: công cụ chỉ đọc phần văn bản vốn đã có sẵn trong tệp và không chạy OCR trên bản quét.

Không cần tài khoản. Không giới hạn dung lượng tệp từ máy chủ. Hoạt động ngoại tuyến sau khi tải xong.

Từ tệp PDF thành một tệp văn bản thuần

Khu vực kéo và thả tệp PDF
1

Thả tài liệu vào

Các trang được kết xuất để bạn xác nhận mình đã nạp đúng tệp trước khi rút bất cứ thứ gì ra khỏi nó.

Lưới các trang đang được sắp xếp lại và xoay
2

Chỉ giữ những trang bạn cần lấy chữ

Xóa phần còn lại, và kết quả sẽ đúng trọng tâm thay vì đổ ra một khối chữ từ bìa tới phụ lục.

Cửa sổ xem trước trang ở kích thước đầy đủ
3

Xuất ra một tệp .txt

Văn bản được ghi ra theo thứ tự trang dưới dạng chữ thuần. Bố cục, bảng biểu và cột không được dựng lại — đây là phần chữ, không phải phần trình bày.

Công cụ này làm gì và không làm gì

Chữ thuần, dán được ngay

Một tệp .txt không có mã đánh dấu và không định dạng, đúng thứ bạn cần để tìm kiếm, trích dẫn hay đưa vào một chương trình khác.

Nói rõ về bản quét, không nói vòng vo

Ở đây không có OCR. Một trang chỉ chứa ảnh sẽ không cho ra gì — và bạn được báo chính xác những trang nào trả về rỗng, thay vì nhận một tệp ngắn ngủn mà chẳng hiểu vì sao.

Chọn trang trước đã

Hãy xóa những trang bạn không cần trước khi xuất, và tệp .txt sẽ chứa đúng phần bạn nhắm tới thay vì cả tài liệu.

Tài liệu mật ở yên tại chỗ

Việc trích xuất văn bản thường nhắm vào thứ đang cần phân tích — một hợp đồng, một báo cáo, một bản sao kê. Không có gì trong đó được tải lên.

Những câu hỏi thường gặp khi trích xuất văn bản từ PDF

Vì sao tệp PDF đã quét của tôi cho ra một tệp rỗng?

Vì một bản quét là bức ảnh chụp trang giấy, không phải văn bản. Việc trích xuất đọc lớp văn bản mà tệp PDF mang theo, còn trang được quét hay chụp thì không có lớp đó. Nhận diện chữ bên trong một bức ảnh chính là OCR, thứ mà công cụ này cố ý không làm — nó báo những trang đó là rỗng thay vì đoán bừa.

Làm sao biết tệp PDF của tôi có chữ thật hay không?

Hãy mở nó bằng trình đọc bất kỳ và thử bôi đen một dòng bằng con trỏ. Nếu chữ được tô sáng thì nó sẽ trích xuất được. Nếu bạn chỉ nhận được một khung chọn phủ lên ảnh thì chẳng có gì để rút ra.

Bố cục của tài liệu có được giữ nguyên không?

Không. Kết quả là chữ thuần theo thứ tự trang. Bố cục nhiều cột, bảng biểu và tiêu đề chạy trang đều ra thành các dòng nối tiếp nhau, nên một trang có bố cục phức tạp có thể đọc lộn xộn.

Tôi có trích xuất văn bản chỉ từ một phần tài liệu được không?

Được — hãy xóa những trang bạn không cần trước khi xuất. Không có chức năng chọn một vùng trong trang, nên đơn vị nhỏ nhất là cả một trang.

Chữ ghép và ký tự có dấu có được xử lý đúng không?

Thường là đúng. Chữ ra sao là do tệp đã mã hóa như vậy, nên những tệp PDF làm chuẩn sẽ trích xuất rất sạch. Tài liệu do phần mềm cũ tạo ra với bảng mã phông chữ bị lỗi có thể cho ra ký tự lạ, và không công cụ trích xuất nào sửa được chuyện đó sau khi sự đã rồi.

Muốn lấy chữ ra thì tài liệu của tôi có bị tải lên không?

Không. pdf.js đọc lớp văn bản ngay trong trình duyệt của bạn và ghi tệp .txt tại đó. Không có gì được gửi đi đâu cả, điều này rất quan trọng vì công cụ thường được dùng với những tài liệu đáng để phân tích.

Lấy phần chữ ra thôi

Một tệp .txt thuần, tạo ra mà không cần tải tệp PDF lên.

Trích xuất văn bản ngay