Wyciągnij tekst z pliku PDF
Przenieś tekst z dokumentu do zwykłego pliku .txt, który przeszukasz, wkleisz albo podasz dalej. Jedno ograniczenie od razu na wstępie: czytamy tekst, który już jest w pliku, i nie uruchamiamy OCR na skanach.
Bez konta. Bez serwerowych limitów rozmiaru plików. Działa offline po wczytaniu.
Z pliku PDF do zwykłego tekstu

Wrzuć dokument
Strony renderują się, żebyś mógł potwierdzić, że wczytałeś właściwy plik, zanim cokolwiek z niego wyciągniesz.

Zostaw tylko strony z potrzebnym tekstem
Resztę usuń, a wynik zostanie skupiony, zamiast przyjść jako ściana tekstu od okładki po aneks.

Wyeksportuj plik .txt
Tekst zapisuje się w kolejności stron jako czysty tekst. Układ, tabele i kolumny nie są odtwarzane — to są słowa, nie projekt graficzny.
Co to narzędzie robi, a czego nie robi
Czysty tekst, gotowy do wklejenia
Plik .txt bez znaczników i formatowania, czyli dokładnie to, czego potrzebujesz do wyszukiwania, cytowania albo podania do innego programu.
Jasno o skanach, bez owijania w bawełnę
Nie ma tu OCR. Strona będąca wyłącznie obrazem nie zwróci nic — i dowiesz się dokładnie, które strony wyszły puste, zamiast dostać krótki plik bez wyjaśnienia.
Najpierw wybierz strony
Usuń niepotrzebne strony przed eksportem, a plik .txt będzie zawierał ten fragment, o który Ci chodziło, a nie cały dokument.
Poufne dokumenty zostają na miejscu
Tekst wyciąga się zwykle z czegoś, co ma zostać przeanalizowane — z umowy, raportu, wyciągu z konta. Nic z tego nie idzie na serwer.
Wyciąganie tekstu z PDF — najczęstsze pytania
Dlaczego mój zeskanowany PDF dał pusty plik?
Bo skan to zdjęcie strony, a nie tekst. Wyciąganie czyta warstwę tekstową, którą niesie plik PDF, a strona zeskanowana albo sfotografowana takiej warstwy nie ma. Rozpoznawanie liter na obrazie to OCR, którego to narzędzie świadomie nie robi — zamiast zgadywać, zgłasza takie strony jako puste.
Jak sprawdzić, czy mój plik PDF ma w sobie prawdziwy tekst?
Otwórz go w dowolnym czytniku i spróbuj zaznaczyć kursorem linijkę. Jeśli tekst się podświetla, da się go wyciągnąć. Jeśli dostajesz tylko prostokąt zaznaczenia na obrazie, nie ma czego wyciągać.
Czy układ dokumentu zostaje zachowany?
Nie. Na wyjściu jest czysty tekst w kolejności stron. Układy wielokolumnowe, tabele i nagłówki wychodzą jako kolejne linie, co przy stronie o złożonym układzie potrafi czytać się nie po kolei.
Czy mogę wyciągnąć tekst tylko z części dokumentu?
Tak — usuń niepotrzebne strony przed eksportem. Zaznaczania fragmentu wewnątrz strony nie ma, więc najmniejszą jednostką jest cała strona.
Czy ligatury i polskie znaki diakrytyczne wychodzą poprawnie?
Zwykle tak. Tekst wychodzi taki, jak zakodował go plik, więc porządnie zrobione dokumenty wyciągają się czysto. Pliki ze starszych programów z popsutym kodowaniem czcionek potrafią dać dziwne znaki i żadne narzędzie nie naprawi tego po fakcie.
Czy mój dokument jest wysyłany, żeby wyciągnąć z niego tekst?
Nie. pdf.js czyta warstwę tekstową w Twojej przeglądarce i tam zapisuje plik .txt. Nic nigdzie nie jest wysyłane, co ma znaczenie, bo robi się to zwykle na dokumentach wartych analizy.