Извлечь текст из PDF в файл .txt
Вытащите текст документа в обычный файл .txt, по которому можно искать, который можно вставить куда угодно или передать другой программе. Одно честное ограничение сразу: инструмент читает текст, который уже есть в файле, и не выполняет OCR для сканов.
Без аккаунта. Без серверных ограничений на размер файлов. Работает офлайн после загрузки.
От PDF к обычному текстовому файлу

Перетащите документ
Страницы отрисовываются, чтобы вы убедились, что загрузили нужный файл, прежде чем что-то из него вытаскивать.

Оставьте только страницы, текст которых нужен
Остальные удалите — тогда результат будет по делу, а не сплошной стеной текста от обложки до приложений.

Сохраните файл .txt
Текст записывается в порядке страниц обычным текстом. Вёрстка, таблицы и колонки не восстанавливаются: это слова, а не оформление.
Что инструмент делает и чего не делает
Обычный текст, готовый к вставке
Файл .txt без разметки и форматирования — именно то, что нужно для поиска, цитирования или передачи в другую программу.
О сканах сказано прямо, без уклончивости
OCR здесь нет. Страница, состоящая только из изображения, не даст ничего — и вам прямо сообщат, какие страницы вернулись пустыми, вместо короткого файла без объяснений.
Сначала выберите страницы
Удалите ненужные страницы до экспорта, и в файле .txt окажется нужный раздел, а не весь документ целиком.
Конфиденциальные документы остаются на месте
Текст обычно извлекают из того, что собираются разбирать: договор, отчёт, выписка. Ничего из этого не уходит на сервер.
Вопросы об извлечении текста из PDF
Почему из моего отсканированного PDF получился пустой файл?
Потому что скан — это картинка страницы, а не текст. Извлечение читает текстовый слой, который несёт в себе PDF, а у отсканированной или сфотографированной страницы его нет. Распознавание букв на изображении — это OCR, которого инструмент намеренно не делает: он сообщает о таких страницах как о пустых, а не пытается угадать.
Как понять, есть ли в моём PDF настоящий текст?
Откройте файл в любой программе просмотра и попробуйте выделить строку курсором. Если текст подсвечивается, он извлечётся. Если получается только прямоугольник выделения поверх изображения, вытаскивать нечего.
Сохраняется ли вёрстка документа?
Нет. На выходе — обычный текст в порядке страниц. Многоколоночная вёрстка, таблицы и колонтитулы превращаются в последовательные строки, из-за чего страница со сложной вёрсткой может читаться не по порядку.
Можно ли извлечь текст только из части документа?
Да — удалите ненужные страницы перед экспортом. Выделения внутри страницы нет, поэтому минимальная единица — целая страница.
Корректно ли обрабатываются лигатуры и буквы с диакритикой?
Обычно да. Текст выходит таким, каким его закодировал файл, поэтому аккуратно сделанные PDF извлекаются чисто. Документы из старых программ со сломанными кодировками шрифтов могут дать странные символы, и починить это задним числом не сможет ни один инструмент извлечения.
Загружается ли документ на сервер, чтобы извлечь текст?
Нет. pdf.js читает текстовый слой внутри вашего браузера и там же записывает файл .txt. Ничего никуда не отправляется, а это важно: так обычно поступают с документами, которые стоит разбирать внимательно.