PDFPDF Organizer
Бесплатно · Без загрузки · На выходе обычный .txt

Извлечь текст из PDF в файл .txt

Вытащите текст документа в обычный файл .txt, по которому можно искать, который можно вставить куда угодно или передать другой программе. Одно честное ограничение сразу: инструмент читает текст, который уже есть в файле, и не выполняет OCR для сканов.

Без аккаунта. Без серверных ограничений на размер файлов. Работает офлайн после загрузки.

От PDF к обычному текстовому файлу

Область для перетаскивания файлов PDF
1

Перетащите документ

Страницы отрисовываются, чтобы вы убедились, что загрузили нужный файл, прежде чем что-то из него вытаскивать.

Сетка страниц, у которых меняется порядок и которые поворачиваются
2

Оставьте только страницы, текст которых нужен

Остальные удалите — тогда результат будет по делу, а не сплошной стеной текста от обложки до приложений.

Окно полноразмерного просмотра страницы
3

Сохраните файл .txt

Текст записывается в порядке страниц обычным текстом. Вёрстка, таблицы и колонки не восстанавливаются: это слова, а не оформление.

Что инструмент делает и чего не делает

Обычный текст, готовый к вставке

Файл .txt без разметки и форматирования — именно то, что нужно для поиска, цитирования или передачи в другую программу.

О сканах сказано прямо, без уклончивости

OCR здесь нет. Страница, состоящая только из изображения, не даст ничего — и вам прямо сообщат, какие страницы вернулись пустыми, вместо короткого файла без объяснений.

Сначала выберите страницы

Удалите ненужные страницы до экспорта, и в файле .txt окажется нужный раздел, а не весь документ целиком.

Конфиденциальные документы остаются на месте

Текст обычно извлекают из того, что собираются разбирать: договор, отчёт, выписка. Ничего из этого не уходит на сервер.

Вопросы об извлечении текста из PDF

Почему из моего отсканированного PDF получился пустой файл?

Потому что скан — это картинка страницы, а не текст. Извлечение читает текстовый слой, который несёт в себе PDF, а у отсканированной или сфотографированной страницы его нет. Распознавание букв на изображении — это OCR, которого инструмент намеренно не делает: он сообщает о таких страницах как о пустых, а не пытается угадать.

Как понять, есть ли в моём PDF настоящий текст?

Откройте файл в любой программе просмотра и попробуйте выделить строку курсором. Если текст подсвечивается, он извлечётся. Если получается только прямоугольник выделения поверх изображения, вытаскивать нечего.

Сохраняется ли вёрстка документа?

Нет. На выходе — обычный текст в порядке страниц. Многоколоночная вёрстка, таблицы и колонтитулы превращаются в последовательные строки, из-за чего страница со сложной вёрсткой может читаться не по порядку.

Можно ли извлечь текст только из части документа?

Да — удалите ненужные страницы перед экспортом. Выделения внутри страницы нет, поэтому минимальная единица — целая страница.

Корректно ли обрабатываются лигатуры и буквы с диакритикой?

Обычно да. Текст выходит таким, каким его закодировал файл, поэтому аккуратно сделанные PDF извлекаются чисто. Документы из старых программ со сломанными кодировками шрифтов могут дать странные символы, и починить это задним числом не сможет ни один инструмент извлечения.

Загружается ли документ на сервер, чтобы извлечь текст?

Нет. pdf.js читает текстовый слой внутри вашего браузера и там же записывает файл .txt. Ничего никуда не отправляется, а это важно: так обычно поступают с документами, которые стоит разбирать внимательно.

Заберите текст из документа

Обычный файл .txt, полученный без отправки PDF на сервер.

Извлечь текст