Витягніть текст із PDF
Дістаньте текст із документа у звичайний файл .txt, у якому можна шукати, який можна вставити чи передати іншій програмі. Одне чесне обмеження одразу: інструмент читає текст, який уже є у файлі, і не виконує OCR для сканів.
Без облікового запису. Без серверних обмежень на розмір файлів. Працює офлайн після завантаження.
Від PDF до звичайного текстового файлу

Перетягніть документ
Сторінки рендеряться, щоб ви переконалися, що додали саме той файл, перш ніж щось із нього діставати.

Залиште лише ті сторінки, з яких потрібен текст
Решту видаліть — і результат лишиться зосередженим, а не прийде суцільною стіною тексту від обкладинки до додатків.

Збережіть файл .txt
Текст записується в порядку сторінок як звичайний текст. Розмітка, таблиці та колонки не відновлюються — це слова, а не оформлення.
Що це вміє, а чого не вміє
Звичайний текст, готовий до вставляння
Файл .txt без розмітки й форматування — саме те, що потрібно для пошуку, цитування чи передавання в іншу програму.
Чітко про скани, без туману
OCR тут немає. Сторінка лише із зображенням не дасть нічого — і вам прямо скажуть, які сторінки повернулися порожніми, замість короткого файлу без жодних пояснень.
Спершу виберіть сторінки
Видаліть непотрібні сторінки до експорту — і у файлі .txt буде саме той розділ, який вам був потрібен, а не весь документ.
Конфіденційні документи лишаються на місці
Текст витягують зазвичай із того, що аналізують: договір, звіт, виписка. Нічого з цього не завантажується.
Витягування тексту з PDF — що запитують найчастіше
Чому мій відсканований PDF дав порожній файл?
Бо скан — це зображення сторінки, а не текст. Витягування читає текстовий шар, який несе PDF, а у відсканованої чи сфотографованої сторінки його немає. Розпізнавання літер усередині зображення — це OCR, якого цей інструмент свідомо не робить: він повідомляє такі сторінки як порожні, а не вгадує.
Як зрозуміти, чи є в моєму PDF справжній текст?
Відкрийте його в будь-якій програмі й спробуйте виділити рядок курсором. Якщо текст підсвічується — він витягнеться. Якщо ви отримуєте лише прямокутник виділення поверх зображення, діставати немає чого.
Чи зберігається оформлення документа?
Ні. На виході — звичайний текст у порядку сторінок. Багатоколонкові макети, таблиці й колонтитули виходять послідовними рядками, і для сторінки зі складним макетом це може читатися не в тому порядку.
Чи можна витягти текст лише з частини документа?
Так — видаліть непотрібні сторінки перед експортом. Виділення в межах сторінки немає, тож найменша одиниця — ціла сторінка.
Чи правильно обробляються лігатури та літери з діакритикою?
Зазвичай так. Текст виходить таким, яким його закодував файл, тож добре зроблені PDF витягуються чисто. Документи, створені старими програмами з поламаним кодуванням шрифтів, можуть дати дивні символи, і жоден екстрактор не виправить це заднім числом.
Чи завантажується мій документ, щоб витягти текст?
Ні. pdf.js читає текстовий шар у вашому браузері й там само записує .txt. Нікуди нічого не надсилається, а це важливо, бо так зазвичай працюють саме з документами, які варті аналізу.