PDFPDF Organizer
Безкоштовно · Без завантаження · На виході звичайний .txt

Витягніть текст із PDF

Дістаньте текст із документа у звичайний файл .txt, у якому можна шукати, який можна вставити чи передати іншій програмі. Одне чесне обмеження одразу: інструмент читає текст, який уже є у файлі, і не виконує OCR для сканів.

Без облікового запису. Без серверних обмежень на розмір файлів. Працює офлайн після завантаження.

Від PDF до звичайного текстового файлу

Зона перетягування для файлів PDF
1

Перетягніть документ

Сторінки рендеряться, щоб ви переконалися, що додали саме той файл, перш ніж щось із нього діставати.

Сітка сторінок, у якій змінюється порядок та виконується обертання
2

Залиште лише ті сторінки, з яких потрібен текст

Решту видаліть — і результат лишиться зосередженим, а не прийде суцільною стіною тексту від обкладинки до додатків.

Вікно перегляду сторінки в повному розмірі
3

Збережіть файл .txt

Текст записується в порядку сторінок як звичайний текст. Розмітка, таблиці та колонки не відновлюються — це слова, а не оформлення.

Що це вміє, а чого не вміє

Звичайний текст, готовий до вставляння

Файл .txt без розмітки й форматування — саме те, що потрібно для пошуку, цитування чи передавання в іншу програму.

Чітко про скани, без туману

OCR тут немає. Сторінка лише із зображенням не дасть нічого — і вам прямо скажуть, які сторінки повернулися порожніми, замість короткого файлу без жодних пояснень.

Спершу виберіть сторінки

Видаліть непотрібні сторінки до експорту — і у файлі .txt буде саме той розділ, який вам був потрібен, а не весь документ.

Конфіденційні документи лишаються на місці

Текст витягують зазвичай із того, що аналізують: договір, звіт, виписка. Нічого з цього не завантажується.

Витягування тексту з PDF — що запитують найчастіше

Чому мій відсканований PDF дав порожній файл?

Бо скан — це зображення сторінки, а не текст. Витягування читає текстовий шар, який несе PDF, а у відсканованої чи сфотографованої сторінки його немає. Розпізнавання літер усередині зображення — це OCR, якого цей інструмент свідомо не робить: він повідомляє такі сторінки як порожні, а не вгадує.

Як зрозуміти, чи є в моєму PDF справжній текст?

Відкрийте його в будь-якій програмі й спробуйте виділити рядок курсором. Якщо текст підсвічується — він витягнеться. Якщо ви отримуєте лише прямокутник виділення поверх зображення, діставати немає чого.

Чи зберігається оформлення документа?

Ні. На виході — звичайний текст у порядку сторінок. Багатоколонкові макети, таблиці й колонтитули виходять послідовними рядками, і для сторінки зі складним макетом це може читатися не в тому порядку.

Чи можна витягти текст лише з частини документа?

Так — видаліть непотрібні сторінки перед експортом. Виділення в межах сторінки немає, тож найменша одиниця — ціла сторінка.

Чи правильно обробляються лігатури та літери з діакритикою?

Зазвичай так. Текст виходить таким, яким його закодував файл, тож добре зроблені PDF витягуються чисто. Документи, створені старими програмами з поламаним кодуванням шрифтів, можуть дати дивні символи, і жоден екстрактор не виправить це заднім числом.

Чи завантажується мій документ, щоб витягти текст?

Ні. pdf.js читає текстовий шар у вашому браузері й там само записує .txt. Нікуди нічого не надсилається, а це важливо, бо так зазвичай працюють саме з документами, які варті аналізу.

Дістаньте цей текст

Звичайний файл .txt, створений без завантаження PDF.

Витягти текст