PDFPDF Organizer
Безплатно · Без качване · Обикновен .txt на изхода

Извлечете текста от PDF файл

Извадете текста от документ в обикновен .txt файл, който можете да търсите, да поставяте или да подадете на друга програма. Едно честно ограничение отпред: това чете текста, който вече е във файла, и не пуска OCR върху сканове.

Без акаунт. Без сървърни ограничения за размера на файловете. Работи офлайн след зареждане.

От PDF до обикновен текстов файл

Зона за плъзгане и пускане на PDF файлове
1

Пуснете документа

Страниците се изобразяват, за да потвърдите, че сте заредили правилния файл, преди да извадите каквото и да е от него.

Решетка от страници, които се пренареждат и завъртат
2

Оставете само страниците, от които ви трябва текст

Изтрийте останалите и резултатът остава фокусиран, вместо да пристигне като една стена от текст от корицата до приложението.

Прозорец за преглед на страница в пълен размер
3

Експортирайте .txt файл

Текстът се записва в реда на страниците като обикновен текст. Оформлението, таблиците и колоните не се възстановяват — това са думите, не дизайнът.

Какво прави и какво не прави този инструмент

Обикновен текст, готов за поставяне

Файл .txt без маркиране и без форматиране — точно каквото ви трябва за търсене, цитиране или подаване към друга програма.

Ясно за скановете, без увъртане

OCR тук няма. Страница само с изображение не дава нищо — и ви се казва точно кои страници са се върнали празни, вместо да получите кратък файл без обяснение.

Първо изберете страниците

Изтрийте страниците, които не ви трябват, преди експорта, и .txt съдържа частта, която сте търсили, а не целия документ.

Поверителните документи си остават на място

Извличането на текст обикновено се прилага върху нещо, което се анализира — договор, доклад, извлечение. Нищо от това не се качва.

Извличане на текст от PDF — честите въпроси

Защо сканираният ми PDF даде празен файл?

Защото сканът е снимка на страница, а не текст. Извличането чете текстовия слой, който PDF файлът носи, а сканирана или снимана страница няма такъв. Разпознаването на букви в изображение е OCR, което този инструмент умишлено не прави — той отчита тези страници като празни, вместо да гадае.

Как да разбера дали в моя PDF има истински текст?

Отворете го в която и да е програма за четене и опитайте да маркирате ред с курсора. Ако текстът се откроява, ще се извлече. Ако получавате само правоъгълник за избор върху изображение, няма какво да се извади.

Запазва ли се оформлението на документа?

Не. Резултатът е обикновен текст в реда на страниците. Оформленията в няколко колони, таблиците и колонтитулите излизат като последователни редове, което при страница със сложно оформление може да се чете разбъркано.

Мога ли да извлека текст само от част от документа?

Да — изтрийте страниците, които не искате, преди експорта. Избор в рамките на страница няма, така че най-малката единица е цяла страница.

Правилно ли се обработват лигатурите и буквите с диакритика?

Обикновено да. Текстът излиза така, както файлът го е кодирал, затова добре направените PDF файлове се извличат чисто. Документи от по-стари програми със счупено кодиране на шрифтовете могат да дадат странни знаци и никой инструмент за извличане не може да поправи това след факта.

Качва ли се документът ми, за да бъде извлечен текстът?

Не. pdf.js чете текстовия слой във вашия браузър и записва .txt файла там. Нищо не се изпраща никъде, което има значение, като се има предвид, че това обикновено се прави върху документи, които си заслужава да бъдат анализирани.

Извадете текста навън

Обикновен .txt файл, произведен без качване на PDF.

Извлечете текста