استخراج متن از یک فایل PDF
متن سند را در یک فایل سادهی .txt بیرون بکشید تا بتوانید در آن جستوجو کنید، جایی بچسبانیدش یا به برنامهای دیگر بدهیدش. یک محدودیت را همین اول صادقانه بگوییم: این ابزار متنی را میخواند که از پیش داخل فایل است و روی اسکنها OCR اجرا نمیکند.
بدون حساب کاربری. بدون محدودیت حجم فایل از سمت سرور. پس از بارگذاری بهصورت آفلاین کار میکند.
از PDF تا یک فایل متنی ساده

سند را رها کنید
صفحهها رندر میشوند تا پیش از بیرون کشیدن چیزی، مطمئن شوید فایل درست را بارگذاری کردهاید.

فقط صفحههایی را نگه دارید که متنشان را میخواهید
بقیه را حذف کنید تا خروجی متمرکز بماند و بهجای یک دیوار متن از جلد تا پیوست، همان بخش مورد نظر را بگیرید.

یک فایل .txt خروجی بگیرید
متن به ترتیب صفحهها و بهصورت متن ساده نوشته میشود. چیدمان، جدولها و ستونها بازسازی نمیشوند — این کلمههاست، نه طراحی.
این ابزار چه میکند و چه نمیکند
متن ساده، آمادهی چسباندن
یک فایل .txt بدون نشانهگذاری و بدون قالببندی؛ همان چیزی که برای جستوجو، نقل قول یا تحویل به برنامهای دیگر میخواهید.
دربارهی اسکنها شفاف، نه مبهم
اینجا OCR وجود ندارد. صفحهای که فقط تصویر است چیزی نمیدهد — و دقیقاً به شما گفته میشود کدام صفحهها خالی برگشتهاند، بهجای اینکه فایلی کوتاه و بیتوضیح تحویل بگیرید.
اول صفحهها را انتخاب کنید
پیش از خروجی، صفحههایی را که لازم ندارید حذف کنید تا فایل .txt همان بخشی را داشته باشد که دنبالش بودید، نه کل سند.
اسناد محرمانه سر جایشان میمانند
استخراج متن معمولاً روی چیزی انجام میشود که در حال تحلیل است — یک قرارداد، یک گزارش، یک صورتحساب. هیچکدام آپلود نمیشوند.
پرسشهای رایج دربارهی استخراج متن از PDF
چرا PDF اسکنشدهی من فایل خالی داد؟
چون اسکن، عکسِ یک صفحه است، نه متن. استخراج، لایهی متنی را میخواند که PDF با خود دارد و صفحهی اسکنشده یا عکسگرفته چنین لایهای ندارد. تشخیص حرفها داخل تصویر یعنی OCR، که این ابزار عمداً انجامش نمیدهد — بهجای حدس زدن، آن صفحهها را خالی گزارش میکند.
از کجا بفهمم PDF من متن واقعی دارد؟
آن را در هر برنامهی خواندن PDF باز کنید و با نشانگر یک خط را انتخاب کنید. اگر متن هایلایت شد، استخراج میشود. اگر فقط یک مستطیل انتخاب روی تصویر گرفتید، چیزی برای بیرون کشیدن نیست.
آیا چیدمان سند حفظ میشود؟
نه. خروجی، متن ساده به ترتیب صفحههاست. چیدمانهای چندستونی، جدولها و سرصفحهها بهصورت خطهای پشتسرهم درمیآیند که برای صفحهای با چیدمان پیچیده ممکن است بیترتیب خوانده شود.
میتوانم فقط از بخشی از سند متن بگیرم؟
بله — پیش از خروجی، صفحههایی را که نمیخواهید حذف کنید. انتخاب درون یک صفحه وجود ندارد، پس کوچکترین واحد، یک صفحهی کامل است.
آیا حرفهای چسبیده و نویسههای نشانهدار درست درمیآیند؟
معمولاً بله. متن همانطور بیرون میآید که فایل کدگذاریاش کرده، پس PDFهای خوشساخت تمیز استخراج میشوند. سندهایی که ابزارهای قدیمی با کدگذاری فونت خراب ساختهاند ممکن است نویسههای عجیب بدهند و هیچ استخراجکنندهای نمیتواند این را بعداً درست کند.
آیا سند من برای استخراج متن آپلود میشود؟
نه. pdf.js لایهی متن را داخل مرورگر شما میخواند و فایل .txt را همانجا مینویسد. چیزی جایی فرستاده نمیشود، و با توجه به اینکه این کار معمولاً روی اسنادی انجام میشود که ارزش تحلیل دارند، همین مهم است.