PDFPDF Organizer
رایگان · بدون آپلود · خروجی متن ساده

استخراج متن از یک فایل PDF

متن سند را در یک فایل ساده‌ی ‎.txt‎ بیرون بکشید تا بتوانید در آن جست‌وجو کنید، جایی بچسبانیدش یا به برنامه‌ای دیگر بدهیدش. یک محدودیت را همین اول صادقانه بگوییم: این ابزار متنی را می‌خواند که از پیش داخل فایل است و روی اسکن‌ها OCR اجرا نمی‌کند.

بدون حساب کاربری. بدون محدودیت حجم فایل از سمت سرور. پس از بارگذاری به‌صورت آفلاین کار می‌کند.

از PDF تا یک فایل متنی ساده

ناحیه کشیدن و رها کردن برای فایل‌های PDF
1

سند را رها کنید

صفحه‌ها رندر می‌شوند تا پیش از بیرون کشیدن چیزی، مطمئن شوید فایل درست را بارگذاری کرده‌اید.

شبکه‌ای از صفحه‌ها در حال تغییر ترتیب و چرخش
2

فقط صفحه‌هایی را نگه دارید که متنشان را می‌خواهید

بقیه را حذف کنید تا خروجی متمرکز بماند و به‌جای یک دیوار متن از جلد تا پیوست، همان بخش مورد نظر را بگیرید.

پنجره پیش‌نمایش صفحه در اندازه کامل
3

یک فایل ‎.txt‎ خروجی بگیرید

متن به ترتیب صفحه‌ها و به‌صورت متن ساده نوشته می‌شود. چیدمان، جدول‌ها و ستون‌ها بازسازی نمی‌شوند — این کلمه‌هاست، نه طراحی.

این ابزار چه می‌کند و چه نمی‌کند

متن ساده، آماده‌ی چسباندن

یک فایل ‎.txt‎ بدون نشانه‌گذاری و بدون قالب‌بندی؛ همان چیزی که برای جست‌وجو، نقل قول یا تحویل به برنامه‌ای دیگر می‌خواهید.

درباره‌ی اسکن‌ها شفاف، نه مبهم

اینجا OCR وجود ندارد. صفحه‌ای که فقط تصویر است چیزی نمی‌دهد — و دقیقاً به شما گفته می‌شود کدام صفحه‌ها خالی برگشته‌اند، به‌جای اینکه فایلی کوتاه و بی‌توضیح تحویل بگیرید.

اول صفحه‌ها را انتخاب کنید

پیش از خروجی، صفحه‌هایی را که لازم ندارید حذف کنید تا فایل ‎.txt‎ همان بخشی را داشته باشد که دنبالش بودید، نه کل سند.

اسناد محرمانه سر جایشان می‌مانند

استخراج متن معمولاً روی چیزی انجام می‌شود که در حال تحلیل است — یک قرارداد، یک گزارش، یک صورت‌حساب. هیچ‌کدام آپلود نمی‌شوند.

پرسش‌های رایج درباره‌ی استخراج متن از PDF

چرا PDF اسکن‌شده‌ی من فایل خالی داد؟

چون اسکن، عکسِ یک صفحه است، نه متن. استخراج، لایه‌ی متنی را می‌خواند که PDF با خود دارد و صفحه‌ی اسکن‌شده یا عکس‌گرفته چنین لایه‌ای ندارد. تشخیص حرف‌ها داخل تصویر یعنی OCR، که این ابزار عمداً انجامش نمی‌دهد — به‌جای حدس زدن، آن صفحه‌ها را خالی گزارش می‌کند.

از کجا بفهمم PDF من متن واقعی دارد؟

آن را در هر برنامه‌ی خواندن PDF باز کنید و با نشانگر یک خط را انتخاب کنید. اگر متن هایلایت شد، استخراج می‌شود. اگر فقط یک مستطیل انتخاب روی تصویر گرفتید، چیزی برای بیرون کشیدن نیست.

آیا چیدمان سند حفظ می‌شود؟

نه. خروجی، متن ساده به ترتیب صفحه‌هاست. چیدمان‌های چندستونی، جدول‌ها و سرصفحه‌ها به‌صورت خط‌های پشت‌سرهم درمی‌آیند که برای صفحه‌ای با چیدمان پیچیده ممکن است بی‌ترتیب خوانده شود.

می‌توانم فقط از بخشی از سند متن بگیرم؟

بله — پیش از خروجی، صفحه‌هایی را که نمی‌خواهید حذف کنید. انتخاب درون یک صفحه وجود ندارد، پس کوچک‌ترین واحد، یک صفحه‌ی کامل است.

آیا حرف‌های چسبیده و نویسه‌های نشانه‌دار درست درمی‌آیند؟

معمولاً بله. متن همان‌طور بیرون می‌آید که فایل کدگذاری‌اش کرده، پس PDFهای خوش‌ساخت تمیز استخراج می‌شوند. سندهایی که ابزارهای قدیمی با کدگذاری فونت خراب ساخته‌اند ممکن است نویسه‌های عجیب بدهند و هیچ استخراج‌کننده‌ای نمی‌تواند این را بعداً درست کند.

آیا سند من برای استخراج متن آپلود می‌شود؟

نه. pdf.js لایه‌ی متن را داخل مرورگر شما می‌خواند و فایل ‎.txt‎ را همان‌جا می‌نویسد. چیزی جایی فرستاده نمی‌شود، و با توجه به اینکه این کار معمولاً روی اسنادی انجام می‌شود که ارزش تحلیل دارند، همین مهم است.

متن را بیرون بکشید

یک فایل ساده‌ی ‎.txt‎ که بدون آپلود کردن PDF ساخته می‌شود.

استخراج متن