PDFPDF Organizer
मुफ़्त · कोई अपलोड नहीं · सादा .txt बाहर

किसी भी PDF से टेक्स्ट निकालकर TXT बनाएँ

दस्तावेज़ का टेक्स्ट एक सादी .txt फ़ाइल में निकाल लीजिए, जिसमें खोज सकें, जिसे चिपका सकें या किसी और प्रोग्राम को दे सकें। एक सीमा पहले ही साफ़ कर दें: यह वही टेक्स्ट पढ़ता है जो फ़ाइल में पहले से मौजूद है, और स्कैन पर OCR नहीं चलाता।

कोई अकाउंट नहीं। सर्वर की ओर से फ़ाइल-आकार की कोई सीमा नहीं। एक बार लोड होने पर ऑफ़लाइन भी काम करता है।

PDF से एक सादी टेक्स्ट फ़ाइल तक

PDF फ़ाइलों के लिए ड्रैग-एंड-ड्रॉप क्षेत्र
1

दस्तावेज़ छोड़ें

पेज रेंडर हो जाते हैं, ताकि कुछ निकालने से पहले आप पक्का कर लें कि सही फ़ाइल लोड हुई है।

पेजों की ग्रिड जिनका क्रम बदला और जिन्हें घुमाया जा रहा है
2

सिर्फ़ वे पेज रखें जिनका टेक्स्ट चाहिए

बाक़ी हटा दें, तो नतीजा कवर से परिशिष्ट तक की टेक्स्ट-दीवार बनने के बजाय काम की बात तक सीमित रहता है।

पूर्ण-आकार का पेज प्रीव्यू मोडल
3

.txt फ़ाइल एक्सपोर्ट करें

टेक्स्ट पेज-क्रम में सादे रूप में लिखा जाता है। लेआउट, टेबल और कॉलम दोबारा नहीं बनाए जाते — यहाँ शब्द मिलते हैं, डिज़ाइन नहीं।

यह क्या करता है और क्या नहीं

सादा टेक्स्ट, चिपकाने के लिए तैयार

बिना किसी मार्कअप और फ़ॉर्मेटिंग की .txt फ़ाइल — खोजने, उद्धृत करने या किसी दूसरे प्रोग्राम को देने के लिए यही चाहिए होता है।

स्कैन के बारे में साफ़ बात, गोलमोल नहीं

यहाँ OCR नहीं है। केवल-इमेज पेज से कुछ नहीं मिलता — और आपको ठीक-ठीक बता दिया जाता है कि कौन-से पेज ख़ाली लौटे, न कि बिना वजह बताए एक छोटी-सी फ़ाइल थमा दी जाती है।

पहले पेज चुन लीजिए

एक्सपोर्ट से पहले ग़ैर-ज़रूरी पेज हटा दें, तो .txt में पूरा दस्तावेज़ नहीं, वही हिस्सा आता है जिसकी आपको तलाश थी।

गोपनीय दस्तावेज़ अपनी जगह रहते हैं

टेक्स्ट आम तौर पर उसी चीज़ से निकाला जाता है जिसका विश्लेषण करना हो — कोई अनुबंध, रिपोर्ट या स्टेटमेंट। इनमें से कुछ भी अपलोड नहीं होता।

PDF से टेक्स्ट निकालने पर अक्सर पूछे जाने वाले सवाल

मेरी स्कैन की गई PDF से ख़ाली फ़ाइल क्यों बनी?

क्योंकि स्कैन पेज की तस्वीर है, टेक्स्ट नहीं। निष्कर्षण उस टेक्स्ट लेयर को पढ़ता है जो PDF अपने साथ रखती है, और स्कैन किए या फ़ोटो खींचे गए पेज में वह होती ही नहीं। इमेज के भीतर अक्षर पहचानना OCR है, जो यह टूल जानबूझकर नहीं करता — वह अंदाज़ा लगाने के बजाय उन पेजों को ख़ाली बता देता है।

कैसे पता करें कि मेरी PDF में सचमुच टेक्स्ट है?

उसे किसी भी रीडर में खोलिए और कर्सर से एक पंक्ति चुनने की कोशिश कीजिए। अगर टेक्स्ट हाइलाइट होता है, तो वह निकल आएगा। अगर सिर्फ़ इमेज के ऊपर चौकोर चयन बनता है, तो निकालने को कुछ है ही नहीं।

क्या दस्तावेज़ का लेआउट बना रहता है?

नहीं। नतीजा पेज-क्रम में सादा टेक्स्ट होता है। कई कॉलम वाले लेआउट, टेबल और हेडर लगातार पंक्तियों के रूप में बाहर आते हैं, जो जटिल लेआउट वाले पेज पर क्रम से हटकर पढ़े जा सकते हैं।

क्या दस्तावेज़ के सिर्फ़ एक हिस्से से टेक्स्ट निकाला जा सकता है?

हाँ — एक्सपोर्ट से पहले वे पेज हटा दीजिए जो नहीं चाहिए। पेज के भीतर चयन की सुविधा नहीं है, इसलिए सबसे छोटी इकाई पूरा पेज है।

क्या लिगेचर और मात्रा वाले अक्षर सही निकलते हैं?

आम तौर पर हाँ। टेक्स्ट वैसे ही बाहर आता है जैसे फ़ाइल ने उसे एन्कोड किया था, इसलिए ढंग से बनी PDF साफ़ निकलती है। पुराने टूल से बने दस्तावेज़, जिनकी फ़ॉन्ट एन्कोडिंग टूटी हो, अजीब अक्षर दे सकते हैं, और उसे बाद में कोई भी एक्सट्रैक्टर ठीक नहीं कर सकता।

क्या टेक्स्ट निकालने के लिए मेरा दस्तावेज़ अपलोड होता है?

नहीं। pdf.js आपके ब्राउज़र में टेक्स्ट लेयर पढ़ता है और .txt वहीं लिखता है। कुछ भी कहीं नहीं भेजा जाता, जो मायने रखता है क्योंकि यह काम आम तौर पर उन्हीं दस्तावेज़ों पर होता है जिनका विश्लेषण करना हो।

टेक्स्ट बाहर निकाल लीजिए

एक सादी .txt फ़ाइल, PDF अपलोड किए बिना।

अभी टेक्स्ट निकालें