PDF से टेक्स्ट निकालें

PDF में से सारा टेक्स्ट निकालें, उसे प्रीव्यू करें, कॉपी करें, या .txt फ़ाइल के रूप में डाउनलोड करें. कुछ भी अपलोड नहीं होता, यह सब आपकी डिवाइस पर ही होता है.

PDF फ़ाइल चुनने के लिए क्लिक करें, या उसे यहां खींचकर लाएं

आपकी डिवाइस पर ही रहती है, कुछ भी अपलोड नहीं होता.

क्या मेरी PDF फ़ाइलें कहीं अपलोड होती हैं?

नहीं. टेक्स्ट पूरी तरह आपके ब्राउज़र के भीतर JavaScript से निकाला जाता है. आपकी फ़ाइलें कभी आपकी डिवाइस से बाहर नहीं जातीं और किसी सर्वर को नहीं छूतीं.

क्या यह स्कैन की गई PDF पर काम करेगा?

नहीं, अकेले नहीं. यह वह टेक्स्ट पढ़ता है जो पहले से PDF में एम्बेड है, स्कैन किया पेज बस एक इमेज होता है, इसलिए जब तक उस पर पहले से OCR न चलाया गया हो, तब तक निकालने के लिए कोई टेक्स्ट नहीं होता.

क्या कॉलम या टेबल जैसी फ़ॉर्मैटिंग साफ़ तरीके से आती है?

ज़्यादातर हां, लेकिन जटिल लेआउट (मल्टी-कॉलम पेज, टेबल) एक अनपेक्षित रीडिंग क्रम में आ सकते हैं, क्योंकि PDF टेक्स्ट को सख्त ऊपर-से-नीचे स्ट्रक्चर में स्टोर नहीं करती.

क्या मैं पासवर्ड-प्रोटेक्टेड PDF से टेक्स्ट निकाल सकता हूं?

अभी नहीं. पासवर्ड-प्रोटेक्टेड या एन्क्रिप्टेड PDF को टूल पढ़ नहीं सकता और एरर दिखाएगा, पहले किसी PDF रीडर से पासवर्ड हटाएं.

ब्लॉग से: PDF कंप्रेशन स्कैन पर शानदार क्यों काम करता है और रिपोर्ट पर लगभग नहीं

यह कैसे काम करता है

PDF पैराग्राफ़, वाक्य या शब्द भी स्टोर नहीं करती; यह तय पोज़िशन पर कैरेक्टर ग्लिफ़ की स्ट्रीम स्टोर करती है: 'इस फ़ॉन्ट के साथ इन कोऑर्डिनेट्स पर यह शेप रखें.' यह टूल pdf.js, फ़ायरफ़ॉक्स के PDF इंजन का इस्तेमाल करके, हर पेज के कंटेंट स्ट्रीम से गुज़रता है और getTextContent() के ज़रिए हर टेक्स्ट-रेंडरिंग ऑपरेशन इकट्ठा करता है. ये टुकड़े स्पेस से जुड़ते हैं और एक्स्ट्रा व्हाइटस्पेस को समेट दिया जाता है, पेज-दर-पेज, ताकि आपको दिखने वाला प्लेन टेक्स्ट बने.

यह स्टोरेज मॉडल दो चीज़ों की वजह बताता है जो शायद आपको एक्सट्रैक्शन में हैरान करें. पहली, रीडिंग ऑर्डर: pdf.js टुकड़े लगभग उसी क्रम में लौटाता है जिस क्रम में वे फ़ाइल में दिखाई देते हैं, जो हमेशा वह क्रम नहीं होता जिसमें कोई इंसान मल्टी-कॉलम पेज या टेबल पढ़ता है. दूसरी, और ज़्यादा ज़रूरी: एक स्कैन की गई PDF में कोई टेक्स्ट होता ही नहीं; स्कैनर एक पेज की फ़ोटोग्राफ़िक इमेज बनाता है, इसलिए जब तक किसी ने OCR नहीं चलाया, वहां निकालने के लिए कोई कैरेक्टर ग्लिफ़ नहीं होते, और टूल ईमानदारी से बताएगा कि उसे कुछ नहीं मिला.

एक्सट्रैक्शन फ़ाइल ड्रॉप करते ही, पूरी तरह एक लोकल वर्कर में होता है. डेवलपर टूल्स खोलें और नेटवर्क टैब देखें: चाहे फ़ाइल कोई कॉन्ट्रैक्ट हो या मेडिकल रिपोर्ट, कोई रिक्वेस्ट आपका डॉक्यूमेंट या उसका टेक्स्ट कहीं नहीं ले जाती.