सीधे कंटेंट पर जाएं

PDF को टेक्स्ट में बदलें

PDF के शब्द उसकी लाइनों और पैराग्राफ़ के साथ बाहर निकालें — सीधे क्लिपबोर्ड पर कॉपी करें या .txt फ़ाइल डाउनलोड करें। कुछ भी स्टोर नहीं किया जाता।

  • कभी स्टोर नहीं होती
  • न कतार, न इंतज़ार
  • साइनअप नहीं, वॉटरमार्क नहीं

यह कैसे काम करता है

1

अपनी PDF जोड़ें

PDF को पेज पर छोड़ें। टेक्स्ट निकालना तुरंत शुरू हो जाता है, एक-एक पेज करके।

2

पढ़ें और ठीक करें

टेक्स्ट एक एडिट होने वाले बॉक्स में दिखता है। पेज ब्रेक के निशान चालू या बंद करें, और सेव करने से पहले कुछ भी एडिट करें।

3

कॉपी या डाउनलोड करें

सब कुछ क्लिपबोर्ड पर कॉपी करें, या इसे .txt फ़ाइल के रूप में डाउनलोड करें।

शब्द कहां से आते हैं, और किस क्रम में निकलते हैं

PDF में कैरेक्टर टेक्स्ट के रूप में स्टोर नहीं होते। वे ग्लिफ़ नंबर के रूप में स्टोर होते हैं जो फ़ाइल में एम्बेड किए गए फ़ॉन्ट की ओर इशारा करते हैं, और इन्हें वापस अक्षरों में बदलना फ़ाइल के अंदर की एक टेबल पर निर्भर करता है, जो बताती है कि हर ग्लिफ़ कौन-सा कैरेक्टर है। ज़्यादातर सॉफ़्टवेयर यह टेबल लिखते हैं। जब कोई नहीं लिखता — और आमतौर पर इसकी वजह कुछ डिज़ाइन सॉफ़्टवेयर के बनाए छोटे-छांटे फ़ॉन्ट सबसेट होते हैं — तो पेज स्क्रीन पर बिल्कुल सही दिखता है पर निकालने पर बेमतलब अक्षर आते हैं, क्योंकि उसे पढ़ने के लिए ज़रूरी जानकारी कभी लिखी ही नहीं गई। कोई भी एक्सट्रैक्टर इसे ठीक नहीं कर सकता; यह कोई कठिन समस्या नहीं, बल्कि गायब डेटा है।

नतीजे पर भरोसा करने से पहले पढ़ने का क्रम जांचें। टेक्स्ट उसी क्रम में निकलता है जिसमें पेज उसे ड्रॉ करता है, यानी जिस क्रम में PDF बनाने वाले सॉफ़्टवेयर ने उसे लिखा — और अक्सर यह वह क्रम नहीं होता जिसमें इंसान पढ़ता है। दो कॉलम वाला पेज कभी बाएं और दाएं कॉलम को सही-सही अलग निकालता है, तो कभी दोनों की लाइनें आपस में मिल जाती हैं — यह पूरी तरह इस पर निर्भर है कि वह कैसे बनाया गया था। हेडर, फ़ुटर, पेज नंबर और साइडबार वहीं आते हैं जहां वे ड्रॉ किए गए थे, आमतौर पर मुख्य टेक्स्ट के बीच में।

कुछ छोटी-मोटी गड़बड़ियों को पहचान लेना बेहतर है, बजाय उन पर उलझने के। लिगेचर उसी एक कैरेक्टर के रूप में आते हैं जो फ़ॉन्ट ने असल में इस्तेमाल किया, इसलिए “find” f और i की जगह एक ही ग्लिफ़ के रूप में आ सकता है, और फिर “find” की सीधी खोज उसे नहीं ढूंढ पाती। लाइन के आख़िर में हाइफ़न से टूटे शब्द हाइफ़न के साथ ही रहते हैं, क्योंकि वह ब्रेक फ़ाइल में सचमुच मौजूद है। और सीधे कोट अक्सर घुमावदार कोट होते हैं, जो तब मायने रखता है जब टेक्स्ट कोड या CSV में जाने वाला हो।

स्कैन किए गए पेज से कुछ भी नहीं निकलता, और टूल ख़ाली फ़ाइल थमाने की जगह यह साफ़ बता देता है — किसी डॉक्यूमेंट की फ़ोटो में कैरेक्टर नहीं होते, सिर्फ़ पिक्सेल होते हैं। यही बात आउटलाइन में बदले गए टेक्स्ट पर भी लागू होती है, जिसे डिज़ाइनर जानबूझकर ऐसा करते हैं ताकि फ़ाइल हर जगह एक जैसी प्रिंट हो; तब तक वह सचमुच आर्टवर्क बन चुका होता है। दोनों के लिए एक्सट्रैक्शन नहीं, OCR चाहिए।

जब आपको कुछ और चाहिए

जब कॉलम मायने रखते हों, तो Poppler का pdftotext -layout in.pdf out.txt ब्राउज़र में होने वाली किसी भी चीज़ से बेहतर है: यह असली ख़ाली जगह से विज़ुअल स्पेसिंग दोबारा बनाता है, इसलिए कॉलम कॉलम ही रहते हैं और टेबल पढ़ने लायक टेबल बनी रहती है। pdftotext -raw उल्टा करता है और ड्रॉ होने का क्रम बिना छेड़े देता है, जो कभी-कभी किसी स्क्रिप्ट को चाहिए होता है।

सैकड़ों फ़ाइलों से टेक्स्ट निकालने के लिए mutool draw -F txt और Python का pdfplumber बुनियाद बनाने लायक हैं — ख़ासकर pdfplumber हर कैरेक्टर को उसके निर्देशांक, फ़ॉन्ट और साइज़ के साथ देता है, ताकि आप हेडर और फ़ुटर को अंदाज़े से नहीं, उनकी जगह के आधार पर छांट सकें। यही वह काम है जो यह पेज नहीं कर सकता, और बड़ी संख्या में फ़ाइलों के लिए यही मायने रखता है।

अक्सर पूछे जाने वाले सवाल

क्या पैराग्राफ़ और लाइन ब्रेक बने रहते हैं?

हां। PDF में पैराग्राफ़ जैसी कोई चीज़ स्टोर ही नहीं होती — सिर्फ़ निर्देशांकों पर रखे कैरेक्टर होते हैं — इसलिए टेक्स्ट को दोबारा बनाया जाता है: एक ही बेसलाइन पर पड़े शब्दों को एक लाइन में रखा जाता है और जहां ऊपर-नीचे की दूरी बढ़ती है वहां नया पैराग्राफ़ शुरू होता है। नतीजा मूल डॉक्यूमेंट जैसा पढ़ा जाता है, एक लगातार बहती लाइन जैसा नहीं।

क्या मेरी PDF कहीं स्टोर होती है?

नहीं। टेक्स्ट आपका अपना ब्राउज़र पढ़ता है और वह कहीं नहीं भेजा जाता। पेज लोड होने के बाद आप इंटरनेट बंद कर दें, तब भी यह काम करता है।

यह कहता है कि मेरी PDF में कोई टेक्स्ट नहीं है — क्यों?

क्योंकि वह स्कैन या फ़ोटो है: पेज एक तस्वीर है, और तस्वीर में निकालने लायक कोई टेक्स्ट नहीं होता। PDF OCR करें इस्तेमाल करें, जो इमेज से ही शब्द पढ़ता है।

क्या डाउनलोड करने से पहले टेक्स्ट एडिट कर सकता हूं?

हां — बॉक्स पूरी तरह एडिट होने वाला है और जो आप देखते हैं, ठीक वही सेव होता है।

टेबल और कॉलम का क्या होता है?

कॉलम उसी क्रम में पढ़े जाते हैं जिसमें PDF उन्हें ड्रॉ करती है। यह आमतौर पर सही होता है, पर कई कॉलम वाले जटिल लेआउट में लाइनें आपस में मिल सकती हैं। टेबल ग्रिड के रूप में नहीं, टेक्स्ट की लाइनों के रूप में आती हैं — टेबल के लिए PDF को Excel में बदलें इस्तेमाल करें।

ध्यान दें: प्लेन टेक्स्ट में कोई फ़ॉर्मैटिंग नहीं होती: बोल्ड, साइज़, रंग, इमेज और टेबल की बनावट — ये सब परिभाषा के हिसाब से ही हट जाते हैं। जो टेक्स्ट असली कैरेक्टर की जगह वेक्टर आउटलाइन के रूप में ड्रॉ किया गया हो (लोगो और कुछ डिज़ाइनर PDF में आम है), उसे OCR के बिना कोई भी टूल नहीं निकाल सकता।

यह टूल अपनी वेबसाइट पर लगाएं

किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।