सीधे कंटेंट पर जाएं

स्कैन की हुई PDF को सर्च करने लायक बनाएं

स्कैन से शब्द पढ़ें और उन्हें पेजों पर अदृश्य रूप से बिछा दें। डॉक्यूमेंट वैसा ही दिखता है — बस उसमें सर्च, सिलेक्ट और कॉपी करना मुमकिन हो जाता है। टेढ़े या बग़ल में मुड़े स्कैन किए गए पेज सीधे कर दिए जाते हैं।

  • कभी स्टोर नहीं होती
  • न कतार, न इंतज़ार
  • साइनअप नहीं, वॉटरमार्क नहीं

यह कैसे काम करता है

1

अपनी स्कैन की हुई PDF जोड़ें

फ़ाइल यहां छोड़ें। टूल जांचता है कि उसमें पहले से टेक्स्ट लेयर है या नहीं, और बताता है अगर OCR से हालत बिगड़ेगी।

2

भाषा जांचें

टूल पहला पेज पढ़ता है और बताता है कि उसे कौन-सी भाषा मिली। ख़ुद चुनना हो तो 120 से ज़्यादा भाषाएं उपलब्ध हैं।

3

डाउनलोड करें

आपको वही डॉक्यूमेंट मिलता है, अब स्कैन के पीछे एक छिपी टेक्स्ट लेयर के साथ।

बिना बदले पेज के ऊपर एक अदृश्य लेयर

स्कैन ठीक वैसा ही रखा जाता है जैसा था। जो जोड़ा जाता है वह अदृश्य रेंडरिंग मोड में बनी टेक्स्ट की एक लेयर है — असली कैरेक्टर, तस्वीर के शब्दों के ऊपर शब्द-दर-शब्द रखे गए, और इस तरह चिह्नित कि वे कभी पेंट न हों। पेज हूबहू दिखता है क्योंकि देखने में कुछ बदला ही नहीं; कोई वाक्य सिलेक्ट करें तो हाइलाइट सही शब्दों पर आता है, क्योंकि अदृश्य टेक्स्ट वहीं है जहां दिखने वाली स्याही है। सर्च करने लायक स्कैन बनाने का यही मानक तरीक़ा है, और इसी वजह से नतीजा डॉक्यूमेंट की फ़ोटो होते हुए भी सर्च, कॉपी और इंडेक्स किया जा सकता है।

पेज की दो बातें जानबूझकर ठीक की जाती हैं, क्योंकि पढ़ने के लिए वैसे भी इनकी ज़रूरत थी। बग़ल में मुड़ा स्कैन हुआ पेज सीधा किया जाता है, और फ़ीडर से टेढ़ा निकला पेज सीधा कर दिया जाता है — इसलिए आउटपुट अक्सर इनपुट से ज़्यादा साफ़-सुथरा होता है। पेज साइज़ मूल PDF से ही रखे जाते हैं, एक जैसे नहीं किए जाते, इसलिए अलग-अलग पेज साइज़ वाला डॉक्यूमेंट वैसा ही रहता है और कुछ भी रीस्केल नहीं होता।

सटीकता लगभग पूरी तरह स्कैन पर निर्भर करती है, और फ़र्क़ बहुत बड़ा होता है। छपे टेक्स्ट का साफ़ 300 DPI स्कैन बहुत ऊंची सटीकता से पढ़ा जाता है; वही पेज 150 DPI पर साफ़ तौर पर ख़राब पढ़ा जाता है; कम रोशनी में तिरछे कोण से ली गई फ़ोटो बिल्कुल अलग मामला है। अगर स्कैनिंग आपके हाथ में है, तो ग्रेस्केल में 300 DPI वह सेटिंग है जो मायने रखती है — इससे ज़्यादा रिज़ॉल्यूशन शायद ही मदद करता है, और इससे कम तुरंत नुक़सान करता है। छोटे अक्षर, पास-पास लाइनें, रंगीन बैकग्राउंड, फ़ोटोकॉपी की फ़ोटोकॉपी और कुछ भी जिस पर मुहर लगी हो या हाथ से लिखा हो — ये सब ऐसे तरीक़ों से मुश्किल हैं जिन्हें कोई सॉफ़्टवेयर पूरी तरह हल नहीं करता।

जो जानबूझकर छोड़ा जाता है, वह भी उतना ही अहम है जितना जो जोड़ा जाता है। फ़ोटो, लोगो, सिग्नेचर और सजावटी ग्राफ़िक्स पढ़े नहीं जाते, अनदेखे किए जाते हैं, क्योंकि किसी तस्वीर से ज़बरदस्ती अक्षर निकालने पर भरोसेमंद दिखने वाली बकवास बनती है जो फिर हर सर्च में दिखती है। चीनी, जापानी और कोरियन शब्द पहचाने जाते हैं, पर जब तक उन्हें लिख सकने वाला फ़ॉन्ट नहीं आता, उन्हें टेक्स्ट लेयर से बाहर रखा जाता है और ख़ाली जगह लिखने के बजाय आपके लिए गिना जाता है। यहां डॉक्यूमेंट की दोबारा टाइपसेटिंग नहीं होती: पेज पर शब्द अब भी एक तस्वीर हैं, और उन्हें एडिट होने वाले टेक्स्ट में बदलने के लिए Word में बदलना सही टूल है।

जब आपको कुछ और चाहिए

OCRmyPDF वह टूल है जिसके बगल में यह पेज बस एक सुविधा है, और वह मुफ़्त है। ocrmypdf --deskew --rotate-pages in.pdf out.pdf यही काम ज़्यादा नियंत्रण के साथ करता है; नतीजा छोटा करने के लिए --optimize 3, ख़राब मौजूदा लेयर बदलने के लिए --redo-ocr, और उसी पास में आर्काइव फ़ाइल बनाने के लिए --output-type pdfa जोड़ा जा सकता है। यह हज़ारों पेज संभालता है, फ़ोल्डर वॉचर में चलता है, और लाइब्रेरी व डॉक्यूमेंट आर्काइव असल में यही इस्तेमाल करते हैं।

मुश्किल सामग्री के लिए — ऐतिहासिक छपाई, असामान्य लेआउट, भारी टेबल — Google, Amazon या Microsoft की होस्टेड सर्विस ऐसे पेज पढ़ लेगी जो आम पहचान वाले टूल नहीं पढ़ पाते, क्योंकि उन्हें कहीं ज़्यादा सामग्री पर ट्रेन किया गया है। यह क्षमता का असली फ़र्क़ है और जानने लायक है। पर इसका मतलब अपने डॉक्यूमेंट किसी तीसरे पक्ष को भेजना भी है, और यही वह सौदा है जिससे बचने के लिए यह पेज बना है — इसलिए किसी नाज़ुक पुरानी किताब के लिए यह सही विकल्प है और मेडिकल रिकॉर्ड के ढेर के लिए ग़लत।

अक्सर पूछे जाने वाले सवाल

क्या बाद में पेज अलग दिखेंगे?

बस ज़्यादा सीधे: जो पेज एक डिग्री टेढ़ा या बग़ल में मुड़ा स्कैन हुआ हो, उसे सीधा कर दिया जाता है। स्कैन ख़ुद जस का तस रहता है और पहचाने गए शब्द उसके ऊपर अदृश्य स्याही में रखे जाते हैं — न कभी पेंट होते हैं, न प्रिंट। फ़र्क़ बस इतना है कि Ctrl+F चीज़ें ढूंढने लगता है।

क्या मेरा डॉक्यूमेंट कहीं स्टोर होता है?

नहीं। पहचानने की प्रक्रिया कुछ भी स्टोर नहीं करती। जब आप पहली बार कोई भाषा इस्तेमाल करते हैं, तो रीडर और भाषा पैक इसी साइट से आते हैं; डॉक्यूमेंट ख़ुद कभी डिवाइस से बाहर नहीं जाता।

यह कितना सटीक है?

छपे टेक्स्ट के साफ़ स्कैन पर, बहुत। धुंधली फ़ोटो, हाथ की लिखावट और असामान्य फ़ॉन्ट से सटीकता घटती है; पढ़ने से पहले टेढ़ापन ठीक कर दिया जाता है। लाइन वाली टेबल सेल-दर-सेल पढ़ी जाती हैं, इसलिए फ़ॉर्म के लेबल अपनी वैल्यू में घुलते-मिलते नहीं।

कौन-सी भाषाएं काम करती हैं?

120 से ज़्यादा, जिनमें अंग्रेज़ी, बांग्ला, हिंदी, उर्दू, अरबी, स्पेनिश, फ़्रेंच, चीनी, जापानी और कोरियन शामिल हैं। लिपि पेज से पहचानी जाती है; जहां कई भाषाओं की लिपि एक ही हो, वहां फ़ैसला आपके ब्राउज़र की भाषा से होता है और आप उसे बदल सकते हैं।

टेक्स्ट लेयर में कुछ शब्द नहीं हैं। क्यों?

टेक्स्ट लेयर में सिर्फ़ वही कैरेक्टर आ सकते हैं जिन्हें साथ आया कोई फ़ॉन्ट लिख सके। बांग्ला, देवनागरी, अरबी, थाई और दो दर्जन दूसरी लिपियों के लिए यहां अपना फ़ॉन्ट है; चीनी, जापानी और कोरियन के लिए अभी नहीं, इसलिए उन शब्दों को ख़ाली जगह के रूप में सेव करने के बजाय आपके लिए गिन दिया जाता है। OCR के साथ PDF को Word में बदलें वह टेक्स्ट आपको पूरा देता है।

इसमें कितना समय लगता है?

हर पेज पर कुछ सेकंड, क्योंकि पढ़ने का काम किसी सर्वर फ़ार्म के बजाय आपका अपना डिवाइस करता है। प्रोग्रेस पेज-दर-पेज दिखाई जाती है।

ध्यान दें: जब तक चीनी, जापानी और कोरियन के लिए फ़ॉन्ट नहीं आता, उनके शब्द टेक्स्ट लेयर से बाहर रखे जाते हैं और ख़ाली जगह के रूप में सेव करने के बजाय आपके लिए गिने जाते हैं; रीडर जो भी दूसरी लिपि जानता है, वह लिखी जाती है। फ़ोटो, लोगो और सिग्नेचर अनदेखे किए जाते हैं ताकि वे कभी बेमतलब टेक्स्ट न बनें। हाथ की लिखावट कोई भी आम OCR टूल भरोसे से नहीं पहचानता।

यह टूल अपनी वेबसाइट पर लगाएं

किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।