स्कैन की गई PDF में सर्च क्यों नहीं होता
क्योंकि उसमें कोई शब्द है ही नहीं। फ़ाइल में असल में क्या है, यह समझ लेने से हर लक्षण समझ आ जाता है, और वह एक सेटिंग भी दिख जाती है जो तय करती है कि इसे कितनी अच्छी तरह ठीक किया जा सकता है।
आख़िरी समीक्षा
फ़ाइल में कोई शब्द नहीं है
एक PDF में दो बिल्कुल अलग चीज़ें हो सकती हैं जो स्क्रीन पर एक जैसी दिखती हैं। Word से एक्सपोर्ट किए डॉक्यूमेंट में टेक्स्ट होता है — असली अक्षर, हर एक की अपनी जगह और फ़ॉन्ट — इसीलिए आप कोई वाक्य सिलेक्ट कर सकते हैं, कोई नाम सर्च कर सकते हैं और पैराग्राफ़ कॉपी कर सकते हैं। स्कैन किए डॉक्यूमेंट में पेज की एक फ़ोटो होती है। उसमें पिक्सेल के सिवा कुछ नहीं होता, ठीक वैसे ही जैसे किसी साइनबोर्ड की फ़ोटो में पिक्सेल के सिवा कुछ नहीं होता।
हर लक्षण इसी एक तथ्य से निकलता है। सर्च में कुछ नहीं मिलता क्योंकि मिलाने को कुछ है ही नहीं। टेक्स्ट सिलेक्ट नहीं होता क्योंकि सिलेक्ट करने को टेक्स्ट नहीं है — कर्सर उसकी जगह तस्वीर पर एक आयत बना देता है। कॉपी करने पर कुछ नहीं मिलता। अपनी लंबाई के हिसाब से फ़ाइल बड़ी होती है, क्योंकि इमेज भारी होती हैं और शब्द नहीं। और इसे Word में बदलने पर या तो ख़ाली डॉक्यूमेंट मिलता है या उसमें चिपकाई एक तस्वीर।
जल्दी से जांचने का तरीक़ा: माउस से कोई एक शब्द सिलेक्ट करके देखें। अगर टेक्स्ट कर्सर आता है और शब्द हाइलाइट होता है, तो असली टेक्स्ट है। अगर एक डिब्बा बनता है, तो वह तस्वीर है।
OCR असल में क्या जोड़ता है
ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) तस्वीर में बनी आकृतियों को पढ़ता है और पता लगाता है कि वे कौन-से अक्षर हैं। काम का हिस्सा उसके बाद होता है: पहचाने गए शब्द PDF में वापस अदृश्य टेक्स्ट के रूप में, इमेज के शब्दों के ठीक ऊपर लिखे जाते हैं। पेज बिल्कुल पहले जैसा दिखता है, क्योंकि दिखने में कुछ नहीं बदला — लेकिन अब उसमें सर्च, सिलेक्ट, कॉपी और इंडेक्स किया जा सकता है।
यह जान-बूझकर रखा गया सावधान डिज़ाइन है, और डॉक्यूमेंट के लिए यही सही है। कुछ भी दोबारा टाइपसेट नहीं होता, इसलिए कॉन्ट्रैक्ट अब भी वही कॉन्ट्रैक्ट दिखता है जिस पर हस्ताक्षर हुए थे, और ओरिजिनल स्कैन ही दिखने वाला रिकॉर्ड बना रहता है। स्कैन की गई PDF को सर्च करने लायक बनाना यह एक ही बार में करता है, और आम तौर पर पेजों को सीधा और सही दिशा में भी घुमा देता है, क्योंकि पढ़ने के लिए यह वैसे भी ज़रूरी था।
अगर आपको सर्च करने लायक नहीं, बल्कि एडिट होने वाला डॉक्यूमेंट चाहिए, तो वह अलग और कहीं ज़्यादा मुश्किल काम है: टेक्स्ट निकालना होता है, लेआउट का अनुमान लगाना होता है, और नतीजे को पैराग्राफ़ और टेबल के रूप में दोबारा बनाना होता है। Word में बदलना यही करता है, और उसके नतीजे को हमेशा ऐसी जांच की ज़रूरत होती है जो टेक्स्ट लेयर को नहीं होती।
वह सेटिंग जो सब कुछ तय करती है: 300 DPI
पहचान की सटीकता सॉफ़्टवेयर से कहीं ज़्यादा स्कैन पर निर्भर करती है, और सबसे अहम आंकड़ा रिज़ॉल्यूशन है। 300 DPI मानक है, और यह मनमाना नहीं है — इससे आम बॉडी टेक्स्ट की ऊंचाई में लगभग 30 पिक्सेल आते हैं, जो मिलते-जुलते अक्षरों को अलग पहचानने के लिए ज़रूरी न्यूनतम से आराम से ज़्यादा है।
150 DPI पर सटीकता साफ़ तौर पर गिरती है, और ग़लतियां धोखेबाज़ क़िस्म की होती हैं: 1 को l पढ़ना, 5 को S, rn को m। उससे नीचे यह तेज़ी से बिगड़ती है। 300 से ऊपर जाने से शायद ही फ़ायदा होता है और फ़ाइलें बहुत बड़ी हो जाती हैं — 600 DPI सिर्फ़ बहुत छोटी छपाई या ख़राब ओरिजिनल के लिए फ़ायदेमंद है।
कैप्चर की तीन और सेटिंग लगभग उतनी ही अहम हैं। ब्लैक-एंड-व्हाइट के बजाय ग्रेस्केल, क्योंकि सख़्त थ्रेशोल्ड अक्षरों के पतले हिस्से मिटा देता है। सेंसर के सामने सपाट और सीधा, क्योंकि तिरछे कोण से खींचे गए पेज पर अक्षरों की आकृति पूरे पेज में बदलती जाती है। और एक जैसी रोशनी — सबसे आम ग़लती है ऊपर से फ़ोटो खींचते समय पेज पर आपकी अपनी परछाईं पड़ना।
जो कोई OCR नहीं पढ़ेगा
इस बारे में ईमानदार रहने से बहुत समय बचता है। जुड़ी हुई (कर्सिव) लिखावट को आम OCR नहीं पहचानता, और इसकी वजह मेहनत की कमी नहीं, बल्कि बनावट है: छपा हुआ टेक्स्ट पढ़ना अक्षरों के बीच की सीमाएं ढूंढकर काम करता है, और कर्सिव में कोई सीमा होती ही नहीं। हाथ से अलग-अलग लिखे अक्षर, कैपिटल अक्षर और फ़ॉर्म के खाने अक्सर अच्छे से पढ़े जाते हैं, क्योंकि वे बीच में जगह वाली अलग-अलग आकृतियां हैं।
जो टेक्स्ट किसी फ़ोटो का हिस्सा है — साइनबोर्ड पर, किसी प्रोडक्ट पर, भरे-पूरे बैकग्राउंड पर लिखे शब्द — वह काग़ज़ के टेक्स्ट से कहीं ज़्यादा मुश्किल है, और बहुत स्टाइल वाली या सजावटी लिखावट और भी मुश्किल। फ़ोटोकॉपी की फ़ोटोकॉपी में वे पतली रेखाएं खो जाती हैं जो अक्षरों को अलग पहचान देती हैं। और जिस डॉक्यूमेंट पर मुहर, नोट या हाइलाइट लगे हों, वह वहां ख़राब पढ़ा जाता है जहां ये निशान टेक्स्ट पर पड़ते हैं।
अच्छा टूल बताता है कि वह कितना आश्वस्त था, और वह आंकड़ा इस्तेमाल करने के लिए ही है। ऐसे वाक्य के बीच में कम आश्वस्ति, जिसे आप संदर्भ से पढ़ सकते हैं, खाता नंबर के किसी अंक पर कम आश्वस्ति से कहीं कम मायने रखती है। ख़तरनाक ग़लतियां वे हैं जिन पर टूल आश्वस्त था, क्योंकि उन पर कुछ भी ध्यान नहीं दिलाता।
यह सुविधा से आगे क्यों मायने रखता है
बिना टेक्स्ट लेयर वाला स्कैन आर्काइव व्यावहारिक रूप से खोया हुआ है। उसमें कुछ भी सर्च नहीं हो सकता, कुछ भी उसे इंडेक्स नहीं कर सकता, कोई कम्प्लायंस सिस्टम उसमें कोई नाम नहीं ढूंढ सकता, और कोई स्क्रीन रीडर उसे पढ़कर नहीं सुना सकता — जिसकी वजह से कई क़ानूनी क्षेत्रों में उसे प्रकाशित करना असुविधा नहीं, बल्कि क़ानूनी समस्या बन जाता है।
इसीलिए पहली बार में ही सही सेटिंग पर स्कैन करने पर ज़ोर देना फ़ायदेमंद है। डॉक्यूमेंट का पूरा डिब्बा दोबारा स्कैन करना, एक बार ठीक से स्कैन करने से कहीं महंगा है, और कितनी भी प्रोसेसिंग उस बारीकी को वापस नहीं ला सकती जो कभी कैप्चर ही नहीं हुई।
अक्सर पूछे जाने वाले सवाल
OCR असल में कितना सटीक है?
आम छपे टेक्स्ट के साफ़ 300 DPI स्कैन पर बहुत सटीक — इतना कि ग़लतियां रोज़ की बात नहीं, कभी-कभार होती हैं। ख़राब रोशनी में तिरछे कोण से खींची फ़ोन फ़ोटो पर कहीं ज़्यादा बुरा। सॉफ़्टवेयर के चुनाव से कहीं ज़्यादा स्कैन की क्वालिटी मायने रखती है।
क्या OCR से मेरा डॉक्यूमेंट दिखने में बदल जाएगा?
नहीं। पहचाना गया टेक्स्ट मौजूदा इमेज के ऊपर अदृश्य रूप से जोड़ा जाता है, इसलिए पेज बिल्कुल पहले जैसा दिखता है। प्रोसेस के दौरान पेज आम तौर पर सीधे और सही दिशा में कर दिए जाते हैं, जिससे टेढ़े स्कैन अलग नहीं, बेहतर दिखते हैं।
क्या OCR चलाने के बाद मैं टेक्स्ट एडिट कर सकता हूं?
PDF में ही नहीं — दिखने वाला पेज अब भी एक तस्वीर है, और टेक्स्ट लेयर उसके ऊपर अदृश्य रूप से रहती है। एडिट होने वाली फ़ाइल के लिए, पहचाने गए डॉक्यूमेंट को Word में बदलें, और नतीजे की जांच करने के लिए तैयार रहें।
क्या OCR हाथ की लिखावट पर काम करता है?
हाथ से अलग-अलग लिखे अक्षर और भरे हुए फ़ॉर्म अक्सर काम करते हैं। जुड़ी हुई लिखावट किसी भी आम OCR टूल में काम नहीं करती — अक्षर आपस में मिले होते हैं और ढूंढने को कोई सीमा नहीं होती। ख़ास तौर पर लिखावट पर ट्रेन किए गए टूल बेहतर करते हैं, लेकिन इसके बदले आपके पेज किसी तीसरे पक्ष को भेजे जाते हैं।
मेरी सर्च करने लायक PDF इतनी बड़ी क्यों हो गई?
साइज़ मुश्किल से बदलना चाहिए — टेक्स्ट लेयर हर पेज पर कुछ किलोबाइट की होती है। अगर यह बहुत बढ़ गया, तो शायद पेज जैसे के तैसे रखने के बजाय दोबारा रेंडर किए गए, और यह जांचने लायक है, क्योंकि टेक्स्ट लेयर का पूरा मतलब ही यह है कि ओरिजिनल इमेज बिना छुए सुरक्षित रहे।