PDF को सही तरीक़े से रिडैक्ट कैसे करें
टेक्स्ट पर काला आयत रिडैक्शन नहीं है। शब्द फ़ाइल में अब भी मौजूद हैं, और कोई भी उन्हें करीब चार सेकंड में पढ़ सकता है। असल में यह काम करता है, और इस तरह जांचें कि काम हुआ या नहीं।
आख़िरी समीक्षा
ग़लती, और यह बार-बार क्यों होती है
PDF पेज एक ड्रॉइंग प्रोग्राम है। टेक्स्ट ख़ास अक्षरों को ख़ास जगहों पर रखने का एक निर्देश है, और काला आयत एक हिस्से को भरने का दूसरा निर्देश। आयत बनाने से टेक्स्ट हटता नहीं — वह उसके ऊपर बन जाता है। अक्षर फ़ाइल में अब भी नीचे मौजूद हैं, और उस हिस्से को सिलेक्ट करके उन्हें कॉपी किया जा सकता है। कोई भी मुफ़्त टूल उन्हें सेकंडों में निकाल लेता है।
यह बार-बार इसलिए होता है क्योंकि इंटरफ़ेस बताता है कि काम हो गया। आप डिब्बा बनाते हैं, शब्द नज़र से गायब हो जाते हैं, आप फ़ाइल सेव करते हैं, और वह बिल्कुल रिडैक्ट किए डॉक्यूमेंट जैसी दिखती है। न कोई एरर, न कोई चेतावनी, और सही रिडैक्शन से कोई दिखने वाला फ़र्क़ नहीं। रिडैक्शन की हर सार्वजनिक नाकामी जिसके बारे में आपने पढ़ा है — बिना रिडैक्ट हुए अदालती दस्तावेज़, समझौते की रक़म, गवाहों के नाम, एक ख़ुफ़िया रिपोर्ट जिसके हटाए हिस्से मिनटों में वापस निकाल लिए गए — किसी के एक आकृति बनाकर उस पर भरोसा कर लेने से हुई।
टेक्स्ट को काले रंग से हाइलाइट करना भी वही ग़लती है, बस दूसरे रूप में, और एक्सपोर्ट करने से पहले वर्ड प्रोसेसर में उसे सफ़ेद आयत से ढकना भी।
असली रिडैक्शन क्या करता है
क्रम उल्टा होता है। पहले टेक्स्ट पेज के कंटेंट से डिलीट किया जाता है, और काला डिब्बा बाद में यह दिखाने के लिए बनाया जाता है कि वहां कभी कुछ था। रिडैक्ट किए हिस्से को कॉपी करें तो कुछ नहीं मिलता, क्योंकि वहां कुछ है ही नहीं; पेज का टेक्स्ट निकालें तो शब्द मौजूद ही नहीं होते।
यहां PDF रिडैक्ट करना यही करता है, और बताता है कि उसने टेक्स्ट के कितने टुकड़े हटाए — यह मायने रखता है, क्योंकि जिस रिडैक्शन से कुछ मेल नहीं खाया वह बिल्कुल सफल रिडैक्शन जैसा दिखता है। अगर आपने किसी नाम पर डिब्बा बनाया और कुछ नहीं हटा, तो वह नाम शायद टेक्स्ट नहीं, किसी इमेज का हिस्सा है, और उसके लिए अगला पैराग्राफ़ देखें।
तस्वीरों में टेक्स्ट एक अलग समस्या है
स्कैन किए पेज के अंदर का नाम, या किसी रिपोर्ट में चिपकाए स्क्रीनशॉट में लिखा नाम, टेक्स्ट है ही नहीं — वह पिक्सेल है। टेक्स्ट डिलीट करना उसे छू नहीं सकता, और उस पर बनाया डिब्बा ठीक वही बेअसर ढक्कन है जिसका ऊपर ज़िक्र है, क्योंकि नीचे के पिक्सेल इमेज डेटा में बने रहते हैं।
हल है उन पेजों को रिडैक्शन लागू करके दोबारा रेंडर करना, ताकि वे पिक्सेल सच में मौजूद न रहें। इसकी एक असली क़ीमत है जो जानने लायक है: वे पेज तस्वीरें बन जाते हैं, इसलिए उन पर का कोई भी टेक्स्ट सिलेक्ट होना बंद हो जाता है और फ़ाइल बड़ी हो जाती है। स्कैन किए डॉक्यूमेंट के लिए इससे कुछ नहीं बदलता, क्योंकि वह पहले से तस्वीरें था। मिले-जुले डॉक्यूमेंट के लिए यह एक सौदा है।
आम तौर पर इमेज पर भी यही लागू होता है। अगर आप किसी चेहरे या नंबर प्लेट को ब्लर कर रहे हैं, तो इतना तेज़ ब्लर करें कि उस हिस्से में कोई दिखने वाली बनावट न बचे — शोधकर्ताओं ने कमज़ोर पिक्सेलेशन से संभावित टेक्स्ट बनाकर और उनका मिलान करके असली टेक्स्ट दोबारा हासिल किया है। अगर आप अब भी अंदाज़ा लगा सकते हैं कि वहां कितने अक्षर थे, तो ब्लर काफ़ी तेज़ नहीं है।
PDF किन जगहों पर वे नाम रखती है जो आप भूल गए
यही वह हिस्सा है जिसमें वे लोग भी फंसते हैं जिन्होंने रिडैक्शन सही किया था। PDF दिखने वाले पेज के अलावा कई और जगहों पर टेक्स्ट स्टोर करती है, और पेज का बिल्कुल सही रिडैक्शन उन सभी जगहों को जस का तस छोड़ देता है।
बुकमार्क की रूपरेखा में अक्सर ऐसे सेक्शन टाइटल होते हैं जिनमें नाम होते हैं। फ़ॉर्म फ़ील्ड की वैल्यू फ़ील्ड के न दिखने पर भी बनी रहती हैं। फ़ाइल अटैचमेंट PDF के अंदर छिपे पूरे के पूरे डॉक्यूमेंट हो सकते हैं। डॉक्यूमेंट की जानकारी और XMP मेटाडेटा पैकेट में टाइटल, लेखक, सॉफ़्टवेयर और अक्सर ओरिजिनल फ़ाइल पाथ होता है — जिससे यूज़रनेम और फ़ोल्डर की बनावट पता चल जाती है। कमेंट और एनोटेशन का अपना टेक्स्ट और उनके लेखक का नाम होता है। और फ़ाइल का नाम ख़ुद डॉक्यूमेंट के साथ हर जगह जाता है।
एक और जगह है, और वह सबसे बारीक है: इंक्रीमेंटल तरीक़े से सेव की गई PDF अपने पुराने रिविज़न उसी फ़ाइल के अंदर रखती है। अगर किसी डॉक्यूमेंट को दोबारा लिखने के बजाय एडिट करके सेव किया गया था, तो किसी पेज का पिछला वर्शन अब भी उसमें हो सकता है। इसीलिए नीचे की जांच किसी भी अहम चीज़ के लिए वैकल्पिक नहीं है।
जांचें, और कैसे
जांच वह क़दम है जिसे लोग छोड़ देते हैं, और वही असल में आपको बचाता है। तीन जांचें, बढ़ती गहराई के क्रम में।
नतीजा खोलें और रिडैक्ट किए हिस्से को सिलेक्ट करके देखें। अगर कुछ भी कॉपी हो जाए, तो रुकें। यह पांच सेकंड में बुनियादी नाकामी पकड़ लेता है और हर बार करने लायक है।
डॉक्यूमेंट की प्रॉपर्टी देखें। टाइटल, लेखक, विषय और कीवर्ड किसी भी PDF रीडर में File और फिर Properties में दिखते हैं। अगर लेखक वाले फ़ील्ड में वही नाम है जिसे हटाने में आपने अभी एक घंटा लगाया, तो रिडैक्शन से कुछ हासिल नहीं हुआ।
फ़ाइल को दोबारा बनाएं। नतीजे को ऐसे टूल से गुज़ारना जो डॉक्यूमेंट को सिर्फ़ उन चीज़ों से दोबारा लिखता है जिनका उसके पेज असल में हवाला देते हैं — Ghostscript के साथ gs -sDEVICE=pdfwrite, या qpdf --empty --pages out.pdf 1-z -- — बिना हवाले वाले ऑब्जेक्ट और पुराने रिविज़न हटा देता है। exiftool -all:all= जोड़ने से मेटाडेटा साफ़ हो जाता है। अदालती फ़ाइलिंग या खुलासे (disclosure) के दायरे में आने वाली किसी भी चीज़ के लिए, तीनों करें और किसी दूसरे से जांच करवाएं।
पेज डिलीट करना भी रिडैक्शन नहीं है
यह अलग से कहने लायक है, क्योंकि यह उसी तरह की ग़लती है। PDF से पेज हटाना आपके रखे पेजों से एक नया डॉक्यूमेंट बनाता है — लेकिन रखे गए पेज पर कोई लिंक जो डिलीट किए पेज की ओर इशारा करता था, उसे अब भी कहीं पहुंचना होता है, और इस वजह से उस डिलीट किए पेज की एक कॉपी नई फ़ाइल में ऐसे ऑब्जेक्ट के रूप में आ जाती है जिसका कोई पेज ट्री हवाला नहीं देता। हर रीडर में अदृश्य, बाइट में मौजूद।
किसी पेज को नज़र से हटाने के लिए डिलीट करना सही और काफ़ी है। उसके कंटेंट को पूरी तरह मिटाने के लिए, पेज डिलीट करें और ऊपर बताए तरीक़े से फ़ाइल को दोबारा बनाएं।
अक्सर पूछे जाने वाले सवाल
क्या काला डिब्बा कभी ठीक है?
सिर्फ़ असली रिडैक्शन के ऊपर दिखने वाले निशान के रूप में। अकेले में यह शब्दों को सिर्फ़ उस पाठक से छिपाता है जो ध्यान से नहीं देख रहा, और किसी से नहीं। अगर डॉक्यूमेंट प्रकाशित, फ़ाइल या उजागर किया जाएगा, तो सिर्फ़ डिब्बे को बिल्कुल भी रिडैक्शन न मानें।
इसके बजाय PDF को फ़्लैटन करने के बारे में क्या?
फ़्लैटन करना एनोटेशन को पेज में पक्का कर देता है, जिससे बनाया गया डिब्बा आर्टवर्क के रूप में स्थायी हो जाता है — लेकिन उसके नीचे का टेक्स्ट पेज का कंटेंट है, एनोटेशन नहीं, इसलिए वह अब भी वहीं है। फ़्लैटन करना फ़ॉर्म के जवाब और हस्ताक्षर पक्के करने का सही टूल है, शब्द छिपाने का नहीं।
क्या मैं PDF को इमेज में बदलकर रिडैक्ट कर सकता हूं?
यह काम करता है, इस मायने में कि डिब्बे वाले पेज की तस्वीर के नीचे सच में कोई टेक्स्ट नहीं होता। इसकी क़ीमत असली है: डॉक्यूमेंट सर्च करने लायक नहीं रहता, फ़ाइल बड़ी हो जाती है, और मेटाडेटा आम तौर पर फिर भी साथ चला आता है — इसलिए उसे आपको अलग से साफ़ करना ही होगा।
क्या PDF में प्रिंट करने से छिपा टेक्स्ट हट जाता है?
पेज के कंटेंट के लिए आम तौर पर हां, क्योंकि पेज दोबारा रेंडर होता है — इसीलिए यह कभी-कभी संयोग से काम कर जाता है। यह भरोसेमंद तरीक़ा नहीं है, यह हर मेटाडेटा फ़ील्ड साफ़ नहीं करता, और यह प्रिंटर ड्राइवर पर निर्भर है। ऐसा टूल इस्तेमाल करें जो बताए कि वह क्या हटाता है।
क्या किसी वेबसाइट पर संवेदनशील डॉक्यूमेंट रिडैक्ट करना सुरक्षित है?
इस साइट पर किसी भी समय कुछ भी स्टोर नहीं किया जाता, और यहां रिडैक्शन की सुविधा होने की वजह ही यही है — लोगों को जिन डॉक्यूमेंट को रिडैक्ट करना होता है, वे ठीक वही हैं जो किसी अजनबी के सर्वर पर नहीं पड़े रहने चाहिए। क़ानूनी फ़ाइलिंग के लिए, उतने ही अहम काम के लिए बना सॉफ़्टवेयर इस्तेमाल करें और नतीजा ख़ुद जांचें।