PDF को HTML में बदलें
PDF को एक ऐसी HTML फ़ाइल में बदलें जो मूल जैसी दिखे और जिसे किसी और चीज़ की ज़रूरत न हो — न स्टाइलशीट, न फ़ॉन्ट, न इमेज का फ़ोल्डर।
- कभी स्टोर नहीं होती
- न कतार, न इंतज़ार
- साइनअप नहीं, वॉटरमार्क नहीं
यह कैसे काम करता है
अपनी PDF जोड़ें
वह डॉक्यूमेंट छोड़ें जिसे आप वेब पेज के रूप में चाहते हैं।
कन्वर्ट करें
हर पेज को उसके आर्टवर्क और टेक्स्ट के साथ एक तय जगह पर रखे ब्लॉक के रूप में दोबारा बनाया जाता है।
डाउनलोड करें
एक ही .html फ़ाइल, जिसे आप जैसी है वैसी ही खोल, होस्ट या ईमेल कर सकते हैं।
एक फ़ाइल, कोई निर्भरता नहीं, तय लेआउट
नतीजा एक अकेली .html फ़ाइल होती है, जिसके साथ और कुछ नहीं होता। हर तस्वीर data URI के रूप में अंदर डाली जाती है, स्टाइलशीट head में होती है, और कोई फ़ॉन्ट कहीं से नहीं मंगाया जाता — इसलिए पेज बिना इंटरनेट वाली मशीन पर भी बिल्कुल एक जैसा खुलता है, और HTML एक्सपोर्ट का यही एक रूप काम का है। इसकी क़ीमत सीधा हिसाब है: बाइनरी इमेज डेटा को टेक्स्ट के रूप में एन्कोड करने से वह लगभग एक-तिहाई बड़ा हो जाता है, इसलिए स्कैन की 10 MB की PDF लगभग 14 MB की HTML बनती है, और ब्राउज़र को कुछ भी दिखाने से पहले यह सब पार्स करना होता है।
लेआउट तय है, रिस्पॉन्सिव नहीं, और यह कोई चूक नहीं, सोचा-समझा फ़ैसला है। हर पेज PDF के सटीक आयामों (पॉइंट में) वाला एक बॉक्स है, और टेक्स्ट की हर लाइन अपने मूल निर्देशांकों पर absolute पोज़िशन वाला span है, जिसमें उसका साइज़ और रंग भी साथ आता है। कुछ भी कभी नहीं ढलता — फ़ोन पर आपको पढ़ने लायक टेक्स्ट का कॉलम नहीं, पूरा पेज छोटा करके मिलता है। प्रिंट स्टाइलशीट शामिल है, इसलिए HTML प्रिंट करने पर पेज मूल पेज-सीमाओं पर साफ़-साफ़ टूटते हैं।
क्योंकि फ़ाइल के साथ कोई फ़ॉन्ट नहीं जाता, टेक्स्ट पढ़ने वाले की मशीन में मौजूद Helvetica या Arial में दिखता है। साइज़ और जगह सही होती है, अक्षरों की बनावट नहीं, इसलिए कोई लाइन अपने पीछे के आर्टवर्क से थोड़ी चौड़ी जा सकती है। एक काम की तरकीब जानने लायक है: जब किसी पेज के शब्द असली टेक्स्ट नहीं बल्कि ड्रॉ किए गए आर्टवर्क का हिस्सा हों, तब भी टेक्स्ट लेयर लिखी जाती है, पर पारदर्शी — ताकि पेज सिलेक्ट और सर्च होने लायक बना रहे और शब्द दो बार न दिखें।
PDF के अंदर के लिंक anchor नहीं, सादे टेक्स्ट के रूप में आते हैं, हेडिंग heading एलिमेंट नहीं, पोज़िशन किए गए span के रूप में आती हैं, और पढ़ने का कोई ख़ास क्रम नहीं होता। नतीजा एक डॉक्यूमेंट की सटीक तस्वीर है जो संयोग से HTML से बनी है — यह संरचित, सिमैंटिक मार्कअप नहीं है, और इसे वहां इस्तेमाल नहीं करना चाहिए जहां स्क्रीन रीडर या सर्च इंजन को इसका मतलब समझना हो।
जब आपको कुछ और चाहिए
pdf2htmlEX वह टूल है जो यह काम ठीक से करता है। यह PDF के अपने फ़ॉन्ट निकालकर वेब फ़ॉन्ट के रूप में एम्बेड करता है, इसलिए टेक्स्ट सिर्फ़ सही जगह पर नहीं, सही टाइपफ़ेस और सही चौड़ाई में भी होता है, और यह पेज को तस्वीर में समेटने की जगह वेक्टर आर्टवर्क को वेक्टर के रूप में ही दोबारा बनाता है। नतीजा कहीं ज़्यादा सटीक और कहीं ज़्यादा जटिल होता है। Poppler का pdftohtml -s -c in.pdf out.html झटपट वाला बीच का रास्ता है।
अगर आपको असल में पेज की तस्वीर नहीं, बल्कि वेब पेज चाहिए — जो फ़ोन पर ढले, जिसे Google पढ़ सके, जिसमें स्क्रीन रीडर घूम सके — तो कोई भी PDF-से-HTML कन्वर्टर यह नहीं दे सकता, क्योंकि उसके लिए ज़रूरी संरचना PDF बनाते समय ही फेंक दी गई थी। फ़्लोइंग मोड में Word में बदलें और वहां से एक्सपोर्ट करें, या उस मूल फ़ाइल पर वापस जाएं जिससे PDF प्रिंट हुई थी।
अक्सर पूछे जाने वाले सवाल
क्या यह सच में एक ही फ़ाइल है?
हां। हर इमेज data URI के रूप में अंदर ही डाली जाती है और स्टाइल फ़ाइल में ही होते हैं, इसलिए साथ रखने के लिए कोई एसेट फ़ोल्डर नहीं होता और यह इंटरनेट के बिना भी बिल्कुल एक जैसी खुलती है।
क्या टेक्स्ट सिलेक्ट हो सकता है?
हां। टेक्स्ट आर्टवर्क के ऊपर सही जगह पर रखे असली HTML टेक्स्ट के रूप में लिखा जाता है, इसलिए उसे सिलेक्ट किया जा सकता है, खोजा जा सकता है और स्क्रीन रीडर पढ़ सकता है।
क्या फ़ोन पर यह स्क्रीन के हिसाब से ढलेगा?
नहीं, और यही ईमानदार सौदा है: हर पेज अपना सटीक लेआउट रखता है, इसलिए नतीजा रिस्पॉन्सिव वेबसाइट जैसा नहीं, PDF जैसा दिखता है। अगर आपको स्क्रीन के हिसाब से ढलने वाला टेक्स्ट चाहिए, तो PDF को Word में बदलें या PDF को टेक्स्ट में बदलें इस्तेमाल करें।
क्या मेरी PDF कहीं स्टोर होती है?
नहीं। किसी भी चरण में कुछ भी स्टोर नहीं किया जाता।
क्या मैं इसे प्रिंट कर सकता हूं?
हां — इसमें प्रिंट स्टाइलशीट शामिल है, ताकि हर पेज स्क्रीन वाली परछाइयों के बिना अपनी अलग शीट पर प्रिंट हो।
ध्यान दें: लेआउट रिस्पॉन्सिव नहीं, तय होता है: पेज अपने सटीक आयाम रखते हैं और छोटी स्क्रीन पर नहीं ढलते। पेज का आर्टवर्क रास्टर इमेज के रूप में एम्बेड होता है, इसलिए बहुत बड़े डॉक्यूमेंट से बड़ी HTML फ़ाइलें बनती हैं। PDF के अंदर के लिंक सादा टेक्स्ट बन जाते हैं।
यह टूल अपनी वेबसाइट पर लगाएं
किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।
और PDF टूल्स
HTML को PDF में बदलें
मार्कअप से PDF, बिल्कुल वैसा जैसा ब्राउज़र प्रिंट करता है
PDF को टेक्स्ट में बदलें
प्लेन टेक्स्ट, जिसे कॉपी और एडिट कर सकें
PDF को Word में बदलें
एडिट होने वाली .docx में, स्कैन के लिए OCR के साथ
PDF को PDF/A में बदलें
लंबे समय तक सहेजने के लिए आर्काइव फ़ॉर्मैट
PDF को Excel में बदलें
टेबल को असली स्प्रेडशीट में
PDF को PowerPoint में बदलें
किसी भी PDF से एडिट होने वाली स्लाइड