बांग्ला PDF को Word में बदलें
कोई बांग्ला PDF — परिपत्र, फ़ॉर्म, किताब का अध्याय, स्कैन — ऐसी .docx में जिसे आप एडिट कर सकें, संयुक्ताक्षर और स्वर-चिह्न सही क्रम में, और स्कैन किए पेजों के लिए OCR बांग्ला पर सेट। कुछ भी स्टोर नहीं किया जाता।
- कभी स्टोर नहीं होती
- न कतार, न इंतज़ार
- साइनअप नहीं, वॉटरमार्क नहीं
यह कैसे काम करता है
अपनी PDF जोड़ें
टेक्स्ट PDF या स्कैन। टूल पहला पेज देखता है और स्कैन के लिए OCR चालू कर देता है; रीडर पहले से बांग्ला पर सेट है।
मोड चुनें
“एडिट होने वाला टेक्स्ट” एक सामान्य Word डॉक्यूमेंट देता है, पेज-दर-पेज। “हूबहू रूप” हर लाइन को पेज की तस्वीर के ऊपर ठीक उसी जगह टिका देता है, एडिट के बजाय प्रिंट के लिए।
बदलें और डाउनलोड करें
यूनिकोड बांग्ला फ़ॉन्ट में एक .docx, हेडिंग, पैराग्राफ़, इमेज और लिंक के साथ।
बांग्ला PDF में अलग क्या है
पुनर्क्रम ही सारी बात है। PDF की टेक्स्ट लेयर ग्लिफ़ को बनाने के क्रम में रखती है, और बांग्ला शेपिंग इंजन व्यंजन से पहले आने वाले स्वर-चिह्न (ি, ে, ৈ) को व्यंजन से पहले बनाता है और ো और ৌ को उसके दोनों तरफ़ दो ग्लिफ़ में बांट देता है; इसलिए सादे एक्सट्रैक्टर से निकला टेक्स्ट “স্ব␃াভািবক” होता है, जहां पेज पर “স্বাভাবিক” लिखा है। कुछ और करने से पहले हर लाइन को तार्किक क्रम में वापस रखा जाता है — स्वर-चिह्न अपने समूह के बाद, रेफ র্ के रूप में उस समूह से पहले जिस पर वह बैठता है, दो हिस्सों वाले स्वर एक कोड पॉइंट के रूप में। OCR के आउटपुट को इसकी ज़रूरत नहीं, क्योंकि इंजन पहले से तार्किक क्रम में ही देता है।
हेडिंग, पैराग्राफ़, लिंक, इमेज और पेज ब्रेक ठीक वैसे ही तय किए जाते हैं जैसे सामान्य “PDF को Word में बदलें” पेज पर: एक ही बेसलाइन वाले शब्द एक लाइन हैं, बढ़ता फ़ासला नया पैराग्राफ़ शुरू करता है, बॉडी साइज़ के 1.6 गुना पर छोटी लाइन हेडिंग है, और लिंक एनोटेशन Word हाइपरलिंक बन जाता है। “हूबहू रूप” पेज का आर्टवर्क 144 DPI पर रेंडर करता है और उसके ऊपर असली टेक्स्ट रखता है; “एडिट होने वाला टेक्स्ट” पढ़ने के क्रम में साफ़ पैराग्राफ़ दोबारा बनाता है।
बांग्ला अंक बांग्ला अंक ही रहते हैं, और पेज पर लैटिन शब्द — ईमेल पता, रेफ़रेंस नंबर — लैटिन ही रहता है। स्कैन के लिए बांग्ला पैक ही लोड होता है, इसलिए अंग्रेज़ी लेटरहेड वाला बांग्ला पेज बांग्ला को सही पढ़ता है और लेटरहेड को बांग्ला जैसे बेतुके टेक्स्ट की तरह पढ़ सकता है; अगर अंग्रेज़ी मायने रखती है तो भाषा सूची में अंग्रेज़ी जोड़ें।
जब आपको कुछ और चाहिए
Word फ़ाइल से बनी PDF एक ऐसा पुनर्निर्माण है जो होने का इंतज़ार कर रहा है; हो सके तो .docx मांग लें। और Bijoy .docx को PDF में प्रिंट करके वापस बदलने से बेहतर है उसे “Bijoy को यूनिकोड में बदलें” से कन्वर्ट करना — कीस्ट्रोक एक भी ग़लती के बिना बदलते हैं, फ़ॉर्मैटिंग बची रहती है, और कुछ भी पिक्सेल से दोबारा नहीं पढ़ा जाता।
स्कैन की गई बांग्ला किताबों के आर्काइव के लिए बांग्ला मॉडल वाला डेस्कटॉप OCR टूल रात भर में पूरा फ़ोल्डर पढ़ लेता है, और OCRmyPDF हर PDF में उसका रूप बदले बिना सर्च होने वाली लेयर जोड़ देता है — सैकड़ों फ़ाइलों के लिए सही आकार का टूल वही है, जहां यह पेज एक के लिए है।
अक्सर पूछे जाने वाले सवाल
क्या मेरी PDF स्टोर होती है?
नहीं। कुछ भी स्टोर नहीं किया जाता; फ़ाइल कभी रखी नहीं जाती। स्कैन के लिए रीडर और बांग्ला पैक एक बार इसी साइट से आते हैं और अगली बार के लिए रख लिए जाते हैं — डॉक्यूमेंट ख़ुद कहीं नहीं जाता।
PDF से निकली बांग्ला की स्पेलिंग आम तौर पर ग़लत क्यों होती है?
क्योंकि PDF ग्लिफ़ को उसी क्रम में रखती है जिसमें वे बनाए जाते हैं, और बांग्ला के लिए वह दिखने का क्रम है: इ-कार उस व्यंजन से पहले बनाया जाता है जिसके बाद वह आता है, और ো के दो हिस्से उसके दोनों तरफ़ बैठते हैं। ज़्यादातर कन्वर्टर उस क्रम को जैसे का तैसा कॉपी कर देते हैं, इसलिए বাংলাদেশ के स्वर-चिह्न ग़लत अक्षरों के आगे आ जाते हैं और हर शब्द की स्पेलिंग ऐसी ग़लत होती है जिसे कोई स्पेल-चेकर ठीक नहीं कर सकता। यह कन्वर्टर चिह्नों को वहां वापस रखता है जहां यूनिकोड उन्हें चाहता है — वही पुनर्क्रम जो हर बांग्ला PDF को चाहिए, इस साइट पर बनी PDF को भी।
क्या यह Bijoy डॉक्यूमेंट से बनी PDF संभाल लेता है?
अगर PDF में SutonnyMJ की टेक्स्ट लेयर है, तो टेक्स्ट Bijoy कीस्ट्रोक के रूप में निकलता है, क्योंकि फ़ाइल में वही है; नतीजे को “Bijoy को यूनिकोड में बदलें” से गुज़ारें और फ़ॉर्मैटिंग बची रहती है। अगर PDF स्कैन है, तो OCR तस्वीर पढ़ता है और सीधे यूनिकोड देता है।
बांग्ला स्कैन पर OCR कितना अच्छा है?
छपी बांग्ला के साफ़ 300 dpi स्कैन अच्छे पढ़े जाते हैं; फीकी फ़ोटोकॉपी और फ़ोन की फ़ोटो में संयुक्ताक्षर खो जाते हैं। इस पेज पर भाषा बांग्ला पर तय है, इसलिए कोई लैटिन लेटरहेड या रेफ़रेंस नंबर रीडर को पूरे पेज के लिए अंग्रेज़ी की तरफ़ नहीं धकेल सकता। टेढ़े स्कैन हुए पेज पहले सीधे किए जाते हैं।
मुझे कौन-सा Word फ़ॉर्मैट मिलता है?
एक स्टैंडर्ड .docx, यूनिकोड बांग्ला फ़ॉन्ट में सेट, जो Word, Google Docs और LibreOffice में खुलती है। टेक्स्ट असली यूनिकोड है: सर्च होने वाला, और Avro या Ridmik से टाइप करने लायक।
टेबल और फ़ॉर्म का क्या?
स्कैन में लाइनों वाले फ़ॉर्म “एडिट होने वाला टेक्स्ट” मोड में असली Word टेबल बनकर आते हैं। टेक्स्ट PDF की टेबल जगह पर रखे टेक्स्ट के रूप में आती हैं, जैसे हर PDF-से-Word कन्वर्टर में — स्प्रेडशीट के लिए “PDF को Excel में बदलें” बेहतर टूल है।
ध्यान दें: फ़ॉन्ट बदल जाते हैं: .docx में यूनिकोड बांग्ला फ़ॉन्ट इस्तेमाल होता है, PDF का अपना नहीं, इसलिए रूप एक जैसा नहीं, मिलता-जुलता होता है। Bijoy फ़ॉन्ट में सेट टेक्स्ट PDF Bijoy कीस्ट्रोक के रूप में कन्वर्ट होती हैं और बाद में “Bijoy को यूनिकोड में बदलें” कन्वर्टर चाहिए। OCR फ़ोटो और लोगो को अनदेखा करता है, हाथ की लिखावट को तस्वीर ही रहने देता है, और हर पेज पर कुछ सेकंड लेता है, क्योंकि पढ़ने का काम आपका अपना डिवाइस करता है।
यह टूल अपनी वेबसाइट पर लगाएं
किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।
मिलते-जुलते टूल्स
PDF को Word में बदलें
एडिट होने वाली .docx में, स्कैन के लिए OCR के साथ
बांग्ला OCR
फ़ोटो या स्कैन से बांग्ला टेक्स्ट पढ़ें
Bijoy को यूनिकोड में बदलें
SutonnyMJ टेक्स्ट को असली बांग्ला में पढ़ें
PDF को टेक्स्ट में बदलें
प्लेन टेक्स्ट, जिसे कॉपी और एडिट कर सकें
PDF को Excel में बदलें
टेबल को असली स्प्रेडशीट में
PDF को PowerPoint में बदलें
किसी भी PDF से एडिट होने वाली स्लाइड