फ़ोटो से बांग्ला पढ़ें
पेज की फ़ोटो, स्कैन या स्क्रीनशॉट दें और बांग्ला टेक्स्ट यूनिकोड में वापस पाएं — सर्च और एडिट होने वाला, पेस्ट के लिए तैयार। फ़ोटो आने से पहले ही रीडर बांग्ला पर सेट होता है, इसलिए न कुछ पहचानना है, न कुछ चुनना। आपकी फ़ोटो कभी स्टोर नहीं होती।
- कभी स्टोर नहीं होती
- न कतार, न इंतज़ार
- साइनअप नहीं, वॉटरमार्क नहीं
यह कैसे काम करता है
फ़ोटो जोड़ें
किताब के पेज की फ़ोटो, कोई पुराना परिपत्र, स्कैन किया सर्टिफ़िकेट या बांग्ला टेक्स्ट का स्क्रीनशॉट। JPG, PNG, WebP, HEIC और TIFF सब चलते हैं; तिरछे कोण से ली गई फ़ोटो पहले सीधी की जाती है।
इसे पढ़ने दें
बांग्ला पहले से चुनी हुई है। अगर पेज पर अंग्रेज़ी भी है — कोई फ़ॉर्म, कोई लेटरहेड — तो उसे सूची से जोड़ें, और दोनों पढ़ी जाती हैं।
यूनिकोड में कॉपी करें
ओरिजिनल चाहे किसी भी फ़ॉन्ट में छपा हो, टेक्स्ट यूनिकोड में निकलता है: SutonnyMJ में छपा परिपत्र सामान्य बांग्ला की तरह पढ़ा जाता है, “evsjv‡`k” की तरह नहीं। लेआउट रखें या लाइनें जोड़ें, फिर कॉपी या डाउनलोड करें।
बांग्ला होने से पढ़ने में क्या बदलता है
बांग्ला मॉडल अक्षर नहीं, अक्षर-समूह पढ़ता है। ক্ষ या ন্ত্র जैसा संयुक्ताक्षर पेज पर एक ही आकार है, और मॉडल को तय करना होता है कि वह क्या है और यूनिकोड में कैसे टूटता है — इसीलिए बांग्ला में ग़लत पढ़ाई का नतीजा आम तौर पर सीधा ग़लत अक्षर नहीं, बल्कि ग़लत संयुक्ताक्षर या ग़लत अक्षर पर लगा स्वर-चिह्न होता है। आउटपुट उसी क्रम में होता है जो यूनिकोड चाहता है: स्वर-चिह्न अपने व्यंजन-समूह के बाद, रेफ उस समूह से पहले র + हसंत के रूप में जिस पर वह बैठता है, और दो हिस्सों वाले स्वर एक कोड पॉइंट के रूप में। यही क्रम हर सर्च बॉक्स, स्पेल-चेकर और फ़ॉन्ट चाहता है, और यह उस दिखने वाले क्रम का ठीक उल्टा है जिसमें Bijoy टाइपिस्ट काम करता है।
सामान्य रीडर जो कुछ करता है, वह सब यहां भी होता है: कागज़ की रोशनी बराबर की जाती है, पेज सीधा किया जाता है, लाइनों वाली टेबल सेल-दर-सेल पढ़ी जाती हैं ताकि लेबल और उसकी वैल्यू अलग रहें, और नतीजा या तो पेज जैसे लेआउट में आता है या पैराग्राफ़ में जुड़ा हुआ। जो नंबर बांग्ला अंकों में छपे हैं, वे बांग्ला अंकों में ही पढ़े जाते हैं; जिस फ़ॉर्म में ০১২ और 012 मिले हुए हैं, उसमें दोनों बने रहते हैं।
बांग्ला का मॉडल किसी और भाषा के साथ साझा नहीं है, लेकिन फ़ोटो में फिर भी अंग्रेज़ी हो सकती है — लेटरहेड, रेफ़रेंस नंबर, हस्ताक्षर का हिस्सा — और एक भाषा दूसरी को बेतुके टेक्स्ट की तरह पढ़ती है। सूची से अंग्रेज़ी जोड़ने पर पेज दोनों पैक से पढ़ा जाता है और हर शब्द उसी लिपि में रहता है जिसमें वह छपा था।
जब आपको कुछ और चाहिए
जो Bijoy डॉक्यूमेंट अब भी फ़ाइल के रूप में मौजूद है, उसकी फ़ोटो खींचने से बेहतर है उसे कन्वर्ट करना। OCR टेक्स्ट को पिक्सेल से दोबारा बनाता है और सबसे अच्छे पेज पर भी हज़ार में कुछ अक्षर ग़लत करता है; “Bijoy को यूनिकोड में बदलें” कन्वर्टर उसे कीस्ट्रोक से दोबारा बनाता है, एक भी ग़लती नहीं करता, और बोल्ड और टेबल बनाए रखता है। पेज की फ़ोटो तभी लें जब फ़ाइल खो गई हो।
पूरी किताब या स्कैन के आर्काइव के लिए डेस्कटॉप टूल ही सही आकार का है: इसी बांग्ला मॉडल वाला कमांड-लाइन OCR टूल रात भर में पूरा फ़ोल्डर पढ़ लेता है, और OCRmyPDF उसकी हर PDF में सर्च होने वाली टेक्स्ट लेयर जोड़ देता है। यह पेज आपके सामने रखे पेज के लिए है।
अक्सर पूछे जाने वाले सवाल
क्या मेरी फ़ोटो कहीं स्टोर होती है?
नहीं। किसी भाषा को पहली बार इस्तेमाल करने पर उसका लैंग्वेज पैक इसी साइट से आता है; फ़ोटो ख़ुद कभी स्टोर नहीं होती और कहीं भेजी नहीं जाती, इसलिए यह Wi-Fi बंद होने पर भी काम करता है।
यह बांग्ला कितनी अच्छी तरह पढ़ता है?
आम टाइपफ़ेस में छपी बांग्ला — SutonnyMJ, Nikosh, Kalpurush, SolaimanLipi, कोई किताब या अख़बार — सीधी और फ़ोकस में खींची गई हो तो अच्छी पढ़ी जाती है; धुंधले या फीके पेज पर कभी-कभार कोई संयुक्ताक्षर ग़लत आता है। ग़लतियां इस लिपि की अपनी तरह की होती हैं: किसी ऐसे अक्षर पर रेफ या स्वर-चिह्न जिसे मॉडल ने उस आकार में नहीं देखा, और छोटे छपे संयुक्ताक्षर। 300 dpi का साफ़ स्कैन फ़ोन की फ़ोटो से बेहतर पढ़ा जाता है, और दिन की रोशनी में ली गई फ़ोन की फ़ोटो ट्यूबलाइट के नीचे ली गई फ़ोटो से बेहतर।
क्या यह Bijoy डॉक्यूमेंट पर काम करता है?
हां, और यह इसके सबसे अच्छे इस्तेमालों में से एक है। OCR अक्षरों की तस्वीर पढ़ता है, फ़ॉन्ट के कोड पॉइंट नहीं, इसलिए SutonnyMJ में टाइप किया पेज सीधे यूनिकोड बांग्ला में निकलता है — किसी कन्वर्ज़न की ज़रूरत नहीं। जो Word फ़ाइल अब भी Bijoy में है (टेक्स्ट, तस्वीर नहीं), उसके लिए “Bijoy को यूनिकोड में बदलें” इस्तेमाल करें, जो फ़ॉर्मैटिंग रखता है और पढ़ने की कोई ग़लती नहीं करता।
बांग्ला के लिए अलग पेज क्यों?
क्योंकि पहचान में समय लगता है और दूसरी लिपियों के मुक़ाबले बांग्ला में यह ज़्यादा बार ग़लत होती है: लैटिन लेटरहेड, मुहर या नंबर वाला पेज अंग्रेज़ी मानकर पढ़ा जा सकता है, और नतीजा पूरे भरोसे वाला बेतुके टेक्स्ट का पेज होता है। फ़ोटो आने से पहले भाषा सेट होने का मतलब है कि पेज खुलते ही बांग्ला पैक डाउनलोड होना शुरू हो जाता है और रीडर कभी ग़लत भाषा का ऑडिशन नहीं लेता। सामान्य “इमेज से टेक्स्ट निकालें” पेज यही काम पहचान चालू रखकर करता है, किसी भी भाषा की फ़ोटो के लिए।
क्या यह हाथ की लिखावट पढ़ सकता है?
अलग-अलग लिखे छपे जैसे अक्षर कभी-कभी; जुड़ी हुई लिखावट नहीं, न बांग्ला में, न किसी और लिपि में — यह हर सामान्य OCR टूल पर लागू होता है। हाथ की लिखावट वाला पेज यह बात साफ़ कहता है और दिखाता है कि वह कितना पढ़ पाया।
स्कैन की गई PDF का क्या?
पूरे डॉक्यूमेंट के लिए “बांग्ला PDF को Word में बदलें” इस्तेमाल करें: यह हर पेज इसी तरह पढ़ता है और आपको .docx देता है। यह पेज एक फ़ोटो के लिए है।
ध्यान दें: सिर्फ़ छपा टेक्स्ट: जुड़ी हुई लिखावट पहचानी नहीं जाती। सजावटी बांग्ला टाइपफ़ेस, तस्वीर के ऊपर लिखा टेक्स्ट और बहुत फीकी छपाई अधूरी निकलती है। असमिया अलग पैक है — पेज असमिया में हो तो उसे सूची से जोड़ें। नतीजा प्लेन टेक्स्ट है: बोल्ड, रंग और फ़ोटो ख़ुद साथ नहीं आते।
यह टूल अपनी वेबसाइट पर लगाएं
किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।
मिलते-जुलते टूल्स
इमेज से टेक्स्ट निकालें
फ़ोटो से शब्द, 120+ भाषाओं में
बांग्ला PDF को Word में बदलें
बांग्ला PDF से एडिट होने वाली .docx, स्कैन हो या न हो
Bijoy को यूनिकोड में बदलें
SutonnyMJ टेक्स्ट को असली बांग्ला में पढ़ें
PDF OCR करें
स्कैन को सर्च करने लायक बनाएं
स्क्रीनशॉट से टेक्स्ट निकालें
स्क्रीनशॉट पेस्ट करें, टेक्स्ट पाएं
हाथ की लिखावट पढ़ें
अलग-अलग लिखे अक्षर, ईमानदारी से पढ़े गए