फ़ोटो से टेक्स्ट निकालें
फ़ोटो, स्कैन या स्क्रीनशॉट से शब्द पढ़ें और उन्हें ऐसे टेक्स्ट के रूप में ले जाएं जिसे आप एडिट, सर्च और पेस्ट कर सकें। फ़ोटो कभी स्टोर नहीं होती।
- कभी स्टोर नहीं होती
- न कतार, न इंतज़ार
- साइनअप नहीं, वॉटरमार्क नहीं
यह कैसे काम करता है
अपनी फ़ोटो जोड़ें
JPG, PNG, WebP, GIF, BMP, iPhone की HEIC या स्कैनर की TIFF। तिरछे कोण से ली गई फ़ोटो को पढ़ने से पहले सीधा किया जाता है और उसकी रोशनी बराबर की जाती है।
भाषा जांचें
फ़ोटो से लिपि पढ़ी जाती है और भाषा आपके लिए चुन ली जाती है। अगर अंदाज़ा ग़लत निकला, या फ़ोटो में एक से ज़्यादा भाषाएं हैं, तो 120 से ज़्यादा भाषाएं उपलब्ध हैं।
कॉपी या डाउनलोड करें
लेआउट बनाए रखें, यानी लाइनें और कॉलम वहीं रहें जहां थे, या लाइनों को जोड़कर बहते हुए पैराग्राफ़ बनाएं जो कहीं और पेस्ट करने के लिए तैयार हों।
फ़ोटो कैसे पढ़ी जाती है
पढ़ने वाले को किस साइज़ की ज़रूरत है, यह फ़ाइल से नहीं बल्कि स्याही से मापा जाता है। टेक्स्ट की एक लाइन की ऊंचाई फ़ोटो से ही आंकी जाती है और सब कुछ ऐसे रीस्केल किया जाता है कि एक लाइन लगभग चौंतीस पिक्सेल की हो — छोटा स्क्रीनशॉट चार गुना तक बड़ा किया जाता है, और बहुत बड़ी फ़ोटो छोटी की जाती है, और दोनों ही सूरतों में सबसे लंबी साइड की एक सीमा होती है। इसीलिए मेन्यू की नौ मेगापिक्सेल वाली फ़ोटो किसी शार्प छोटी फ़ोटो से ज़्यादा सटीक नहीं होती, और इसीलिए जिस फ़ोटो की छोटी साइड लगभग तीन सौ पिक्सेल से कम है, उसमें भाषा की पहचान पूरी तरह छोड़ दी जाती है और उसे लैटिन लिपि मानकर पढ़ा जाता है। इन सबसे पहले, स्याही के पीछे का कागज़ टुकड़ों में आंका जाता है और रोशनी बराबर करने के लिए उसे हटा दिया जाता है, पूरी ऊंचाई में पेज का तिरछापन मापकर उसे सीधा घुमाया जाता है, और नतीजे को एक ही ग्लोबल थ्रेशोल्ड पर ब्लैक एंड व्हाइट में बदला जाता है।
भाषा चुनना सूची में देखना नहीं, एक तरह का ऑडिशन है, क्योंकि आम डिटेक्टर भाषाएं पहचानता ही नहीं। पहला चरण सिर्फ़ लिपि और रोटेशन बताता है, और कुछ नहीं; लिपि से विकल्प कम होते हैं, एक ही लिपि वाली भाषाओं के बीच आपके ब्राउज़र की भाषा सेटिंग्स फ़ैसला करती हैं, और फिर हर उम्मीदवार भाषा से फ़ोटो की एक छोटी कॉपी सच में पढ़ी जाती है और इस आधार पर अंक दिए जाते हैं कि उसने कितने भरोसेमंद शब्द निकाले। जीतने वाली भाषा असली पेज पढ़ती है, और पहचाने गए टेक्स्ट को फिर से जांचा जाता है — मात्राओं और विशेष चिह्नों, ख़ास अक्षर-जोड़ों और आम छोटे शब्दों के लिए — यह देखने को कि कोई दूसरी भाषा बेहतर करेगी या नहीं। “ग़लत भाषा चुनने पर आपको पूरे भरोसे वाला ख़ाली पेज मिलता है” — इस बात के पीछे यही तंत्र है: ऑडिशन ठीक इसीलिए है कि अंदाज़ा बस मान न लिया जाए, बल्कि आपकी फ़ोटो पर परखा जाए।
आउटपुट में क्या पहुंचता है, इसके बारे में एक बात जानने लायक है। जिस पैराग्राफ़ पर पढ़ने वाला आश्वस्त नहीं था, उसे दिखाने के बजाय हटा दिया जाता है, इसलिए जो टेक्स्ट आपको फ़ोटो में दिखता है, वह बेतुके टेक्स्ट के रूप में आने के बजाय नतीजे से पूरी तरह ग़ायब हो सकता है। यही बात उन ब्लॉक पर लागू होती है जिन्हें पढ़ने वाले ने तस्वीर या शोर माना, और उन अकेले निशानों पर भी जिनमें कोई अक्षर या अंक नहीं है। सामान्य कम-भरोसे वाले शब्दों पर कोई कटौती नहीं होती, इसलिए पैराग्राफ़ के अंदर की ग़लत पढ़ाई बनी रहती है और उसे पकड़ना आपका काम है। जब भरोसे का आंकड़ा ठीक-ठाक हो और पेज का कोई हिस्सा बस ग़ायब हो, तो यही हुआ है।
जब आपको कुछ और चाहिए
कुछ भी स्टोर नहीं होता, लेकिन यह साइट का अकेला टूल है जिसमें पहली बार चलाना मुफ़्त नहीं पड़ता: पढ़ने वाला ख़ुद कुछ मेगाबाइट का है और हर लैंग्वेज पैक एक से पांच मेगाबाइट और, जो इसी साइट से आते हैं और फिर अगली बार के लिए रख लिए जाते हैं। एक पेज के लिए इंतज़ार करना ठीक है, पर तय शेड्यूल पर दो हज़ार स्कैन के लिए नहीं — उसके लिए OCRmyPDF जैसा डेस्कटॉप OCR टूल सही है, जो एक ही कमांड में पूरे फ़ोल्डर में टेक्स्ट लेयर जोड़ देता है, बिना डाउनलोड और बिना क्लिक के।
तीन चीज़ें यहां आज़माई ही नहीं जातीं, और उन्हें पहले से जानना बाद में पता चलने से जल्दी है। पर्सपेक्टिव ठीक नहीं किया जाता — पेज का रोटेशन मापकर उसे सीधा किया जाता है, लेकिन साइड से खींची गई फ़ोटो का समलंब आकार बना रहता है, इसलिए ठीक ऊपर से फ़ोटो लेने में लगा एक सेकंड वसूल है। स्याही को कागज़ से अलग करने वाला थ्रेशोल्ड हर हिस्से के लिए अलग नहीं, पूरी फ़ोटो के लिए एक ही होता है, इसलिए आधी परछाईं वाला पेज रोशनी बराबर करने के बाद भी अपना गहरा आधा हिस्सा खो देगा; उससे जूझने के बजाय एक-सी रोशनी में दोबारा फ़ोटो लें। और जो टेबल लाइनों के बजाय सिर्फ़ ख़ाली जगह से बनी है, उसमें ढूंढने को कोई लाइन नहीं होती, इसलिए वह गद्य के कॉलम की तरह पढ़ी जाती है और स्प्रेडशीट में पेस्ट होने पर ठीक रहना क़िस्मत की बात है।
अक्सर पूछे जाने वाले सवाल
यह कितना सटीक है?
सीधे और फ़ोकस में खींचे गए साफ़ छपे टेक्स्ट पर बहुत — हज़ार में कुछ ही अक्षर ग़लत। धुंधलापन, चमक, कम कॉन्ट्रास्ट और असामान्य फ़ॉन्ट से सटीकता घटती है, और पेज आपको अंदाज़ा लगाने पर मजबूर करने के बजाय दिखाता है कि पढ़ने वाला कितना आश्वस्त था। अगर यह संख्या कम है तो आमतौर पर समस्या फ़ोटो में होती है: ज़्यादा रोशनी, कम तिरछापन, और फ़्रेम को टेक्स्ट से भर देना — इनसे ज़्यादातर सुधर जाता है।
क्या मेरी फ़ोटो कहीं स्टोर होती है?
नहीं। किसी भाषा को पहली बार इस्तेमाल करने पर उसका लैंग्वेज पैक इसी साइट से आता है; फ़ोटो ख़ुद कभी स्टोर नहीं होती और कहीं भेजी नहीं जाती, इसलिए यह Wi-Fi बंद होने पर भी काम करता है।
यह कौन-सी भाषाएं पढ़ सकता है?
120 से ज़्यादा, जिनमें अंग्रेज़ी, बांग्ला, हिंदी, उर्दू, अरबी, स्पेनिश, फ़्रेंच, जर्मन, पुर्तगाली, रूसी, चीनी, जापानी और कोरियाई शामिल हैं। लिपि फ़ोटो से ही पढ़ी जाती है; जहां कई भाषाओं की लिपि एक है — लैटिन, सिरिलिक, अरबी, देवनागरी — वहां आपके ब्राउज़र की भाषा से फ़ैसला होता है, और आप इसे हमेशा बदल सकते हैं।
क्या कॉलम और टेबल बने रहेंगे?
हां, अगर आप ऐसा चाहें। लाइनों वाली टेबल पहचानी जाती हैं और सेल-दर-सेल पढ़ी जाती हैं, ताकि लेबल अपनी वैल्यू में न घुस जाए, और वे टैब से अलग की गई पंक्तियों के रूप में आती हैं जो सीधे स्प्रेडशीट में पेस्ट हो जाती हैं। गद्य के कॉलम सीधे आर-पार नहीं, पढ़ने के क्रम में पढ़े जाते हैं। इसके बजाय लाइनें जोड़ना चुनने पर यह ढांचा जानबूझकर हटा दिया जाता है, और जिस पैराग्राफ़ को आप दोबारा सेट करने वाले हैं, उसके लिए आपको यही चाहिए।
क्या यह हाथ की लिखावट पढ़ सकता है?
साफ़, अलग-अलग लिखे अक्षर — जैसे फ़ॉर्म पर बड़े अक्षर — अक्सर पढ़ लिए जाते हैं। जुड़ी हुई लिखावट नहीं पढ़ी जाती, न यहां, न किसी और सामान्य OCR टूल में; ईमानदार जवाब यह है कि यह एक अलग समस्या है जिसके लिए अलग तरीक़ा चाहिए। हाथ की लिखावट के लिए एक अलग पेज है जो यह बात साफ़ कहता है और दिखाता है कि वह कितना पढ़ पाया।
कौन-से फ़ोटो फ़ॉर्मैट काम करते हैं?
JPG, PNG, WebP, GIF, BMP और SVG ब्राउज़र के ज़रिए, साथ ही iPhone की HEIC और स्कैनर की TIFF। फ़ोन पर पोर्ट्रेट में ली गई फ़ोटो सही दिशा में आती है, क्योंकि कैमरे का लिखा ओरिएंटेशन फ़्लैग पहले लागू किया जाता है।
इसने कुछ शब्द ग़लत क्यों पढ़े?
लगभग हमेशा वजह टेक्स्ट नहीं, फ़ोटो होती है: पेज पर चमक, आपके हाथ की परछाईं, कैमरे का हिलना, या स्क्रीन पर इतना छोटा टेक्स्ट कि हर अक्षर कुछ ही पिक्सेल का हो। पढ़ने वाले को फ़ोटो उस साइज़ में दी जाती है जिस पर वह सबसे अच्छा पढ़ता है, और रोशनी पहले बराबर की जाती है, लेकिन कितना भी सुधार वह डिटेल पैदा नहीं कर सकता जो कैमरे ने कैद ही नहीं की।
क्या साइज़ की कोई लिमिट है?
सिर्फ़ आपके डिवाइस की अपनी मेमोरी। कुछ भी स्टोर नहीं होता, इसलिए सर्वर की कोई लिमिट नहीं है। बहुत बड़ी फ़ोटो को उतना छोटा किया जाता है जितना पढ़ने वाला इस्तेमाल कर सके — एक हद के बाद ज़्यादा पिक्सेल सिर्फ़ ख़र्च बढ़ाते हैं, सटीकता नहीं।
ध्यान दें: जुड़ी हुई हाथ की लिखावट को कोई भी सामान्य OCR टूल भरोसे से नहीं पहचानता, यह टूल भी नहीं। तस्वीर के ऊपर छपा टेक्स्ट, बहुत ज़्यादा सजावटी अक्षर और बहुत कम कॉन्ट्रास्ट अधूरा निकलेगा। नतीजा प्लेन टेक्स्ट होता है: फ़ॉन्ट, रंग, बोल्ड और इटैलिक साथ नहीं आते, और न ही फ़ोटो ख़ुद।
यह टूल अपनी वेबसाइट पर लगाएं
किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।
मिलते-जुलते टूल्स
स्क्रीनशॉट से टेक्स्ट निकालें
स्क्रीनशॉट पेस्ट करें, टेक्स्ट पाएं
डॉक्यूमेंट स्कैन करें
पेज की फ़ोटो, स्कैन जैसी साफ़
PDF OCR करें
स्कैन को सर्च करने लायक बनाएं
हाथ की लिखावट पढ़ें
अलग-अलग लिखे अक्षर, ईमानदारी से पढ़े गए
QR कोड स्कैन करें
खोलने से पहले देखें कि QR कोड में क्या लिखा है
बारकोड स्कैन करें
बारकोड का नंबर, जांचा हुआ