सीधे कंटेंट पर जाएं

शब्द गिनें

शब्द, वाक्य, पैराग्राफ़ और पढ़ने में लगने वाला समय — टाइप करते ही अपडेट होता है। उन भाषाओं के लिए भी सही, जो शब्दों के बीच स्पेस नहीं डालतीं, जहां ज़्यादातर काउंटर ग़लत गिनते हैं। कुछ भी स्टोर नहीं किया जाता।

  • कभी स्टोर नहीं होती
  • न कतार, न इंतज़ार
  • साइनअप नहीं, वॉटरमार्क नहीं

0

शब्द

किसी भी भाषा में

0

कैरेक्टर

इमोजी एक गिना जाता है

0

वाक्य

संक्षिप्त रूपों का ध्यान रखा गया

0

पैराग्राफ़

ख़ाली लाइनों पर अलग

हर गिनती, और उसका इस्तेमाल कहां होता है
लाइनेंजैसे एडिटर उन्हें नंबर देता है
0
वाक्य“Dr.” या “etc.” से नहीं टूटते
0
पैराग्राफ़ख़ाली लाइन से अलग किए गए हिस्से
0
कोड पॉइंटजिसे रेगुलर एक्सप्रेशन का “.” मैच करता है
0
UTF-16 यूनिटJavaScript में string.length जो बताता है
0
UTF-8 बाइटजिसे VARCHAR लिमिट और HTTP हेडर मापते हैं
0
पढ़ने का समयमन में, 238 शब्द प्रति मिनट की दर से
—
बोलने का समयबोलकर, 150 शब्द प्रति मिनट की दर से
—
सबसे लंबा शब्दकैरेक्टर के हिसाब से, बाइट के नहीं
—
औसत शब्दपढ़ने में आसानी का एक मोटा संकेत
—

टाइप करना शुरू करें और सब कुछ भर जाएगा। कोई इमोजी या चीनी भाषा का एक वाक्य आज़माएं — दोनों को वैसे ही गिना जाता है जैसे कोई इंसान गिनेगा, जिसमें ज़्यादातर काउंटर ग़लती करते हैं।

यह कैसे काम करता है

1

पेस्ट या टाइप करें

या कोई टेक्स्ट फ़ाइल यहां छोड़ें। गिनती साथ-साथ अपडेट होती है; कुछ भी कहीं नहीं भेजा जाता।

2

आंकड़े पढ़ें

शब्द, वाक्य, पैराग्राफ़, लाइनें और कैरेक्टर, साथ में पढ़ने और बोलने का समय।

3

अपनी सीमा जांचें

अगर आप किसी सीमा में लिख रहे हैं — SEO टाइटल, मेटा डिस्क्रिप्शन, SMS — तो पेज दिखाता है कि आप उसके कितने क़रीब हैं।

क्या गिना जाता है, और गिनता कौन है

शब्दों की गिनती हमारी नहीं है। शब्द ब्राउज़र के अपने Unicode सेगमेंटर से आते हैं, जिससे किसी ख़ास लोकेल के बजाय उसके डिफ़ॉल्ट लोकेल में पूछा जाता है, और पेज उन्हीं टुकड़ों को रखता है जिन्हें वह शब्द जैसा बताता है। यहां उसके ऊपर हाइफ़न, एपॉस्ट्रॉफ़ी या अंकों के लिए कोई नियम नहीं जोड़ा जाता — आपको वही मिलता है जो सेगमेंटर तय करता है कि शब्द कहां शुरू होते हैं, इसीलिए चीनी और जापानी में जवाब सही आता है, और इसीलिए दो मशीनों पर दो ब्राउज़र एक ही टेक्स्ट पर बहुत थोड़ा अलग गिन सकते हैं। जिस ब्राउज़र में सेगमेंटर नहीं है, इतने पुराने ब्राउज़र पर पेज स्पेस पर तोड़ने के तरीक़े पर लौट आता है और बताता है कि आंकड़ा अनुमानित है — यही आंकड़ा सरल काउंटर हर समय देते हैं, बिना बताए।

पैराग्राफ़ और लाइनें हमारे अपने नियमों से गिनी जाती हैं, और दोनों के नियम एक नहीं हैं। पैराग्राफ़ की सीमा एक ख़ाली लाइन है — दो लाइन ब्रेक जिनके बीच सिर्फ़ स्पेस या टैब हों — इसलिए कैरिज रिटर्न समेत छोड़ी गई Windows टेक्स्ट फ़ाइल एक ही पैराग्राफ़ गिनी जाती है; बॉक्स में पेस्ट किए टेक्स्ट में यह दिक़्क़त कभी नहीं आती, क्योंकि टेक्स्ट बॉक्स लाइन फ़ीड देता है। लाइनें उसी तरह गिनी जाती हैं जैसे किसी एडिटर का गटर गिनता है: ख़ाली बॉक्स शून्य लाइन है, एक शब्द एक लाइन है, और जिस फ़ाइल के आख़िर में न्यूलाइन हो, उसकी आख़िरी ख़ाली लाइन भी गिनी जाती है। यह जान-बूझकर कमांड लाइन के wc जैसा नहीं है, जो लाइन टर्मिनेटर की संख्या बताता है।

दो छोटे फ़ैसले आंकड़ों पर होने वाली ज़्यादातर बहस सुलझा देते हैं। बिना स्पेस के कैरेक्टर में वह सब हटा दिया जाता है जिसे ब्राउज़र व्हाइटस्पेस मानता है, जिसमें वेब पेज से कॉपी किए टेक्स्ट के साथ आने वाला नॉन-ब्रेकिंग स्पेस भी शामिल है — पर ज़ीरो-विड्थ स्पेस नहीं, जो व्हाइटस्पेस नहीं है और गिनती में बना रहता है। और सबसे लंबा शब्द और शब्द की औसत लंबाई कोड पॉइंट में मापी जाती है, न कि उन ग्रैफ़ीम क्लस्टर में जिनसे मुख्य कैरेक्टर आंकड़ा बनता है, इसलिए इमोजी या जुड़ने वाले एक्सेंट वाला शब्द यहां दिखने से ज़्यादा लंबा मापा जाता है। फ़्रीक्वेंसी टेबल अंग्रेज़ी के लगभग साठ आम फ़ंक्शन वर्ड तब तक छिपाती है जब तक आप उन्हें न मांगें, और केस को अंग्रेज़ी के सादे नियम से ही एक करती है, चाहे आप किसी भी भाषा में लिख रहे हों।

जब आपको कुछ और चाहिए

जब कोई ख़ास प्रोग्राम फ़ैसला करने वाला हो, तो सिर्फ़ उसी प्रोग्राम का आंकड़ा मायने रखता है। जो जर्नल कहता है कि रेफ़रेंस समेत आठ हज़ार शब्द, उसका मतलब Word का बताया आंकड़ा है, और Word फ़ील्ड, फ़ुटनोट, कैप्शन और टेक्स्ट बॉक्स को अपनी सेटिंग के हिसाब से गिनता है। आम गद्य पर यह पेज क़रीब पहुंचेगा, पर शब्द-दर-शब्द मेल नहीं खाएगा, इसलिए उसी टूल के हिसाब से जमा करें जो आपको जांच रहा है, इसके हिसाब से नहीं।

एक से ज़्यादा डॉक्यूमेंट के लिए गिनती शेल की एक लाइन है। wc -w एक बार में पूरा फ़ोल्डर लेता है और आपकी मेमोरी से बड़ी फ़ाइलों को स्ट्रीम करता है; Markdown, HTML या LaTeX के लिए, पहले फ़ाइल को pandoc से सादे टेक्स्ट में बदलने से मार्कअप हट जाता है, ताकि कोड फ़ेंस, लिंक टारगेट और टैग गद्य के रूप में न गिने जाएं — यही फ़र्क़ है रिपॉज़िटरी की शब्द गिनती और असली गिनती में। चार सौ फ़ाइलों के लिए इनमें से कोई भी काम पेस्ट बॉक्स नहीं कर सकता।

अक्सर पूछे जाने वाले सवाल

क्या मेरा टेक्स्ट कहीं स्टोर होता है?

नहीं। कुछ भी स्टोर नहीं किया जाता और कोई रिक्वेस्ट नहीं भेजी जाती, और नेटवर्क बंद होने पर भी यह काम करता रहता है। टेक्स्ट के मामले में यह दिखने से ज़्यादा मायने रखता है: लोग ऑनलाइन काउंटर में जो पेस्ट करते हैं, वह अप्रकाशित लेखन, क़ानूनी ड्राफ़्ट, छात्रों का काम और अंदरूनी डॉक्यूमेंट होते हैं।

क्या यह चीनी, जापानी या थाई के लिए काम करता है?

हां, और यही चीज़ इसे ज़्यादातर काउंटर से अलग करती है। ये भाषाएं शब्दों के बीच स्पेस नहीं डालतीं, इसलिए आम तरीक़ा — स्पेस पर तोड़ना — पूरे चीनी लेख को एक शब्द बता देता है। यह ब्राउज़र के Unicode वर्ड सेगमेंटेशन (UAX #29 एल्गोरिदम) का इस्तेमाल करता है, जो हर लिपि में जानता है कि शब्द असल में कहां शुरू और कहां ख़त्म होते हैं। चीनी टेक्स्ट को इस पेज और किसी दूसरे काउंटर में साथ-साथ पेस्ट करके देखें; फ़र्क़ तुरंत दिख जाएगा।

पढ़ने का समय कैसे निकाला जाता है?

मन में पढ़ने के लिए शब्दों को 238 प्रति मिनट से, और ज़ोर से पढ़ने के लिए 150 प्रति मिनट से भाग दिया जाता है। 238 का आंकड़ा वयस्कों के मन में पढ़ने पर हुई 190 स्टडी के Brysbaert के 2019 के मेटा-विश्लेषण से आता है, न कि 200 या 250 जैसे गोल आंकड़ों से जो ब्लॉग पोस्ट एक-दूसरे से कॉपी करते हैं। यह आम गद्य का औसत है — घना तकनीकी लेखन धीमे पढ़ा जाता है, और जाना-पहचाना विषय तेज़।

वाक्य किसे माना जाता है?

वाक्य फ़ुल स्टॉप, प्रश्नवाचक चिह्न या विस्मयादिबोधक चिह्न पर ख़त्म होता है — पर किसी उपाधि या संक्षिप्त रूप के बाद नहीं। “We met Dr. Smith on Monday.” एक वाक्य है, दो नहीं; ब्राउज़र का अपना सेगमेंटेशन इसे ग़लत गिनता है और यह पेज उसे ठीक करता है। “Bring pens, paper, etc. and we will start” भी एक ही वाक्य है; यही वाक्यांश अगर कैपिटल अक्षर से आगे बढ़े, तो दो।

पैराग्राफ़ किसे माना जाता है?

ख़ाली लाइन से अलग किया गया टेक्स्ट का एक हिस्सा। हर लाइन ब्रेक को पैराग्राफ़ मानने पर किसी पते की हर लाइन पैराग्राफ़ बन जाती, इसीलिए यहां के आंकड़े कुछ दूसरे टूल्स से अलग हैं।

क्या यह Word डॉक्यूमेंट या PDF के शब्द गिनता है?

सीधे नहीं — टेक्स्ट पेस्ट करें, या पहले हमारा “PDF को टेक्स्ट में बदलें” टूल इस्तेमाल करके नतीजा पेस्ट करें। यह पेज टेक्स्ट पर काम करता है, और इसी वजह से यह तुरंत और निजी रहता है।

मेरी शब्द गिनती Microsoft Word से अलग क्यों है?

आम तौर पर हाइफ़न और नंबर की वजह से। Word “well-known” को एक शब्द गिनता है और हम भी; कुछ टूल दो गिनते हैं। अकेले नंबर, तारीख़ें और चिह्न यहां तब शब्द माने जाते हैं जब उनमें कोई अंक या अक्षर हो। आम गद्य के लिए दोनों लगभग बराबर आते हैं; पार्ट नंबर की सूची के लिए नहीं।

ध्यान दें: पढ़ने और बोलने का समय आम गद्य का औसत है — घना तकनीकी लेखन धीमे पढ़ा जाता है और जाना-पहचाना विषय तेज़, इसलिए इसे अंदाज़ा मानें, वादा नहीं। गिनती ब्राउज़र के Unicode सेगमेंटेशन पर निर्भर है; जिस ब्राउज़र में यह नहीं है, इतना पुराना ब्राउज़र अनुमान पर लौट आता है और पेज पर यह बता देता है।

यह टूल अपनी वेबसाइट पर लगाएं

किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।