सीधे कंटेंट पर जाएं

DOCX को TXT में बदलें

Word डॉक्यूमेंट से टेक्स्ट निकालें — लिस्ट नंबरिंग, टेबल और फ़ुटनोट बरकरार, कुछ भी दोहराया नहीं जाता — कॉपी करने या .txt फ़ाइल के रूप में सेव करने के लिए तैयार। कुछ भी कभी स्टोर नहीं किया जाता।

  • कभी स्टोर नहीं होती
  • न कतार, न इंतज़ार
  • साइनअप नहीं, वॉटरमार्क नहीं

यह कैसे काम करता है

1

अपना डॉक्यूमेंट जोड़ें

पेज पर .docx फ़ाइल छोड़ें। टेक्स्ट तुरंत दिख जाता है।

2

चुनें कि क्या रखना है

टेबल टैब से अलग पंक्तियों में या सीधे कॉलम में, हेडर और फ़ुटर, फ़ुटनोट, और Windows या Mac/Linux लाइन एंडिंग।

3

कॉपी या डाउनलोड करें

चाहें तो टेक्स्ट एडिट करें, फिर उसे कॉपी करें या UTF-8 .txt फ़ाइल के रूप में सेव करें।

शब्द रखें, बाक़ी सब छोड़ दें

.docx असल में XML की एक ZIP आर्काइव है, और टेक्स्ट उसके अंदर एक डॉक्यूमेंट हिस्से में रहता है। इसलिए इसे निकालना उस तरह भरोसेमंद है जैसे PDF से टेक्स्ट निकालना नहीं होता — शब्द शब्दों के रूप में, पढ़ने के क्रम में स्टोर होते हैं, न ग्लिफ़ की जगहें दोबारा जोड़नी पड़ती हैं, न यह उलझन कि पहले कौन-सा कॉलम आता है। यह कन्वर्ज़न और जो भी खोए, टेक्स्ट न खोता है न उसका क्रम बिगाड़ता है।

प्लेन टेक्स्ट परिभाषा से ही बाक़ी कुछ नहीं रख सकता: बोल्ड और इटैलिक, फ़ॉन्ट और साइज़, रंग, पेज लेआउट, हेडर और फ़ुटर। जहां प्लेन टेक्स्ट में कोई तरीक़ा है, वहां ढांचा बचाया जाता है — पैराग्राफ़ अलग रहते हैं, लिस्ट आइटम अपने निशान और इंडेंट रखते हैं, और टेबल सेल ऐसे अलग किए जाते हैं कि पंक्तियां एक लंबी लाइन में सिमटने के बजाय पढ़ने लायक रहें। फ़ुटनोट छोड़े नहीं जाते, इकट्ठा किए जाते हैं, क्योंकि फ़ुटनोट का टेक्स्ट भी टेक्स्ट ही है।

तस्वीरें, चार्ट और SmartArt छोड़ दिए जाते हैं — उनमें निकालने लायक कोई टेक्स्ट नहीं होता, और प्लेसहोल्डर किसी के काम का नहीं। समीकरण चिह्नों के बजाय a/b + x^2 जैसे सरल लीनियर रूप में आते हैं, जो ईमानदार समझौता है: पढ़ने लायक, बिना दोहरे अर्थ के, और टाइपसेटिंग होने का दिखावा किए बिना।

दो काम की बातें। ट्रैक किए गए बदलाव और कमेंट शामिल नहीं होते — आपको डॉक्यूमेंट वैसा मिलता है जैसा वह अभी पढ़ा जाता है, उसका संशोधन इतिहास नहीं, जो जानना ज़रूरी है अगर आप कोई हटाया गया हिस्सा वापस पाने की उम्मीद कर रहे थे। और पुरानी .doc फ़ाइलों को पहले .docx के रूप में सेव करना होगा, क्योंकि 1997 का बाइनरी फ़ॉर्मैट बिल्कुल अलग चीज़ है, जिसका मक़सद बस वही है।

जब आपको कुछ और चाहिए

Pandoc .docx को टेक्स्ट या Markdown में कहीं ज़्यादा नियंत्रण के साथ बदलता है: प्लेन टेक्स्ट के लिए pandoc in.docx -t plain -o out.txt, या हेडिंग, ज़ोर और लिस्ट को पढ़ने लायक मार्कअप के रूप में रखने के लिए -t markdown — जो लोग “बस टेक्स्ट” मांगते समय असल में आमतौर पर यही चाहते हैं। यह इमेज को फेंकने के बजाय एक फ़ोल्डर में निकाल भी देता है।

सैकड़ों डॉक्यूमेंट से टेक्स्ट निकालने के लिए Python के python-docx और docx2txt आपको पैराग्राफ़ प्रोग्राम से देते हैं, ताकि फ़ाइल पढ़ने के बजाय आप उन्हें फ़िल्टर, सर्च या इंडेक्स कर सकें। और ख़ास तौर पर ट्रैक किए गए बदलाव या कमेंट तक पहुंचने के लिए, डॉक्यूमेंट खोलने से बेहतर न कोई कन्वर्टर है न स्क्रिप्ट — वह जानकारी फ़ाइल में है, बस “टेक्स्ट” का हिस्सा नहीं है।

अक्सर पूछे जाने वाले सवाल

क्या मेरा डॉक्यूमेंट कहीं स्टोर होता है?

नहीं। डॉक्यूमेंट कभी स्टोर नहीं होता और कहीं कुछ नहीं भेजा जाता — जो कॉन्ट्रैक्ट, CV और ऐसी किसी भी चीज़ के लिए मायने रखता है जिसे आप किसी वेबसाइट में पेस्ट नहीं करना चाहेंगे।

क्या लिस्ट नंबर बने रहते हैं?

हां, बिल्कुल वैसे जैसे Word दिखाता है: “1.”, “1.1”, “a)”, “iii.” और बुलेट, उन लिस्ट समेत जो डॉक्यूमेंट में दोबारा शुरू होती हैं या आगे जारी रहती हैं। ज़्यादातर टेक्स्ट निकालने वाले टूल नंबर पूरी तरह छोड़ देते हैं, क्योंकि Word उन्हें टेक्स्ट के रूप में स्टोर नहीं करता।

टेबल कैसे कन्वर्ट होती हैं?

आपकी मर्ज़ी। टैब से अलग पंक्तियां सीधे Excel या Google Sheets में पेस्ट हो जाती हैं; सीधे कॉलम प्लेन टेक्स्ट में अच्छे पढ़े जाते हैं, और उनकी चौड़ाई चीनी या जापानी कैरेक्टर के साथ भी सही रहती है।

ट्रैक किए गए बदलावों और कमेंट का क्या?

टेक्स्ट ऐसे पढ़ा जाता है मानो हर बदलाव स्वीकार कर लिया गया हो: हटाया गया हिस्सा छोड़ दिया जाता है, जोड़ा गया रखा जाता है। कमेंट शामिल नहीं होते।

क्या इसमें टेक्स्ट बॉक्स, फ़ुटनोट, हेडर और फ़ुटर शामिल होते हैं?

टेक्स्ट बॉक्स हमेशा शामिल होते हैं, हर एक सिर्फ़ एक बार, पढ़ने के क्रम में। फ़ुटनोट और एंडनोट [1] जैसे निशानों के रूप में आते हैं और नोट्स आख़िर में सूचीबद्ध होते हैं, और हेडर व फ़ुटर चालू किए जा सकते हैं।

.txt फ़ाइल की एन्कोडिंग क्या है?

UTF-8, जिसे हर आधुनिक एडिटर सही खोलता है और जिसमें हर भाषा आ सकती है। अगर फ़ाइल किसी पुराने Windows प्रोग्राम में जानी है, तो Windows लाइन एंडिंग चुनें।

ध्यान दें: पुरानी .doc फ़ाइलों को पहले .docx के रूप में सेव करना होगा, और पासवर्ड वाले डॉक्यूमेंट का पासवर्ड हटाना होगा। तस्वीरें, चार्ट और SmartArt छोड़ दिए जाते हैं; समीकरण a/b + x^2 जैसे सरल लीनियर रूप में आते हैं।

यह टूल अपनी वेबसाइट पर लगाएं

किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।