DOCX को TXT में बदलें
Word डॉक्यूमेंट से टेक्स्ट निकालें — लिस्ट नंबरिंग, टेबल और फ़ुटनोट बरकरार, कुछ भी दोहराया नहीं जाता — कॉपी करने या .txt फ़ाइल के रूप में सेव करने के लिए तैयार। कुछ भी कभी स्टोर नहीं किया जाता।
- कभी स्टोर नहीं होती
- न कतार, न इंतज़ार
- साइनअप नहीं, वॉटरमार्क नहीं
यह कैसे काम करता है
अपना डॉक्यूमेंट जोड़ें
पेज पर .docx फ़ाइल छोड़ें। टेक्स्ट तुरंत दिख जाता है।
चुनें कि क्या रखना है
टेबल टैब से अलग पंक्तियों में या सीधे कॉलम में, हेडर और फ़ुटर, फ़ुटनोट, और Windows या Mac/Linux लाइन एंडिंग।
कॉपी या डाउनलोड करें
चाहें तो टेक्स्ट एडिट करें, फिर उसे कॉपी करें या UTF-8 .txt फ़ाइल के रूप में सेव करें।
शब्द रखें, बाक़ी सब छोड़ दें
.docx असल में XML की एक ZIP आर्काइव है, और टेक्स्ट उसके अंदर एक डॉक्यूमेंट हिस्से में रहता है। इसलिए इसे निकालना उस तरह भरोसेमंद है जैसे PDF से टेक्स्ट निकालना नहीं होता — शब्द शब्दों के रूप में, पढ़ने के क्रम में स्टोर होते हैं, न ग्लिफ़ की जगहें दोबारा जोड़नी पड़ती हैं, न यह उलझन कि पहले कौन-सा कॉलम आता है। यह कन्वर्ज़न और जो भी खोए, टेक्स्ट न खोता है न उसका क्रम बिगाड़ता है।
प्लेन टेक्स्ट परिभाषा से ही बाक़ी कुछ नहीं रख सकता: बोल्ड और इटैलिक, फ़ॉन्ट और साइज़, रंग, पेज लेआउट, हेडर और फ़ुटर। जहां प्लेन टेक्स्ट में कोई तरीक़ा है, वहां ढांचा बचाया जाता है — पैराग्राफ़ अलग रहते हैं, लिस्ट आइटम अपने निशान और इंडेंट रखते हैं, और टेबल सेल ऐसे अलग किए जाते हैं कि पंक्तियां एक लंबी लाइन में सिमटने के बजाय पढ़ने लायक रहें। फ़ुटनोट छोड़े नहीं जाते, इकट्ठा किए जाते हैं, क्योंकि फ़ुटनोट का टेक्स्ट भी टेक्स्ट ही है।
तस्वीरें, चार्ट और SmartArt छोड़ दिए जाते हैं — उनमें निकालने लायक कोई टेक्स्ट नहीं होता, और प्लेसहोल्डर किसी के काम का नहीं। समीकरण चिह्नों के बजाय a/b + x^2 जैसे सरल लीनियर रूप में आते हैं, जो ईमानदार समझौता है: पढ़ने लायक, बिना दोहरे अर्थ के, और टाइपसेटिंग होने का दिखावा किए बिना।
दो काम की बातें। ट्रैक किए गए बदलाव और कमेंट शामिल नहीं होते — आपको डॉक्यूमेंट वैसा मिलता है जैसा वह अभी पढ़ा जाता है, उसका संशोधन इतिहास नहीं, जो जानना ज़रूरी है अगर आप कोई हटाया गया हिस्सा वापस पाने की उम्मीद कर रहे थे। और पुरानी .doc फ़ाइलों को पहले .docx के रूप में सेव करना होगा, क्योंकि 1997 का बाइनरी फ़ॉर्मैट बिल्कुल अलग चीज़ है, जिसका मक़सद बस वही है।
जब आपको कुछ और चाहिए
Pandoc .docx को टेक्स्ट या Markdown में कहीं ज़्यादा नियंत्रण के साथ बदलता है: प्लेन टेक्स्ट के लिए pandoc in.docx -t plain -o out.txt, या हेडिंग, ज़ोर और लिस्ट को पढ़ने लायक मार्कअप के रूप में रखने के लिए -t markdown — जो लोग “बस टेक्स्ट” मांगते समय असल में आमतौर पर यही चाहते हैं। यह इमेज को फेंकने के बजाय एक फ़ोल्डर में निकाल भी देता है।
सैकड़ों डॉक्यूमेंट से टेक्स्ट निकालने के लिए Python के python-docx और docx2txt आपको पैराग्राफ़ प्रोग्राम से देते हैं, ताकि फ़ाइल पढ़ने के बजाय आप उन्हें फ़िल्टर, सर्च या इंडेक्स कर सकें। और ख़ास तौर पर ट्रैक किए गए बदलाव या कमेंट तक पहुंचने के लिए, डॉक्यूमेंट खोलने से बेहतर न कोई कन्वर्टर है न स्क्रिप्ट — वह जानकारी फ़ाइल में है, बस “टेक्स्ट” का हिस्सा नहीं है।
अक्सर पूछे जाने वाले सवाल
क्या मेरा डॉक्यूमेंट कहीं स्टोर होता है?
नहीं। डॉक्यूमेंट कभी स्टोर नहीं होता और कहीं कुछ नहीं भेजा जाता — जो कॉन्ट्रैक्ट, CV और ऐसी किसी भी चीज़ के लिए मायने रखता है जिसे आप किसी वेबसाइट में पेस्ट नहीं करना चाहेंगे।
क्या लिस्ट नंबर बने रहते हैं?
हां, बिल्कुल वैसे जैसे Word दिखाता है: “1.”, “1.1”, “a)”, “iii.” और बुलेट, उन लिस्ट समेत जो डॉक्यूमेंट में दोबारा शुरू होती हैं या आगे जारी रहती हैं। ज़्यादातर टेक्स्ट निकालने वाले टूल नंबर पूरी तरह छोड़ देते हैं, क्योंकि Word उन्हें टेक्स्ट के रूप में स्टोर नहीं करता।
टेबल कैसे कन्वर्ट होती हैं?
आपकी मर्ज़ी। टैब से अलग पंक्तियां सीधे Excel या Google Sheets में पेस्ट हो जाती हैं; सीधे कॉलम प्लेन टेक्स्ट में अच्छे पढ़े जाते हैं, और उनकी चौड़ाई चीनी या जापानी कैरेक्टर के साथ भी सही रहती है।
ट्रैक किए गए बदलावों और कमेंट का क्या?
टेक्स्ट ऐसे पढ़ा जाता है मानो हर बदलाव स्वीकार कर लिया गया हो: हटाया गया हिस्सा छोड़ दिया जाता है, जोड़ा गया रखा जाता है। कमेंट शामिल नहीं होते।
क्या इसमें टेक्स्ट बॉक्स, फ़ुटनोट, हेडर और फ़ुटर शामिल होते हैं?
टेक्स्ट बॉक्स हमेशा शामिल होते हैं, हर एक सिर्फ़ एक बार, पढ़ने के क्रम में। फ़ुटनोट और एंडनोट [1] जैसे निशानों के रूप में आते हैं और नोट्स आख़िर में सूचीबद्ध होते हैं, और हेडर व फ़ुटर चालू किए जा सकते हैं।
.txt फ़ाइल की एन्कोडिंग क्या है?
UTF-8, जिसे हर आधुनिक एडिटर सही खोलता है और जिसमें हर भाषा आ सकती है। अगर फ़ाइल किसी पुराने Windows प्रोग्राम में जानी है, तो Windows लाइन एंडिंग चुनें।
ध्यान दें: पुरानी .doc फ़ाइलों को पहले .docx के रूप में सेव करना होगा, और पासवर्ड वाले डॉक्यूमेंट का पासवर्ड हटाना होगा। तस्वीरें, चार्ट और SmartArt छोड़ दिए जाते हैं; समीकरण a/b + x^2 जैसे सरल लीनियर रूप में आते हैं।
यह टूल अपनी वेबसाइट पर लगाएं
किसी भी ब्लॉग, क्लास पेज या हेल्प आर्टिकल के लिए मुफ़्त। एक स्निपेट पेस्ट करें और आपके विज़िटर इसे सीधे आपके पेज पर इस्तेमाल कर सकेंगे।
मिलते-जुलते टूल्स
PDF को टेक्स्ट में बदलें
प्लेन टेक्स्ट, जिसे कॉपी और एडिट कर सकें
TXT को PDF में बदलें
टेक्स्ट या नोट्स से साफ़-सुथरी PDF
HTML को DOCX में बदलें
वेब पेज से एडिट होने वाला Word डॉक्यूमेंट
Word फ़ाइल का अनुवाद करें
Word डॉक्यूमेंट दूसरी भाषा में, लेआउट जस का तस
CV / बायोडाटा बनाएं
54 टेम्पलेट में प्रोफ़ेशनल CV या रिज़्यूमे
Markdown को HTML में बदलें
Markdown से साफ़ वेब पेज या HTML स्निपेट