डॉक्यूमेंट को ट्रांसलेटर में पेस्ट करने से वह क्यों बिगड़ जाता है
Word का पैराग्राफ़ सिर्फ़ टेक्स्ट की एक लाइन नहीं होता। वह रन की एक कतार है — ऐसे हिस्से जिनमें एक ही फ़ॉन्ट, साइज़ और रंग है — और उनके बीच फ़ील्ड, बुकमार्क, कमेंट के एंकर, फ़ुटनोट के रेफ़रेंस और तस्वीरें होती हैं। टेक्स्ट कॉपी करें, अनुवाद करें और वापस पेस्ट करें, तो जो कुछ अक्षर नहीं था वह सब चला जाता है: बोल्ड, लिंक, पेज नंबर का फ़ील्ड, फ़ुटनोट का निशान।
सीधा-सा हल, यानी हर रन का अलग अनुवाद, इससे भी बुरा है। भाषाओं में शब्दों का क्रम अलग होता है, इसलिए “the red house” को “la casa roja” बनना पड़ता है — विशेषण अपनी जगह बदलता है, और बोल्ड को भी उसके साथ जाना पड़ता है। टुकड़ों का अलग-अलग अनुवाद करें तो मिलता है “la roja casa”, जो कोई स्पैनिश बोलने वाला नहीं लिखेगा। हर पैराग्राफ़ का अनुवाद पूरा एक साथ होना चाहिए, फ़ॉर्मैटिंग शब्दों के साथ-साथ चलनी चाहिए, और फिर उसे रन-दर-रन वापस रखना होता है। ये टूल यही करते हैं, और इसीलिए कोई बोल्ड शब्द, हाइपरलिंक या हाइलाइट किया हुआ वाक्यांश अनुवाद में सही शब्दों पर ही आता है।
फ़ाइल की बाक़ी हर चीज़ — स्टाइल, नंबरिंग, पेज सेटअप, थीम, इमेज — कभी दोबारा लिखी ही नहीं जाती। आप जो फ़ाइल डाउनलोड करते हैं, वह आपकी ओरिजिनल फ़ाइल ही है, बस उसमें शब्द अलग हैं; उसके जैसा दिखने के लिए बनाया गया कोई नया डॉक्यूमेंट नहीं।
स्प्रेडशीट प्रोग्राम हैं, सिर्फ़ टेक्स्ट नहीं
वर्कबुक की एक समस्या है जो डॉक्यूमेंट में नहीं होती: उसके कुछ शब्द ऐसा डेटा हैं जिससे फ़ॉर्मूले तुलना करते हैं। =COUNTIF(C:C, "Paid") उन सेल को गिनता है जिनमें अंग्रेज़ी शब्द “Paid” है। सेल का अनुवाद “Pagado” कर दें, तो फ़ॉर्मूला फिर भी चलता है, फिर भी एक नंबर दिखाता है, और वह नंबर अब शून्य है। ड्रॉप-डाउन सूचियां, प्रोडक्ट के नाम से होने वाले लुकअप, और नाम से रेफ़र किए जाने वाले टेबल कॉलम भी इसी तरह चुपचाप फ़ेल होते हैं।
इसलिए “Excel फ़ाइल का अनुवाद करें” पहले वर्कबुक का हर फ़ॉर्मूला, वैलिडेशन सूची, पिवट टेबल और टेबल रेफ़रेंस पढ़ता है, और जिस भी टेक्स्ट पर वे निर्भर हैं, वह ठीक वैसा ही रहता है। पेज आपको बताता है कि ऐसे कितने सेल थे, ताकि आपकी जानकारी के बिना कुछ भी न छूटे। शीट के नाम भी वैसे ही रहते हैं, क्योंकि दूसरी शीटों और दूसरी वर्कबुक के फ़ॉर्मूले किसी शीट को उसके नाम से ही ढूंढते हैं।
जिसका अनुवाद होता है, वह सब कुछ है जो कोई इंसान पढ़ता है: सेल का टेक्स्ट, मिली-जुली फ़ॉर्मैटिंग वाले रिच-टेक्स्ट सेल, कमेंट और नोट्स, शेप और टेक्स्ट बॉक्स, और चार्ट के टाइटल और लेबल। नंबर, तारीख़ें, कोड और पते वैसे ही छोड़े जाते हैं, और हज़ारों सेल में दोहराए गए टेक्स्ट का अनुवाद एक ही बार होता है, ताकि वह हर जगह एक जैसा पढ़ा जाए।
मशीन अनुवाद कितना अच्छा है, ईमानदारी से
यहां का अनुवाद वही है जो Mozilla ने Firefox के पेज अनुवाद के लिए बनाया है: सहज, तेज़, और सबसे अच्छा अंग्रेज़ी और ज़्यादा बोली जाने वाली यूरोपीय भाषाओं के बीच। किसी डॉक्यूमेंट को समझने, जांच के लिए एक ड्राफ़्ट तैयार करने, और रोज़मर्रा की चीज़ों — चिट्ठियां, मैनुअल, रेट लिस्ट, रिपोर्ट — का अनुवाद करने के लिए यह बहुत अच्छा है, जिनके लिए कोई अनुवादक को पैसे नहीं देता।
जहां शब्दों का वज़न हो, वहां यह किसी प्रोफ़ेशनल की जगह नहीं ले सकता। मशीन अनुवाद ऐसा वाक्य बना सकता है जो पढ़ने में बिल्कुल सही लगे, लेकिन कहे कुछ और, और उसके पास आपकी कंपनी की शब्दावली जानने का कोई तरीक़ा नहीं है। क़ानूनी, मेडिकल, वित्तीय या छपने जा रही किसी भी चीज़ की जांच किसी धाराप्रवाह बोलने वाले से करवाएं। बिना संदर्भ का छोटा टेक्स्ट — “Net” या “Draw” नाम का कोई स्प्रेडशीट कॉलम — किसी भी अनुवादक के लिए सबसे मुश्किल होता है, इसलिए हेडिंग पर एक नज़र ज़रूर डाल लें।
जिन भाषाओं का सीधा मॉडल नहीं है, उनका अनुवाद अंग्रेज़ी के ज़रिए होता है। यह अपने-आप होता है और आमतौर पर अच्छा काम करता है, लेकिन कोई बारीकी दो बार खो सकती है, इसलिए अंग्रेज़ी से और अंग्रेज़ी में सीधे अनुवाद सबसे सटीक होते हैं।
भाषा का डेटा, और पहली बार ज़्यादा समय क्यों लगता है
पहली बार जब आप किसी भाषा में अनुवाद करते हैं, तो उसका भाषा डेटा डाउनलोड होता है — भाषा के हिसाब से लगभग 15 से 70 MB, और पेज शुरू करने से पहले आपको सटीक साइज़ बता देता है। यह बाद के लिए रखा रहता है, इसलिए उसी भाषा का अगला डॉक्यूमेंट एक-दो सेकंड में शुरू हो जाता है, और आप जब चाहें टूल के पेज से इसे हटा सकते हैं।
इसी वजह से आपके डॉक्यूमेंट को कहीं जाना ही नहीं पड़ता। अनुवाद यहीं होता है, उसी फ़ाइल पर जो आपने छोड़ी, और जो एकमात्र चीज़ आती-जाती है वह भाषा का डेटा है, जो सबके लिए एक जैसा है।