मशीन अनुवाद अब इतना अच्छा हो गया है कि, कई मामलों में, इसे मानव अनुवाद से अलग करना असंभव है। अनुवाद सेवाएँ प्रसंग के अनुरूप, सहज और मुहावरेदार अनुवाद तैयार करती हैं। फिर आप एक डीपीपी डेटा सेट का अनुवाद करते हैं - और अचानक ‘rear lock fibre closure’ बन जाता है ‘Hinterschloss-Faserverschluss’।
समस्या तकनीकी शब्दावली की है। यहाँ, हम समझाते हैं कि उत्पाद डेटा को उपन्यासों की तरह क्यों नहीं माना जाना चाहिए, और Transpareo कौन से उपकरण प्रदान करता है ताकि आपके 40 भाषा संस्करण समझने योग्य बने रहें।
मूल समस्या: एक शब्द, कई अर्थ
बाहरी जैकेट के लिए DPP में ‘सील ‘: जलरोधकता। प्रयोगशाला में ‘सील’: संदर्भ के आधार पर एक सील (जानवर) या एक गैस्केट। रखरखाव लॉग में ‘सील’: संभवतः एक सील (जैसे स्टाम्प में)।
एक सामान्य अनुवाद मॉडल सांख्यिकीय संदर्भ के आधार पर अपनी पसंद करता है। यह निरंतर पाठ के लिए काम करता है - एक उपन्यास बहुत सारा संदर्भ प्रदान करता है। लेकिन primary_closure: seal जैसे डेटा फ़ील्ड के लिए, संदर्भ लगभग नहीं होता है। मॉडल एक अनुमान लगाता है।
परिणाम सूक्ष्म त्रुटियाँ होती हैं। ‘Hinterschloss fibre fastening’ जितनी नाटकीय नहीं, लेकिन महत्वपूर्ण: जर्मन में ‘Dichtung’ नामक एक घटक को अचानक एक इतालवी डीपीपी (DPP) में ‘guarnizione’ के बजाय ‘sigillo’ कहा जाता है । एक खरीदार अब स्पेयर पार्ट नहीं ढूंढ पाता है।
ट्रांसपेरियो आज क्या करता है
हमारी अनुवाद प्रणाली सभी नई सामग्री का सभी सक्रिय भाषाओं में स्वचालित रूप से अनुवाद करती है। इसकी चार प्रमुख विशेषताएँ हैं:
-
मार्कडाउन और चर संरक्षण:
<a href="/hi/pnjiikrt-kren">Pro-Membership</a>जैसे प्लेसहोल्डर और मार्कडाउन संरचनाओं को अनुवाद से पहले निकाल लिया जाता है; साधारण पाठ का अनुवाद किया जाता है, और फिर संरचनाओं को बिना बदले वापस डाल दिया जाता है। यह सुनिश्चित करता है कि सभी भाषाओं में लिंक, फॉर्म और लेआउट सुसंगत रहें। - केंद्रीकृत अनुवाद प्रविष्टियाँ: अनुवाद स्वयं डेटा रिकॉर्ड में संग्रहीत नहीं होते हैं, बल्कि एक साझा परत में संग्रहीत होते हैं। समान स्रोत पाठ वाले कई डेटा रिकॉर्ड एक ही अनुवाद को साझा करते हैं। इससे अनुवाद लागत में बचत होती है और डेटा मॉडल में शब्दावली स्वचालित रूप से मानकीकृत हो जाती है।
- परिवर्तनों पर स्वचालित पुनः-अनुवाद: यदि मूल पाठ में संशोधन किया जाता है, तो सभी भाषाओं में अनुवाद फिर से उत्पन्न होते हैं। जर्मन में एक सुधार स्वचालित रूप से 39 अन्य भाषा संस्करणों को अपडेट कर देता है।
- प्रति डेटा रिकॉर्ड मार्किंग: सामग्री को स्वचालित रन से बाहर रखा जा सकता है, या मौजूदा अनुवादों को लॉक किया जा सकता है - उदाहरण के लिए, अंतर्राष्ट्रीय उत्पाद नामों या मैन्युअल सुधारों के लिए।
जहाँ ग्राहक प्रसंस्करण को पूरक करता है
स्वचालित अनुवाद वर्णनात्मक पाठ, मार्केटिंग कॉपी और देखभाल के निर्देशों के लिए काफी हद तक सटीक परिणाम देता है। हालाँकि, महत्वपूर्ण तकनीकी शब्दावली - जैसे कि ‘seal’/’guarnizione’ - के साथ, कुछ त्रुटियाँ बनी रहती हैं, जिन्हें ग्राहक के प्रशासक को ठीक करना होगा।
यहाँ, एडमिन के पास तीन विकल्प हैं:
- भाषा और कुंजी के अनुसार मैन्युअल ओवरराइड: प्रत्येक अनुवाद प्रविष्टि को एप्लिकेशन मैनेजर में खोला जा सकता है और प्रत्येक भाषा के लिए समायोजित किया जा सकता है। ‘लॉक’ विकल्प को चुनकर, यह मैन्युअल अनुवाद अगले स्वचालित रन में बरकरार रहेगा।
- शब्दावली आयात: अनुवाद उपकरणों या PDF शब्दावलियों से मौजूदा शब्दावली को एक CSV फ़ाइल के रूप में आयात किया जा सकता है और इसका उपयोग सीधे अनुवाद प्रविष्टियाँ बनाने के लिए किया जा सकता है।
- सिस्टम के चलने के दौरान प्रति-भाषा सुधार: एक इतालवी बिक्री टीम को एक त्रुटि दिखाई देती है, वह उसे एप्लिकेशन मैनेजर में सुधारती है - सुधार तुरंत प्रभावी हो जाता है, जबकि अन्य अनुवाद अपरिवर्तित रहते हैं।
एप्लिकेशन मैनेजर सभी 40 भाषाओं का समर्थन करता है
केवल उत्पाद डेटा शीट ही बहुभाषी नहीं हैं - वह इंटरफ़ेस जिसमें आप उन्हें बनाए रखते हैं, वह भी बहुभाषी है। एप्लिकेशन मैनेजर का अनुवाद सभी 40 भाषाओं में किया गया है, और आप इनमें से किसी भी भाषा में सामग्री दर्ज कर सकते हैं। सिस्टम इसे स्वचालित रूप से बाकी सभी भाषाओं में अनुवादित कर देता है।
बहुभाषी टीमों के लिए, यह सहयोग में एक ध्यान देने योग्य अंतर बनाता है: मिलान में उत्पाद प्रबंधन टीम देखभाल के निर्देश इतालवी में लिखती है, वारसॉ में खरीद टीम पोलिश में सामग्री डेटा जोड़ती है, और हैम्बर्ग में गुणवत्ता आश्वासन टीम जर्मन में विवरण की जाँच करती है। हर कोई अपनी भाषा में काम करता है, हर कोई एक ही डेटा सेट देखता है - और जो कोई भी किसी जानकारी को सही करता है, वह एक ही समय में सभी भाषा संस्करणों के लिए उसे सही करता है।
यहाँ भी, ऊपर उल्लेखित चेतावनी लागू होती है: महत्वपूर्ण तकनीकी शब्दावली के मामले में, अंततः एक इंसान को यह जांचना चाहिए कि मशीन ने क्या चुना है।
ईयू भाषाओं की वास्तविकता
24 आधिकारिक ईयू भाषाएँ सुनने में बहुत लगती हैं। व्यवहार में, तीन स्तर हैं:
- मुख्य बाज़ार: DE, EN, FR, IT, ES, NL - यहाँ, हर उपभोक्ता पूर्णता की उम्मीद करता है
- महत्वपूर्ण बाज़ार: PT, PL, SV, DA, FI - एक अच्छा मानक, हालांकि कभी-कभी मशीन का हाथ स्पष्ट रूप से दिख जाता है
- कम आम भाषाएँ: MT, GA, ET, LV, LT - कभी-कभी आपके पास माल्टीज़ में एक DPP होता है, जिसे माल्टा में कोई भी अंतिम उपभोक्ता कभी स्कैन नहीं करता है। फिर भी, यह अनिवार्य है।
यह आवश्यकता वैकल्पिक नहीं है। ईएसपीआर यह अनिवार्य करता है कि डीपीपी सामग्री उस सदस्य राज्य की भाषा में प्रदान की जाए जिसमें उत्पाद बेचा जाता है। इसलिए, 27 देशों में सेवा देने वाले किसी भी व्यक्ति को 24 भाषाओं से निपटना पड़ता है (कुछ देश भाषाएँ साझा करते हैं)।
माल्टीज़ से लेकर बंगाली तक
ट्रांसपेरियो 40 भाषाओं में अनुवाद करता है - सभी 24 आधिकारिक यूरोपीय संघ की भाषाएँ और वैश्विक पहुंच के लिए 16 अन्य:
- यूरोप: बुल्गेरियाई, डेनिश, जर्मन, अंग्रेजी, एस्टोनियाई, फिनिश, फ्रेंच, ग्रीक, आयरिश, इतालवी, क्रोएशियाई, लातवियाई, लिथुआनियाई, मॉल्टीज़, डच, पोलिश, पुर्तगाली, रोमानियाई, स्वीडिश, स्लोवाक, स्लोवेनियाई, स्पेनिश, चेक और हंगेरियन - साथ ही अल्बानियाई, बोस्नियाई, आइसलैंडिक, मैसिडोनियन, नॉर्वेजियन, रूसी, सर्बियाई, तुर्की और यूक्रेनी।
- विश्वव्यापी: बंगाली, चीनी, हिंदी, इंडोनेशियाई, जापानी, कोरियाई और वियतनामी।
आगामी टेक्सटाइल DPP के लिए, बंगाली और वियतनामी प्रमुख उत्पादन देशों को कवर करते हैं - ढाका में एक आपूर्तिकर्ता पेरिस में एक खरीदार के समान उत्पाद पासपोर्ट पढ़ता है।
एक केंद्रीकृत स्थानीयकरण परत क्यों
अधिकांश प्लेटफ़ॉर्म अनुवादों को डेटा रिकॉर्ड में अतिरिक्त फ़ील्ड के रूप में संग्रहीत करते हैं: description_de, description_en, … प्रत्येक अनुवाद योग्य एट्रिब्यूट के लिए 40 फ़ील्ड। यह सरल लगता है, लेकिन इसके तीन नुकसान हैं:
- डुप्लिकेट टेक्स्ट। एक ही सामग्री विवरण वाले दो उत्पाद केवल 40 के बजाय 40 + 40 अनुवाद उत्पन्न करते हैं
- स्केल करना मुश्किल। 41वीं भाषा जोड़ने का मतलब है सभी अनुवाद योग्य मॉडलों में स्कीमा माइग्रेशन
- सुधारों को वैश्विक रूप से लागू करना मुश्किल है। यदि ‘guarnizione’ को हर जगह ठीक किया जाता है, तो सभी डेटा रिकॉर्ड को व्यक्तिगत रूप से संपादित करना होगा
विभाजित अनुवाद परत इसे हल करती है: एक प्रविष्टि, कई संदर्भ। एक सुधार, सभी डेटा रिकॉर्ड को लाभ।
हमारे पास अभी तक क्या नहीं है
स्वचालित सुझाव मान्यता के साथ एक अनुकूलित शब्दावली डेटाबेस विकास के अधीन है, लेकिन वर्तमान में उपलब्ध नहीं है। आज शुरुआत करने वाला कोई भी व्यक्ति मौजूदा उपकरणों से बहुत कुछ हासिल कर सकता है: मैन्युअल ओवरराइड, शब्दावली आयात और ‘कीप’ फ़्लैग सबसे आम उपयोग के मामलों को कवर करते हैं।
हमारा मानना है कि मशीनों को काम का अधिकांश हिस्सा करना चाहिए और लोगों को केवल तभी हस्तक्षेप करना चाहिए जब यह वास्तव में आवश्यक हो। जब तक स्वचालित शब्दावली मान्यता उपलब्ध नहीं हो जाती, तब तक मैन्युअल प्रक्रिया पारदर्शी है - और यह एक ऐसे वादे से अधिक ईमानदार है जिसे पूरा नहीं किया जाता।
इस पोस्ट के बारे में प्रश्न
उत्पाद पासपोर्ट किन भाषाओं में उपलब्ध होना चाहिए?
ESPR के अनुसार उत्पाद की जानकारी उस सदस्य राज्य की भाषा में प्रदान की जानी चाहिए जहाँ उत्पाद बेचा जाता है। इसलिए पूरे यूरोपीय संघ में माल की आपूर्ति करने वाले किसी भी व्यक्ति को 24 आधिकारिक यूरोपीय संघ भाषाओं का ध्यान रखना होगा, जिनमें से कुछ कई सदस्य राज्यों द्वारा साझा की जाती हैं। Transpareo इन 24 भाषाओं के साथ-साथ 16 अन्य भाषाएँ भी प्रदान करता है, और प्रत्येक नया या संशोधित पाठ स्वचालित रूप से उन सभी में अनुवादित हो जाता है। व्यावहारिक रूप से, इसका मतलब है कि भाषा अब आरंभ बिंदु नहीं है - आप एक बार उस भाषा में लिखते हैं जिसमें आप काम करते हैं, और बाज़ार-विशिष्ट संस्करण बाद में तैयार हो जाते हैं।
यदि मशीन अनुवाद किसी तकनीकी शब्द का गलत अनुवाद कर दे तो कौन उत्तरदायी होगा?
उत्पाद को बाजार में उतारने वाले व्यवसाय की यह जिम्मेदारी है कि लेबल पर दी गई जानकारी सही हो, और यह जिम्मेदारी किसी अनुवाद प्रणाली या हम पर नहीं हस्तांतरित होती। इसीलिए हम इस बारे में स्पष्ट हैं कि मशीन कहाँ अच्छा प्रदर्शन करती है और कहाँ नहीं - विवरण, देखभाल निर्देश और विपणन पाठ सही निकलते हैं, जबकि घटक नाम, फास्टनिंग या कोटिंग जैसी तकनीकी शब्दावली के लिए मानवीय दृष्टि आवश्यक है। स्वचालित आउटपुट को 40 भाषाओं में एक संपूर्ण प्रथम मसौदा मानकर, अपनी प्रूफरीडिंग का समय उन कुछ सौ शब्दों पर केंद्रित करें जो मरम्मत की दुकानों और खरीदारों के लिए वास्तव में मायने रखते हैं।
मैं किसी शब्द को कैसे ठीक करूँ ताकि अगली स्वचालित रन इसे ओवरराइट न कर दे?
एप्लिकेशन मैनेजर में अनुवाद प्रविष्टि खोलें, संबंधित भाषा के लिए मान समायोजित करें और ‘लॉक’ फ़्लैग सेट करें। इस बॉक्स को टिक करने से यह प्रविष्टि स्वचालित रन से बाहर हो जाती है, जिससे यह सुनिश्चित होता है कि मूल पाठ बाद में संशोधित होने पर भी यह अपरिवर्तित रहे। यदि यह बॉक्स टिक नहीं किया गया है, तो आपकी सुधार को एक मानक अनुवाद माना जाएगा और मूल पाठ में बदलाव होते ही यह पुनः उत्पन्न हो जाएगा। एक शब्द पर भी वही दो-चरणीय प्रक्रिया लागू होती है जो पूरे पैराग्राफ पर होती है।
क्या हम मौजूदा शब्दावली सूची आयात कर सकते हैं?
हाँ। वह शब्दावली जिसे आप वैसे भी बनाए रखते हैं - चाहे वह किसी अनुवाद उपकरण से हो या आपकी एजेंसी की PDF शब्दावली से - को CSV फ़ाइल के रूप में आयात किया जा सकता है और इसे एक लिखित अनुवाद प्रविष्टि में परिवर्तित किया जाता है। इन प्रविष्टियों को फिर मैन्युअल सुधारों की तरह ही संभाला जाता है। इसे करने का सबसे अच्छा समय पहली बड़ी आयात से पहले है - इस तरह, हजारों रिकॉर्ड्स का अनुवाद होने से पहले ही शब्द तैयार हो जाते हैं, और किसी भी अनुवर्ती कार्य की आवश्यकता नहीं होती।
क्या सुधार सभी उत्पादों पर लागू होता है या केवल खुले रिकॉर्ड पर?
एक ही स्रोत पाठ वाले प्रत्येक डेटा रिकॉर्ड के लिए। अनुवाद व्यक्तिगत उत्पाद पर नहीं बल्कि एक साझा परत में संग्रहीत किए जाते हैं, इसलिए समान स्रोत पाठ वाले डेटा रिकॉर्ड एक ही प्रविष्टि साझा करते हैं, और एक बार की गई सुधार उन सभी पर लागू होती है। इसीलिए सुधार करने में लगने वाला प्रयास कैटलॉग के आकार के साथ नहीं बढ़ता - 4,000 उत्पादों में प्रकट होने वाला एक शब्द 4,000 प्रविष्टियाँ नहीं, बल्कि एक ही प्रविष्टि के रूप में गिना जाता है।
क्या विदेश में काम करने वाले सहकर्मियों को जर्मन या अंग्रेजी में काम करना पड़ता है?
नहीं। एप्लिकेशन मैनेजर स्वयं सभी 40 भाषाओं में उपलब्ध है, और सामग्री इनमें से किसी भी भाषा में दर्ज की जा सकती है। मिलान में उत्पाद प्रबंधन टीम देखभाल के निर्देश इतालवी में लिखती है, वारसॉ में खरीद टीम सामग्री संबंधी डेटा पोलिश में जोड़ती है, और सभी एक ही डेटा रिकॉर्ड देखते हैं। जो कोई भी किसी जानकारी को सुधारता है, वह उसे एक ही समय में सभी भाषा संस्करणों के लिए सुधारता है, जिससे केंद्रीय अनुवाद सेवा के माध्यम से जाने की सामान्य आवश्यकता समाप्त हो जाती है।
क्या कोई स्वचालित शब्दावली मान्यता सुविधा है?
आज नहीं। एक अनुकूलित शब्दावली डेटाबेस जो स्वचालित रूप से शब्द सुझाता है, विकास प्रक्रिया में है और अभी तक जारी नहीं किया गया है। तब तक, उपलब्ध विकल्प हैं: मैन्युअल ओवरराइटिंग, ‘होल्ड’ फ्लैग और ग्लोसरी आयात। हम यह स्पष्ट करना बेहतर समझते हैं बजाय इसके कि आप एक ऐसे फीचर के लिए योजना बनाएँ जो मौजूद ही नहीं है। अधिकांश सामान्य परिदृश्यों के लिए ये तीन उपकरण आपकी आवश्यकताओं को पूरा करते हैं, और आपको जिन शब्दों को फ़्लैग करना है उनकी संख्या उन शब्दों की संख्या से कहीं कम है जिन्हें अनुवादित करने की आवश्यकता है।




