স্বয়ংক্রিয়ভাবে ৪০টি ভাষা: আমাদের এআই অনুবাদ কীভাবে বিশেষায়িত পরিভাষা পরিচালনা করে

স্বয়ংক্রিয়ভাবে ৪০টি ভাষা: আমাদের এআই অনুবাদ কীভাবে বিশেষায়িত পরিভাষা পরিচালনা করে

আমাদের স্বয়ংক্রিয় পণ্য তথ্য অনুবাদের পর্দার আড়ালে এক নজর - এবং কেন বিশেষায়িত পরিভাষাকে উপন্যাসের মতো নয়, ভিন্নভাবে বিবেচনা করতে হয়।

মেশিন অনুবাদ এখন এতটাই উন্নত যে অনেক ক্ষেত্রেই এটিকে মানুষের অনুবাদের থেকে পৃথক করা অসম্ভব। অনুবাদ সেবাগুলো সাবলীল, প্রবাদপ্রতিম অনুবাদ তৈরি করে, যা নিবন্ধনের অনুভূতি ধরে রাখে। তারপর আপনি একটি DPP ডেটা সেট অনুবাদ করেন - এবং হঠাৎ ‘rear lock fibre closure’ হয়ে যায় ‘Hinterschloss-Faserverschluss’।

সমস্যাটি হলো প্রযুক্তি গত পরিভাষা। এখানে আমরা ব্যাখ্যা করছি কেন পণ্য ডেটা উপন্যাসের মতো বিবেচনা করা উচিত নয়, এবং Transpareo কোন সরঞ্জামগুলি প্রদান করে যাতে আপনার ৪০টি ভাষার সংস্করণ বোঝার উপযোগী থাকে।

মৌলিক সমস্যা: একটি শব্দ, একাধিক অর্থ

আউটডোর জ্যাকেটের DPP-তে ‘Seal ‘: জলরোধী করা। ল্যাবরেটরিতে ‘Seal’: প্রসঙ্গ অনুযায়ী সীল (প্রাণী) বা একটি গ্যাসকেট। রক্ষণাবেক্ষণ লগে ‘Seal’: সম্ভবত একটি সীল (যেমন স্ট্যাম্পের সীল)।

একটি সাধারণ অনুবাদ মডেল পরিসংখ্যানগত প্রেক্ষাপটের ভিত্তিতে তার পছন্দ নির্ধারণ করে। এটি ধারাবাহিক লেখার জন্য কাজ করে - একটি উপন্যাস প্রচুর প্রেক্ষাপট প্রদান করে। কিন্তু primary_closure: seal-এর মতো একটি ডেটা ক্ষেত্রের জন্য, প্রায় কোনো প্রেক্ষাপটই থাকে না। মডেলটি একটি শিক্ষিত অনুমান করে।

ফলাফল সূক্ষ্ম ত্রুটি। ‘Hinterschloss-Faserverschluss’ এর মতো নাটকীয় না হলেও তা গুরুত্বপূর্ণ: জার্মান ভাষায় ‘Dichtung’ নামে পরিচিত একটি উপাদান হঠাৎ করেই ইতালীয় DPP-তে ‘guarnizione’ এর পরিবর্তে ‘sigillo’ হিসেবে উল্লেখ করা হয়েছে একজন ক্রেতা আর স্পেয়ার পার্টটি খুঁজে পাচ্ছে না।

Transpareo আজ যা করে

আমাদের অনুবাদ সিস্টেম স্বয়ংক্রিয়ভাবে সমস্ত নতুন বিষয়বস্তুকে সমস্ত সক্রিয় ভাষায় অনুবাদ করে। এটি চারটি মূল বৈশিষ্ট্যে চিহ্নিত:

  • মার্কডাউন এবং ভেরিয়েবল সংরক্ষণ: <a href="/bn/nibndhn-krun">Pro-Membership</a>-এর মতো প্লেসহোল্ডার এবং মার্কডাউন কাঠামো অনুবাদের আগে বের করে নেওয়া হয়; সাধারণ টেক্সট অনুবাদ করা হয়, এবং কাঠামোগুলো অপরিবর্তিত অবস্থায় পুনরায় সন্নিবেশিত করা হয়। এটি নিশ্চিত করে যে লিঙ্ক, ফর্ম এবং লেআউট সব ভাষায় সামঞ্জস্যপূর্ণ থাকে।
  • কেন্দ্রীভূত অনুবাদ এন্ট্রি: অনুবাদগুলি ডেটা রেকর্ডের মধ্যে সংরক্ষণ করা হয় না, বরং একটি ভাগ করা স্তরে সংরক্ষণ করা হয়। একই উৎস পাঠ্যবিশিষ্ট একাধিক ডেটা রেকর্ড একটি একক অনুবাদ শেয়ার করে। এতে অনুবাদ খরচ বাঁচে এবং ডেটা মডেলের জুড়ে পরিভাষা স্বয়ংক্রিয়ভাবে মানসম্মত হয়।
  • পরিবর্তন হলে স্বয়ংক্রিয় পুনরায় অনুবাদ: যদি মূল পাঠ্য সংশোধন করা হয়, তাহলে সমস্ত ভাষার অনুবাদ পুনরায় তৈরি হয়। জার্মান ভাষায় একটি সংশোধন স্বয়ংক্রিয়ভাবে অন্যান্য ৩৯টি ভাষার সংস্করণ আপডেট করে।
  • প্রতি ডেটা রেকর্ডে মার্কিং: স্বয়ংক্রিয় প্রক্রিয়া থেকে বিষয়বস্তু বাদ দেওয়া যেতে পারে, অথবা বিদ্যমান অনুবাদ লক করা যেতে পারে - উদাহরণস্বরূপ, আন্তর্জাতিক পণ্যের নাম বা ম্যানুয়াল সংশোধনের জন্য।

যেখানে গ্রাহক প্রক্রিয়াকরণে সম্পূরক যোগ করেন

স্বয়ংক্রিয় অনুবাদ বর্ণনামূলক টেক্সট, মার্কেটিং কপি এবং যত্নের নির্দেশনার জন্য সাধারণত সঠিক ফলাফল প্রদান করে। তবে, ‘seal’/’guarnizione’ এর মতো গুরুত্বপূর্ণ প্রযুক্তিগত পরিভাষায় কিছু ত্রুটি থেকে যায়, যা গ্রাহকের প্রশাসককে সংশোধন করতে হবে।

এখানে, অ্যাডমিনের তিনটি বিকল্প রয়েছে:

১. ভাষা এবং কী অনুযায়ী ম্যানুয়াল ওভাররাইড: প্রতিটি অনুবাদ এন্ট্রি অ্যাপ্লিকেশন ম্যানেজারে খুলে প্রতিটি ভাষার জন্য সামঞ্জস্য করা যেতে পারে। ‘লক’ অপশন নির্বাচন করলে, পরবর্তী স্বয়ংক্রিয় রানে এই ম্যানুয়াল অনুবাদটি সংরক্ষিত থাকবে। ২. গ্লossary আমদানি: অনুবাদ টুল বা PDF গ্লossary থেকে বিদ্যমান পরিভাষা CSV ফাইল হিসেবে আমদানি করে সরাসরি অনুবাদ এন্ট্রি তৈরিতে ব্যবহার করা যেতে পারে। ৩. সিস্টেম চলমান অবস্থায় প্রতি-ভাষা সংশোধন: একটি ইতালীয় বিক্রয় দল একটি ত্রুটি খুঁজে পেলে, এটি অ্যাপ্লিকেশন ম্যানেজারে সংশোধন করে - সংশোধনটি অবিলম্বে কার্যকর হয়, অন্য অনুবাদগুলো অপরিবর্তিত থাকে।

অ্যাপ্লিকেশন ম্যানেজার সব ৪০টি ভাষাকে সমর্থন করে

শুধুমাত্র পণ্য ডেটা শীটগুলোই বহুভাষিক নয় - যে ইন্টারফেসের মাধ্যমে আপনি সেগুলো রক্ষণাবেক্ষণ করেন তা-ও বহুভাষিক। অ্যাপ্লিকেশন ম্যানেজারটি সব ৪০টি ভাষায় অনূদিত হয়েছে, এবং আপনি এই ভাষাগুলোর যেকোনো একটিতে বিষয়বস্তু প্রবেশ করাতে পারেন। সিস্টেম স্বয়ংক্রিয়ভাবে সেটি অন্যান্য সব ভাষায় অনুবাদ করে।

বহু-ভাষিক দলগুলোর জন্য, এটি সহযোগিতায় একটি লক্ষণীয় পার্থক্য তৈরি করে: মিলানের পণ্য ব্যবস্থাপনা দল ইতালীয় ভাষায় যত্ন নির্দেশিকা লেখে, ওয়ার্সোর ক্রয় দল পোলিশ ভাষায় উপাদান সম্পর্কিত তথ্য যোগ করে, এবং হামবুর্গের গুণগত নিশ্চয়তা দল জার্মান ভাষায় বিবরণগুলি যাচাই করে। প্রত্যেকেই তাদের নিজস্ব ভাষায় কাজ করে, প্রত্যেকে একই ডেটাসেট দেখে - এবং কেউ যখন কোনো তথ্য সংশোধন করে, তখন তা একই সাথে সমস্ত ভাষার সংস্করণের জন্য সংশোধন করা হয়।

এখানেও, উপরে উল্লেখিত সতর্কবার্তাটি প্রযোজ্য: গুরুত্বপূর্ণ প্রযুক্তিগত পরিভাষার ক্ষেত্রে, মেশিন যা বেছে নিয়েছে তা শেষ পর্যন্ত একজন মানুষকে যাচাই করা উচিত।

ইইউ ভাষাগুলির বাস্তবতা

২৪টি সরকারি ইইউ ভাষা শুনতে অনেক মনে হতে পারে। বাস্তবে, তিনটি স্তর রয়েছে:

  • মূল বাজার: DE, EN, FR, IT, ES, NL - এখানে, প্রতিটি ভোক্তা নিখুঁততা আশা করে
  • গুরুত্বপূর্ণ বাজার: PT, PL, SV, DA, FI - এখানে মান ভালো, যদিও মাঝে মাঝে যন্ত্রের হস্তক্ষেপ স্পষ্ট হয়ে ওঠে
  • কম প্রচলিত ভাষা: MT, GA, ET, LV, LT - কখনও কখনও মাল্টায় কোনো শেষ ভোক্তা এটি স্ক্যান না করলেও মাল্টিজ ভাষায় একটি DPP থাকে। তবুও, এটি বাধ্যতামূলক।

এই শর্তটি ঐচ্ছিক নয়। ESPR নির্দেশ করে যে DPP বিষয়বস্তু সেই সদস্য রাষ্ট্রের ভাষায় প্রদান করতে হবে যেখানে পণ্যটি বিক্রি হয়। অতএব, ২৭টি দেশে সেবা প্রদানকারীকে ২৪টি ভাষার মোকাবিলা করতে হয় (কিছু দেশ ভাষা ভাগাভাগি করে)।

মাল্টিজ থেকে বাংলা

ট্রান্সপ্যারেও ৪০টি ভাষায় অনুবাদ করে - সমস্ত ২৪টি EU-এর সরকারি ভাষা এবং বৈশ্বিক বিস্তারের জন্য আরও ১৬টি ভাষা:

  • ইউরোপ: বুলগেরিয়ান, ডেনিশ, জার্মান, ইংরেজি, এস্তোনিয়ান, ফিনিশ, ফরাসি, গ্রীক, আয়ারিশ, ইতালিয়ান, ক্রোয়েশিয়ান, লাটভিয়ান, লিথুয়ানিয়ান, মল্টেসি, ডাচ, পোলিশ, পর্তুগিজ, রোমানিয়ান, সুইডিশ, স্লোভাক, স্লোভেনিয়ান, স্প্যানিশ, চেক এবং হাঙ্গেরিয়ান - এছাড়াও আলবেনিয়ান, বসনীয়, আইসল্যান্ডিক, ম্যাসেডোনিয়ান, নরওয়েজিয়ান, রাশিয়ান, সার্বিয়ান, তুর্কি এবং ইউক্রেনীয়।
  • বিশ্বব্যাপী: বাংলা, চীনা, হিন্দি, ইন্দোনেশীয়, জাপানি, কোরিয়ান এবং ভিয়েতনামী।

আসন্ন টেক্সটাইল DPP-এর জন্য, বাংলা এবং ভিয়েতনামী প্রধান উৎপাদনকারী দেশগুলোকে অন্তর্ভুক্ত করে - ঢাকায় একজন সরবরাহকারী প্যারিসে একজন ক্রেতার মতো একই পণ্য পাসপোর্ট পড়ে।

কেন একটি কেন্দ্রীভূত স্থানীয়করণ স্তর

অধিকাংশ প্ল্যাটফর্ম অনুবাদগুলিকে ডেটা রেকর্ডের অতিরিক্ত ফিল্ড হিসেবে সংরক্ষণ করে: description_de, description_en, … প্রতিটি অনুবাদযোগ্য বৈশিষ্ট্যের জন্য ৪০টি ফিল্ড। এটি শুনতে সহজ মনে হলেও, এর তিনটি অসুবিধা রয়েছে:

  • ডুপ্লিকেট টেক্সট। একই উপাদান বিবরণ সহ দুটি পণ্য মাত্র ৪০টির পরিবর্তে ৪০+৪০টি অনুবাদ তৈরি করে
  • স্কেল করা কঠিন। ৪১তম ভাষা যোগ করার অর্থ হল সমস্ত অনুবাদযোগ্য মডেলের জন্য স্কিমা মাইগ্রেশন
  • সংশোধনগুলো বিশ্বব্যাপী প্রয়োগ করা কঠিন। যদি ‘guarnizione’ সর্বত্র সংশোধন করা হয়, তাহলে সমস্ত ডেটা রেকর্ড আলাদাভাবে সম্পাদনা করতে হবে

বিভক্ত অনুবাদ স্তর এটি সমাধান করে: একটি এন্ট্রি, অনেক রেফারেন্স। একটি সংশোধন, সমস্ত ডেটা রেকর্ড উপকৃত হয়।

যা আমাদের এখনও নেই

স্বয়ংক্রিয় প্রস্তাবনা স্বীকৃতি সহ একটি কাস্টম পরিভাষা ডাটাবেস উন্নয়নাধীন রয়েছে, তবে বর্তমানে এটি উপলব্ধ নয়। আজ যারা শুরু করছেন তারা বিদ্যমান টুলস দিয়ে অনেকদূর এগিয়ে যেতে পারবেন: ম্যানুয়াল ওভাররাইড, গ্লossary আমদানি এবং ‘keep’ ফ্ল্যাগ সবচেয়ে সাধারণ ব্যবহারের ক্ষেত্রে কাজ করে।

আমরা বিশ্বাস করি যে মেশিনগুলোই কাজের বড় অংশটি করা উচিত এবং মানুষ শুধুমাত্র তখনই হস্তক্ষেপ করা উচিত যখন তা সত্যিই প্রয়োজন। স্বয়ংক্রিয় পরিভাষা স্বীকৃতি উপলব্ধ না হওয়া পর্যন্ত, ম্যানুয়াল প্রক্রিয়াটি স্বচ্ছ - এবং তা পূরণ না হওয়া প্রতিশ্রুতির তুলনায় বেশি সৎ।

এই পোস্ট সম্পর্কে প্রশ্ন

কোন কোন ভাষায় একটি পণ্য পাসপোর্ট উপলব্ধ থাকতে হবে?

ESPR অনুযায়ী পণ্য বিক্রিত সদস্য রাষ্ট্রের ভাষায় পণ্য সম্পর্কিত তথ্য প্রদান করতে হয়। তাই সমগ্র ইউরোপীয় ইউনিয়নে পণ্য সরবরাহকারী যে কেউ ২৪টি সরকারি ভাষা বিবেচনায় নিতে বাধ্য, যেগুলোর কিছু একাধিক সদস্য রাষ্ট্রের মধ্যে ভাগাভাগি করা হয়। Transpareo এই ২৪টি ভাষার পাশাপাশি আরও ১৬টি ভাষা প্রদান করে, এবং প্রতিটি নতুন বা সংশোধিত পাঠ্য স্বয়ংক্রিয়ভাবে সব ভাষায় অনুবাদিত হয়। ব্যবহারিক দিক থেকে এর অর্থ হলো ভাষা আর আরম্ভের বিন্দু নয় - আপনি একবার আপনার কাজের ভাষায় লিখবেন, এবং বাজার-নির্দিষ্ট সংস্করণগুলো তৈরি হয়ে যাবে।

যদি কোনো মেশিন অনুবাদে একটি প্রযুক্তিগত পরিভাষা ভুল হয়, তাহলে কে দায়ী?

পণ্যের লেবেলে থাকা তথ্য সঠিক আছে কি না তা নিশ্চিত করার দায়িত্ব বাজারজাতকারী প্রতিষ্ঠানের; এই দায়িত্ব কোনো অনুবাদ ব্যবস্থায় বা আমাদের ওপর হস্তান্তরিত হয় না। এজন্য আমরা স্বচ্ছভাবে জানাই মেশিনটি কোথায় ভালো কাজ করে এবং কোথায় করে না - বর্ণনা, যত্ন নির্দেশিকা এবং বিপণনমূলক লেখা সঠিকভাবে আসে, তবে উপাদান নাম, ফাস্টেনিং বা কোটিংসের মতো অত্যন্ত বিশেষায়িত পরিভাষার জন্য মানবীয় নজরদারি প্রয়োজন। স্বয়ংক্রিয় আউটপুটকে ৪০টি ভাষায় একটি সম্পূর্ণ প্রথম খসড়া হিসেবে বিবেচনা করুন এবং আপনার প্রুফরিডিং সময় ব্যয় করুন সেই কয়েকশো শব্দে, যা মেরামত দোকান ও ক্রেতাদের জন্য সত্যিই গুরুত্বপূর্ণ।

আমি কীভাবে একটি টার্ম সংশোধন করব যাতে পরবর্তী স্বয়ংক্রিয় রানের সময় তা ওভাররাইট না হয়?

অ্যাপ্লিকেশন ম্যানেজারে অনুবাদ এন্ট্রিটি খুলুন, সংশ্লিষ্ট ভাষার মান সামঞ্জস্য করুন এবং ‘লক’ ফ্ল্যাগ সেট করুন। এই বাক্সে টিক দিলে এন্ট্রিটি স্বয়ংক্রিয় রানের বাইরে রাখা হয়, ফলে মূল পাঠ পরবর্তীতে পরিবর্তিত হলেও এটি অপরিবর্তিত থাকে। যদি এই বাক্সে টিক না দেওয়া হয়, আপনার সংশোধনটি একটি সাধারণ অনুবাদের মতো গণ্য হবে এবং মূল পাঠ পরিবর্তিত হওয়া মাত্রই তা পুনরায় তৈরি হবে। একটি একক শব্দের ক্ষেত্রেও এবং একটি সম্পূর্ণ অনুচ্ছেদের ক্ষেত্রেও একই দুই-ধাপের প্রক্রিয়া প্রযোজ্য।

আমরা কি বিদ্যমান পরিভাষা তালিকা আমদানি করতে পারি?

হ্যাঁ। আপনি যেই পরিভাষা যেকোনোভাবেই রক্ষণ করেন - চাই তা কোনো অনুবাদ টুল থেকে হোক বা আপনার এজেন্সির PDF গ্লসারি থেকে - CSV ফাইল হিসেবে আমদানি করে লিখিত অনুবাদ এন্ট্রি হিসেবে দেখানো যায়। এই এন্ট্রিগুলো পরবর্তীতে ম্যানুয়াল সংশোধনের মতোই বিবেচিত হয়। এটি করার সেরা সময় হল প্রথম প্রধান আমদানির আগে - এভাবে হাজার হাজার রেকর্ড অনুবাদ হওয়ার আগেই শব্দসমূহ সঠিকভাবে প্রস্তুত থাকবে, এবং কোনো অতিরিক্ত কাজের প্রয়োজন পড়বে না।

সংশোধন কি সব পণ্যের ক্ষেত্রে প্রযোজ্য, নাকি শুধুমাত্র খোলা রেকর্ডের ক্ষেত্রে?

একই উৎস পাঠ্যবিশিষ্ট প্রতিটি ডেটা রেকর্ডের জন্য। অনুবাদগুলো পৃথক পণ্যের সাথে সংরক্ষণ না করে একটি ভাগ করা স্তরে রাখা হয়, তাই একই উৎস পাঠ্যবিশিষ্ট ডেটা রেকর্ডগুলো একটি একক এন্ট্রি শেয়ার করে, এবং একবার করা সংশোধন সবগুলোর ক্ষেত্রেই প্রযোজ্য হয়। এই কারণেই সংশোধন করার প্রচেষ্টা তালিকার আকারের সাথে সাথে বৃদ্ধি পায় না - ৪,০০০টি পণ্যে যে কোনো শব্দ একক এন্ট্রি হিসেবে গণ্য হয়, ৪,০০০টি নয়।

বিদেশে কর্মরত সহকর্মীদের কি জার্মান ভাষায় কাজ করতে হয় নাকি ইংরেজি ভাষায়?

না। অ্যাপ্লিকেশন ম্যানেজার নিজেই ৪০টি ভাষায় উপলব্ধ, এবং যেকোনো ভাষায় বিষয়বস্তু প্রবেশ করানো যায়। মিলানের পণ্য ব্যবস্থাপনা দল ইতালীয় ভাষায় যত্ন নির্দেশিকা লেখে, ওয়ার্সোর ক্রয় দল পোলিশ ভাষায় উপাদান তথ্য যোগ করে, এবং সবাই একই ডেটা রেকর্ড দেখতে পায়। যে কেউ কোনো তথ্য সংশোধন করলে তা একই সাথে সব ভাষা সংস্করণের জন্য সংশোধন করা হয়, ফলে সাধারণত কেন্দ্রীয় অনুবাদ সেবার মাধ্যমে যাওয়ার প্রয়োজনীয়তা দূর হয়।

স্বয়ংক্রিয় পরিভাষা শনাক্তকরণ বৈশিষ্ট্য কি আছে?

আজ নয়। স্বয়ংক্রিয়ভাবে শব্দ প্রস্তাব করে এমন একটি কাস্টমাইজড পরিভাষা ডাটাবেস বর্তমানে উন্নয়নাধীন রয়েছে এবং এখনও প্রকাশ করা হয়নি। ততক্ষণ পর্যন্ত উপলব্ধ বিকল্পগুলো হল ম্যানুয়াল ওভাররাইটিং, ‘হোল্ড’ ফ্ল্যাগ এবং গ্লসারি আমদানি। আমরা চাই এটা স্পষ্ট করে দিতে, যাতে আপনি এমন কোনো ফিচারের জন্য পরিকল্পনা না করেন যা আসলে নেই। সাধারণ বেশিরভাগ পরিস্থিতিতে এই তিনটি টুলই যথেষ্ট, এবং আপনাকে ফ্ল্যাগ করতে হবে এমন শব্দের সংখ্যা অনুবাদ করতে হবে এমন শব্দের সংখ্যার তুলনায় অনেক কম।

বহুভাষিকতা এবং DPP অনুশীলন সম্পর্কিত আপডেট

নতুন ভাষা, ডেটা গুণমান এবং পণ্য বৈশিষ্ট্য - প্রতি মাসে একবার আপনার ইনবক্সে বাছাই করে পাঠানো হয়।