40 nyelv automatikusan: hogyan kezeli a mesterséges intelligencia által támogatott fordításunk a szakszavakat

40 nyelv automatikusan: hogyan kezeli a mesterséges intelligencia által támogatott fordításunk a szakszavakat

Egy pillantás az automatikus termékadat-fordítás kulisszái mögé - és arra, hogy miért kell a szakszókincset másképp kezelni, mint egy regény szövegét.

A gépi fordítás manapság már olyan jó, hogy sok esetben nem lehet megkülönböztetni az emberi fordítástól. A fordítási szolgáltatások folyékonyan, idiomatikus módon, a stílusra való érzékkel működnek. Aztán lefordítunk egy DPP-adatsort - és hirtelen a „rear lock fiber closure” „hátsó zár szálzáró” lesz .

A probléma a szakszókincs. Itt elmagyarázzuk, miért nem szabad a termékadatokat úgy kezelni, mint a regényeket, és milyen eszközöket biztosít a Transpareo ahhoz, hogy a 40 nyelvi változatuk érthető maradjon.

Az alapvető probléma: egy szó, több jelentés

„Seal” egy outdoor kabát DPP-jében: tömítés. „Seal” egy laboratóriumban: fók vagy tömítés, a kontextustól függően. „Seal” egy karbantartási jegyzőkönyvben: bizonyos körülmények között pecsét.

Egy általános fordítási modell a statisztikai kontextus alapján választ. Folyékony szöveg esetén ez működik - a regény bőséges kontextust nyújt. Egy primary_closure: seal adatmező esetében alig van kontextus. A modell csak találgat.

Ennek következtében finom hibák keletkeznek. Nem olyan drámaiak, mint a „Hinterschloss-Faserverschluss”, de következményesek: egy alkatrész, amelyet németül „Dichtung”-nak neveznek, egy olasz DPP-ben hirtelen „sigillo”-nak hívják „guarnizione” helyett . Egy beszerző már nem találja meg a pótalkatrészt.

Mit nyújt ma a Transpareo

Fordítási rendszerünk minden új tartalmat automatikusan átvisz az összes aktív nyelvre. Négy tulajdonság jellemzi:

  • Markdown és változók megőrzése: a helyőrzőket, mint példáula<a href="/hu/regisztralni">Pro-Mitgliedschaft</a>, és a Markdown-struktúrákat a fordítás előtt kivonjuk, a puszta szöveget lefordítjuk, majd a struktúrákat változatlanul visszahelyezzük. Így a linkek, űrlapok és az elrendezés minden nyelven konzisztens marad.
  • Központi fordítási bejegyzések: A fordításokat nem magában az adatrekordban tároljuk, hanem egy megosztott rétegben. Több, azonos eredeti szöveggel rendelkező adatrekord osztozik egy fordításon. Ez csökkenti a fordítási költségeket, és automatikusan egységesíti a kifejezéseket az adatmodell egészében.
  • Automatikus újrafordítás módosítás esetén: Ha az eredeti szöveget módosítják, a fordítások minden nyelven újra generálódnak. Egy javítás a német nyelven - 39 másik nyelvi változat automatikusan követi.
  • Adatrekordonkénti jelölések: A tartalmak kizárhatók az automatikus feldolgozásból, vagy a meglévő fordítások rögzíthetők - például nemzetközi terméknevek vagy kézi javítások esetén.

Ahol az ügyfél kiegészíti a feldolgozást

Az automatikus fordítás nagyrészt helyes eredményeket szolgáltat a leíró szövegek, marketing szövegek és karbantartási utasítások esetében. Kritikus szakszókincs - például a „seal”/„guarnizione” - esetén marad egy kis mennyiségű hiba, amelyet az ügyfél rendszergazdájának kell kijavítania.

Itt az adminisztrátornak három lehetősége van:

  1. Kézi felülírás nyelvenként és kulcsszóként: Minden fordítási bejegyzés megnyitható az Alkalmazáskezelőben, és nyelvenként módosítható. A rögzítés jelöléssel ez a kézi fordítás megmarad a következő automatikus futtatás során.
  2. Szótárimport: A fordítóeszközökből vagy PDF-szótárakból származó meglévő terminológiák CSV-fájlként importálhatók, és közvetlenül leírt fordítási bejegyzéseket hoznak létre.
  3. Nyelvenkénti javítások működés közben: Ha például az olasz értékesítési csapat hibát észlel, azt az Alkalmazáskezelőben kijavítja - a javítás azonnal hatályba lép, a többi fordítás változatlan marad.

Az Alkalmazáskezelő ugyanazt a 40 nyelvet támogatja

Nem csak a termékadatlapok többnyelvűek - hanem az a felület is, amelyen azokat karbantartja. Az Alkalmazáskezelő mind a 40 nyelvre le van fordítva, és Ön bármelyik nyelven rögzítheti a tartalmakat. A rendszer automatikusan lefordítja azokat az összes többi nyelvre.

A többnyelvű csapatok számára ez érezhetően megváltoztatja az együttműködést: a milánói termékmenedzsment olaszul írja meg a karbantartási utasításokat, a varsói beszerzés lengyelül egészíti ki az anyagadatokat, a hamburgi minőségbiztosítás pedig németül ellenőrzi azokat. Mindenki a saját nyelvén dolgozik, mindenki ugyanazt az adatsort látja - és aki egy adatot javít, az egyszerre javítja az összes nyelvi változatban.

Itt is érvényes a fentebb említett korlátozás: kritikus szakszókincs esetén végül egy embernek ellenőriznie kell, hogy a gép mit választott.

Az EU-nyelvek valósága

24 EU-hivatalos nyelv - ez soknak tűnik. A gyakorlatban három réteg van:

  • Fő piacok: DE, EN, FR, IT, ES, NL - itt minden fogyasztó tökéletességet vár
  • Jelentős piacok: PT, PL, SV, DA, FI - jó színvonal, néha észrevehető a gépi fordítás
  • Ritka nyelvek: MT, GA, ET, LV, LT - néha van egy máltai nyelvű DPP, anélkül, hogy valaha is egy végfelhasználó Máltán beolvasná. Ennek ellenére kötelező.

Ez a kötelezettség nem opcionális. Az ESPR előírja, hogy a DPP-tartalmaknak annak a tagállamnak a nyelvén kell szerepelniük, ahol a terméket értékesítik. Aki 27 országot szolgál ki, annak tehát 24 nyelvet kell figyelembe vennie (néhány országban több nyelv is használatos).

A máltai nyelvtől a bengáliig

A Transpareo 40 nyelvre fordít - mind a 24 uniós hivatalos nyelvre, valamint további 16 nyelvre a globális lefedettség érdekében:

  • Európa: bolgár, dán, német, angol, észt, finn, francia, görög, ír, olasz, horvát, lett, litván, máltai, holland, lengyel, portugál, román, svéd, szlovák, szlovén, spanyol, cseh és magyar - emellett albán, bosnyák, izlandi, macedón, norvég, orosz, szerb, török és ukrán nyelv is.
  • Világszerte: bengáli, kínai, hindi, indonéz, japán, koreai és vietnámi.

A közelgő textil-DPP esetében a bengáli és a vietnámi nyelvvel lefedve vannak a nagy termelőországok - egy dhakai beszállító ugyanazt a leírást olvassa, mint egy párizsi beszerző.

Miért van szükség egy központosított lokalizációs rétegre?

A legtöbb platform a fordításokat kiegészítő mezőkként tárolja az adatrekordban: description_de, description_en, … 40 mező fordítható attribútumonként. Egyszerűnek tűnik, de három hátránya van:

  • Duplikált szöveg. Két, azonos anyagmegjelöléssel rendelkező termék 40 + 40 fordítást eredményez, ahelyett, hogy egyszerre 40-et
  • Nehezen skálázható. Egy 41. nyelv hozzáadása azt jelenti: sémamigráció az összes fordítható modellre kiterjedően
  • A javítások nehezen alkalmazhatók globálisan. Ha a „guarnizione” szót mindenhol kijavítják, akkor az összes adatrekordot egyenként kellene szerkeszteni

A megosztott fordítási réteg megoldja ezt: egy bejegyzés, sok hivatkozás. Egy javítás, és az összes adatrekord részesül belőle.

Ami még nincs meg

Egy ügyfélspecifikus terminológiai adatbázis automatikus javaslatfelismeréssel a fejlesztési tervekben szerepel, de jelenleg még nem áll rendelkezésre. Aki ma kezd bele, a meglévő eszközökkel is messzire jut: a kézi felülírások, a szótárimportok és a rögzítési jelölés lefedik a leggyakoribb felhasználási eseteket.

Úgy véljük, hogy a gépeknek kell elvégezniük a munka nagy részét, az embereknek pedig csak ott kell beavatkozniuk, ahol valóban szükséges. Amíg az automatikus terminológiafelismerés elérhetővé nem válik, a kézi beavatkozás átlátható - és ez őszintébb, mint egy be nem tartott ígéret.

Kérdések ehhez a bejegyzéshez

Milyen nyelveken kell rendelkezésre állnia a terméknyilatkozatnak?

Az ESPR előírja, hogy a címkék tartalmát annak a tagállamnak a nyelvén kell megadni, amelyben a terméket értékesítik. Aki az egész Unióba szállít, annak az EU 24 hivatalos nyelvével kell számolnia, amelyek közül néhányat több tagállam is használ. A Transpareo biztosítja ezt a 24 nyelvet és további 16 nyelvet, és minden új vagy módosított szöveg automatikusan átkerül az összes nyelvre. A gyakorlatban ez azt jelenti, hogy a nyelv már nem jelent kiindulási kritériumot - Ön egyszer írja meg a szöveget abban a nyelven, amelyben dolgozik, és a piaci változatok automatikusan elkészülnek.

Ki felel, ha egy gépi fordításban egy szakszó helytelenül szerepel?

Ön. A termék forgalomba hozójára hárul a kötelezettség, hogy a termékleírás tartalmát pontosan tartsa, és ez a felelősség sem a fordítási rendszerre, sem ránk nem hárul át. Ezért nyíltan megmondjuk, hol teljesít jól a gép, és hol nem - a leírások, ápolási útmutatások és marketing szövegek hibátlanul jönnek ki, míg a szűk értelemben vett szakszavak, mint például az alkatrészek nevei, a zárókészülékek vagy a bevonatok, emberi szemre szorulnak. Tekintse az automatikus fordítást egy teljes, 40 nyelvű első vázlatnak, és fordítsa az ellenőrzési időt arra a néhány száz kifejezésre, amelyek valóban fontosak a szervizek és a vásárlók számára.

Hogyan javíthatok ki egy kifejezést úgy, hogy a következő automatikus futtatás ne írja felül?

Nyissa meg a fordítási bejegyzést az Alkalmazáskezelőben, módosítsa az adott nyelv értékét, majd jelölje be a „Rögzítés” jelölőnégyzetet. A jelölés kivonja a bejegyzést az automatikus futtatásból, így az az eredeti szöveg későbbi módosításait is megőrzi. Jelölés nélkül a javítását a rendszer egyszerű fordításnak tekinti, és az eredeti szöveg megváltozásakor újra generálja. Egyetlen szó esetében is ugyanaz a kétlépéses eljárás érvényes, mint egy egész bekezdésnél.

Be tudunk-e importálni egy meglévő terminológiai listát?

Igen. Azokat a terminológiai elemeket, amelyeket egyébként is karbantart, akár egy fordítóeszközből, akár az ügynöksége PDF-szótárából, CSV-fájlként importálhatja, és azok írásbeli fordítási bejegyzésként kerülnek be a rendszerbe. Ezek a bejegyzések ezután úgy viselkednek, mint a kézi javítások. A legalkalmasabb időpont erre az első nagy import előtt van - ilyenkor a kifejezések már rendelkezésre állnak, mielőtt több ezer adatsor lefordításra kerülne, és nem marad utólagos munkára szükség.

A módosítás minden termékre vonatkozik, vagy csak a megnyitott adatrekordra?

Minden olyan adatrekord esetében, amelynek eredeti szövege megegyezik. A fordítások nem az egyes termékekhez, hanem egy közös rétegben találhatók, így az azonos szövegű adatrekordok egy bejegyzést osztanak meg egymás között, és egy egyszeri javítás mindegyikre hatással van. Ezért a javítási ráfordítás sem növekszik a katalógus méretével arányosan - egy kifejezés 4000 terméken egy bejegyzést jelent, nem pedig 4000-et.

A külföldön dolgozó kollégáknak németül vagy angolul kell dolgozniuk?

Nem. Maga az alkalmazáskezelő mind a 40 nyelven elérhető, és a tartalmak bármelyik nyelven rögzíthetők. A milánói termékmenedzsment olaszul írja meg a karbantartási utasításokat, a varsói beszerzési osztály lengyelül egészíti ki az anyagadatokat, és mindenki ugyanazt az adatsort látja. Aki egy adatot javít, az egyszerre javítja az összes nyelvi változatban, így nincs szükség a szokásos, központi fordítóirodán keresztül történő körforgásra.

Van-e automatikus terminológia-felismerés?

Ma még nem. Egy ügyfélspecifikus terminológiai adatbázis, amely önállóan javasol kifejezéseket, jelenleg fejlesztés alatt áll, és még nem került kiadásra. Addig is a rendelkezésre álló eszközök a kézi felülírás, a megjelölés és a szószedet-import. Inkább egyértelműen közöljük ezt, nehogy olyan funkcióval tervezzen, amely még nem létezik. A leggyakoribb esetekben ez a három eszköz elegendő, és a rögzíteni szükséges kifejezések száma jóval kisebb, mint a lefordítandó kifejezéseké.

Friss hírek a többnyelvűségről és a DPP-gyakorlatról

Új nyelvek, adatminőség és termékfunkciók - havonta egyszer válogatott formában a beérkező levelek mappájába.