40 sprog automatisk: Sådan håndterer vores AI-oversættelse fagterminologi

40 sprog automatisk: Sådan håndterer vores AI-oversættelse fagterminologi

Et kig bag kulisserne på vores automatiske oversættelse af produktdata - og hvorfor fagterminologi skal behandles anderledes end en roman.

Maskinoversættelse er i dag så god, at man i mange tilfælde ikke længere kan skelne den fra menneskelig oversættelse. Oversættelsestjenesterne leverer flydende, idiomatiske oversættelser med sans for sprogregister. Så oversætter man et DPP-datasæt - og pludselig bliver »rear lock fiber closure« til »Hinterschloss-Faserverschluss«.

Problemet hedder fagterminologi. Her forklarer vi, hvorfor produktdata ikke skal behandles som romaner, og hvilke værktøjer Transpareo stiller til rådighed, så dine 40 sprogversioner forbliver forståelige.

Grundproblemet: ét ord, flere betydninger

»Seal« i DPP-dataene for en outdoor-jakke: tætning. »Seal« i et laboratorium: sæl eller tætning, afhængigt af konteksten. »Seal« i en vedligeholdelsesprotokol: under visse omstændigheder et segl.

En generel oversættelsesmodel vælger ud fra den statistiske kontekst. I en flydende tekst fungerer det - romanen leverer rigelig kontekst. I et datafelt primary_closure: seal er der næsten ingen kontekst. Modellen gætter.

Det resulterer i subtile fejl. Ikke så dramatiske som »Hinterschloss-Faserverschluss«, men med store konsekvenser: En komponent, der på tysk kaldes »Dichtung«, hedder pludselig »sigillo« i stedet for »guarnizione« i et italiensk DPP . En indkøber kan ikke længere finde reservedelen.

Hvad Transpareo tilbyder i dag

Vores oversættelsessystem overfører automatisk alt nyt indhold til alle aktive sprog. Det er kendetegnet ved fire egenskaber:

  • Bevarelse af Markdown og variabler: Pladsholdere som <a href="/da/registrere">Pro-Mitgliedschaft</a> og Markdown-strukturer udtrækkes før oversættelsen, den rene tekst oversættes, og derefter indsættes strukturerne igen uændret. På den måde forbliver links, formularer og layout konsistente på tværs af alle sprog.
  • Centrale oversættelsesposter: Oversættelserne gemmes ikke i selve dataposten, men i et fælles lag. Flere dataposter med samme originaltekst deler én oversættelse. Det sparer oversættelsesomkostninger og standardiserer automatisk terminologien på tværs af datamodellen.
  • Automatisk genoversættelse ved ændringer: Hvis originalteksten ændres, genereres oversættelserne på alle sprog på ny. En rettelse på tysk - 39 andre sprogversioner følger automatisk.
  • Markeringer pr. datapost: Indhold kan undtages fra den automatiske oversættelse, eller eksisterende oversættelser kan låses fast - f.eks. for internationale produktnavne eller manuelle rettelser.

Hvor kunden supplerer behandlingen

Den automatiske oversættelse leverer for det meste korrekte resultater for beskrivende tekster, marketingtekster og vedligeholdelsesvejledninger. Ved kritisk fagterminologi - såsom »seal«/»guarnizione« - forbliver der en restmængde fejl, som kundens administrator skal rette.

Her har administratoren tre muligheder:

  1. Manuel overskrivning pr. sprog og nøgle: Hver oversættelsespost kan åbnes i Applikations-Manager og tilpasses for hvert sprog. Med markeringen »Fastlåst« bevares denne manuelle oversættelse ved den næste automatiske oversættelsesrunde.
  2. Import af ordliste: Eksisterende terminologi fra oversættelsesværktøjer eller PDF-ordlister kan importeres som CSV-fil og genererer direkte indtastede oversættelsesposter.
  3. Korrektioner pr. sprog under drift: En italiensk salgsmedarbejder opdager en fejl, retter den i Applikations-Manager - rettelsen træder i kraft med det samme, mens de øvrige oversættelser forbliver uændrede.

Applikationsmanageren understøtter de samme 40 sprog

Det er ikke kun produktpasene, der er flersprogede - det samme gælder den brugergrænseflade, hvor du vedligeholder dem. Applikationsmanageren er oversat til alle 40 sprog, og du kan indtaste indhold på hvert af disse sprog. Systemet oversætter det automatisk til alle de andre.

For flersprogede teams ændrer dette samarbejdet mærkbart: Produktledelsen i Milano skriver plejevejledningerne på italiensk, indkøbsafdelingen i Warszawa supplerer materialedataene på polsk, og kvalitetssikringen i Hamborg kontrollerer på tysk. Hver person arbejder på sit eget sprog, alle ser det samme datasæt - og den, der retter en oplysning, retter den for alle sprogversioner på én gang.

Også her gælder den ovennævnte begrænsning: Ved kritisk fagterminologi bør et menneske til sidst kontrollere, hvad maskinen har valgt.

Virkeligheden med EU-sprogene

24 officielle EU-sprog lyder af meget. I praksis er der tale om tre lag:

  • Kernemarkeder: DE, EN, FR, IT, ES, NL - her forventer alle forbrugere perfektion
  • Vigtige markeder: PT, PL, SV, DA, FI - godt niveau, men af og til kan man mærke maskinens indblanding
  • Sjældne sprog: MT, GA, ET, LV, LT - nogle gange har man en DPP på maltesisk, uden at en eneste slutforbruger på Malta nogensinde læser den. Alligevel er det obligatorisk.

Kravet er ikke valgfrit. ESPR kræver, at DPP-indholdet er på det sprog, der tales i den medlemsstat, hvor produktet sælges. Hvis man betjener 27 stater, er der altså 24 sprog i spil (nogle deler sprog).

Fra maltesisk til bengalsk

Transpareo oversætter til 40 sprog - alle 24 officielle EU-sprog og 16 yderligere for global rækkevidde:

  • Europa: bulgarsk, dansk, tysk, engelsk, estisk, finsk, fransk, græsk, irsk, italiensk, kroatisk, lettisk, litauisk, maltesisk, nederlandsk, polsk, portugisisk, rumænsk, svensk, slovakisk, slovensk, spansk, tjekkisk og ungarsk - samt albansk, bosnisk, islandsk, makedonsk, norsk, russisk, serbisk, tyrkisk og ukrainsk.
  • Globalt: bengalsk, kinesisk, hindi, indonesisk, japansk, koreansk og vietnamesisk.

I forbindelse med det kommende tekstil-DPP dækkes de store produktionslande med bengalsk og vietnamesisk - en leverandør i Dhaka læser det samme produktblad som en indkøber i Paris.

Hvorfor et centraliseret lokaliseringslag

De fleste platforme gemmer oversættelser som ekstra felter i datasættet: description_de, description_en, … 40 felter pr. oversætteligt attribut. Det lyder enkelt, men har tre ulemper:

  • Dobbelt opbevaret tekst. To produkter med samme materialeangivelse genererer 40 + 40 oversættelser i stedet for én gang 40
  • Svært at skalere. At tilføje et 41. sprog betyder: skemaoverførsel på tværs af alle oversættelige modeller
  • Rettelser er svære at anvende globalt. Hvis »guarnizione« rettes overalt, skal alle dataposter redigeres enkeltvis

Det opdelte oversættelseslag løser dette: én post, mange referencer. Én rettelse, og alle dataposter drager fordel af den.

Hvad vi endnu ikke har

En kundespecifik terminologidatabase med automatisk genkendelse af forslag er planlagt til udvikling, men er endnu ikke leveret. Den, der starter i dag, kommer langt med de eksisterende værktøjer: manuelle overskrivninger, import af ordlister og markering af fastholdelse dækker de hyppigste anvendelsestilfælde.

Vi mener, at maskiner bør udføre hovedparten af arbejdet, og at mennesker kun skal gribe ind, hvor det virkelig er nødvendigt. Indtil den automatiske terminologigenkendelse er tilgængelig, er den manuelle indgriben gennemsigtig - og det er mere ærligt end et løfte, der ikke indfries.

Spørgsmål til dette indlæg

På hvilke sprog skal et produktpas foreligge?

ESPR kræver, at indholdet på etiketterne skal være på det sprog, der tales i den medlemsstat, hvor produktet sælges. Hvis man leverer til hele Unionen, kommer man dermed til at have de 24 officielle EU-sprog at tage højde for, hvoraf nogle deles af flere stater. Transpareo leverer disse 24 sprog samt 16 yderligere sprog, og enhver ny eller ændret tekst oversættes automatisk til dem alle. I praksis betyder det, at sproget ikke længere er et udgangspunkt - du skriver én gang på det sprog, du arbejder på, og markedsversionerne følger efter.

Hvem bærer ansvaret, hvis en maskinoversættelse ikke gengiver et fagudtryk korrekt?

Det er den økonomiske aktør, der markedsfører produktet, der har pligten til at sikre, at indholdet i paset er korrekt, og denne pligt overgår hverken til et oversættelsessystem eller til os. Derfor siger vi åbent, hvor maskinen fungerer, og hvor den ikke gør - beskrivelser, plejeanvisninger og markedsføringstekster kommer korrekt ud, mens snævre fagudtryk som komponentnavne, lukninger eller belægninger kræver et menneskeligt øje. Betragt den automatiske oversættelse som et fuldstændigt førsteudkast på 40 sprog, og brug korrekturtiden på de få hundrede termer, som virkelig betyder noget for værksteder og købere.

Hvordan retter jeg et udtryk, så det ikke overskrives ved den næste automatiske kørsel?

Åbn oversættelsesoplysningen i Applikationsmanageren, juster værdien for det pågældende sprog, og sæt markeringen for »Bevar«. Markeringen fjerner posten fra den automatiske gennemkørsel, så den bevares ved senere ændringer af originalteksten. Uden markeringen betragtes din rettelse som en almindelig oversættelse og genereres på ny, så snart originalteksten ændres. For et enkelt ord gælder den samme to-trins-procedure som for et helt afsnit.

Kan vi importere en eksisterende terminologiliste?

Ja. Terminologi, som De alligevel vedligeholder - uanset om den stammer fra et oversættelsesværktøj eller fra Deres agenturs PDF-ordliste - kan importeres som CSV og bliver dermed til en skriftlig oversættelsespost. Disse poster fungerer derefter som manuelle rettelser. Det bedste tidspunkt for dette er før den første store import - så er begreberne på plads, inden tusindvis af dataposter oversættes, og der er intet, der skal rettes efterfølgende.

Gælder en rettelse for alle produkter eller kun for den åbne datapost?

For hver datapost med den samme originaltekst. Oversættelserne findes i et fælles lag i stedet for ved det enkelte produkt, så dataposter med samme tekst deler én post, og en enkelt rettelse gælder for dem alle. Derfor stiger korrekturarbejdet heller ikke i takt med kataloget - et begreb på 4.000 produkter udgør én post, ikke 4.000.

Skal kolleger i udlandet arbejde på tysk eller engelsk?

Nej. Selve applikationsmanageren findes på alle 40 sprog, og indholdet kan indtastes på hvert af disse sprog. Produktledelsen i Milano skriver plejevejledningerne på italiensk, indkøbsafdelingen i Warszawa supplerer materialedataene på polsk, og alle ser den samme datasæt. Når man retter en oplysning, rettes den for alle sprogversioner på én gang, hvilket eliminerer den sædvanlige proces via et centralt oversættelsesbureau.

Findes der en automatisk terminologigenkendelse?

Ikke i dag. En kundespecifik terminologidatabase, der selv foreslår termer, er under udvikling og er endnu ikke leveret. Indtil da er de tilgængelige værktøjer manuel overskrivning, markering af termer og import af ordlister. Det siger vi hellere klart og tydeligt, end at De planlægger ud fra en funktion, der ikke findes. I de fleste tilfælde dækker disse tre værktøjer behovet, og antallet af termer, De skal markere, er langt mindre end antallet af termer, der skal oversættes.

Opdateringer om flersprogethed og DPP-praksis

Nye sprog, datakvalitet og produktfunktioner - udvalgt og leveret til din indbakke en gang om måneden.