40言語を自動翻訳:当社のAI翻訳が専門用語をどのように処理するか

40言語を自動翻訳:当社のAI翻訳が専門用語をどのように処理するか

当社の自動製品データ翻訳の舞台裏を覗いてみましょう――そして、専門用語が小説のテキストとは異なる扱いを受ける必要がある理由について。

今日の機械翻訳は、多くの場合、人間による翻訳と見分けがつかないほど精度が高まっています。翻訳サービスは、流暢で、慣用表現を適切に使いこなし、文体のニュアンスも的確に捉えています。ところが、DPPデータセットを翻訳してみると、突然 「rear lock fiber closure」が が「Hinterschloss-Faserverschluss」という訳になってしまうのです

問題は専門用語にあります。ここでは、製品データが小説のように扱われてはならない理由と、40言語の翻訳版が理解しやすいものとなるよう、Transpareoが提供するツールについて解説します。

根本的な問題:一つの単語、複数の意味

アウトドアジャケットのDPPにおける 「Seal」:防水処理。実験室における「Seal」:文脈に応じてアザラシ、あるいはシール。メンテナンス記録における「Seal」:状況によっては封印。

一般的な翻訳モデルは、統計的な文脈に基づいて選択を行います。流暢な文章であれば、これは機能します。小説には豊富な文脈があるからです。しかし、データフィールドの primary_closure: seal の場合、文脈はほとんどありません。モデルは推測するしかありません。

その結果、微妙な誤訳が生じます。 「Hinterschloss-Faserverschluss」ほど劇的ではありませんが、影響は甚大です。ドイツ語で「Dichtung」と呼ばれる部品が、イタリア語のDPPでは突然「guarnizione」ではなく「sigillo」となってしまいます その結果、購買担当者はその交換部品を見つけられなくなってしまいます。

Transpareoが現在提供しているサービス

当社の翻訳システムは、新しいコンテンツを自動的にすべての有効な言語に翻訳します。このシステムには4つの特徴があります:

-マークダウンおよび変数の保持<a href="/ja/deng-lu-suru">Pro-Mitgliedschaft</a> のようなプレースホルダーやマークダウン構造は翻訳前に抽出され、テキスト部分のみが翻訳された後、構造は変更されずに元の位置に再挿入されます。これにより、リンク、フォーム、レイアウトがすべての言語で一貫性を保ちます。 -中央集約型の翻訳エントリ:翻訳はデータレコード自体には保存されず、共有レイヤーに保存されます。同じ原文を持つ複数のデータレコードが1つの翻訳を共有します。これにより、翻訳コストを削減し、データモデル全体で用語を自動的に統一します。 -変更時の自動再翻訳:原文が変更されると、すべての言語の翻訳が再生成されます。ドイツ語での修正1件に対し、他の39の言語バージョンが自動的に更新されます。 -レコードごとのマーク設定:コンテンツを自動処理の対象から除外したり、既存の翻訳を固定したりすることができます。これは、国際的な製品名や手動による修正などの場合に ## 役立ちます。

顧客による処理の補完

自動翻訳は、説明文、マーケティング文、メンテナンス手順などに対して、大部分で正確な結果を提供します。しかし、 seal」* *や「guarnizione」といった重要な専門用語に関しては、一部の誤りが残るため、顧客側の管理者が修正する必要があります。

この場合、管理者は以下の3つの手段を利用できます:

  1. 言語およびキーごとの手動上書き:各翻訳エントリはアプリケーションマネージャーで開いて、言語ごとに調整できます。「固定」マークを付けると、この手動翻訳は次回の自動翻訳実行時にも保持されます。
  2. 用語集のインポート:翻訳ツールやPDF用語集にある既存の用語をCSV形式で取り込むことで、直接入力された翻訳エントリを生成できます。
  3. 運用中の言語ごとの修正:イタリアの営業担当者が誤りに気づき、アプリケーションマネージャーで修正すると、その修正は即座に反映され、その他の翻訳には影響しません。

アプリケーションマネージャーは、これら40言語すべてに対応しています

製品パスだけでなく、その管理を行うインターフェースも多言語対応です。アプリケーションマネージャーは40言語すべてに翻訳されており、各言語でコンテンツを入力できます。システムが自動的に他のすべての言語に翻訳します。

多言語チームにとって、これは協業のあり方を著しく変えます。ミラノの製品管理部門がイタリア語でメンテナンスの注意事項を作成し、ワルシャワの購買部門がポーランド語で材料データを補足し、ハンブルクの品質保証部門がドイツ語でチェックを行います。 各担当者は自分の母国語で作業を行い、全員が同じデータセットを確認します。そして、誰かが情報を修正すれば、すべての言語バージョンに対して同時に修正が反映されます。

ここでも前述の制限が適用されます。重要な専門用語については、最終的に人間が機械が選択した表現を検証する必要があります。

EU言語の現実

EUの公用語は24言語と多く聞こえますが、実際には3つの層に分かれています:

-主要市場:DE、EN、FR、IT、ES、NL - ここでは、すべての消費者が完璧さを求めています -主要市場:PT、PL、SV、DA、FI ― 水準は良好だが、時折機械翻訳であることがわかる -使用頻度の低い言語:MT、GA、ET、LV、LT ― マルタのエンドユーザーがスキャンすることなど決してないにもかかわらず、マルタ語のDPPが作成されることもある。それでも義務である。

この義務は任意ではありません。ESPR(欧州製品安全規則)では、製品が販売される加盟国の言語によるDPPコンテンツが義務付けられています。したがって、27カ国に製品を供給する場合、24の言語が対象となります(一部の国では言語が重複しています)。

マルタ語からベンガル語まで

Transpareoは40言語に対応しています。EUの公用語24言語に加え、グローバル展開のためにさらに16言語に対応しています:

-ヨーロッパ:ブルガリア語、デンマーク語、ドイツ語、英語、エストニア語、フィンランド語、フランス語、ギリシャ語、アイルランド語、イタリア語、クロアチア語、ラトビア語、リトアニア語、 マルタ語、オランダ語、ポーランド語、ポルトガル語、ルーマニア語、スウェーデン語、スロバキア語、スロベニア語、スペイン語、チェコ語、ハンガリー語――さらにアルバニア語、ボスニア語、 アイスランド語、マケドニア語、ノルウェー語、ロシア語、セルビア語、トルコ語、ウクライナ語。 -世界全体:ベンガル語、中国語、ヒンディー語、インドネシア語、日本語、韓国語、ベトナム語。

今後導入されるテキスタイル用DPPでは、ベンガル語とベトナム語が主要生産国を網羅しており、ダッカのサプライヤーもパリのバイヤーも、同じ製品仕様書を読むことができます。

なぜ一元化されたローカライズ層が必要なのか

ほとんどのプラットフォームでは、翻訳をデータレコードの追加フィールドとして保存しています:description_dedescription_en、… 翻訳可能な属性1つにつき40個のフィールドです。単純そうに聞こえますが、これには3つの欠点があります:

  • テキストの重複管理。 同じ素材表記を持つ2つの製品があると、40件の翻訳が1回で済むのではなく、40+40件の翻訳が生成される
  • スケーラビリティが低い。41番目の言語を追加するには、翻訳可能なすべてのモデルにわたるスキーマの移行が必要となる
  • 修正をグローバルに適用するのが困難。 「guarnizione」を全箇所で修正する場合、すべてのデータレコードを個別に編集する必要があります。

分割された翻訳レイヤーはこの問題を解決します。1つのエントリに対し、多数の参照先。1回の修正で、すべてのデータレコードが恩恵を受けます。

まだ実現できていないこと

自動候補検出機能を備えた顧客固有の用語データベースは開発計画に含まれていますが、現時点では提供されていません。今すぐ導入を始める場合でも、既存のツールで十分に対応可能です。手動での上書き、用語集のインポート、および「保留」マークの設定により、最も一般的なユースケースをカバーできます。

私たちは、作業の大部分は機械が行い、人間は本当に必要な場合にのみ介入すべきだと考えています。自動用語認識機能が利用可能になるまでは、手動による操作が透明に行われます。これは、果たされない約束をするよりも誠実な対応だと考えています。

この記事に関するご質問

製品パスポートはどの言語で用意する必要がありますか?

ESPRでは、製品が販売される加盟国の言語でラベル記載を行うことが求められています。EU全域に製品を供給する場合、24のEU公用語が対象となりますが、そのうちいくつかは複数の加盟国で共有されています。 Transpareoはこれら24言語に加え、さらに16言語に対応しており、新規または変更されたテキストはすべて自動的に全言語に反映されます。つまり、実際には言語がもはや開始条件ではなくなります。普段お使いの言語で一度作成するだけで、各市場向けのバージョンが自動的に生成されるのです。

機械翻訳で専門用語の訳が不適切だった場合、誰が責任を負うのでしょうか?

貴社です。パスポートの内容を正確に保つ義務は、製品を市場に流通させる経済主体にあり、その責任は翻訳システムにも、当社にも転嫁されるものではありません。 そのため、機械翻訳が有効な部分とそうでない部分を率直にお伝えしています。説明文、お手入れ方法、マーケティング文などは正確に翻訳されますが、部品名、留め具、コーティングといった専門的な用語については、人間の目による確認が必要です。 自動翻訳の結果を、40言語による完全な初稿として扱い、修理業者や購入者にとって実際に重要な数百語の用語の確認に時間を割いてください。

ある用語を修正した際、次回の自動実行で上書きされないようにするにはどうすればよいでしょうか?

アプリケーションマネージャーで翻訳エントリを開き、該当する言語の値を調整して、「固定」チェックボックスにチェックを入れてください。 このチェックマークを付けると、そのエントリは自動処理の対象外となり、その後原文が変更されてもその翻訳は維持されます。チェックマークを付けない場合、修正内容は通常の翻訳として扱われ、原文が変更されると再生成されます。単語1つについても、段落全体と同じ2つの手順が適用されます。

既存の専門用語リストを取り込むことはできますか?

はい。翻訳ツールや御社の翻訳会社のPDF用語集などから、普段から管理されている用語は、CSV形式でインポートすることができ、翻訳エントリとして反映されます。これらのエントリは、その後、手動での修正と同様に扱われます。 これを行うのに最適なタイミングは、最初の大規模なインポートの前です。そうすれば、何千件ものデータレコードが翻訳される前に用語が確定し、後で手直しする必要がなくなります。

その修正は、すべての製品に適用されるのでしょうか、それとも開いているデータセットのみに適用されるのでしょうか?

同じ原文を持つ各データレコードについてです。翻訳は個々の商品ではなく、共有レイヤーに格納されているため、同一のデータレコードは1つのエントリを共有することになり、一度修正を行えばすべてに反映されます。 そのため、カタログの規模が拡大しても修正の手間は増えません。4,000点の商品に共通する用語は、4,000件のエントリではなく、1つのエントリとして扱われます。

海外で勤務する同僚は、ドイツ語か英語で仕事をする必要がありますか?

いいえ。アプリケーションマネージャー自体は40言語すべてで利用可能であり、どの言語でもコンテンツを入力することができます。ミラノの製品管理部門がイタリア語でメンテナンスの注意事項を作成し、ワルシャワの購買部門がポーランド語で材料データを追加しても、全員が同じデータセットを確認できます。 誰かが情報を修正すると、すべての言語版に対して同時に修正されるため、通常必要となる中央翻訳部門を経由する手間が省けます。

用語の自動認識機能はありますか?

本日は対応しておりません。用語を自動的に提案する、お客様専用の用語データベースは現在開発計画段階にあり、まだ提供されていません。それまでの間は、手動での上書き、固定マーク、および用語集のインポートをご利用ください。 存在しない機能に基づいて計画を立てられるよりは、この点を明確に申し上げておきたいのです。一般的なケースについては、これら3つのツールで対応可能ですし、固定処理が必要な用語の数は、翻訳対象となる用語の数よりもはるかに少ないのです。

多言語対応とDPPの実践に関する最新情報

新しい言語、データ品質、製品機能――毎月1回、厳選された情報をメールでお届けします。