Сегодня машинный перевод настолько качественный, что во многих случаях его уже невозможно отличить от человеческого. Переводческие сервисы работают плавно, идиоматично и с учетом стилистического регистра. Но стоит перевести набор данных DPP - и вдруг «rear lock fiber closure» превращается в «задний замок с волоконной застежкой».
Проблема заключается в специальной терминологии. Здесь мы объясним, почему данные о продуктах нельзя трактовать как романы, и какие инструменты предоставляет Transpareo, чтобы ваши 40 языковых версий оставались понятными.
Основная проблема: одно слово - несколько значений
«Seal» в DPP-файле для куртки для активного отдыха: герметизация. «Seal» в лаборатории: тюлень или уплотнение, в зависимости от контекста. «Seal» в протоколе технического обслуживания: в некоторых случаях - печать.
Общая модель перевода делает выбор на основе статистического контекста. В случае беглого текста это работает - роман предоставляет обильный контекст. В поле данных primary_closure: seal контекста практически нет. Модель вынуждена гадать.
Результатом становятся едва заметные ошибки. Не такие драматичные, как «замок с задней защелкой», но имеющие серьезные последствия: компонент, который в немецком языке называется «Dichtung», в итальянском DPP внезапно становится «sigillo» вместо «guarnizione». Закупщик больше не может найти эту запасную часть.
Что предлагает Transpareo сегодня
Наша система перевода автоматически переводит каждый новый контент на все активные языки. Её отличают четыре особенности:
-
Сохранение Markdown и переменных: заполнители, такие как
<a href="/ru/zarieghistrirovat-sia">Pro-Mitgliedschaft</a>, и структуры Markdown извлекаются перед переводом, переводится чистый текст, а затем структуры вставляются обратно без изменений. Таким образом, ссылки, формы и верстка остаются единообразными во всех языках. - Централизованные переводческие записи: переводы хранятся не в самой записи, а в общем слое. Несколько записей с одинаковым исходным текстом используют один и тот же перевод. Это позволяет сократить расходы на перевод и автоматически унифицировать терминологию во всей модели данных.
- Автоматический перевод при изменении: если исходный текст изменяется, переводы на всех языках генерируются заново. Исправление на немецком языке автоматически отражается в 39 других языковых версиях.
- Пометки для каждой записи: контент можно исключить из автоматического цикла перевода или зафиксировать существующие переводы - например, для международных названий продуктов или ручных исправлений.
Где клиент дополняет обработку
Автоматический перевод в большинстве случаев дает правильные результаты для описательных текстов, маркетинговых текстов и инструкций по уходу. В случае критической специальной терминологии - например, «seal»/«guarnizione» - остается некоторое количество ошибок, которые должен исправить администратор клиента.
Здесь у администратора есть три возможности:
- Ручная перезапись для каждого языка и ключа: каждую запись перевода можно открыть в диспетчере приложений и скорректировать для каждого языка. С помощью отметки «Зафиксировать» этот ручной перевод сохранится при следующем автоматическом цикле.
- Импорт глоссария: существующие термины из инструментов переводчиков или PDF-глоссариев можно импортировать в формате CSV, что позволяет напрямую создавать записи перевода.
- Корректировки по каждому языку в режиме реального времени: итальянский отдел продаж обнаруживает ошибку, исправляет её в Менеджере приложений - исправление вступает в силу немедленно, остальные переводы остаются без изменений.
Менеджер приложений поддерживает все 40 языков
Не только паспорта продукции являются многоязычными - многоязычным является и интерфейс, в котором вы их редактируете. Менеджер приложений переведён на все 40 языков, и вы можете вводить контент на любом из них. Система автоматически переводит его на все остальные языки.
Для многоязычных команд это заметно меняет процесс совместной работы: отдел управления продуктами в Милане составляет инструкции по уходу на итальянском языке, отдел закупок в Варшаве дополняет данные о материалах на польском, а отдел контроля качества в Гамбурге проверяет их на немецком. Каждый сотрудник работает на своём языке, все видят один и тот же набор данных - и тот, кто исправляет какую-либо информацию, исправляет её одновременно для всех языковых версий.
Здесь также действует ограничение, упомянутое выше: в случае критически важной специальной терминологии в конечном итоге человек должен проверить, что выбрала система.
Реальность языков ЕС
24 официальных языка ЕС - ## этозвучит внушительно. На практике же они делятся на три уровня:
- Основные рынки: DE, EN, FR, IT, ES, NL - здесь каждый потребитель ожидает безупречного качества
- Значимые рынки: PT, PL, SV, DA, FI - хороший уровень, иногда заметно участие машины
- Редкие языки: MT, GA, ET, LV, LT - иногда приходится создавать DPP на мальтийском языке, хотя ни один конечный потребитель на Мальте его никогда не просмотрит. Тем не менее это обязательное требование.
Эта обязанность не является факультативной. Регламент ESPR требует, чтобы содержание DPP было на языке того государства-члена, в котором продается продукт. Таким образом, компания, обслуживающая 27 государств, имеет дело с 24 языками (некоторые страны используют общие языки).
От мальтийского до бенгальского
Transpareo осуществляет перевод на 40 языков - все 24 официальных языка ЕС и 16 дополнительных для глобального охвата:
- Европа: болгарский, датский, немецкий, английский, эстонский, финский, французский, греческий, ирландский, итальянский, хорватский, латышский, литовский, мальтийский, нидерландский, польский, португальский, румынский, шведский, словацкий, словенский, испанский, чешский и венгерский - а также албанский, боснийский, исландский, македонский, норвежский, русский, сербский, турецкий и украинский.
- По всему миру: бенгальский, китайский, хинди, индонезийский, японский, корейский и вьетнамский.
В предстоящем проекте DPP для текстильной отрасли бенгальский и вьетнамский языки охватывают крупнейшие страны-производители - поставщик в Дакке читает ту же спецификацию, что и закупщица в Париже.
Зачем нужен централизованный уровень локализации
Большинство платформ хранят переводы в виде дополнительных полей в наборе данных: description_de, description_en, … 40 полей на каждый переводимый атрибут. Звучит просто, но имеет три недостатка:
- Дублирование текста. Два продукта с одинаковым описанием материала генерируют 40 + 40 переводов вместо одного набора из 40
- Сложность масштабирования. Добавление 41-го языка означает: миграцию схемы по всем переводимым моделям
- Сложность глобального применения исправлений. Если слово «guarnizione» исправить везде, придётся редактировать все записи по отдельности.
Разделённый переводной слой решает эту проблему: одна запись, много ссылок. Одно исправление - и все записи получают выгоду.
Чего у нас ещё нет
В планах разработки находится клиентская терминологическая база данных с функцией автоматического распознавания предложений, но на данный момент она ещё не доступна. Те, кто начинает работу сегодня, могут добиться значительных результатов с помощью имеющихся инструментов: ручная замена, импорт глоссариев и отметка «сохранить» покрывают наиболее распространённые сценарии использования.
Мы считаем, что машины должны выполнять большую часть работы, а люди должны вмешиваться только там, где это действительно необходимо. Пока автоматическое распознавание терминологии не будет доступно, ручное управление останется прозрачным - и это честнее, чем обещание, которое не будет выполнено.
Вопросы по данной публикации
На каких языках должен быть составлен паспорт продукции?
Согласно требованиям ESPR, содержание инструкций должно быть представлено на языке того государства-члена, в котором продается продукт. Для компаний, поставляющих продукцию на территорию всего Союза, это означает необходимость учета 24 официальных языков ЕС, причем некоторые из них являются общими для нескольких государств. Transpareo обеспечивает поддержку этих 24 языков, а также 16 дополнительных, и любой новый или изменённый текст автоматически переносится на все языки. На практике это означает, что язык больше не является исходным критерием - вы пишете текст один раз на том языке, на котором работаете, а версии для рынков создаются автоматически.
Кто несет ответственность, если при машинном переводе неверно переведен термин из специальной области?
Вы. Обязанность обеспечить точность содержания пасса лежит на субъекте хозяйственной деятельности, выпускающем продукт на рынок, и она не переходит ни на систему перевода, ни на нас. Поэтому мы честно указываем, в чём система справляется, а в чём нет: описания, рекомендации по уходу и маркетинговые тексты переводятся безупречно, а узкоспециальные термины, такие как названия компонентов, замки или покрытия, требуют проверки человеческим глазом. Рассматривайте автоматический перевод как полноценный первоначальный черновой вариант на 40 языках и направьте время на проверку тех нескольких сотен терминов, от которых действительно зависит работа ремонтных мастерских и покупателей.
Как исправить термин таким образом, чтобы следующий автоматический прогон не перезаписал его?
Откройте запись перевода в диспетчере приложений, измените значение для соответствующего языка и установите флажок «Зафиксировать». Этот флажок исключает запись из автоматического цикла, благодаря чему она сохраняется при любых последующих изменениях исходного текста. Без этого флажка ваша корректировка рассматривается как обычный перевод и будет сгенерирована заново при любом изменении исходного текста. Для отдельного слова применяется та же двухэтапная процедура, что и для целого абзаца.
Можно ли импортировать имеющийся терминологический список?
Да. Терминология, которую вы и так ведёте - будь то из переводческого инструмента или из глоссария в PDF-файле вашего агентства - можно импортировать в формате CSV, и она будет занесена в виде текстовых записей перевода. В дальнейшем эти записи обрабатываются как ручные исправления. Наиболее подходящий момент для этого - до первого крупного импорта: тогда термины будут готовы до того, как начнут переводиться тысячи записей, и не придётся ничего дорабатывать.
Действует ли данная корректировка для всех товаров или только для открытой записи?
Для каждой записи с одинаковым исходным текстом. Переводы хранятся в общем слое, а не привязаны к отдельному товару, поэтому записи с одинаковым текстом используют одну запись, и однократная корректировка применяется ко всем. Поэтому объем работы по исправлению не растёт пропорционально размеру каталога - один термин, применяемый к 4000 товарам, представляет собой одну запись, а не 4000.
Должны ли коллеги, работающие за рубежом, общаться на немецком или английском языке?
Нет. Сам диспетчер приложений доступен на всех 40 языках, и контент можно вводить на любом из них. Отдел управления продуктами в Милане составляет инструкции по уходу на итальянском языке, отдел закупок в Варшаве дополняет данные о материалах на польском языке, и все видят одну и ту же запись. Тот, кто вносит исправление в какую-либо информацию, корректирует её одновременно для всех языковых версий, что исключает необходимость прохождения стандартной процедуры через централизованный переводческий отдел.
Предусмотрено ли автоматическое распознавание терминологии?
Сегодня - нет. База данных терминологии, адаптированная под нужды конкретного клиента и способная самостоятельно предлагать термины, находится в стадии планирования разработки и пока не доступна. До тех пор в вашем распоряжении остаются такие инструменты, как ручная замена, отметка «Зафиксировать» и импорт глоссария. Мы предпочитаем четко об этом заявить, чтобы вы не строили планы, опираясь на функцию, которой пока нет. Для большинства случаев этих трёх инструментов вполне достаточно, а количество терминов, которые вам необходимо зафиксировать, значительно меньше, чем количество терминов, подлежащих переводу.




