Ngày nay, chất lượng dịch máy đã đạt đến mức cao đến nỗi trong nhiều trường hợp, người ta không thể phân biệt được nó với bản dịch do con người thực hiện. Các dịch vụ dịch thuật này mang lại văn phong trôi chảy, sử dụng thành ngữ một cách tự nhiên và thể hiện sự tinh tế trong việc điều chỉnh phong cách ngôn ngữ. Tuy nhiên, khi dịch một bộ dữ liệu DPP, cụm từ “rear lock fiber closure” bỗng chốc lại trở thành th ành “Hinterschloss-Faserverschluss”.
Vấn đề nằm ở thuật ngữ chuyên ngành. Trong bài viết này, chúng tôi sẽ giải thích lý do tại sao dữ liệu sản phẩm không thể được xử lý như tiểu thuyết, cũng như các công cụ mà Transpareo cung cấp để đảm bảo 40 phiên bản ngôn ngữ của quý vị vẫn dễ hiểu.
Vấn đề cốt lõi: một từ, nhiều nghĩa
“Seal” trong DPP của một chiếc áo khoác ngoài trời: lớp chống thấm. “Seal” trong phòng thí nghiệm: hải cẩu hoặc miếng đệm, tùy theo ngữ cảnh. “Seal” trong biên bản bảo trì: trong một số trường hợp có thể là con dấu.
Một mô hình dịch thuật chung sẽ đưa ra lựa chọn dựa trên bối cảnh thống kê. Điều này hoạt động hiệu quả với văn bản liền mạch - tiểu thuyết cung cấp bối cảnh dồi dào. Tuy nhiên, với trường dữ liệu primary_closure: seal, bối cảnh gần như không có. Mô hình chỉ có thể đưa ra phỏng đoán.
Một trường dữ liệu không cung cấp bối cảnh, và khi thiếu bối cảnh, mô hình sẽ phải phỏng đoán.
Hậu quả là những sai sót tinh vi. Không quá nghiêm trọng như trường hợp “Hinterschloss-Faserverschluss”, nhưng lại gây ra hệ lụy: một bộ phận được gọi là “Dichtung” trong tiếng Đức, bỗng nhiên trong một DPP tiếng Ý lại được dịch thành “sigillo” thay vì “guarnizione”. Một nhân viên mua hàng sẽ không thể tìm thấy phụ tùng thay thế đó nữa.
Những gì Transpareo đang thực hiện hiện nay
Hệ thống dịch thuật của chúng tôi tự động chuyển đổi mọi nội dung mới sang tất cả các ngôn ngữ đang hoạt động. Hệ thống này có bốn đặc điểm nổi bật:
-
Giữ nguyên định dạng Markdown và biến số: Các ký hiệu giữ chỗ như
<a href="/vi/dang-ky">Pro-Mitgliedschaft</a>cùng cấu trúc Markdown sẽ được trích xuất trước khi dịch; phần văn bản thuần túy sẽ được dịch, sau đó các cấu trúc này sẽ được chèn lại mà không thay đổi. Nhờ đó, các liên kết, biểu mẫu và bố cục vẫn được duy trì nhất quán trên tất cả các ngôn ngữ. - Các mục dịch thuật tập trung: Các bản dịch không được lưu trữ trực tiếp trong bản ghi dữ liệu mà được lưu trong một lớp dữ liệu chung. Nhiều bản ghi dữ liệu có cùng văn bản gốc sẽ chia sẻ chung một bản dịch. Điều này giúp tiết kiệm chi phí dịch thuật và tự động thống nhất các thuật ngữ trên toàn bộ mô hình dữ liệu.
- Tự động dịch lại khi có thay đổi: Nếu văn bản gốc được sửa đổi, các bản dịch trong tất cả các ngôn ngữ sẽ được tạo lại. Một chỉnh sửa trong tiếng Đức sẽ tự động được áp dụng cho 39 phiên bản ngôn ngữ khác.
- Các đánh dấu cho từng bản ghi dữ liệu: Nội dung có thể được loại trừ khỏi quy trình tự động hoặc các bản dịch hiện có có thể được cố định - chẳng hạn như đối với tên sản phẩm quốc tế hoặc các chỉnh sửa thủ công.
Nơi khách hàng bổ sung quá trình xử lý
Chức năng dịch tự động phần lớn mang lại kết quả chính xác cho các văn bản mô tả, nội dung tiếp thị và hướng dẫn bảo dưỡng. Tuy nhiên, đối với các thuật ngữ chuyên ngành quan trọng - như “seal”/“guarnizione” - vẫn còn một số lỗi nhỏ mà quản trị viên của khách hàng cần phải chỉnh sửa.
Tại đây, quản trị viên có ba phương án:
- Ghi đè thủ công theo từng ngôn ngữ và từ khóa: Mỗi mục dịch thuật có thể được mở trong Trình quản lý Ứng dụng và điều chỉnh theo từng ngôn ngữ. Khi được đánh dấu “Khóa”, bản dịch thủ công này sẽ được giữ nguyên trong lần chạy tự động tiếp theo.
- Nhập danh mục thuật ngữ: Các thuật ngữ hiện có từ các công cụ dịch thuật hoặc danh mục thuật ngữ dưới dạng PDF có thể được nhập dưới định dạng CSV và tự động tạo ra các mục dịch thuật mới.
- Sửa lỗi theo từng ngôn ngữ trong quá trình vận hành: Một nhân viên kinh doanh người Ý phát hiện ra lỗi, sau đó sửa lỗi đó trong Trình quản lý ứng dụng - bản sửa lỗi có hiệu lực ngay lập tức, trong khi các bản dịch còn lại vẫn được giữ nguyên.
Trình quản lý ứng dụng hỗ trợ cùng 40 ngôn ngữ
Không chỉ các thông số kỹ thuật sản phẩm được cung cấp đa ngôn ngữ - mà cả giao diện mà quý vị sử dụng để quản lý chúng cũng vậy. Trình quản lý ứng dụng đã được dịch sang tất cả 40 ngôn ngữ, và quý vị có thể nhập nội dung bằng bất kỳ ngôn ngữ nào trong số đó. Hệ thống sẽ tự động dịch nội dung đó sang tất cả các ngôn ngữ còn lại.
Đối với các đội ngũ đa ngôn ngữ, điều này mang lại sự thay đổi rõ rệt trong quá trình hợp tác: Bộ phận Quản lý Sản phẩm tại Milan soạn thảo hướng dẫn bảo quản bằng tiếng Ý, bộ phận Mua hàng tại Warsaw bổ sung dữ liệu nguyên vật liệu bằng tiếng Ba Lan, còn bộ phận Kiểm soát Chất lượng tại Hamburg tiến hành kiểm tra bằng tiếng Đức.
Mỗi người làm việc bằng ngôn ngữ của mình, tất cả đều xem cùng một bộ dữ liệu, và bất kỳ ai chỉnh sửa một thông tin nào đó sẽ đồng thời chỉnh sửa cho tất cả các phiên bản ngôn ngữ.
Ở đây cũng áp dụng hạn chế đã nêu ở trên: Đối với các thuật ngữ chuyên ngành quan trọng, cuối cùng cần có người kiểm tra lại những gì hệ thống đã lựa chọn.
Thực trạng ngôn ngữ tại EU
24 ngôn ngữ chính thức của EU nghe có vẻ nhiều. Trên thực tế, chúng được chia thành ba nhóm:
- Thị trường trọng điểm: DE, EN, FR, IT, ES, NL - tại đây, mọi người tiêu dùng đều mong đợi sự hoàn hảo
- Thị trường quan trọng: PT, PL, SV, DA, FI - chất lượng tốt, thỉnh thoảng vẫn nhận ra dấu vết của máy dịch
- Ngôn ngữ hiếm: MT, GA, ET, LV, LT - đôi khi phải cung cấp DPP bằng tiếng Malta dù không có người tiêu dùng cuối nào tại Malta quét mã vạch. Tuy nhiên, đây vẫn là nghĩa vụ bắt buộc.
Yêu cầu này không phải là tùy chọn. Quy định ESPR yêu cầu nội dung DPP phải được trình bày bằng ngôn ngữ của quốc gia thành viên nơi sản phẩm được bán. Do đó, những doanh nghiệp phục vụ 27 quốc gia sẽ phải xử lý 24 ngôn ngữ (một số quốc gia chia sẻ chung ngôn ngữ).
Từ tiếng Malta đến tiếng Bengal
Transpareo cung cấp dịch thuật sang 40 ngôn ngữ - bao gồm toàn bộ 24 ngôn ngữ chính thức của EU và 16 ngôn ngữ khác nhằm mở rộng phạm vi toàn cầu:
- Châu Âu: tiếng Bulgaria, tiếng Đan Mạch, tiếng Đức, tiếng Anh, tiếng Estonia, tiếng Phần Lan, tiếng Pháp, tiếng Hy Lạp, tiếng Ailen, tiếng Ý, tiếng Croatia, tiếng Latvia, tiếng Litva, tiếng Malta, tiếng Hà Lan, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Rumani, tiếng Thụy Điển, tiếng Slovak, tiếng Slovenia, tiếng Tây Ban Nha, tiếng Séc và tiếng Hungary - cùng với tiếng Albania, tiếng Bosnia, tiếng Iceland, tiếng Macedonia, tiếng Na Uy, tiếng Nga, tiếng Serbia, tiếng Thổ Nhĩ Kỳ và tiếng Ukraina.
- Toàn cầu: tiếng Bengal, tiếng Trung, tiếng Hindi, tiếng Indonesia, tiếng Nhật, tiếng Hàn và tiếng Việt.
Đối với dự án DPP ngành dệt may sắp tới, việc hỗ trợ tiếng Bengal và tiếng Việt đã bao quát các quốc gia sản xuất lớn - một nhà cung cấp tại Dhaka có thể đọc cùng một bản mô tả sản phẩm như một nhà mua hàng tại Paris.
Tại sao cần có một lớp bản địa hóa tập trung
Hầu hết các nền tảng lưu trữ bản dịch dưới dạng các trường bổ sung trong bộ dữ liệu: description_de, description_en, … 40 trường cho mỗi thuộc tính có thể dịch. Nghe có vẻ đơn giản, nhưng lại có ba nhược điểm:
- Văn bản bị lưu trữ trùng lặp. Hai sản phẩm có cùng thông tin về chất liệu sẽ tạo ra 40 + 40 bản dịch thay vì chỉ 40 bản dịch duy nhất
- Khó mở rộng quy mô. Việc thêm ngôn ngữ thứ 41 đồng nghĩa với việc phải thực hiện di chuyển cấu trúc dữ liệu trên tất cả các mô hình có thể dịch
- Khó áp dụng các chỉnh sửa trên phạm vi toàn hệ thống. Nếu từ “guarnizione” được sửa ở mọi nơi, tất cả các bản ghi dữ liệu sẽ phải được chỉnh sửa riêng lẻ
Lớp dịch thuật phân chia sẽ giải quyết vấn đề này: một mục nhập, nhiều tham chiếu. Chỉ cần một lần sửa đổi, tất cả các bản ghi dữ liệu đều được cập nhật.
Những gì chúng tôi chưa có
Một cơ sở dữ liệu thuật ngữ dành riêng cho khách hàng với tính năng đề xuất tự động hiện đang nằm trong kế hoạch phát triển, nhưng hiện tại vẫn chưa được triển khai. Những ai bắt đầu ngay từ hôm nay vẫn có thể tiến xa với các công cụ hiện có: ghi đè thủ công, nhập danh mục thuật ngữ và tính năng đánh dấu giữ nguyên đều đáp ứng được các trường hợp sử dụng phổ biến nhất.
Chúng tôi tin rằng máy móc nên đảm nhận phần lớn công việc, còn con người chỉ can thiệp khi thực sự cần thiết. Cho đến khi tính năng nhận diện thuật ngữ tự động được triển khai, việc can thiệp thủ công vẫn diễn ra một cách minh bạch - và điều này trung thực hơn so với một lời hứa không thể thực hiện được.
Các câu hỏi liên quan đến bài viết này
Hồ sơ sản phẩm phải được lập bằng những ngôn ngữ nào?
Quy định ESPR yêu cầu nội dung nhãn mác phải được trình bày bằng ngôn ngữ của quốc gia thành viên nơi sản phẩm được bán. Đối với các doanh nghiệp cung cấp sản phẩm trên toàn Liên minh, điều này đồng nghĩa với việc phải xử lý 24 ngôn ngữ chính thức của EU, trong đó một số ngôn ngữ được sử dụng chung bởi nhiều quốc gia. Transpareo cung cấp 24 ngôn ngữ này cùng với 16 ngôn ngữ khác, và mọi văn bản mới hoặc đã được chỉnh sửa đều được tự động chuyển sang tất cả các ngôn ngữ đó. Trên thực tế, điều này có nghĩa là ngôn ngữ không còn là tiêu chí ban đầu nữa - quý vị chỉ cần soạn thảo một lần bằng ngôn ngữ làm việc của mình, và các phiên bản dành cho thị trường sẽ được tạo ra tự động.
Ai sẽ phải chịu trách nhiệm nếu bản dịch tự động dịch sai một thuật ngữ chuyên ngành?
Chính quý vị. Trách nhiệm đảm bảo tính chính xác của nội dung trên nhãn mác thuộc về chủ thể kinh doanh đưa sản phẩm ra thị trường, và trách nhiệm này không được chuyển giao cho bất kỳ hệ thống dịch thuật nào cũng như không chuyển giao cho chúng tôi. Do đó, chúng tôi sẽ thẳng thắn chỉ ra những phần mà hệ thống máy móc có thể xử lý và những phần không thể - các phần mô tả, hướng dẫn bảo quản và nội dung tiếp thị sẽ được dịch chính xác; trong khi đó, các thuật ngữ chuyên môn hẹp như tên các bộ phận, cơ chế khóa hoặc lớp phủ cần sự kiểm duyệt của con người. Xin quý vị hãy coi bản dịch tự động như một bản nháp ban đầu hoàn chỉnh bằng 40 ngôn ngữ và dành thời gian kiểm tra cho vài trăm thuật ngữ mà các cơ sở sửa chữa và người mua thực sự quan tâm.
Làm thế nào để tôi sửa một thuật ngữ sao cho lần chạy tự động tiếp theo không ghi đè lên nó?
Vui lòng mở mục dịch thuật trong Trình quản lý ứng dụng, điều chỉnh giá trị cho ngôn ngữ tương ứng và đánh dấu tùy chọn “Giữ nguyên”. Việc đánh dấu này sẽ loại bỏ mục đó khỏi quy trình tự động, giúp mục đó vẫn giữ nguyên ngay cả khi văn bản gốc có thay đổi sau này. Nếu không được đánh dấu, bản sửa đổi của quý vị sẽ được coi là bản dịch thông thường và sẽ được tạo lại ngay khi văn bản gốc thay đổi. Đối với một từ đơn lẻ, quy trình hai bước này cũng được áp dụng giống như đối với một đoạn văn hoàn chỉnh.
Chúng ta có thể nhập một danh sách thuật ngữ hiện có vào được không?
Đúng vậy. Các thuật ngữ mà quý vị đã quản lý sẵn, dù là từ công cụ dịch thuật hay từ bảng thuật ngữ trong tệp PDF của công ty dịch thuật, đều có thể được nhập dưới dạng tệp CSV và sẽ được chuyển thành các mục dịch thuật dưới dạng văn bản. Sau đó, các mục này sẽ được xử lý giống như các chỉnh sửa thủ công. Thời điểm thích hợp nhất để thực hiện việc này là trước khi tiến hành đợt nhập dữ liệu quy mô lớn đầu tiên - khi đó các thuật ngữ đã được chuẩn bị sẵn trước khi hàng nghìn bản ghi dữ liệu được dịch, và sẽ không còn gì cần phải chỉnh sửa lại sau này.
Việc điều chỉnh này có áp dụng cho tất cả các sản phẩm hay chỉ áp dụng cho bản ghi đang được mở?
Đối với mỗi bản ghi có cùng văn bản gốc. Các bản dịch được lưu trữ trong một lớp dữ liệu chung thay vì gắn liền với từng sản phẩm riêng lẻ; do đó, các bản ghi có nội dung giống hệt nhau sẽ chia sẻ chung một mục nhập, và việc chỉnh sửa một lần sẽ có hiệu lực cho tất cả. Do đó, khối lượng công việc chỉnh sửa cũng không tăng theo quy mô danh mục - một thuật ngữ xuất hiện trên 4.000 sản phẩm chỉ cần một mục nhập duy nhất, chứ không phải 4.000 mục.
Các đồng nghiệp làm việc ở nước ngoài có bắt buộc phải sử dụng tiếng Đức hay tiếng Anh trong công việc không?
Không. Bản thân Trình quản lý ứng dụng đã có sẵn bằng cả 40 ngôn ngữ, và nội dung có thể được nhập bằng bất kỳ ngôn ngữ nào trong số đó. Bộ phận Quản lý sản phẩm tại Milan soạn thảo các hướng dẫn bảo quản bằng tiếng Ý, bộ phận Mua hàng tại Warsaw bổ sung dữ liệu vật liệu bằng tiếng Ba Lan, và tất cả đều xem cùng một bộ dữ liệu. Khi một người chỉnh sửa một thông tin nào đó, việc chỉnh sửa này sẽ được áp dụng đồng thời cho tất cả các phiên bản ngôn ngữ, nhờ đó loại bỏ được quy trình thông thường phải thông qua một bộ phận dịch thuật trung tâm.
Có tính năng nhận diện thuật ngữ tự động không?
Hiện tại thì chưa. Một cơ sở dữ liệu thuật ngữ tùy chỉnh theo yêu cầu khách hàng, có khả năng tự động đề xuất các thuật ngữ, hiện đang trong giai đoạn lập kế hoạch phát triển và chưa được triển khai. Cho đến khi đó, các giải pháp thay thế bao gồm việc ghi đè thủ công, đánh dấu để lưu lại và nhập từ điển thuật ngữ. Chúng tôi muốn làm rõ điều này để quý vị không lên kế hoạch dựa trên một tính năng chưa tồn tại. Đối với các trường hợp thường gặp, ba công cụ này đã đáp ứng đầy đủ nhu cầu, và số lượng thuật ngữ mà quý vị cần đánh dấu là ít hơn rất nhiều so với số lượng thuật ngữ cần dịch.




