机器翻译
计算机将一种语言的文本自动翻译为另一种语言的技术。神经机器翻译 (NMT) 的出现使翻译质量实现了飞跃式提升,能够完成伴随字符数变化的跨语言转换。
机器翻译 (machine translation, MT) 是在无需人工干预的情况下,将文本从一种语言转换为另一种语言的技术。Google 翻译、DeepL、百度翻译、有道翻译等服务已经普及,在网页翻译、商务文档初译、实时对话翻译等场景中,作为跨越语言障碍的工具被日常使用。
机器翻译的发展历程可分为三个阶段。第一代基于规则的翻译源于 1950 年代的研究,依靠人工编写的语法规则和双语词典进行转换。第二代统计机器翻译以 1990 年代的研究为基础,在 2000 年代进入主要翻译服务,从大量平行语料中按概率学习译词和语序的对应。第三代神经机器翻译 (NMT) 在 2010 年代中期逐步实用化,它不是替换词语和短语,而是把整句作为一个序列处理,因此译文的语序更加自然。不过各代之间的界线并非按年份截然划分,同一时期有多种方法并存。
机器翻译与字符数的关系十分密切。同一内容用不同语言表达时,字符数会发生显著变化。中文的"信息"(2 个字符) 翻译成英文是"information"(11 个字符)。中文译成英文后字符数会明显增加,英文译成中文后则会缩减;翻译实务中虽有各种经验比例,但它们因领域和文体而浮动很大,并不是有保证的系数。此外,按字符数还是按词数统计,数字本身也会不同,引用比例时需要注明单位。这一膨胀率在 UI 本地化中直接影响按钮和标签的尺寸设计。
翻译后的字符数限制是实务中的重要课题。以 X (原 Twitter) 的帖子为例,上限写作 280,但这是加权计数:中文、日文、韩文字符每个按 2 计算,因此纯中文帖子的上限实际是 140 字;半角拉丁字母按 1 计算,译成英文后可用的字符数实际翻倍,但要用 280 个英文字符说完 140 个中文字的内容仍可能不够。元描述、广告文案、UI 标签等有字符数限制的文本,翻译时不能简单直译,而需要进行意译或概括以控制在限制范围内。
BLEU 分数是机器翻译质量评估的标准指标之一。BLEU 通过比较机器翻译输出与人工参考翻译的 N-gram 匹配率来评分,范围为 0 至 100。需要注意的是,同一译文的分值会随分词 (tokenization) 方式和参考译文数量而变化,不同论文或服务公布的数值不能直接并列比较。像中英这样语序和切分方式差异很大的语言对,即使译文可读,N-gram 也难以匹配,分数偏低并不直接等于质量偏低。
译后编辑 (post-editing,即对机器翻译输出进行人工修正) 在翻译行业中日益普及。先用机器翻译生成初稿,再由人工译者对照原文修改,有可能比从零开始翻译更快完成;但初稿质量不高时,反复阅读和改写的工夫会增加,反而可能更耗时。译后编辑的工作量取决于机器翻译的质量和原文的字符数。