機械翻訳

コンピュータがある言語のテキストを別の言語に自動的に翻訳する技術。ニューラル機械翻訳 (NMT) の登場により品質が飛躍的に向上し、文字数の変動を伴う言語間変換を実現する。

機械翻訳 (machine translation、MT) は、人間の介入なしにテキストをある言語から別の言語に変換する技術です。Google 翻訳、DeepL、Microsoft Translator などのサービスとして普及しており、ウェブページの翻訳、ビジネス文書の下訳、リアルタイムの会話翻訳など、言語の壁を越えるツールとして日常的に使われています。

機械翻訳の歴史は大きく 3 つの世代に分けて説明されます。第一世代のルールベース翻訳は 1950 年代の研究に始まり、文法規則と対訳辞書を人手で記述して変換しました。第二世代の統計的機械翻訳は 1990 年代の研究を土台に 2000 年代の主要な翻訳サービスへ実装され、大量の対訳データから訳語と語順の対応を確率的に学習しました。第三世代のニューラル機械翻訳 (NMT) は 2010 年代半ばに実用化が進み、単語や句の置き換えではなく文全体を一続きの列として扱うため、訳文が自然な語順でつながるようになりました。ただし世代の境目は年で明確に切れるものではなく、同じ時期に複数の方式が併存していた点は押さえておく必要があります。

機械翻訳と文字数の関係は密接です。同じ内容を異なる言語で表現すると、文字数は大きく変動します。日本語の「情報」(2 文字) は英語で「information」(11 文字) になります。日本語から英語では文字数が 1.5〜2 倍に、英語から日本語では 0.5〜0.7 倍になるという比率が翻訳の実務で目安として使われますが、これは分野や文体によって幅があり、保証された係数ではありません。短い文ほど比率は大きく振れます。また、数える単位を文字数と語数のどちらに取るかで数字そのものが変わるため、比率を引用するときは単位を明示する必要があります。この膨張率は、UI のローカライゼーションでボタンやラベルのサイズ設計に直接影響します。

翻訳後の文字数制限は実務上の重要な課題です。X (旧 Twitter) の投稿を例にとると、上限は 280 という数え方ですが、これは重み付きの値で、日本語・中国語・韓国語の文字は 1 文字を 2 として計算されます。したがって日本語だけで書いた投稿は 140 文字が上限です。半角のラテン文字は 1 文字を 1 として数えるため、英語に訳すと数えられる枠は実質的に倍になりますが、日本語 140 文字の内容を英語で言い切るには 280 文字で足りない場合があります。メタディスクリプション、広告コピー、UI ラベルなど、文字数制限のあるテキストの翻訳では、単純な翻訳ではなく、制限内に収まるよう意訳や要約が必要です。制限のあるフィールドは、訳文が確定した時点でもう一度数え直すのが確実です。原文が収まっていたことは、訳文が収まる根拠になりません。

機械翻訳の品質評価では BLEU スコアが標準的な指標の一つです。BLEU は機械翻訳の出力と人間による参照訳を N-gram (連続する n 語の並び) の一致率で比較する指標で、訳文が参照訳より短いときに減点する仕組みを持ち、慣例として 0 から 100 に換算して示されます。注意が必要なのは、同じ訳文でも語の切り方 (トークン化) の手順や参照訳の本数によって値が変わる点です。異なる論文やサービスが公表した数値をそのまま並べて優劣を論じることはできず、比較するなら同じ評価データと同じ計算手順で測り直す必要があります。日本語と英語のように語順や語の区切り方が離れた言語の組み合わせでは、訳文として読めていても N-gram が一致せず点が伸びにくい傾向があり、点数の低さがそのまま品質の低さを意味するとは限りません。

ポストエディット (機械翻訳の出力を人間が修正する作業) は、翻訳の現場に定着してきた進め方です。機械翻訳で下訳を作り、翻訳者が原文と突き合わせて直す形にすると、白紙から訳すより短い時間で仕上がる場合がある一方、下訳の質が低いと読み直しと書き直しの手間が増え、かえって時間がかかることもあります。工数を左右するのは、どこまで直すかの取り決めです。誤訳と用語の統一だけを直すのか、読み物として通る文体まで整えるのかで、同じ分量でも作業量は大きく変わります。見積もりの単位には原文の文字数や語数が使われるため、対象範囲が確定した時点で文字数を数えておくと、作業量の見通しが立てやすくなります。

この記事を共有