海外の取引先から、英語で長文のメールが来る。返事を書く時間はない。とりあえずDeepLか、最近ならChatGPTに突っ込んで日本語にして、画面の上で読む。内容は分かる。判断もできる。判断したつもりになる。
逆向きも同じだ。社内で英文の案内を出さねばならず、日本語で書いた原稿を機械翻訳に通し、出てきた英文に目を走らせ、まあ大丈夫だろうと送信する。先方からの返信はとくに変な様子もない。だから今回もうまくいったのだろう、と思う。
問題は、本当にうまくいっていたかどうかを、こちら側の誰も検証していない、という点にある。原文と訳文を並べて、ここはOK、ここは危ない、ここは致命的、と判定する作業が、現代の翻訳パイプラインのどこにも入っていない。
これは個人のメールの話に閉じない。マーケコピー、社内通達、契約書のドラフト、IR資料、サポートのFAQ。あらゆる種類の文書が、ここ数年で機械翻訳の上に乗せられた。乗せた量は爆発的に増えた。その品質を確認するレイヤーは、ほぼ増えていない。確認しているつもりの人はいる。「読んで違和感がなかった」というのを確認と呼んでいる。違うのだ。それは確認ではなく、希望的観測である。
そしてここで多くの人が見落としているのは、これは機械翻訳に限った話ではない、という点だ。プロの翻訳者に発注した訳文ですら、それが発注者の意図に対して全編にわたって整合しているかを、発注者側が独立に確認する手段は、現状ほぼ存在しない。納品物を読んで「日本語として読めるな」「英語として通るな」と確認し、それで終わる。原稿全体に対して、ブリーフどおりに仕事がなされているかを項目別に検証する作業は、コストの問題で誰もやっていない。やる方法がない、と言った方が正確かもしれない。
翻訳評価という分野は、この問題の解決を仕事として引き受けてきた。だが、業界の外にいる人間が思っているほど、この分野はうまくいっていない。
機械翻訳は、皆が思うほど完璧ではない
最初にひとつ、神話を解いておく必要がある。
2026年の機械翻訳とLLMの出力は、確かに数年前とは別物の水準にある。これは事実だ。日常用途の8割は、もう人間がやり直す必要がない。
だが、ここから先が誤解されている。残りの2割――特に、訳文に「狙い」がある場面――では、現在のシステムは依然として安定して仕事をしない。具体的に何が起きるかというと、二つだ。
ひとつは、翻訳意図のブレ。同じ原文を同じモデルに二回投げて、二回とも「演説として訳せ」と指示しても、出てくる二つの訳文はトーンが揃わない。一方は煽動的、もう一方はやや抑制的、ということが平気で起きる。狙いに対する着地が確率的にしか定まらない。
もうひとつは、長文での一貫性。文書の前半で contract を「契約」と訳しておきながら、後半で「契約書」に化けている。前半でフォーマルだったトーンが、後半で微妙にカジュアルにずれている。固有名詞の表記が三通り出てくる。これらは個別には致命的ではない。だが文書全体としては、ボディブローのように品質を削っていく。
そして、これらの問題は、出力を読んだだけでは気づきにくい。一文ずつ見れば全部「ちゃんとした文」だからだ。違和感の正体が、文単位ではなく文書単位で発生している。違和感を覚えない読者は、安心して送信ボタンを押す。それが安心すべき状態かどうかは、別の話だ。
人間の翻訳者でも、同じ構造の問題は発生する。長尺の文書の途中で疲労や判断の揺らぎが入る。ジャンルやレジスターの細部が、最初のページと最後のページで完全には揃わない。ベテランほどこれを自覚しているし、だからこそ自己レビューに時間をかける。だが、その自己レビューが完全であるかどうかを、外側から確認する手段は、これもまた存在しない。
要は、機械であれ人間であれ、翻訳の品質が「狙いに対して」「全編にわたって」揃っているかどうかを、独立に確認する仕組みが、業界全体として欠落している。これが現状だ。
我々が持っている指標は、我々が気にしていることを測っていない
確認の仕組みがないわけではない。あるにはある。問題は、何を測っているかだ。
機械翻訳研究で主要な自動評価指標はBLEUとCOMETの二つだ。BLEUは出力を参照訳(reference translation)と突き合わせて、重なる単語列を数える。COMETは学習済みのモデルで意味的類似度をスコアにする。どちらもそれ自体の用途には有用だ。そしてどちらも、エンジニアリングでは抜け出せない同じ前提を抱えている。「正解」が存在し、その正解はテストセットに置かれた参照訳である、という前提だ。
翻訳という営みは、そう動かない。
日本の児童文学から一文借りる。「あの男の子はまるで桃太郎みたいだ」。日本で育った人間にとって、桃太郎は犬と猿と雉を連れて鬼を退治する民話の英雄だ。子供を「桃太郎みたい」と言えば、年の割に勇敢で、肝が据わっていて、体は小さくても侮れない、というニュアンスが乗る。
これを、桃太郎を聞いたことのない英語読者向けに訳す。選択肢は複数ある。
そのまま That boy is just like Momotarō. と書ける。原文の表面は完璧に保たれる。参照訳がたまたま同じなら、BLEUは大喜びする。だが英語読者にはほとんど何も伝わらない。文の中身が、彼らの知らない名前のなかに全部閉じ込められているからだ。
That boy is so brave for his age. と書くこともできる。文化固有性は捨てるが、意味は一発で着地する。
あるいは That boy's another little Hulk. と書く手もある。これは攻めた選択だ。文化的に通じない参照対象を、文化的に通じる別の参照対象で置き換えている。参照先の「中身」ではなく「機能」を移植する翻案だ。ブリーフ(発注内容)次第で、これがその場の最善手にもなれば、不適切にもなる。
どれが正解か。条件次第だ。読者、媒体、許される裁量の幅、周辺テクストのレジスター、その他十二くらいの要素次第。そしてそれらの要素はすべて、文の上位にあって、文だけを見ている指標からは見えない。
BLEUは、たまたま参照訳に一致した選択肢を褒め、それ以外を罰する。どれが優れているかとは無関係に、だ。COMETは意味的距離でランクづけして、翻訳が読者にどんな効果を及ぼすべきかという問いを丸ごとスキップする。どちらも「この仕事にどの選択がフィットするか」を教えない。そもそも、ハルクへの置き換えという案は、人間の翻訳者なら飛ぶことのある跳躍だが、参照訳との近さで訓練された指標が報酬を与えることは絶対にない。
翻訳について、大事な一点を言っておく。単一の正解は存在しない。一行ごとに、正当な選択肢が扇のように開いている。そのなかからどれを取るかは、翻訳者の判断だ。「桃太郎みたい」「年の割に勇敢」「ちっちゃなハルク」――いずれも擁護可能な選択だ。評価の仕事は、唯一の正しい訳を当てに行くことではない。翻訳者が下した判断を見て、それがこの仕事に対して機能しているかを率直に告げることだ。
LLMに直接聞くと何が返ってくるか
近代的にやるなら、指標などすっ飛ばしてLLMに直接訊ねればいい。原文、訳文、これどうだ? と。
これは思うより上手くいき、希望するより上手くいかない。
思うより上手くいくのは、LLMが原理的に、レジスター、読者、文化的参照、修辞的効果といった、BLEUやCOMETの手の届かないものについて推論できるからだ。文章がリズムを失っていることに気づける。桃太郎訳が不透明であると指摘できる。
希望するより上手くいかない理由は二つあり、実運用ではこれが複利で効いてくる。
一つ目は、評価軸が動くことだ。同じモデルに同じ問いを二度投げると、別の次元構成で答えが返ってくる。一回目は流暢性中心、二回目は正確性中心、三回目は途中で新カテゴリを発明する。複数の文書間で評価を比較できない。何を測っているのかが、そもそも揃わないからだ。測定中に、計器の方が動いている。
二つ目はサイコファンシー(おべっか)だ。LLMは、対話相手を喜ばせるように、かなり強く訓練されている。訳文を渡して「これいい?」と訊くと、相当な確率で「いいですよ」と返ってくる。押し返せば、押し返しに同意する。モデルは「ユーザーを尊重して耳を傾けたフリ」を最適化しているのであって、「冷徹な評価者であれ」を最適化しているのではない。低リスク用途なら、これでいい。だが翻訳をプロダクトとして出荷する人間、翻訳を採点する人間、翻訳を実弾で買う人間にとって、この性質は欲しいものの真逆だ。
そんなわけで、奇妙な状況が続いてきた。我々が欲しかったもの――非専門家が翻訳を実際に検証するための手段――は、まともには存在していなかった。翻訳を外注したら、ベンダーを信じるしかなかった。機械翻訳を使うなら、指を組んで祈るしかなかった。翻訳を確実にチェックできるのは、両言語を翻訳が要らないレベルまで習得済みのシニアレビュアーだけだった。
CATERがやろうとしていること
CATERというツールがある。私はその開発側の人間だ。これがこの問題に対する、まともな最初の解決の試みだと思っているので、何をしているかを説明させてほしい。
CATERは翻訳を六つの明示的な軸で評価する。文法的精度(GP)、意味整合性(SI)、事実整合性(FC)、用語整合性(TC)、談話一貫性(DC)、伝達・文体適切性(CSA)。軸はランごとに動かない。毎回同じだ。評価Aと評価Bを比較したら、その比較は意味を持つ。
スコアリング自体はLLMに任せていない。モデルはエラーを同定して特徴づける役割を担い、決定論的なパイプラインが、深刻度、義務強度、軸感度から数値を計算する。同じ入力を二回流せば、同じ数字が出る。これは些細な実装詳細に聞こえるかもしれない。違う。「計器」と「雰囲気」を分ける線がここにある。
そして、少し時間を割いて話したいのはTranslation Brief(翻訳ブリーフ)の方だ。
ブリーフは、その翻訳が何のためのものかをCATERに教える。読者は誰か、媒体は何か、どんな効果を生むべきか、何を犠牲にしてよく、何を絶対に保たねばならないか。ブリーフがあれば、評価は「ある抽象的な正解からどれだけ近いか」という問いではなくなる。「この翻訳は、雇われた仕事をやれているか」という問いになる。私の知る限り、これだけが本当に意味のある問いだ。
ブリーフを与えると、桃太郎の例は決着がつく。ブリーフが「アメリカの子供向け児童書、可読性最優先」なら、That boy is just like Momotarō はCSA軸でフラグが立つ。参照先が着地しないからだ。That boy's another little Hulk は高スコアを取りうる。ブリーフが「学術アンソロジー向け文学翻訳、文化的特異性を保持」なら判定は反転する。桃太郎の行は原文のままが正しく、ハルクへの置換は同化(domestication)が過ぎる。同じ原文、同じ選択肢、違うブリーフ、違う正解。評価者はこれを見える。ブリーフが第一級の入力だからだ。
ブリーフを与えなければCATERは推論で補う。実際の現場で、書面のブリーフが存在する翻訳は少数派だ。だが暗黙のブリーフは必ずある。ジャンル、レジスター、想定読者が「良い翻訳」の境界を制約する。腕のあるレビュアーは、ブリーフを自動的に頭のなかで再構成しながら読んでいる。CATERは同じことを明示的にやり、推論したブリーフを画面に出す。間違っていれば、人間が修正できる。
ノーベル賞級の翻訳に、CATERを当ててみる
ここで具体例を出す。機械翻訳の出力ではない。話を、機械翻訳が登場するはるか以前の、人間による文学翻訳に振る。
エドワード・サイデンステッカー訳の川端康成『雪国』。1956年初訳、後の改訳を経て、1968年に川端がノーベル文学賞を受賞する際、選考委員会が参照したのはこのサイデンステッカー訳だった。日本文学の英訳として、20世紀の頂点と言っていい。これに勝る人間翻訳を持ち出すのは、相当に難しい。
その冒頭一段落をCATERにかけた。明示ブリーフなし、評価器に推論させた。
総合スコア58.8/100、判定は「大規模な再作業が必要(Major rework)」。軸別の内訳はこうだ。
軸 スコア 文法的精度 (GP) 100.0 意味整合性 (SI) 25.1 事実整合性 (FC) 100.0 用語整合性 (TC) 79.5 談話一貫性 (DC) 100.0 伝達・文体適切性 (CSA) 0.0
ここで早合点しないでほしい。CATERが「サイデンステッカーは下手だ」と言っているわけではない。文法、事実、論理構成は全部満点だ。崩れているのは意味の核と文学的効果という、限られた、しかし重大な部分だ。そしてCATERは、その崩れがどこにあるかを、ピンポイントで指している。
「夜の底が白くなった」が、サイデンステッカー訳では The earth lay white under the night sky. となっている。CATERの診断はこうだ――「夜の底」という比喩的・知覚的表現が「地面が夜空の下で白い」という別の情景に置き換えられている。白さが夜の内部から立ち上がる原文の意味作用が保持されていない。最小修正案として The bottom of the night turned white. が提示されている。これがSI軸を25まで落とした主因だ。
もうひとつ。窓を開けた娘が「遠くへ叫ぶように、『駅長さあん、駅長さあん』」と呼びかける場面。サイデンステッカー訳は Leaning far out the window, the girl called to the station master as though he were a great distance away. となっている。直接話法そのものが、要約叙述に置き換えられている。CATERのコメント――「呼び声そのものの響きと場面の即時性が失われている。発話内容を消去したため、文学的再現としての現前感が弱まっている」。これがCSA軸を0にした。
これらの指摘について、サイデンステッカーには彼なりの選択の理由があったはずだ、というのが正しい受け止めだ。1950年代の英語圏読者に向けた文学翻訳として、当時の翻訳規範のなかで、彼は意識的にこれを選んだ。CATERのコメント自体、これを「誤訳」とは呼んでおらず、「ブリーフ次第で判定が変わる解釈の問題」として扱っている。だが、現代の日本文学英訳プロジェクトに同じ原文を発注し、「原典の詩的雰囲気の再現を最優先する」というブリーフを書いたなら、この訳文では仕事になっていない、という判定になる。同じ訳文、違うブリーフ、違う結論。
ここで読み取ってほしいのは、スコアの数字そのものではない。三つのことだ。
ひとつ。世界文学史に名を残す翻訳ですら、特定のブリーフのもとでは「再作業」判定が出る。これは翻訳の品質に絶対的な天井がないことの証明であり、同時に、評価とはブリーフに対する相対的な作業である、ということの実証でもある。
ふたつ。CATERは「これがダメだ」と言うだけではなく、「こう直せ」を具体的な代案で出している。診断と処方が一体になっている。これがあるから、評価結果を見た側が次の手を打てる。
みっつ。文法と事実と論理構成が満点でも、文学翻訳としての仕事は失敗しうる。「読んで違和感がない」では掴めない種類の失敗が、ちゃんと別軸で出てくる。日々機械翻訳の出力に対してやっている「読んで違和感がなかったから大丈夫」という確認が、いかに弱い検証であるか――これが、サイデンステッカー級の翻訳ですら明示的な軸に分解すると揺らぐ、という事実から逆算して見えてくる。
なぜ翻訳研究者以外にとっても重要なのか
ここまでの話の大半は、ローカライゼーション業界の外にいる人には内輪話に聞こえると思う。それでもなぜ重要かを書く。
翻訳は現時点でLLMの主要用途のひとつだ。カスタマーサポート、プロダクトコピー、社内通達、法務文書、契約書を機械翻訳パイプラインに通している企業の数とトラフィックは、三年前にはなかった規模になっている。このパイプラインを流れている経済活動は莫大だ。その上に乗っている検証レイヤーは、ほぼゼロだ。人々は、検証できない翻訳を出荷している。法務条項のなかでモデルが数字を捏造していないこと、mustをshouldに弱めていないこと、マーケコピーを成立させていたトーンを落としていないことを、祈りながら出している。
そして繰り返すが、これは機械翻訳の問題ではない。プロの翻訳者に外注した訳文も、同じ検証の不在のなかで納品されている。発注者は受け取った訳文を読んで「日本語として読める」と確認する。それは翻訳の品質確認ではなく、納品物が日本語であることの確認だ。両者の間にあるはずの、長い距離が、これまで誰にも踏破されてこなかった。
2026年の自動翻訳は、たいていの用途で「実用上十分」なレベルにある。これは本当だ。だが「たいていの用途で十分」は検証戦略ではない。間違いが致命的になりうる場面――臨床文書、契約書、公的声明、文学翻訳――において、「読んで違和感がなかった」「信頼できる翻訳者に頼んだ」は、もう通用する答えではない。
我々がずっと欠いてきたのは、非専門家が出力を検証するためのレイヤーだ。数字一個ではない。ゴム印でもない。「この翻訳の強みはここ、リスクはここ、Xを重視するならここを直せ」という、構造化された、読める診断。
それがCATERだ。cater.erudaite.ai で無料で試せる。手法と背後の理論は about.erudaite.ai に置いてある。
自分の手元にある翻訳、たとえば送信前のメール、社内資料、契約書ドラフト、外注して納品されたばかりの原稿を放り込んで、何が出てくるか見てほしい。
CATERで、その品質、翻訳の特徴が確認できるはずだ。





