YouMind
登录

翻译真的准确吗?

@KurandoIida
日语2026年5月21日
531K
47
6
4
32

TL;DR

本文探讨了现代翻译流程中客观评估的严重缺失,并介绍了 CATER。这是一款利用结构化简报来评估翻译质量的工具,其评估维度远超简单的流畅度检查。

你收到一封海外客户发来的长英文邮件。你没时间写回复。于是,你把它丢进 DeepL,或者最近常用的 ChatGPT,转成日文后直接在屏幕上阅读。你理解了内容。你能做出判断。或者至少,你觉得自己能做出判断。

反过来也一样。你需要在公司内部发一份英文通知,于是把日文草稿扔进机器翻译,扫一眼生成的英文,觉得“看起来没问题”,然后点击发送。对方的回复也没什么异常。于是你想:“这次应该也没问题吧。”

问题在于,这一方没有任何人核实过是否真的没问题。把源文本和目标文本并排比对,逐一判断“这部分可以”“这部分有风险”“这部分致命”——这个流程在如今的翻译流程中已经完全缺失。

这不只是个人邮件层面的问题。营销文案、内部通知、合同草案、投资者关系材料、客服 FAQ——各种类型的文档在最近几年都被交给了机器翻译。处理量暴增。然而,质量检查的环节几乎没有增加。有些人以为自己是在检查。他们把“读一遍,没感到不舒服”称为检查。这不是检查。这不是检查,是自我安慰。

而很多人忽略的是,这不只是机器翻译的问题。即使是委托专业译员完成的翻译,目前也几乎没有任何方法让客户独立核实整篇译文是否与自己的意图一致。客户读完交付件,觉得“读起来像日文”或“能当英文用”,就完事了。没有人会逐项核实整篇稿件是否按照要求完成——因为成本问题。更准确地说,是根本没有办法这么做。

翻译评估领域一直承担着解决这个问题的任务。但该领域的现状并没有行业外的人想象的那么好。

机器翻译远没有大家想的那么完美

首先,需要破除一个神话。

2026 年的机器翻译和大语言模型输出,水平当然和几年前不可同日而语。这是事实。对于日常 80% 的使用场景,人类已经不需要再重做一遍翻译。

然而,接下来的部分被误解了。在剩余的 20%——尤其是在翻译有特定“目的”的情况下——现有系统仍然无法稳定工作。具体来说,会出现两个问题。

一是翻译意图的波动。即使用同一个模型、同一段源文本,两次都指示“以演讲稿风格翻译”,两次的结果也会有不一致的语调。一次可能语气激昂,另一次则有所克制。相对于目标的落点只是概率性地确定。

二是长文本的一致性。一份文档可能前半部分把“合同”翻成“契約”,后半部分变成了“契約書”。前半部分正式的语气后半部分悄然变得随意。专有名词可能出现三种不同的写法。单独来看,这些都不是致命问题。但对整份文档而言,它们就像持续击打的身体重拳,一点点蚕食质量。

而且,这些问题光靠读译文是很难发现的。单看每一句话,都是“正确的句子”。不适感的源头在文档层面,不在句子层面。读起来没觉得不舒服的读者,会放心地按下发送键。至于他们是否应该感到放心,那就是另一回事了。

同样的问题在人工翻译中也会出现。长时间处理长文档时,疲劳或判断波动会悄悄出现。体裁或语域的细节在首页和末页之间可能无法完全对齐。资深译员对此心知肚明,所以他们会花时间做自审。然而,外部同样无法验证自审是否完成。

简而言之,无论机器还是人工,整个行业都缺乏一种机制来独立验证译文质量是否“相对于目的”并且“贯穿整篇文档”。这就是现状。

我们现有的评估指标,衡量的不是我们在乎的东西

不是说完全没有验证机制。有。问题在于它们衡量的是什么。

机器翻译研究中两个主要的自动评估指标是 BLEU 和 COMET。BLEU 将输出与参考译文进行比较,统计重叠的词语序列。COMET 用预训练模型对语义相似度打分。两者在其预期用途上都有用。而它们共享一个工程领域无法逃脱的前提:存在一个“正确答案”,而这个正确答案就是测试集中放置的参考译文。

翻译作为一种活动,并不遵循这个逻辑。

借用一句日本儿童文学中的句子:“あの男の子はまるで桃太郎みたいだ。”对于在日本长大的人来说,桃太郎是一个民间传说英雄,带着狗、猴子和野鸡打败了妖怪。说一个孩子“像桃太郎一样”,隐含的意思是这孩子在同龄人中很勇敢,有胆量,即使个头小也不能小看。

如果你要把这句话翻译给一个从未听说过桃太郎的英文读者,有多个选择。

你可以直译:“That boy is just like Momotaro.”源文表面完全保留。如果参考译文恰好也是这个,BLEU 会很高兴。但英文读者几乎什么也接收不到。这句话的含义完全锁死在一个他们不知道的名字里。

你也可以写成:“That boy is so brave for his age.”你舍弃了文化特异性,但含义瞬间落地。

或者你还可以大胆一步:“That boy's another little Hulk.”这是一个大胆的选择。它用一个文化上可理解的概念替换了一个文化上不可理解的概念。这是一种移植了“功能”而非“内容”的改写。根据需求(订单详情),这可能最佳,也可能不当。

哪个是正确答案?取决于条件。取决于读者、媒介、允许的发挥空间、周围文本的语域,以及大约另外十二个因素。而所有这些因素都存在于句子层面之上,那些只看句子的评估指标根本看不到。

BLEU 会表扬恰好匹配参考译文的选项,而惩罚其他所有选项,不管哪个更优。COMET 按语义距离排序,完全跳过译文应该对读者产生什么效果的问题。两者都无法告诉你“哪个选择适合这份工作”。首先,用“Hulk”替换这个想法是人类译员可能做出的飞跃,但基于与参考译文接近程度训练的评估指标永远不会奖励这种选择。

关于翻译,请允许我说一件重要的事。翻译没有唯一的正确答案。每一行,合理的选项像扇子一样展开。选择哪一个,是译员的判断。“像桃太郎”“比同龄人勇敢”“小 Hulk”——所有都是可辩护的选择。评估的工作不是去猜测唯一正确的译文,而是审视译员做出的判断,并坦率地指出这份判断在这项任务中是否起作用。

直接问大语言模型会发生什么

如果你想用现代的方式,你可以跳过评估指标,直接问大语言模型。“这是源文,这是译文——质量如何?”

这个方法的效果比你想的好,也比你想的差。

比你想的好,是因为大语言模型原则上能够推理语域、受众、文化参照和修辞效果——这些是 BLEU 和 COMET 无法触及的。它能注意到一句话失去了节奏感。它能指出桃太郎的翻译是模糊的。

比你想的差,原因有两个,而且在实践中它们会互相叠加。

第一,评估轴会漂移。如果你向同一个模型问同一个问题两次,它会返回不同维度的答案。第一次可能关注流畅度,第二次关注准确性,第三次可能半路发明一个新的类别。你无法跨文档比较评估结果,因为你从一开始衡量的东西就不一致。在你测量的同时,测量工具本身在移动。

第二,谄媚(讨好)。大语言模型被训练得极强地倾向于取悦对话伙伴。如果你递上一段译文并问“这个好吗?”,它很有可能会说“很好。”如果你提出异议,它也会同意你的异议。模型优化的目标是“假装倾听并尊重用户”,而不是“做一个冷酷的评估者”。对于低风险用途,这没问题。但对于那些把翻译作为产品发货的人、那些给翻译评分的人、或那些花真金白银购买翻译的人来说,这种特质恰恰是最不想要的。

结果,一个奇怪的局面持续了下来。我们想要的东西——让非专业人士真正能够验证翻译的手段——并没有实际存在过。如果你外包了翻译,你只能信任供应商。如果你用了机器翻译,你只能祈祷。唯一能可靠检查翻译的人,是那些已经熟练掌握两种语言、以至于根本不需要翻译的高级审阅者。

CATER 试图做什么

有一个叫 CATER 的工具。我在它的开发团队中。我相信这是对这个问题的第一次严肃尝试,所以让我解释一下它的功能。

CATER 在六个明确的评估轴上评价翻译:语法精准度(GP)、语义完整性(SI)、事实一致性(FC)、术语一致性(TC)、语篇连贯性(DC)以及交际与文体适切性(CSA)。评估轴不会随运行次数变化。每次都是一样的。如果你比较评估 A 和评估 B,这个比较是有意义的。

评分本身不由大语言模型完成。模型负责识别和描述错误,而一个确定性的流程根据严重程度、必改强度和轴敏感性计算数值。如果你两次运行相同输入,你会得到相同的数字。这听起来像是一个小实现细节。但并非如此。这是区分“仪器”和“氛围”的界线。

而我想花一点时间讲的是“翻译需求说明”。

需求说明告诉 CATER 这篇翻译的用途。读者是谁,媒介是什么,应该产生什么效果,什么可以牺牲,什么必须绝对保留?有了需求说明,评估不再是“这个译文离某个抽象正确答案有多近?”的问题,而变成了:“这篇译文完成了它被雇佣来完成的任务吗?”据我所知,这才是唯一真正重要的问题。

当你提供了需求说明,桃太郎的例子就能解决。如果需求说明是“面向美国儿童的绘本,可读性为最高优先级”,那么“That boy is just like Momotaro”会在 CSA 轴上被标记,因为该参照无法落地。“That boy's another little Hulk”可能得到高分。如果需求说明是“学术文集的文学翻译,保留文化特异性”,判断就会反转。保留原文的桃太郎句是正确的,替换成 Hulk 则是过度的归化。相同源文,相同选项,不同需求说明,不同正确答案。评估者能看到这一点,因为需求说明是一级输入。

如果你没有提供需求说明,CATER 会通过推理进行补充。在实际操作中,有书面需求说明的翻译是少数。但总是存在一个隐含的需求说明。体裁、语域和目标受众限定了“好翻译”的边界。一个熟练的审阅者会在阅读时自动在脑中重建需求说明。CATER 以显式方式做同样的事,并在屏幕上显示推理出的需求说明。如果它错了,人类可以修正。

将 CATER 应用于诺贝尔奖级别的翻译

让我给一个具体例子。这不是机器翻译输出。我将话题转向机器翻译出现之前很久的人类文学翻译。

川端康成的《雪国》,爱德华·塞登斯蒂克英译。首次译于 1956 年,后来经过修订,川端康成 1968 年获得诺贝尔文学奖时,评委参考的正是塞登斯蒂克的译本。它堪称 20 世纪日本文学英译的巅峰。很难找到超越它的人类翻译。

我将其开篇段落输入 CATER。没有提供显式需求说明,让评估器自行推理。

总体得分:58.8/100。判决是“需要大幅修改”。以下是各轴分解:

请不要急于下结论。CATER 不是在说“塞登斯蒂克不好”。语法、事实和逻辑结构都得了满分。出问题的是核心含义和文学效果——有限但关键的部分。而 CATER 精确指出了问题所在。

“夜の底が白くなった”被塞登斯蒂克翻译为“The earth lay white under the night sky”。CATER 的诊断是:隐喻和知觉性的表达“夜的底部”被替换成了不同的场景“夜空下的地面是白色的”。原文中白色从黑夜内部升起的语义效果没有被保留。作为最小修正,“The bottom of the night turned white”被建议替代。这是 SI 轴降至 25 的主要原因。

另一个例子。一个女孩打开窗户,“好像在远处喊叫一样”喊道:“站长先生、站长先生!”塞登斯蒂克的译文是:“Leaning far out the window, the girl called to the station master as though he were a great distance away.”直接引语被替换成了概括性描述。CATER 的评论:“呼喊本身的回响和场景的即时性丢失了。由于口语内容被删除,作为文学再现的临场感被削弱。”这使得 CSA 轴降至 0。

正确理解这些评价:塞登斯蒂克必然有自己的理由选择这些译法。作为面向 20 世纪 50 年代英语读者的文学翻译,他在当时的翻译规范内做出了有意识的选择。CATER 的评论本身并未称之为“误译”,而是将其视为“根据需求说明判断会发生变化的解释性问题”。然而,如果针对同一源文本委托一个现代日本文学翻译项目,并写出需求说明“优先再现原文的诗意氛围”,那么这个翻译就没有完成它的工作。相同译文,不同需求说明,不同结论。

我希望你从中学到的不是分数本身,而是三件事。

第一:即使是在世界文学史上留下印记的翻译,在特定需求说明下也可能收到“需要修改”的判决。这证明了翻译质量没有绝对的顶峰,同时也展示了评估是一项相对于需求说明的任务。

第二:CATER 不仅仅说“这个不好”,它提供具体的替代方案:“这样改”。诊断和处方是整合的。因此,看到评估结果的一方可以采取下一步行动。

第三:即使语法、事实和逻辑结构完美,作为文学翻译的工作也可能失败。那些“读一遍没感到不舒服”无法捕捉的失败,会恰当地在不同轴上显现出来。通过反推——连塞登斯蒂克级别的翻译在分解成显式评估轴时都会出现波动——就能明白仅仅依靠“没感到不舒服”来检查机器翻译输出是多么薄弱。

为什么这对非翻译研究人员也很重要

到目前为止我所说的大部分内容,对本地化行业之外的人来说可能听起来像内部话题。但为什么它仍然重要。

翻译目前是大语言模型的主要用途之一。通过机器翻译管道处理客户支持、产品文案、内部通知、法律文件和合同的公司数量和流量规模,是三年前不存在的。依靠这些管道的经济活动量巨大。但架设在这些管道之上的验证层几乎为零。人们正在发布他们无法验证的翻译。他们发送法律条款时祈祷模型没有虚构数字、没有把“必须”弱化成“应该”、没有丢失让营销文案有效的语调。

我重复一遍,这不是机器翻译的问题。外包给专业翻译的译文同样是在缺乏验证的情况下交付的。客户阅读交付的译文并确认“读起来像日文”。这不是翻译的质量检查;这是确认交付件是日文。这两者之间本应存在的巨大距离,至今没有人跨越过。

2026 年的自动翻译对于大多数用途而言已经达到“实际足够”的水平。这是事实。但“对大多数用途足够”不是验证策略。在错误可能致命的场景——临床文档、合同、公开声明、文学翻译——中,“我读着没感到不舒服”或“我找的是可靠的翻译”不再是可接受的答案。

我们长期以来缺乏的是一个让非专业人士验证输出的层。不是一个单一数字。不是一块橡皮图章。而是一个结构化的、可读的诊断报告,指出“这篇翻译的强项在这里,风险在这里,如果你重视 X,就修正这部分”。

那就是 CATER。你可以在 cater.erudaite.ai 免费试用。方法论和背后的理论可在 about.erudaite.ai 找到。

试着把你手头的一份译文扔进去——比如发送前的邮件、内部资料、合同草案、或者刚从外包方交付的稿件——看看结果如何。

你应该能够通过 CATER 确认其质量和翻译特性。

一键保存

使用 YouMind AI 深度阅读爆款文章

保存原文、追问细节、总结观点,并在一个 AI 工作空间里把爆款文章沉淀成可复用笔记。

了解 YouMind
写给创作者

把你的 Markdown 变成干净的 𝕏 文章

图片上传、表格、代码块,往 𝕏 上手动重排太痛苦。YouMind 把整篇 Markdown 一键转成干净、可直接发布的 𝕏 文章草稿。

试试 Markdown 转 𝕏

更多可拆解样本

近期爆款文章

探索更多爆款文章