YouMind
登入

翻譯內容真的準確嗎?

@KurandoIida
日語2026年5月21日
531K
47
6
4
32

TL;DR

本文探討了現代翻譯流程中缺乏客觀評估的關鍵問題,並介紹了 CATER。這款工具透過結構化的簡報(Briefs)進行評估,能超越單純的流暢度,深入檢視翻譯品質。

您收到一封來自海外客戶的長篇英文電子郵件。您沒有時間回覆。現在,您把它丟進 DeepL,或者更近期的 ChatGPT,讓它轉成日文,然後在螢幕上閱讀。您理解了內容。您可以做出判斷。或者至少,您覺得自己可以。

反過來也一樣。您需要對內發送一封英文公告,於是用機器翻譯將用日文寫好的草稿轉成英文,掃過一遍結果,覺得「看起來還行」,然後按下發送。對方的回覆看起來也沒什麼特別奇怪的地方。於是想:「這次應該也順利吧。」

問題在於,沒有人在這邊驗證過它是否真的順利。將原文與譯文並排比對,判斷「這部分沒問題」、「這部分有風險」、「這部分會致命」的流程,在現代的翻譯管道中已經消失了。

這不限於個人郵件。行銷文案、內部通知、合約草稿、投資人關係資料、客服常見問答——過去幾年,各種文件都被丟進了機器翻譯。數量急遽增加。然而,檢查品質的環節幾乎沒有增加。有些人以為他們在檢查。他們把「讀起來沒有不適感」稱為檢查。那不是檢查。那不是檢查,那是一廂情願。

而且很多人忽略的一點是,這不只是機器翻譯的問題。即使是委託專業譯者做的翻譯,客戶也幾乎沒有辦法獨立驗證整份文件是否符合自己的意圖。他們讀了交付的譯稿,覺得「讀起來像日文」或「看起來像英文」,就這樣結束了。沒有人因為成本問題,而逐一核對整份稿件是否符合委託要求。更準確地說,是根本沒有辦法做到。

翻譯評估這個領域肩負著解決這個問題的任務。然而,這個領域的狀況並不如業外人士所想的那麼樂觀。

機器翻譯並沒有大家想的那麼完美

首先,需要破除一個迷思。

2026 年的機器翻譯和大型語言模型的輸出,確實和幾年前不在同一個層級。這是事實。對於 80% 的日常用途,人類不再需要重新做一遍。

然而,接下來的事情被誤解了。在剩下的 20%——尤其是在譯文帶有特定「目的」的情況下——目前的系統仍然無法穩定運作。具體來說,會發生兩件事。

一是翻譯意圖的波動。即使你把同一份原文丟進同一個模型兩次,兩次都指示它「以演講稿的方式翻譯」,兩次得出的譯文也不會有一致的語氣。一個可能很有煽動性,另一個則有些克制。相對於目標的落點只是機率性地決定。

二是長文本的一致性。一份文件可能前半段把「contract」翻成「keiyaku」,後半段卻變成「keiyakusho」。前半段語氣正式,後半段卻不知不覺變得隨意。專有名詞可能出現三種不同的寫法。個別來看,這些都不是致命傷。但對整份文件來說,它們像不斷累積的打點一樣磨損品質。

更糟的是,這些問題只靠閱讀輸出是很難察覺的。如果你看每個句子,它們都是「合格的句子」。不適感的來源發生在文件層級,而不是句子層級。沒有不適感的讀者就會安心按下發送鍵。至於那是不是一個應該感到安心的狀態,則是另一回事。

同樣的結構性問題也發生在人工作業上。在處理長文件時,疲勞或判斷的波動會滲入。文類或語域的細節在首頁與末頁之間可能無法完美對齊。老手知道這一點,所以他們會花時間自我審查。然而,外部也無法驗證那份自我審查是否完整。

總之,無論是機器還是人類,整個業界都欠缺一套機制,來獨立驗證譯文的品質是否「相對於目標」且「在整份文件中」保持一致。這就是目前的現狀。

我們擁有的指標,衡量的不是我們在意的東西

不是沒有驗證機制。有。問題在於它們衡量的是什麼。

機器翻譯研究中兩個主要的自動評估指標是 BLEU 和 COMET。BLEU 將輸出與參考譯文比對,計算重疊的詞序。COMET 使用預訓練模型來評分語義相似度。兩者都有其用途。而且兩者都共享同一個工程上無法逃脫的前提:存在一個「正確答案」,而那個正確答案就是測試集中的參考譯文。

翻譯這項活動並不是那樣運作的。

借用一句日本兒童文學的句子:「あの男の子はまるで桃太郎みたいだ。」對於在日本長大的人來說,桃太郎是民間傳說中的英雄,帶著狗、猴子、雉雞去打鬼。說一個孩子「像桃太郎」帶有「小小年紀卻很勇敢、有膽量、不能小看」的意味。

如果你要為一個從沒聽過桃太郎的英文讀者翻譯這句話,可以有多種選項。

你可以照字面寫:「That boy is just like Momotaro.」原文的表面被完美保留。如果參考譯文恰好也是這樣,BLEU 會很開心。但英文讀者幾乎什麼也接收不到。句子的意義完全被封鎖在一個他們不知道的名字裡。

你也可以寫:「That boy is so brave for his age.」你捨棄了文化特殊性,但意義立刻落地。

或者你可以大膽一點:「That boy's another little Hulk.」這是個大膽的選擇。它把一個文化上無法理解的指涉,替換成另一個文化上可以理解的指涉。這是一種移植「功能」而非「內容」的改寫。取決於委託單(訂單細節),這可能是最佳選擇,也可能是個不恰當的選擇。

哪個是正確答案?取決於條件。取決於讀者、媒介、允許的改寫範圍、周圍文本的語域,以及其他大約十二個因素。而所有這些因素都存在於句子層級之上,對於只看句子的指標來說是看不見的。

BLEU 會讚揚那些恰巧與參考譯文一致的選擇,並處罰其他一切選擇,不管哪個比較優秀。COMET 則按語義距離排名,跳過了譯文應該對讀者產生什麼效果這個問題。兩者都不會告訴你「哪個選擇適合這項工作」。首先,像用 Hulk 來替換這種跳躍,是人類譯者可能做出的舉動,但一個以貼近參考譯文為訓練目標的指標永遠不會獎勵它。

關於翻譯,有一件重要的事情要說。沒有唯一的正確答案。每一行,有效的選項都會像扇子一樣展開。選哪一個是譯者的判斷。「像桃太郎」、「對他的年齡來說很勇敢」、「一個小 Hulk」——全都是站得住腳的選擇。評估的工作不是去猜測唯一正確的翻譯。而是去看譯者所做的判斷,並坦率地指出這個判斷對這項工作是否有效。

直接問 LLM 會發生什麼事

如果你想用現代的方式,你可以跳過指標,直接問 LLM。「這是原文,這是譯文——怎麼樣?」

這個方法比你想像中好用,也比你想像中糟糕。

它比你想像中好用,因為 LLM 原則上能夠推理語域、受眾、文化指涉、修辭效果等 BLEU 和 COMET 觸及不到的東西。它可以注意到句子節奏是否跑掉。它可以指出桃太郎的翻譯是模糊的。

它比你想像中糟糕的原因有兩個,而且在實務上會產生疊加效應。

第一,評估軸線會移動。如果你對同一個模型問同一個問題兩次,它會回傳具有不同維度配置的答案。第一次可能關注流暢度,第二次關注正確性,第三次可能中途發明一個新的類別。你無法比較多份文件的評估,因為衡量的東西從一開始就不一致。當你在測量時,測量儀器本身正在移動。

第二是諂媚(拍馬屁)。LLM 在訓練上非常傾向於取悅對話者。如果你遞上一份譯文並問「這個好嗎?」,它有很大機率會說「很好」。如果你追問,它會同意你的追問。模型正在優化「假裝傾聽並尊重使用者」,而不是「當個冷血的評估者」。對於低風險的使用,這沒問題。但對於把翻譯當作產品出貨的人、給翻譯打分數的人、或拿真錢買翻譯的人來說,這個特質正是他們最不需要的。

結果,一個奇怪的狀況持續存在。我們想要的——讓非專家能夠實際驗證翻譯的方法——並沒有妥善存在。如果你外包翻譯,就只能信任廠商。如果你用機器翻譯,就只能祈禱。唯一能夠可靠地檢查翻譯的人,是那些已經精通兩種語言到根本不需要譯文的資深審校員。

CATER 想做的事

有一個工具叫做 CATER。我屬於開發方。我相信這是解決這個問題的第一個嚴肅嘗試,讓我來說明它的功能。

CATER 在六個明確的軸線上評估翻譯:語法精確度、語義完整性、事實一致性、術語一致性、篇章連貫性,以及溝通與風格適切性。這些軸線在執行之間不會移動。每次都是一樣的。如果你比較評估 A 和評估 B,這個比較是有意義的。

評分本身不是交給了 LLM。模型負責識別和描述錯誤,而一個確定性的管道會根據嚴重程度、強制強度、軸線敏感度來計算數值。如果你對同一輸入執行兩次,你會得到同樣的數值。這聽起來像個小小的實作細節。但並非如此。這就是區分「儀器」和「氛圍」的界線。

而且我想花一點時間談的是翻譯委託單。

委託單告訴 CATER 這份譯文是做什麼用的。讀者是誰、媒介是什麼、應該產生什麼效果、哪些可以犧牲、哪些必須絕對保留。有了委託單,評估不再是「這份譯文離某個抽象的標準答案有多近?」它變成了:「這份譯文有沒有完成它被雇來做的工作?」據我所知,這才是唯一真正重要的問題。

當你提供委託單時,桃太郎的例子就解決了。如果委託單是「給美國小孩的童書,可讀性優先」,那麼「That boy is just like Momotaro」會在 CSA 軸線上被標記,因為這個指涉無法落地。而「That boy's another little Hulk」可能得到高分。如果委託單是「為學術文集做的文學翻譯,保留文化特殊性」,判斷就會反過來。保留桃太郎這句是正確的,用 Hulk 取代則是過度的在地化。同一來源、同一選項、不同委託單、不同正確答案。評估者可以看到這一點,因為委託單是第一級輸入。

如果你沒有提供委託單,CATER 會用推論來補充。在實際應用中,有書面委託單的翻譯是少數。但總有一個隱含的委託單。文類、語域和目標受眾會約束「好翻譯」的邊界。一個熟練的審校員在閱讀時,會自動在腦中重建一份委託單。CATER 也明確地做同樣的事,並在螢幕上顯示推論出的委託單。如果錯了,人類可以修正它。

將 CATER 應用於諾貝爾獎級別的翻譯

讓我舉一個具體的例子。這不是機器翻譯的輸出。我要把話題轉到機器翻譯出現之前很久的人類文學翻譯。

川端康成的《雪國》,由 Edward Seidensticker 翻譯。這個 Seidensticker 譯本最早於 1956 年出版,後來經過修訂,是川端康成 1968 年獲得諾貝爾文學獎時評審委員會參考的版本。它可以被稱為 20 世紀日本文學英譯的巔峰。很難找到超越這個的人類譯本。

我把它的開頭段落放進 CATER。沒有提供明確的委託單,我讓評估者自行推論。

總分:58.8/100。判斷是「需要大幅修改」。以下是各軸線的細項:

請不要妄下結論。CATER 並不是說「Seidensticker 很爛」。語法、事實、邏輯結構都得了滿分。出問題的是核心意義和文學效果——有限但關鍵的部分。而且 CATER 準確指出了問題所在。

「夜の底が白くなった」被 Seidensticker 翻譯為「The earth lay white under the night sky.」CATER 的診斷是:隱喻性和感知性的表達「夜の底」(夜的底部)被替換成了不同的場景,「大地在夜空下泛白」。原文中白從夜之內部浮現的語義效果沒有被保留。建議的最小修正為「The bottom of the night turned white.」這是 SI 軸線降到 25 的主要原因。

還有一個場景。一個女孩打開窗戶,像對著遠方喊一樣叫道:「駅長さあん、駅長さあん。」Seidensticker 的翻譯是:「Leaning far out the window, the girl called to the station master as though he were a great distance away.」直接引語本身被替換成了概括描述。CATER 的評論:「呼喊本身的迴響和場景的即時性都喪失了。因為口頭內容被抹去,作為文學再現的臨場感被削弱了。」這使 CSA 軸線降到了 0。

正確理解這些觀點的方式是,Seidensticker 必定有他自己的理由做出這些選擇。作為 1950 年代為英語讀者所做的文學翻譯,他在當時的翻譯規範中自覺地做出了這個選擇。CATER 的評論本身並沒有稱之為「誤譯」,而是將其視為「取決於委託單而判斷會改變的詮釋問題」。然而,如果你委託同一份原文做一個現代日本文學翻譯項目,並寫下委託單說「優先再現原文的詩意氛圍」,那麼判斷就是這份譯文沒有做好它的工作。同一份譯文、不同的委託單、不同的結論。

我希望你從中汲取的不是分數本身,而是三件事。

第一:即使是能在世界文學史上留下印記的譯文,也可能在特定委託單下獲得「需要修改」的判斷。這證明了翻譯品質沒有絕對的天花板,同時也展示了評估是相對於委託單的任務。

第二:CATER 不只說「這不好」,它還提供了具體的替代方案:「像這樣修改」。診斷和處方是整合的。正因如此,看到評估結果的一方可以採取下一步行動。

第三:即使語法、事實和邏輯結構都完美,作為文學翻譯的工作仍可能失敗。那些透過「讀起來沒有不適感」無法捕捉的失敗,會在明確的軸線上顯示出來。用「因為沒有不適感所以沒問題」來檢查機器翻譯的輸出是多麼薄弱——從即使 Seidensticker 層級的譯文在拆解為明確軸線後也會動搖這個事實往回推算,就可以看得清楚。

為什麼這對非翻譯研究人員也很重要

到目前為止我所說的,對本地化產業以外的人來說聽起來可能像業內行話。以下說明為什麼它仍然重要。

翻譯目前是 LLM 的主要用途之一。將客戶支援、產品文案、內部通知、法律文件和合約放進機器翻譯管道的公司數量和流量,是三年前不存在的規模。依託在這些管道上的經濟活動非常龐大。然而,坐落在它們之上的驗證層幾乎為零。人們正在送出他們無法驗證的譯文。他們送出法律條款時祈禱模型沒有捏造數字、沒有把「必須」弱化成「應該」、沒有丟掉讓行銷文案奏效的語氣。

而且我重申,這不是機器翻譯的問題。外包給專業譯者的翻譯,同樣也在缺乏驗證的情況下交付。客戶閱讀交付的譯稿,確認「讀起來像日文」。那不是翻譯的品質檢查,那是確認交付的是日文。兩者之間理應存在的巨大差距,至今沒有人走過。

2026 年的自動翻譯水準,對大多數用途來說是「實際上足夠的」。這是事實。但「對大多數用途足夠」並不是一套驗證策略。在錯誤可能致命的場合——臨床文件、合約、公開聲明、文學翻譯——「我讀起來沒有不適感」或「我問了可靠的譯者」不再是可接受的答案。

我們長期缺乏的,是一個讓非專家能夠驗證輸出的層級。不是單一數字。不是橡皮圖章。而是一份結構化、可讀的診斷,告訴你:「這份譯文的優點在這裡,風險在這裡,如果你重視 X,請修改這部分。」

那就是 CATER。你可以在 cater.erudaite.ai 免費試用。方法論與背後的理論可在 about.erudaite.ai 取得。

試著把你手邊的翻譯丟進去——例如一封發送前的電子郵件、內部資料、合約草稿,或剛從外包商那交付的稿件——看看結果。

你應該能夠透過 CATER 確認它的品質與翻譯特性。

一鍵儲存

使用 YouMind AI 深度閱讀爆款文章

保存原文、追問細節、總結觀點,並在一個 AI 工作空間裡把爆款文章沉澱成可複用筆記。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章