해외 클라이언트로부터 긴 영어 이메일을 받았다. 답장을 작성할 시간이 없다. 그래서 우선 DeepL이나 요즘은 ChatGPT에 넣어 일본어로 번역한 뒤 화면으로 읽는다. 내용은 이해된다. 판단을 내릴 수 있다. 적어도 그렇게 느껴진다.
반대의 경우도 마찬가지다. 사내에 영어 공지를 보내야 할 때, 일본어로 작성한 초안을 기계 번역에 돌리고 결과물을 훑어보며 "괜찮아 보이는데" 하고 생각한 후 전송 버튼을 누른다. 상대방의 답신이 특별히 이상하지 않다. 그래서 "이번에도 잘 된 모양이군" 하고 생각한다.
문제는 이쪽에 있는 누구도 그것이 실제로 잘 되었는지 확인하지 않았다는 점이다. 원문과 번역문을 나란히 놓고 "이 부분은 괜찮다", "이 부분은 위험하다", "이 부분은 치명적이다"라고 판단하는 과정이 현대의 번역 파이프라인에서 누락되어 있다.
이는 개인 이메일에 국한된 이야기가 아니다. 마케팅 카피, 사내 공지, 계약서 초안, IR 자료, 지원 FAQ 등 수많은 문서가 최근 몇 년 사이 기계 번역에 맡겨졌다. 그 양은 폭발적으로 증가했다. 그런데도 품질을 확인하는 계층은 거의 늘지 않았다. 어떤 사람들은 자신이 확인하고 있다고 생각한다. "읽어봐도 불편함이 없다"는 것을 확인이라고 부른다. 그것은 확인이 아니다. 그것은 희망 사항일 뿐이다.
그리고 많은 사람들이 여기서 간과하는 것은 이것이 기계 번역에만 해당하는 문제가 아니라는 점이다. 전문 번역가에게 의뢰한 번역조차도 현재 의뢰인이 번역물이 자신의 의도와 전체적으로 일치하는지 독립적으로 확인할 수 있는 방법이 거의 없다. 그들은 납품된 번역문을 읽고 "일본어답게 읽힌다" 또는 "영어로서 통한다"고 생각하고 그걸로 끝이다. 비용 문제로 인해 전체 원고에 대해 작업이 브리핑에 따라 수행되었는지 항목별로 확인하는 작업을 수행하는 사람은 아무도 없다. 더 정확하게 말하면 그렇게 할 방법이 없다고 해도 과언이 아니다.
번역 평가 분야는 이 문제를 해결하는 임무를 맡고 있다. 하지만 이 분야는 업계 외부 사람들이 생각하는 것만큼 잘 작동하지 않고 있다.
기계 번역은 모두가 생각하는 것만큼 완벽하지 않다
먼저 한 가지 오해를 불식시킬 필요가 있다.
2026년의 기계 번역과 LLM의 출력은 확실히 몇 년 전과는 다른 수준이다. 이것은 사실이다. 일상적인 사용의 80%에서는 인간이 더 이상 작업을 다시 할 필요가 없다.
하지만 그 다음이 오해된다. 나머지 20%, 특히 번역에 특정 "목적"이 있는 상황에서는 현재 시스템이 여전히 일관되게 작동하지 않는다. 구체적으로 두 가지 현상이 발생한다.
하나는 번역 의도의 변동이다. 동일한 원문을 동일한 모델에 두 번 넣고 매번 "연설문으로 번역하라"고 지시하더라도 두 결과물의 어조는 일관되지 않는다. 하나는 선동적일 수 있고 다른 하나는 다소 절제될 수 있다. 목적에 대한 착지점은 확률적으로만 결정된다.
다른 하나는 긴 텍스트에서의 일관성이다. 한 문서에서 "contract"가 전반부에는 "계약"으로 번역되다가 후반부에는 "계약서"로 바뀔 수 있다. 전반부에 격식체였던 어조가 후반부에는 자연스럽게 반말로 바뀔 수 있다. 고유명사가 세 가지 다른 표기로 나타날 수 있다. 개별적으로는 치명적이지 않다. 그러나 문서 전체로서는 바디 블로처럼 품질을 깎아내린다.
게다가 이러한 문제는 출력물을 읽기만 해서는 알아차리기 어렵다. 각 문장을 보면 모두 "적절한 문장"이다. 불편함의 근원은 문장 수준이 아닌 문서 수준에서 발생한다. 불편함을 느끼지 않은 독자는 안심하고 전송 버튼을 누른다. 그것이 안심해도 되는 상태인지는 별개의 문제다.
인간 번역가에게도 동일한 구조적 문제가 발생한다. 긴 문서를 작업하는 동안 피로나 판단 변동이 생긴다. 장르나 레지스터의 세부 사항이 첫 페이지와 마지막 페이지에서 완벽하게 일치하지 않을 수 있다. 베테랑들은 이를 알고 있기 때문에 자체 검토에 시간을 할애한다. 하지만 그 자체 검토가 완전한지 외부에서 확인할 방법도 없다.
요컨대, 기계든 인간이든 업계 전체에는 "목적 대비" 그리고 "문서 전체에 걸쳐" 번역 품질이 일관되는지 독립적으로 확인할 수 있는 메커니즘이 부족하다. 이것이 현재 상황이다.
우리가 가진 지표는 우리가 신경 쓰는 것을 측정하지 않는다
확인 메커니즘이 전혀 없는 것은 아니다. 있다. 문제는 그것들이 무엇을 측정하고 있는지이다.
기계 번역 연구에서 사용되는 두 가지 주요 자동 평가 지표는 BLEU와 COMET이다. BLEU는 출력물을 참조 번역과 비교하여 겹치는 단어 시퀀스를 센다. COMET은 사전 훈련된 모델을 사용하여 의미적 유사성을 점수화한다. 둘 다 의도된 용도에는 유용하다. 그리고 둘 다 공학이 피할 수 없는 동일한 전제를 공유한다. 즉, "정답"이 존재하며 그 정답은 테스트 세트에 놓인 참조 번역이라는 전제이다.
활동으로서의 번역은 그렇게 작동하지 않는다.
일본 아동 문학의 한 문장을 빌려보자: "Ano otokonoko wa marude Momotaro mitai da." 일본에서 자란 사람에게 모모타로는 개, 원숭이, 꿩과 함께 오니를 물리치는 민화 속 영웅이다. 아이를 "모모타로 같다"고 말하는 것은 그 아이가 나이에 비해 용감하고, 배짱이 있으며, 작아도 얕봐서는 안 된다는 뉘앙스를 담고 있다.
모모타로에 대해 들어본 적 없는 영어 독자를 위해 이것을 번역한다면 여러 선택지가 있다.
직역할 수 있다: "That boy is just like Momotaro." 원문의 표면은 완벽하게 보존된다. 참조 번역이 우연히 같다면 BLEU는 기뻐할 것이다. 그러나 영어 독자에게는 거의 아무것도 전달되지 않는다. 문장의 의미는 그들이 모르는 이름 속에 완전히 갇혀 있다.
또 이렇게 쓸 수도 있다: "That boy is so brave for his age." 문화적 특수성은 버리지만 의미는 즉시 전달된다.
또는 대담한 선택을 할 수도 있다: "That boy's another little Hulk." 이것은 과감한 선택이다. 문화적으로 이해할 수 없는 참조를 다른 문화적으로 이해할 수 있는 참조로 대체한다. 참조의 "내용"이 아닌 "기능"을 이식하는 각색이다. 브리핑(주문 세부 사항)에 따라 이것이 최선의 선택일 수도 있고 부적절한 선택일 수도 있다.
어느 것이 정답인가? 조건에 따라 다르다. 독자, 매체, 허용된 재량 범위, 주변 텍스트의 레지스터, 그리고 약 12가지 다른 요소에 따라 달라진다. 그리고 이러한 모든 요소는 문장 수준 위에 존재하며, 문장만 보는 지표에는 보이지 않는다.
BLEU는 우연히 참조 번역과 일치하는 선택을 칭찬하고, 어느 것이 더 우수한지와 관계없이 다른 모든 것을 처벌한다. COMET은 의미적 거리로 순위를 매기고 번역이 독자에게 어떤 효과를 내야 하는지에 대한 전체 질문을 건너뛴다. 둘 중 어느 것도 "어떤 선택이 이 작업에 맞는지"를 알려주지 않는다. 애초에 헐크로 대체하는 발상은 인간 번역가가 할 수 있는 도약이지만, 참조 번역에 대한 근접성으로 훈련된 지표는 결코 그것에 점수를 주지 않는다.
번역에 대해 한 가지 중요한 점을 말하겠다. 단 하나의 정답은 없다. 모든 줄마다 부챗살처럼 유효한 선택지가 열린다. 어느 것을 선택할지는 번역가의 판단이다. "모모타로 같다", "나이에 비해 용감하다", "작은 헐크" — 모두 방어 가능한 선택이다. 평가의 임무는 유일한 정답을 추측하는 것이 아니다. 번역가가 내린 판단을 보고 그것이 이 작업에 적합한지 솔직하게 진술하는 것이다.
LLM에 직접 물어보면 어떻게 될까
현대적인 방식으로 하려면 지표를 건너뛰고 LLM에 직접 물어볼 수 있다. "여기 원문이 있고, 여기 번역문이 있습니다. 어때요?"
생각보다 잘 작동하고, 생각보다 나쁘게 작동한다.
생각보다 잘 작동하는 이유는 LLM이 원칙적으로 레지스터, 독자, 문화적 참조, 수사적 효과 등 BLEU와 COMET이 도달할 수 없는 것들에 대해 추론할 수 있기 때문이다. 문장의 리듬이 깨졌을 때 알아챌 수 있다. 모모타로 번역이 불투명하다고 지적할 수 있다.
생각보다 나쁘게 작동하는 이유는 두 가지이며, 실제로는 이들이 상승 효과를 낸다.
첫째, 평가 축이 이동한다. 동일한 질문을 동일한 모델에 두 번 하면 다른 차원 구성의 답변이 반환된다. 첫 번째는 유창성에 초점을 맞추고 두 번째는 정확성에, 세 번째는 중간에 새로운 범주를 만들어낼 수 있다. 여러 문서에 걸쳐 평가를 비교할 수 없는 이유는 측정되는 것이 처음부터 일관되지 않기 때문이다. 측정하는 동안 측정 도구 자체가 움직이고 있는 셈이다.
둘째는 아첨(아부)이다. LLM은 대화 상대를 기쁘게 하도록 상당히 강하게 훈련된다. 번역문을 건네며 "이거 괜찮나요?"라고 물으면 높은 확률로 "괜찮습니다"라고 말할 것이다. 반박하면 반박에 동의할 것이다. 모델은 "냉혈한 평가자가 되는 것"이 아니라 "듣고 존중하는 척 하는 것"에 최적화되어 있다. 위험이 낮은 용도에서는 괜찮다. 그러나 번역을 제품으로 출시하는 사람, 번역을 평가하는 사람, 실제 돈을 주고 번역을 구매하는 사람에게 이 특성은 필요한 것의 정반대이다.
그 결과 이상한 상황이 지속되었다. 우리가 원했던 것, 즉 비전문가가 실제로 번역을 확인할 수 있는 수단이 제대로 존재하지 않았다. 번역을 아웃소싱하면 공급업체를 신뢰할 수밖에 없었다. 기계 번역을 사용하면 손가락을 걸고 기도할 수밖에 없었다. 번역을 확실히 확인할 수 있는 유일한 사람은 애초에 번역이 필요 없을 정도로 두 언어를 모두 마스터한 시니어 리뷰어뿐이었다.
CATER가 하려는 것
CATER라는 도구가 있다. 나는 그 개발 쪽에 있다. 이것이 이 문제에 대한 첫 번째 진지한 해결 시도라고 믿기 때문에 그것이 무엇을 하는지 설명하겠다.
CATER는 6가지 명시적 축으로 번역을 평가한다: 문법적 정밀성(Grammatical Precision, GP), 의미적 무결성(Semantic Integrity, SI), 사실적 일관성(Factual Consistency, FC), 용어 일관성(Terminology Consistency, TC), 담화 일관성(Discourse Coherence, DC), 의사소통 및 스타일 적절성(Communicative & Stylistic Appropriateness, CSA). 축은 실행마다 변하지 않는다. 매번 동일하다. 평가 A와 평가 B를 비교한다면 그 비교에는 의미가 있다.
점수화 자체는 LLM에 맡겨지지 않는다. 모델은 오류를 식별하고 특성화하는 역할을 담당하며, 결정론적 파이프라인이 심각도, 필수 강도, 축 민감도에 따라 수치를 계산한다. 동일한 입력을 두 번 실행하면 동일한 숫자가 나온다. 이것이 사소한 구현 세부 사항처럼 들릴 수 있다. 그렇지 않다. 이것이 "도구"와 "분위기"를 구분짓는 선이다.
그리고 잠시 이야기하고 싶은 것은 번역 브리핑(Translation Brief)이다.
브리핑은 CATER에 번역의 목적이 무엇인지 알려준다. 독자는 누구인가, 매체는 무엇인가, 어떤 효과를 내야 하는가, 무엇을 희생해도 되는가, 무엇을 절대적으로 보존해야 하는가? 브리핑이 있으면 평가는 더 이상 "이것이 추상적인 정답에 얼마나 가까운가?"라는 질문이 아니다. "이 번역이 고용된 일을 하고 있는가?"라는 질문이 된다. 내가 아는 한, 이것이 진정으로 중요한 유일한 질문이다.
브리핑을 제공하면 모모타로 예제가 해결된다. 브리핑이 "미국 아이들을 위한 동화책, 가독성이 최우선"이라면 "That boy is just like Momotaro"는 참조가 전달되지 않기 때문에 CSA 축에서 플래그가 지정된다. "That boy's another little Hulk"는 높은 점수를 받을 수 있다. 브리핑이 "학술 선집을 위한 문학 번역, 문화적 특수성 보존"이라면 판단은 역전된다. 모모타로 대사를 원문 그대로 유지하는 것이 옳고, 헐크로 대체하는 것은 과도한 자국화이다. 동일한 원문, 동일한 선택지, 다른 브리핑, 다른 정답. 평가자는 브리핑이 일급 입력이기 때문에 이것을 볼 수 있다.
브리핑을 제공하지 않으면 CATER는 추론으로 보충한다. 실제로 브리핑이 작성된 번역은 소수이다. 그러나 항상 암시적 브리핑이 존재한다. 장르, 레지스터, 대상 독자가 "좋은 번역"의 경계를 제약한다. 숙련된 리뷰어는 읽으면서 머릿속에서 브리핑을 자동으로 재구성한다. CATER는 동일한 작업을 명시적으로 수행하고 추론된 브리핑을 화면에 표시한다. 틀렸다면 인간이 수정할 수 있다.
노벨상 수준의 번역에 CATER 적용하기
구체적인 예를 들어보겠다. 이것은 기계 번역 출력이 아니다. 기계 번역이 등장하기 훨씬 전의 인간 문학 번역으로 이야기를 옮겨보겠다.
가와바타 야스나리의 "Snow Country", 에드워드 사이덴스티커 번역. 1956년 첫 번역 후 개정된 이 사이덴스티커 번역은 1968년 가와바타가 노벨 문학상을 수상했을 때 선정 위원회가 참조한 번역이다. 20세기 일본 문학 영어 번역의 정점이라고 할 수 있다. 이를 능가하는 인간 번역을 찾기는 매우 어렵다.
나는 그 서문을 CATER에 돌렸다. 명시적 브리핑은 제공하지 않았고 평가자가 추론하도록 했다.
전체 점수: 58.8/100. 판정은 "대대적인 수정 필요"였다. 축별 분석은 다음과 같다.
성급한 결론을 내리지 말기 바란다. CATER는 "사이덴스티커가 나쁘다"고 말하는 것이 아니다. 문법, 사실, 논리 구조는 모두 완벽한 점수를 받았다. 깨진 것은 핵심 의미와 문학적 효과 — 제한적이지만 중요한 부분이다. 그리고 CATER는 그 붕괴가 정확히 어디인지 지적한다.
"Yoru no soko ga shiroku natta" (밤의 바닥이 하얗게 되었다)는 사이덴스티커가 "The earth lay white under the night sky"로 번역했다. CATER의 진단은 이렇다: 은유적이고 지각적인 표현인 "밤의 바닥"이 "밤하늘 아래 땅이 하얗다"라는 다른 장면으로 대체되었다. 밤 속에서 하양이 솟아오르는 원문의 의미 효과가 보존되지 않았다. 최소한의 수정으로 "The bottom of the night turned white"가 제안된다. 이것이 SI 축이 25로 떨어진 주된 이유이다.
하나 더. 창문을 여는 소녀가 "마치 멀리 외치듯, '역장님! 역장님!'"이라고 부르는 장면. 사이덴스티커의 번역은: "Leaning far out the window, the girl called to the station master as though he were a great distance away." 직접 화법 자체가 요약 설명으로 대체되었다. CATER의 코멘트: "부름 자체의 울림과 장면의 즉각성이 상실되었다. 말해진 내용이 지워졌기 때문에 문학적 재현으로서의 현장감이 약화되었다." 이로 인해 CSA 축이 0이 되었다.
이 점들을 올바르게 받아들이는 방식은 사이덴스티커가 자신만의 이유로 이러한 선택을 했을 것이라는 점이다. 1950년대 영어권 독자를 위한 문학 번역으로서 그는 당시 번역 규범 내에서 의식적으로 이것을 선택했다. CATER의 코멘트 자체는 이것을 "오역"이라고 부르지 않고 "브리핑에 따라 판단이 달라지는 해석상의 문제"로 취급한다. 그러나 동일한 원문을 현대 일본 문학 번역 프로젝트에 의뢰하고 "원작의 시적 분위기 재현을 우선시하라"는 브리핑을 작성했다면 이 번역은 제 역할을 하지 못한다는 판정이 나올 것이다. 동일한 번역, 다른 브리핑, 다른 결론.
여기서 얻어가길 바라는 것은 점수 자체가 아니라 세 가지이다.
첫째: 세계 문학사에 족적을 남긴 번역조차도 특정 브리핑 하에서는 "수정 필요" 판정을 받을 수 있다. 이것은 번역 품질에 절대적인 상한선이 없음을 증명하는 동시에, 평가가 브리핑에 상대적인 작업임을 보여주는 증거이다.
둘째: CATER는 단순히 "이것은 나쁘다"고 말하는 것이 아니라 "이렇게 수정하라"는 구체적인 대안을 제공한다. 진단과 처방이 통합되어 있다. 이 때문에 평가 결과를 본 측이 다음 단계를 밟을 수 있다.
셋째: 문법, 사실, 논리 구조가 완벽하더라도 문학 번역으로서의 작업은 실패할 수 있다. "읽어봐도 불편함이 없어서 괜찮았다"는 방식으로는 잡을 수 없는 실패가 다른 축에서 제대로 드러난다. 사이덴스티커 수준의 번역조차 명시적 축으로 분해하면 흔들린다는 사실로부터 역산하면, 기계 번역 출력을 "불편함을 느끼지 않았으니 괜찮았다"고 확인하는 것이 얼마나 취약한 검증인지 알 수 있다.
번역 연구자가 아니어도 이것이 중요한 이유
지금까지 말한 대부분은 현지화 업계 외부 사람들에게는 업계 내부 이야기처럼 들릴 수 있다. 그래도 여전히 중요한 이유를 말하겠다.
번역은 현재 LLM의 주요 사용 사례 중 하나이다. 고객 지원, 제품 카피, 사내 공지, 법률 문서, 계약서를 기계 번역 파이프라인에 통과시키는 기업의 수와 트래픽 양은 3년 전에는 존재하지 않았던 규모이다. 이 파이프라인에 의존하는 경제 활동은 막대하다. 그 위에 놓인 검증 계층은 거의 제로에 가깝다. 사람들은 검증할 수 없는 번역을 배송하고 있다. 모델이 숫자를 조작하지 않았는지, "must"를 "should"로 약화시키지 않았는지, 마케팅 카피를 작동하게 만든 어조를 떨어뜨리지 않았는지 기도하면서 법률 조항을 보내고 있다.
그리고 다시 말하지만, 이것은 기계 번역의 문제가 아니다. 전문 번역가에게 아웃소싱된 번역도 동일한 검증 부재 상태로 납품되고 있다. 의뢰인은 납품된 번역을 읽고 "일본어답게 읽힌다"고 확인한다. 그것은 번역의 품질 확인이 아니라 납품물이 일본어로 되어 있다는 확인일 뿐이다. 둘 사이에 존재해야 할 긴 간극은 지금까지 아무도 가로지르지 않았다.
2026년의 자동 번역은 대부분의 용도에서 "실용적으로 충분한" 수준이다. 이것은 사실이다. 그러나 "대부분의 용도에 충분하다"는 것은 검증 전략이 아니다. 실수가 치명적일 수 있는 상황 — 임상 문서, 계약서, 공개 성명, 문학 번역 — 에서 "읽어봐도 불편함이 없었다"거나 "신뢰할 수 있는 번역가에게 의뢰했다"는 것은 더 이상 받아들일 수 있는 답변이 아니다.
우리가 오랫동안 결여했던 것은 비전문가가 출력을 검증할 수 있는 계층이다. 단일 숫자가 아니다. 도장 찍기가 아니다. "이 번역의 강점은 여기, 위험은 여기, 그리고 X를 중요시한다면 이 부분을 수정하라"고 말하는 구조화되고 읽을 수 있는 진단이다.
바로 CATER이다. cater.erudaite.ai에서 무료로 체험할 수 있다. 방법론과 그 배경 이론은 about.erudaite.ai에서 확인할 수 있다.
손에 있는 번역 — 예를 들어 보내기 전 이메일, 사내 자료, 계약서 초안, 또는 아웃소스에서 막 납품된 원고 — 을 넣고 어떤 결과가 나오는지 확인해보라.
CATER를 통해 번역의 품질과 특성을 확인할 수 있을 것이다.





