YouMind
Iniciar sessão

Essa tradução está realmente correta?

@KurandoIida
JAPONÊS21/05/2026
531K
47
6
4
32

TL;DR

Este artigo explora a falta crítica de uma avaliação objetiva nos fluxos de trabalho de tradução modernos e apresenta o CATER, uma ferramenta que utiliza briefings estruturados para avaliar a qualidade além da simples fluência.

Você recebe um e-mail longo em inglês de um cliente estrangeiro. Não tem tempo para responder. Por enquanto, você o joga no DeepL ou, mais recentemente, no ChatGPT, para transformá-lo em japonês e lê-lo na tela. Você entende o conteúdo. Pode formar um julgamento. Ou, pelo menos, sente que entendeu.

O oposto também é verdade. Você precisa enviar um comunicado interno em inglês, então passa um rascunho escrito em japonês por uma tradução automática, examina o resultado em inglês, pensa "parece OK" e clica em enviar. A resposta da outra parte não parece particularmente estranha. Então você pensa: "Dessa vez também deve ter funcionado bem."

O problema é que ninguém deste lado verificou se realmente funcionou. O processo de alinhar os textos fonte e alvo e julgar "esta parte está OK", "esta parte é arriscada" ou "esta parte é fatal" está ausente nos pipelines de tradução modernos.

Isso não se limita a e-mails pessoais. Textos de marketing, comunicados internos, minutas de contratos, materiais de RI, FAQs de suporte — todos os tipos de documentos foram colocados sob tradução automática nos últimos anos. O volume explodiu. No entanto, a camada de verificação de qualidade quase não aumentou. Algumas pessoas acham que estão verificando. Elas chamam de "verificação" o ato de "ler e não sentir desconforto". Não é. Isso não é uma verificação; é pensamento positivo.

E o que muitos ignoram aqui é que isso não se trata apenas de tradução automática. Mesmo para traduções encomendadas a tradutores profissionais, atualmente quase não há como o cliente verificar de forma independente se a tradução é consistente com sua intenção ao longo de todo o texto. Eles leem a entrega, pensam "isso se lê como português" ou "passa como inglês", e é só. Ninguém está realizando a tarefa de verificar, item por item, se o trabalho foi feito de acordo com o briefing para o manuscrito inteiro, devido a questões de custo. Talvez seja mais preciso dizer que não há como fazer isso.

O campo da avaliação de tradução assumiu a tarefa de resolver esse problema. No entanto, esse campo não está indo tão bem quanto os de fora da indústria podem pensar.

A Tradução Automática Não É Tão Perfeita Quanto Todos Pensam

Primeiro, um mito precisa ser desfeito.

A saída da tradução automática e dos LLMs em 2026 está certamente em um nível diferente do que era há alguns anos. Isso é um fato. Para 80% dos usos diários, os humanos não precisam mais refazer o trabalho.

No entanto, o que vem depois é mal compreendido. Nos 20% restantes — especialmente em situações onde a tradução tem um "objetivo" específico — os sistemas atuais ainda não funcionam de forma consistente. Especificamente, duas coisas acontecem.

Uma é a flutuação da intenção da tradução. Mesmo que você jogue o mesmo texto fonte no mesmo modelo duas vezes e instrua-o a "traduzir como um discurso" ambas as vezes, as duas traduções resultantes não terão um tom consistente. Uma pode ser inflamada enquanto a outra é um tanto contida. O ponto de aterrissagem em relação ao objetivo é determinado apenas probabilisticamente.

A outra é a consistência em textos longos. Um documento pode traduzir "contract" como "contrato" na primeira metade, mas se transformar em "instrumento contratual" na segunda metade. Um tom que era formal na primeira metade pode mudar sutilmente para casual na segunda metade. Nomes próprios podem aparecer em três notações diferentes. Individualmente, isso não é fatal. Mas para o documento como um todo, eles corroem a qualidade como golpes no corpo.

Além disso, esses problemas são difíceis de notar apenas lendo a saída. Se você olhar cada frase, todas são "frases adequadas". A origem do desconforto ocorre no nível do documento, não no nível da frase. Leitores que não sentem desconforto sentem-se seguros para clicar em enviar. Se esse é um estado em que deveriam se sentir seguros, é outra questão.

Os mesmos problemas estruturais ocorrem com tradutores humanos. Fadiga ou flutuações de julgamento surgem durante um documento longo. Detalhes de gênero ou registro podem não se alinhar perfeitamente entre a primeira e a última página. Veteranos estão cientes disso, e é por isso que dedicam tempo à autorrevisão. No entanto, também não há como verificar externamente se essa autorrevisão está completa.

Em suma, seja máquina ou humano, a indústria como um todo carece de um mecanismo para verificar de forma independente se a qualidade de uma tradução é consistente "em relação ao objetivo" e "ao longo de todo o texto". Esta é a situação atual.

As Métricas Que Temos Não Medem o Que Realmente Importa

Não é que não existam mecanismos de verificação. Eles existem. O problema é o que eles estão medindo.

As duas principais métricas de avaliação automática na pesquisa de tradução automática são BLEU e COMET. BLEU compara a saída com uma tradução de referência e conta sequências de palavras sobrepostas. COMET usa um modelo pré-treinado para pontuar a similaridade semântica. Ambas são úteis para seus propósitos. E ambas compartilham a mesma premissa da qual a engenharia não pode escapar: a premissa de que existe uma "resposta correta", e que essa resposta correta é a tradução de referência colocada no conjunto de teste.

A tradução como atividade não funciona assim.

Vamos pegar emprestada uma frase da literatura infantil japonesa: "Ano otokonoko wa marude Momotaro mitai da." Para alguém criado no Japão, Momotaro é um herói do folclore que derrota ogros com um cachorro, um macaco e um faisão. Chamar uma criança de "como Momotaro" carrega a nuance de que ela é corajosa para a idade, tem coragem e não deve ser subestimada mesmo sendo pequena.

Se você traduzir isso para um leitor de inglês que nunca ouviu falar de Momotaro, há múltiplas opções.

Você poderia escrever literalmente: "That boy is just like Momotaro." A superfície do original é perfeitamente preservada. Se a tradução de referência for a mesma, o BLEU ficará feliz. Mas quase nada será transmitido ao leitor de inglês. O significado da frase está inteiramente trancado dentro de um nome que eles não conhecem.

Você também poderia escrever: "That boy is so brave for his age." Você descarta a especificidade cultural, mas o significado chega instantaneamente.

Ou você poderia dar um passo ousado: "That boy's another little Hulk." Esta é uma escolha arrojada. Substitui uma referência culturalmente incompreensível por outra culturalmente compreensível. É uma adaptação que transplanta a "função" em vez do "conteúdo" da referência. Dependendo do briefing (os detalhes do pedido), esta pode ser a melhor jogada ou uma inadequada.

Qual é a resposta correta? Depende das condições. Depende do leitor, do meio, da margem de discrição permitida, do registro do texto ao redor e de cerca de doze outros fatores. E todos esses fatores existem acima do nível da frase, invisíveis para métricas que só olham para frases.

BLEU elogia escolhas que por acaso coincidem com a tradução de referência e pune todo o resto, independentemente de qual é superior. COMET classifica pela distância semântica e ignora toda a questão de qual efeito a tradução deveria ter sobre o leitor. Nenhuma delas te diz "qual escolha se adequa a este trabalho". Em primeiro lugar, a ideia de substituir pelo Hulk é um salto que um tradutor humano poderia dar, mas uma métrica treinada na proximidade de uma tradução de referência nunca a recompensará.

Deixe-me dizer uma coisa importante sobre tradução. Não existe uma única resposta correta. Para cada linha, opções válidas se abrem como um leque. Qual escolher é o julgamento do tradutor. "Como Momotaro", "corajoso para a idade", "um pequeno Hulk" — todas são escolhas defensáveis. O trabalho da avaliação não é adivinhar a única tradução correta. É olhar para o julgamento que o tradutor fez e declarar francamente se ele funciona para este trabalho.

O Que Acontece Quando Você Pergunta Diretamente a um LLM

Se você quiser fazer do jeito moderno, pode pular as métricas e perguntar diretamente a um LLM. "Aqui está a fonte, aqui está a tradução — como está?"

Isso funciona melhor do que você pensa, e pior do que você espera.

Funciona melhor do que você pensa porque os LLMs podem, em princípio, raciocinar sobre coisas como registro, público, referências culturais e efeitos retóricos — coisas que BLEU e COMET não alcançam. Ele pode notar quando uma frase perdeu seu ritmo. Ele pode apontar que a tradução de Momotaro é opaca.

As razões pelas quais funciona pior do que você espera são duplas e, na prática, têm um efeito composto.

Primeiro, os eixos de avaliação mudam. Se você fizer a mesma pergunta ao mesmo modelo duas vezes, ele retornará respostas com configurações dimensionais diferentes. A primeira vez pode focar na fluência, a segunda na precisão, e a terceira pode inventar uma nova categoria no meio do caminho. Você não pode comparar avaliações em vários documentos porque o que está sendo medido não é consistente para começar. Enquanto você está medindo, o próprio instrumento está se movendo.

Segundo é a bajulação (adulação). Os LLMs são treinados fortemente para agradar seu interlocutor. Se você entregar uma tradução e perguntar "Isso é bom?", há uma alta probabilidade de que ele diga "É bom." Se você contestar, ele concordará com sua contestação. O modelo está otimizando para "fingir que ouve e respeita o usuário", não para "ser um avaliador frio e calculista". Para usos de baixo risco, isso é aceitável. Mas para alguém que comercializa tradução como um produto, alguém que avalia tradução ou alguém que compra tradução com dinheiro real, essa característica é exatamente o oposto do que é necessário.

Como resultado, uma situação estranha persistiu. A coisa que queríamos — um meio para não especialistas realmente verificarem traduções — não existia adequadamente. Se você terceirizava a tradução, só tinha que confiar no fornecedor. Se usava tradução automática, só tinha que cruzar os dedos e rezar. As únicas pessoas que podiam verificar uma tradução de forma confiável eram revisores sêniores que já dominavam ambos os idiomas a um nível em que nem precisavam da tradução em primeiro lugar.

O Que o CATER Está Tentando Fazer

Existe uma ferramenta chamada CATER. Estou do lado do desenvolvimento dela. Acredito que esta seja a primeira tentativa séria de uma solução para este problema, então deixe-me explicar o que ela faz.

O CATER avalia a tradução em seis eixos explícitos: Precisão Gramatical (GP), Integridade Semântica (SI), Consistência Factual (FC), Consistência Terminológica (TC), Coerência do Discurso (DC) e Adequação Comunicativa e Estilística (CSA). Os eixos não mudam de execução para execução. Eles são os mesmos todas as vezes. Se você comparar a Avaliação A e a Avaliação B, essa comparação tem significado.

A pontuação em si não é deixada para o LLM. O modelo é responsável por identificar e caracterizar erros, e um pipeline determinístico calcula valores numéricos com base na severidade, na obrigatoriedade e na sensibilidade do eixo. Se você executar a mesma entrada duas vezes, obtém os mesmos números. Isso pode soar como um detalhe menor de implementação. Não é. Esta é a linha que separa um "instrumento" de uma "atmosfera".

E o que quero abordar um pouco é o Briefing de Tradução.

O briefing diz ao CATER para que serve a tradução. Quem é o leitor, qual é o meio, que efeito deve produzir, o que pode ser sacrificado e o que deve ser absolutamente preservado? Com um briefing, a avaliação não é mais uma questão de "quão próximo isso está de alguma resposta correta abstrata?" Torna-se a pergunta: "Esta tradução está fazendo o trabalho para o qual foi contratada?" Tanto quanto sei, esta é a única pergunta que realmente importa.

Quando você fornece um briefing, o exemplo do Momotaro é resolvido. Se o briefing for "Livro infantil para crianças americanas, legibilidade é a prioridade máxima", então "That boy is just like Momotaro" é sinalizado no eixo CSA porque a referência não se concretiza. "That boy's another little Hulk" poderia obter uma pontuação alta. Se o briefing for "Tradução literária para uma antologia acadêmica, preserve a especificidade cultural", o julgamento é invertido. Manter a linha do Momotaro como no original é correto, e substituí-la pelo Hulk é uma domesticação excessiva. Mesma fonte, mesmas opções, briefing diferente, resposta correta diferente. O avaliador pode ver isso porque o briefing é uma entrada de primeira classe.

Se você não fornecer um briefing, o CATER o complementa com inferência. Na prática real, traduções com um briefing por escrito são minoria. Mas sempre há um briefing implícito. Gênero, registro e público-alvo restringem os limites de uma "boa tradução". Um revisor habilidoso lê enquanto reconstrói automaticamente o briefing em sua cabeça. O CATER faz a mesma coisa explicitamente e exibe o briefing inferido na tela. Se estiver errado, um humano pode corrigi-lo.

Aplicando o CATER a uma Tradução de Nível Nobel

Deixe-me dar um exemplo concreto. Isso não é saída de tradução automática. Vou mudar a conversa para a tradução literária humana de muito antes do surgimento da tradução automática.

"Snow Country" de Yasunari Kawabata, traduzido por Edward Seidensticker. Traduzido pela primeira vez em 1956 e posteriormente revisado, esta tradução de Seidensticker foi a que o comitê de seleção consultou quando Kawabata ganhou o Prêmio Nobel de Literatura em 1968. Pode ser chamada de pináculo do século XX da tradução para o inglês da literatura japonesa. É bastante difícil encontrar uma tradução humana que supere esta.

Eu executei seu parágrafo de abertura através do CATER. Nenhum briefing explícito foi fornecido; deixei o avaliador inferi-lo.

Pontuação geral: 58,8/100. O julgamento foi "Grande retrabalho necessário". Aqui está o detalhamento por eixo:

Por favor, não tire conclusões precipitadas. O CATER não está dizendo "Seidensticker é ruim". Gramática, fatos e estrutura lógica obtêm pontuações perfeitas. O que está quebrado são o significado central e os efeitos literários — partes limitadas, mas críticas. E o CATER aponta exatamente para onde está essa quebra.

"Yoru no soko ga shiroku natta" (O fundo da noite ficou branco) é traduzido por Seidensticker como "The earth lay white under the night sky". O diagnóstico do CATER é este: a expressão metafórica e perceptiva "fundo da noite" foi substituída por uma cena diferente, "o chão está branco sob o céu noturno". O efeito semântico do original, onde a brancura surge de dentro da noite, não é preservado. Como correção mínima, "The bottom of the night turned white" é sugerido. Esta é a principal razão pela qual o eixo SI caiu para 25.

Mais um. Uma cena em que uma garota abrindo uma janela grita "como se gritasse ao longe, 'Chefe da estação! Chefe da estação!'" A tradução de Seidensticker é: "Leaning far out the window, the girl called to the station master as though he were a great distance away." O discurso direto em si foi substituído por uma descrição resumida. Comentário do CATER: "A ressonância do próprio chamado e a imediatez da cena são perdidas. Como o conteúdo falado foi apagado, a sensação de presença como uma reprodução literária é enfraquecida." Isso levou o eixo CSA a 0.

A maneira correta de interpretar esses pontos é que Seidensticker deve ter tido suas próprias razões para essas escolhas. Como uma tradução literária para leitores de língua inglesa na década de 1950, ele escolheu isso conscientemente dentro das normas de tradução da época. O comentário do CATER em si não chama isso de "tradução incorreta", mas trata como "uma questão de interpretação onde o julgamento muda dependendo do briefing". No entanto, se você encomendasse o mesmo texto fonte para um projeto de tradução de literatura japonesa moderna e escrevesse um briefing dizendo "Priorize a reprodução da atmosfera poética do original", o julgamento seria que esta tradução não está fazendo seu trabalho. Mesma tradução, briefing diferente, conclusão diferente.

O que quero que você absorva disso não é a pontuação em si, mas três coisas.

Primeiro: Mesmo uma tradução que deixa sua marca na história literária mundial pode receber um julgamento de "retrabalho" sob um briefing específico. Isso é prova de que não há teto absoluto para a qualidade da tradução e, ao mesmo tempo, uma demonstração de que a avaliação é uma tarefa relativa a um briefing.

Segundo: O CATER não diz apenas "isso é ruim", ele fornece alternativas específicas de "corrija assim". Diagnóstico e prescrição são integrados. Por causa disso, o lado que vê os resultados da avaliação pode dar o próximo passo.

Terceiro: Mesmo que gramática, fatos e estrutura lógica sejam perfeitos, o trabalho como tradução literária pode falhar. Falhas que não podem ser capturadas "lendo e não sentindo desconforto" aparecem adequadamente em eixos diferentes. Quão fraca é uma verificação que verifica a saída da tradução automática dizendo "estava OK porque não senti desconforto" — isso se torna visível calculando retroativamente a partir do fato de que mesmo uma tradução de nível Seidensticker vacila quando decomposta em eixos explícitos.

Por Que Isso É Importante Mesmo Para Quem Não É Pesquisador de Tradução

A maior parte do que eu disse até agora pode soar como conversa interna para aqueles fora da indústria de localização. Aqui está por que ainda é importante.

A tradução é atualmente um dos principais usos dos LLMs. O número de empresas e o volume de tráfego que passam por atendimento ao cliente, texto de produto, comunicados internos, documentos legais e contratos através de pipelines de tradução automática estão em uma escala que não existia há três anos. A atividade econômica que depende desses pipelines é enorme. A camada de verificação sobre eles é quase zero. As pessoas estão enviando traduções que não podem verificar. Estão enviando cláusulas legais rezando para que o modelo não tenha fabricado números, não tenha enfraquecido "deve" para "deveria" e não tenha deixado cair o tom que fazia o texto de marketing funcionar.

E repito, isso não é um problema da tradução automática. Traduções terceirizadas para tradutores profissionais também estão sendo entregues na mesma ausência de verificação. O cliente lê a tradução entregue e confirma "isso se lê como português". Isso não é uma verificação de qualidade da tradução; é uma confirmação de que a entrega está em português. A longa distância que deveria existir entre os dois nunca foi percorrida por ninguém até agora.

A tradução automática em 2026 está em um nível que é "praticamente suficiente" para a maioria dos usos. Isso é verdade. Mas "suficiente para a maioria dos usos" não é uma estratégia de verificação. Em situações onde erros podem ser fatais — documentos clínicos, contratos, declarações públicas, traduções literárias — "não senti desconforto ao ler" ou "perguntei a um tradutor confiável" não são mais respostas aceitáveis.

O que há muito nos falta é uma camada para não especialistas verificarem a saída. Não um único número. Não um carimbo de borracha. Um diagnóstico estruturado e legível que diga: "O ponto forte desta tradução é aqui, o risco é aqui, e se você valoriza X, corrija esta parte."

Isso é o CATER. Você pode testá-lo gratuitamente em cater.erudaite.ai. A metodologia e a teoria por trás dele estão disponíveis em about.erudaite.ai.

Tente jogar uma tradução que você tem em mãos — por exemplo, um e-mail antes de enviar, materiais internos, uma minuta de contrato ou um manuscrito acabado de ser entregue por um terceirizado — e veja o que sai.

Você deve conseguir confirmar sua qualidade e as características da tradução com o CATER.

Guardar com um clique

Faça leitura aprofundada de artigos virais com IA no YouMind

Guarde a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis num único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais