YouMind
Entrar

Essa tradução está realmente correta?

@KurandoIida
JAPONÊS21 de mai. de 2026
531K
47
6
4
32

TL;DR

Este artigo explora a falta crítica de avaliação objetiva nos fluxos de tradução modernos e apresenta o CATER, uma ferramenta que utiliza briefings estruturados para avaliar a qualidade além da simples fluência.

Você recebe um e-mail longo em inglês de um cliente no exterior. Você não tem tempo para escrever uma resposta. Por enquanto, você o joga no DeepL ou, mais recentemente, no ChatGPT para transformá-lo em japonês e lê-lo na tela. Você entende o conteúdo. Consegue formar um julgamento. Ou, pelo menos, sente que sim.

O inverso também é verdadeiro. Você precisa enviar um comunicado interno em inglês, então executa um rascunho escrito em japonês através de uma tradução automática, examina o inglês resultante, pensa "parece ok" e clica em enviar. A resposta da outra parte não parece particularmente estranha. Então você pensa: "Dessa vez também deve ter dado certo."

O problema é que ninguém deste lado verificou se realmente deu certo. O processo de alinhar os textos de origem e destino e julgar "esta parte está OK", "esta parte é arriscada" ou "esta parte é fatal" está ausente nos pipelines de tradução modernos.

Isso não se limita a e-mails pessoais. Textos de marketing, avisos internos, minutas de contratos, materiais de RI, FAQs de suporte — todos os tipos de documentos foram colocados sob tradução automática nos últimos anos. O volume explodiu. No entanto, a camada para verificar a qualidade quase não aumentou. Algumas pessoas acham que estão verificando. Elas chamam de "verificação" o ato de "ler e não sentir desconforto". Não é. Isso não é uma verificação; é pensamento positivo.

E o que muitos ignoram aqui é que isso não se trata apenas de tradução automática. Mesmo para traduções encomendadas a tradutores profissionais, atualmente quase não há como o cliente verificar de forma independente se a tradução é consistente com sua intenção em todo o texto. Eles leem a entrega, pensam "parece português" ou "passa como inglês", e é isso. Ninguém está realizando a tarefa de verificar, item por item, se o trabalho foi feito de acordo com o briefing para o manuscrito inteiro, devido a questões de custo. Talvez seja mais preciso dizer que não há como fazer isso.

O campo da avaliação de tradução assumiu a tarefa de resolver esse problema. No entanto, este campo não está indo tão bem quanto quem está de fora do setor pode pensar.

A Tradução Automática Não É Tão Perfeita Quanto Todos Pensam

Primeiro, um mito precisa ser desfeito.

A saída da tradução automática e dos LLMs em 2026 está certamente em um nível diferente do que era há alguns anos. Isso é um fato. Para 80% dos usos diários, os humanos não precisam mais refazer o trabalho.

No entanto, o que vem a seguir é mal compreendido. Nos 20% restantes — especialmente em situações onde a tradução tem um "objetivo" específico — os sistemas atuais ainda não funcionam de forma consistente. Especificamente, duas coisas acontecem.

Uma é a flutuação da intenção da tradução. Mesmo que você jogue o mesmo texto fonte no mesmo modelo duas vezes e o instrua a "traduzir como um discurso" ambas as vezes, as duas traduções resultantes não terão um tom consistente. Uma pode ser inflamada enquanto a outra é um tanto contida. O ponto de chegada em relação ao objetivo é determinado apenas probabilisticamente.

A outra é a consistência em textos longos. Um documento pode traduzir "contract" como "contrato" na primeira metade, mas se transformar em "contrato formal" na segunda metade. Um tom que era formal na primeira metade pode mudar sutilmente para casual na segunda metade. Nomes próprios podem aparecer em três notações diferentes. Individualmente, isso não é fatal. Mas para o documento como um todo, eles corroem a qualidade como golpes no corpo.

Além disso, esses problemas são difíceis de notar apenas lendo a saída. Se você olhar para cada frase, todas são "frases adequadas". A fonte do desconforto ocorre no nível do documento, não no nível da frase. Leitores que não sentem desconforto se sentem seguros para clicar em enviar. Se esse é um estado em que deveriam se sentir seguros é outra questão.

Os mesmos problemas estruturais ocorrem com tradutores humanos. Fadiga ou flutuações no julgamento surgem durante um documento longo. Detalhes de gênero ou registro podem não se alinhar perfeitamente entre a primeira e a última página. Veteranos estão cientes disso, e é por isso que dedicam tempo à auto-revisão. No entanto, também não há como verificar externamente se essa auto-revisão está completa.

Em resumo, seja máquina ou humano, o setor como um todo carece de um mecanismo para verificar de forma independente se a qualidade de uma tradução é consistente "em relação ao objetivo" e "ao longo de todo o texto". Esta é a situação atual.

As Métricas Que Temos Não Medem O Que Nos Importa

Não é que não existam mecanismos de verificação. Existem. O problema é o que eles estão medindo.

As duas principais métricas de avaliação automática na pesquisa de tradução automática são BLEU e COMET. BLEU compara a saída com uma tradução de referência e conta sequências de palavras sobrepostas. COMET usa um modelo pré-treinado para pontuar a similaridade semântica. Ambas são úteis para seus propósitos. E ambas compartilham a mesma premissa da qual a engenharia não pode escapar: a premissa de que uma "resposta correta" existe, e que essa resposta correta é a tradução de referência colocada no conjunto de teste.

A tradução como atividade não funciona dessa forma.

Vamos pegar uma frase emprestada da literatura infantil japonesa: "Ano otokonoko wa marude Momotaro mitai da." Para alguém criado no Japão, Momotaro é um herói do folclore que derrota ogros com um cachorro, um macaco e um faisão. Chamar uma criança de "como Momotaro" traz a nuance de que ela é corajosa para sua idade, tem peito e não deve ser subestimada mesmo sendo pequena.

Se você traduzir isso para um leitor de inglês que nunca ouviu falar de Momotaro, há múltiplas opções.

Você poderia escrever literalmente: "That boy is just like Momotaro." A superfície do original é perfeitamente preservada. Se a tradução de referência for a mesma, o BLEU ficará encantado. Mas quase nada será transmitido ao leitor de inglês. O significado da frase está inteiramente trancado dentro de um nome que ele não conhece.

Você também poderia escrever: "That boy is so brave for his age." Você descarta a especificidade cultural, mas o significado chega instantaneamente.

Ou você poderia dar um passo ousado: "That boy's another little Hulk." Esta é uma escolha audaciosa. Substitui uma referência culturalmente incompreensível por outra culturalmente compreensível. É uma adaptação que transporta a "função" em vez do "conteúdo" da referência. Dependendo do briefing (os detalhes do pedido), esta pode ser a melhor jogada ou uma inadequada.

Qual é a resposta correta? Depende das condições. Depende do leitor, do meio, da margem de discrição permitida, do registro do texto ao redor e cerca de doze outros fatores. E todos esses fatores existem acima do nível da frase, invisíveis para métricas que olham apenas para frases.

BLEU elogia escolhas que coincidentemente correspondem à tradução de referência e pune todo o resto, independentemente de qual é superior. COMET classifica pela distância semântica e ignora toda a questão de qual efeito a tradução deveria ter sobre o leitor. Nenhuma delas te diz "qual escolha se encaixa neste trabalho". Em primeiro lugar, a ideia de substituir por Hulk é um salto que um tradutor humano pode dar, mas uma métrica treinada na proximidade de uma tradução de referência jamais recompensará.

Deixe-me dizer uma coisa importante sobre tradução. Não existe uma única resposta correta. Para cada linha, opções válidas se abrem como um leque. Qual escolher é o julgamento do tradutor. "Como Momotaro", "corajoso para a idade", "um pequeno Hulk" — todas são escolhas defensáveis. O trabalho da avaliação não é adivinhar a única tradução correta. É olhar para o julgamento que o tradutor fez e declarar francamente se funciona para este trabalho.

O Que Acontece Quando Você Pergunta Diretamente a um LLM

Se você quiser fazer do jeito moderno, pode pular as métricas e perguntar diretamente a um LLM. "Aqui está a fonte, aqui está a tradução — como está?"

Isso funciona melhor do que você imagina, e pior do que você espera.

Funciona melhor do que você imagina porque os LLMs podem, em princípio, raciocinar sobre coisas como registro, público, referências culturais e efeitos retóricos — coisas que BLEU e COMET não alcançam. Ele pode notar quando uma frase perdeu o ritmo. Pode apontar que a tradução de Momotaro é opaca.

As razões pelas quais funciona pior do que você espera são duas e, na prática, elas têm um efeito agravante.

Primeiro, os eixos de avaliação mudam. Se você fizer a mesma pergunta ao mesmo modelo duas vezes, ele retornará respostas com configurações dimensionais diferentes. A primeira vez pode focar na fluência, a segunda na precisão, e a terceira pode inventar uma nova categoria no meio do caminho. Você não pode comparar avaliações entre múltiplos documentos porque o que está sendo medido não é consistente desde o início. Enquanto você está medindo, o próprio instrumento está se movendo.

Segundo é a bajulação (sycophancy). LLMs são treinados fortemente para agradar seu interlocutor. Se você entregar uma tradução e perguntar "Isso é bom?", há uma alta probabilidade de ele dizer "É bom." Se você contestar, ele concordará com sua contestação. O modelo está otimizando para "fingir que ouve e respeita o usuário", não para "ser um avaliador de sangue frio". Para usos de baixo risco, isso é aceitável. Mas para alguém que comercializa tradução como produto, alguém que avalia tradução ou alguém que compra tradução com dinheiro de verdade, essa característica é exatamente o oposto do que é necessário.

Como resultado, uma situação estranha persistiu. A coisa que queríamos — um meio para não especialistas realmente verificarem traduções — não existia adequadamente. Se você terceirizava a tradução, tinha que confiar no fornecedor. Se usava tradução automática, tinha que cruzar os dedos e rezar. As únicas pessoas que podiam verificar uma tradução de forma confiável eram revisores seniores que já dominavam ambos os idiomas a um nível em que não precisavam da tradução em primeiro lugar.

O Que o CATER Está Tentando Fazer

Existe uma ferramenta chamada CATER. Eu estou no lado do desenvolvimento dela. Acredito que esta é a primeira tentativa séria de uma solução para este problema, então deixe-me explicar o que ela faz.

O CATER avalia a tradução em seis eixos explícitos: Precisão Gramatical (GP), Integridade Semântica (SI), Consistência Factual (FC), Consistência Terminológica (TC), Coerência do Discurso (DC) e Adequação Comunicativa e Estilística (CSA). Os eixos não mudam de execução para execução. Eles são os mesmos todas as vezes. Se você comparar a Avaliação A e a Avaliação B, essa comparação tem significado.

A pontuação em si não é deixada para o LLM. O modelo é responsável por identificar e caracterizar erros, e um pipeline determinístico calcula valores numéricos com base na gravidade, na força obrigatória e na sensibilidade do eixo. Se você executar a mesma entrada duas vezes, obterá os mesmos números. Isso pode parecer um detalhe menor de implementação. Não é. Esta é a linha que separa um "instrumento" de uma "atmosfera".

E o que eu quero dedicar um pouco de tempo para falar é o Briefing de Tradução (Translation Brief).

O briefing diz ao CATER para que serve a tradução. Quem é o leitor, qual é o meio, qual efeito deve produzir, o que pode ser sacrificado e o que deve ser absolutamente preservado? Com um briefing, a avaliação não é mais uma questão de "quão perto isso está de uma resposta correta abstrata?" Torna-se a pergunta: "Esta tradução está fazendo o trabalho para o qual foi contratada?" Até onde eu sei, esta é a única pergunta que realmente importa.

Quando você fornece um briefing, o exemplo do Momotaro é resolvido. Se o briefing for "Livro infantil para crianças americanas, legibilidade é a prioridade máxima", então "That boy is just like Momotaro" será sinalizado no eixo CSA porque a referência não se concretiza. "That boy's another little Hulk" pode obter uma pontuação alta. Se o briefing for "Tradução literária para uma antologia acadêmica, preserve a especificidade cultural", o julgamento é invertido. Manter a linha Momotaro como no original é correto, e substituí-la por Hulk é uma domesticação excessiva. Mesma fonte, mesmas opções, briefing diferente, resposta correta diferente. O avaliador pode ver isso porque o briefing é uma entrada de primeira classe.

Se você não fornecer um briefing, o CATER o complementa com inferência. Na prática real, traduções com um briefing escrito são minoria. Mas há sempre um briefing implícito. Gênero, registro e público-alvo delimitam as fronteiras de uma "boa tradução". Um revisor habilidoso lê enquanto reconstrói automaticamente o briefing em sua cabeça. O CATER faz a mesma coisa explicitamente e exibe o briefing inferido na tela. Se estiver errado, um humano pode corrigi-lo.

Aplicando o CATER a uma Tradução de Nível Nobel

Deixe-me dar um exemplo concreto. Isso não é saída de tradução automática. Vou deslocar a conversa para a tradução literária humana de muito antes do surgimento da tradução automática.

"Snow Country" de Yasunari Kawabata, traduzido por Edward Seidensticker. Traduzido pela primeira vez em 1956 e posteriormente revisado, esta tradução de Seidensticker foi a que o comitê de seleção consultou quando Kawabata ganhou o Prêmio Nobel de Literatura em 1968. Pode ser chamada de ápice do século XX da tradução para o inglês da literatura japonesa. É muito difícil encontrar uma tradução humana que supere esta.

Eu executei seu parágrafo de abertura no CATER. Nenhum briefing explícito foi fornecido; deixei o avaliador inferi-lo.

Pontuação geral: 58,8/100. O julgamento foi "Requer retrabalho significativo". Aqui está o detalhamento por eixo:

Por favor, não tire conclusões precipitadas. O CATER não está dizendo "Seidensticker é ruim". Gramática, fatos e estrutura lógica obtêm pontuações perfeitas. O que está quebrado são o significado central e os efeitos literários — partes limitadas, mas críticas. E o CATER aponta exatamente onde está essa quebra.

"Yoru no soko ga shiroku natta" (O fundo da noite ficou branco) é traduzido por Seidensticker como "The earth lay white under the night sky." O diagnóstico do CATER é este: a expressão metafórica e perceptiva "fundo da noite" foi substituída por uma cena diferente, "o chão está branco sob o céu noturno." O efeito semântico original, onde a brancura surge de dentro da noite, não é preservado. Como correção mínima, "The bottom of the night turned white" é sugerida. Esta é a principal razão pela qual o eixo SI caiu para 25.

Mais um. Uma cena em que uma garota abrindo uma janela grita "como se gritasse para a distância, 'Chefe da estação! Chefe da estação!'" A tradução de Seidensticker é: "Leaning far out the window, the girl called to the station master as though he were a great distance away." O discurso direto em si foi substituído por uma descrição resumida. Comentário do CATER: "A ressonância do próprio chamado e a imediatidade da cena se perdem. Porque o conteúdo falado foi apagado, a sensação de presença como uma reprodução literária é enfraquecida." Isso levou o eixo CSA para 0.

A maneira correta de entender esses pontos é que Seidensticker deve ter tido suas próprias razões para essas escolhas. Como uma tradução literária para leitores de língua inglesa na década de 1950, ele escolheu isso conscientemente dentro das normas de tradução da época. O comentário do CATER em si não chama isso de "erro de tradução", mas trata como "uma questão de interpretação onde o julgamento muda dependendo do briefing". No entanto, se você encomendasse o mesmo texto fonte para um projeto de tradução de literatura japonesa moderna e escrevesse um briefing dizendo "Priorize a reprodução da atmosfera poética do original", o julgamento seria que esta tradução não está cumprindo seu trabalho. Mesma tradução, briefing diferente, conclusão diferente.

O que quero que você absorva disso não é a pontuação em si, mas três coisas.

Primeiro: Mesmo uma tradução que deixa sua marca na história literária mundial pode receber um julgamento de "retrabalho" sob um briefing específico. Isso é uma prova de que não há teto absoluto para a qualidade da tradução e, ao mesmo tempo, uma demonstração de que a avaliação é uma tarefa relativa a um briefing.

Segundo: O CATER não diz apenas "isso é ruim", ele fornece alternativas específicas para "corrigir assim". Diagnóstico e prescrição são integrados. Por causa disso, o lado que vê os resultados da avaliação pode dar o próximo passo.

Terceiro: Mesmo que gramática, fatos e estrutura lógica sejam perfeitos, o trabalho como tradução literária pode falhar. Falhas que não podem ser detectadas por "ler e não sentir desconforto" aparecem adequadamente em eixos diferentes. Quão fraca é a verificação de verificar a saída da tradução automática dizendo "estava ok porque não senti desconforto" — isso se torna visível calculando retroativamente a partir do fato de que mesmo uma tradução de nível Seidensticker vacila quando dividida em eixos explícitos.

Por Que Isso é Importante Mesmo Para Quem Não é Pesquisador de Tradução

A maior parte do que eu disse até agora pode soar como conversa interna para quem está fora da indústria de localização. Aqui está por que ainda é importante.

A tradução é atualmente um dos principais usos dos LLMs. O número de empresas e o volume de tráfego que passam por pipelines de tradução automática de suporte ao cliente, texto de produto, avisos internos, documentos legais e contratos estão em uma escala que não existia há três anos. A atividade econômica apoiada nesses pipelines é enorme. A camada de verificação sobre eles é quase zero. As pessoas estão enviando traduções que não podem verificar. Estão enviando cláusulas legais rezando para que o modelo não tenha inventado números, não tenha enfraquecido "deve" para "deveria" e não tenha perdido o tom que fazia o texto de marketing funcionar.

E repito, isso não é um problema com tradução automática. Traduções terceirizadas para tradutores profissionais também estão sendo entregues na mesma ausência de verificação. O cliente lê a tradução entregue e confirma "parece português". Isso não é uma verificação de qualidade da tradução; é uma confirmação de que a entrega está em português. A longa distância que deveria existir entre os dois nunca foi percorrida por ninguém até agora.

A tradução automática em 2026 está em um nível que é "praticamente suficiente" para a maioria dos usos. Isso é verdade. Mas "suficiente para a maioria dos usos" não é uma estratégia de verificação. Em situações onde erros podem ser fatais — documentos clínicos, contratos, declarações públicas, traduções literárias — "não senti desconforto ao ler" ou "pedi a um tradutor confiável" não são mais respostas aceitáveis.

O que há muito nos falta é uma camada para não especialistas verificarem a saída. Não um número único. Não um carimbo. Um diagnóstico estruturado e legível que diga: "A força desta tradução está aqui, o risco está aqui, e se você valoriza X, corrija esta parte."

Isso é o CATER. Você pode testá-lo gratuitamente em cater.erudaite.ai. A metodologia e a teoria por trás dele estão disponíveis em about.erudaite.ai.

Tente jogar uma tradução que você tem em mãos — por exemplo, um e-mail antes de enviar, materiais internos, uma minuta de contrato ou um manuscrito recém-entregue por um terceirizado — e veja o que sai.

Você deve ser capaz de confirmar sua qualidade e as características da tradução com o CATER.

Salvar com um clique

Faça leitura profunda de artigos virais com IA no YouMind

Salve a fonte, faça perguntas específicas, resuma o argumento e transforme um artigo viral em notas reutilizáveis em um único espaço de trabalho com IA.

Explorar o YouMind
Para criadores

Transforme seu Markdown em um artigo 𝕏 impecável

Quando você publica seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown em um artigo 𝕏 impecável e pronto para publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais