YouMind
Iniciar sesión

¿Esa traducción es realmente correcta?

@KurandoIida
JAPONÉS21 may 2026
531K
47
6
4
32

TL;DR

Este artículo explora la falta crítica de una evaluación objetiva en los procesos de traducción modernos y presenta CATER, una herramienta que utiliza resúmenes estructurados para evaluar la calidad más allá de la simple fluidez.

Recibes un correo electrónico largo en inglés de un cliente en el extranjero. No tienes tiempo para redactar una respuesta. Por ahora, lo metes en DeepL o, más recientemente, en ChatGPT para convertirlo a japonés y leerlo en tu pantalla. Entiendes el contenido. Puedes tomar una decisión. O al menos, sientes que puedes.

Lo contrario también es cierto. Necesitas enviar un anuncio interno en inglés, así que pasas un borrador escrito en japonés por traducción automática, escaneas el inglés resultante, piensas "se ve bien" y le das a enviar. La respuesta de la otra parte no parece particularmente extraña. Entonces piensas: "Debe haber salido bien esta vez también".

El problema es que nadie de este lado ha verificado si realmente salió bien. El proceso de alinear los textos fuente y destino y juzgar "esta parte está bien", "esta parte es riesgosa" o "esta parte es fatal" está ausente en los flujos de traducción modernos.

Esto no se limita a los correos electrónicos personales. Textos de marketing, avisos internos, borradores de contratos, materiales de relaciones públicas, preguntas frecuentes de soporte—todo tipo de documentos han sido puestos en traducción automática en los últimos años. El volumen se ha disparado. Sin embargo, la capa para verificar la calidad apenas ha aumentado. Algunas personas creen que están verificando. Llaman "leerlo y no sentir ninguna molestia" a una verificación. No lo es. Eso no es una verificación; es un pensamiento ilusorio.

Y lo que muchos pasan por alto aquí es que esto no se trata solo de la traducción automática. Incluso para las traducciones encargadas a traductores profesionales, actualmente casi no hay forma de que el cliente verifique de forma independiente si la traducción es coherente con su intención en todo el texto. Leen la entrega, piensan "se lee como japonés" o "pasa como inglés", y eso es todo. Nadie realiza la tarea de verificar, elemento por elemento, si el trabajo se realizó de acuerdo con las instrucciones para todo el manuscrito debido a problemas de costo. Podría ser más preciso decir que no hay forma de hacerlo.

El campo de la evaluación de traducciones ha asumido la tarea de resolver este problema. Sin embargo, este campo no está yendo tan bien como los de fuera de la industria podrían pensar.

La Traducción Automática No Es Tan Perfecta Como Todos Creen

Primero, hay que disipar un mito.

La salida de la traducción automática y los LLM en 2026 está ciertamente en un nivel diferente al de hace unos años. Esto es un hecho. Para el 80% de los usos diarios, los humanos ya no necesitan rehacer el trabajo.

Sin embargo, lo que sigue se malinterpreta. En el 20% restante—especialmente en situaciones donde la traducción tiene un "propósito" específico—los sistemas actuales todavía no funcionan de manera consistente. Específicamente, ocurren dos cosas.

Una es la fluctuación de la intención de traducción. Incluso si metes el mismo texto fuente en el mismo modelo dos veces y le instruyes "traduce esto como un discurso" ambas veces, las dos traducciones resultantes no tendrán un tono consistente. Una podría ser incendiaria mientras que la otra es algo moderada. El punto de aterrizaje en relación con el objetivo solo se determina de manera probabilística.

La otra es la consistencia en textos largos. Un documento podría traducir "contract" como "keiyaku" en la primera mitad, pero se convierte en "keiyakusho" en la segunda mitad. Un tono que era formal en la primera mitad podría cambiar sutilmente a informal en la segunda mitad. Los nombres propios podrían aparecer en tres notaciones diferentes. Individualmente, esto no es fatal. Pero para el documento en su conjunto, desgastan la calidad como golpes al cuerpo.

Además, estos problemas son difíciles de notar solo con leer el resultado. Si miras cada oración, todas son "oraciones correctas". La fuente de la molestia ocurre a nivel del documento, no a nivel de la oración. Los lectores que no sienten molestia se sienten seguros al presionar el botón de enviar. Si ese es un estado en el que deberían sentirse seguros es otro asunto.

Los mismos problemas estructurales ocurren con los traductores humanos. La fatiga o las fluctuaciones en el juicio se filtran durante un documento largo. Los detalles del género o registro pueden no alinearse perfectamente entre la primera y la última página. Los veteranos son conscientes de esto, por eso dedican tiempo a la auto-revisión. Sin embargo, tampoco hay forma de verificar desde fuera si esa auto-revisión está completa.

En resumen, ya sea una máquina o un humano, a la industria en su conjunto le falta un mecanismo para verificar de forma independiente si la calidad de una traducción es consistente "en relación con el objetivo" y "en todo el texto". Esta es la situación actual.

Las Métricas Que Tenemos No Miden Lo Que Nos Importa

No es que no haya mecanismos de verificación. Los hay. El problema es lo que están midiendo.

Las dos principales métricas de evaluación automática en la investigación de traducción automática son BLEU y COMET. BLEU compara la salida con una traducción de referencia y cuenta secuencias de palabras superpuestas. COMET utiliza un modelo preentrenado para puntuar la similitud semántica. Ambas son útiles para sus propósitos previstos. Y ambas comparten la misma premisa de la que la ingeniería no puede escapar: la premisa de que existe una "respuesta correcta", y que esa respuesta correcta es la traducción de referencia colocada en el conjunto de prueba.

La traducción como actividad no funciona así.

Tomemos prestada una frase de la literatura infantil japonesa: "Ano otokonoko wa marude Momotaro mitai da". Para alguien criado en Japón, Momotaro es un héroe del folclore que derrota ogros con un perro, un mono y un faisán. Llamar a un niño "como Momotaro" conlleva el matiz de que es valiente para su edad, tiene agallas y no se le debe subestimar aunque sea pequeño.

Si traduces esto para un lector inglés que nunca ha oído hablar de Momotaro, hay múltiples opciones.

Podrías escribirlo literalmente: "That boy is just like Momotaro". La superficie del original se conserva perfectamente. Si la traducción de referencia resulta ser la misma, BLEU estará encantado. Pero casi nada se transmitirá al lector inglés. El significado de la oración está completamente encerrado dentro de un nombre que no conocen.

También podrías escribir: "That boy is so brave for his age". Descartas la especificidad cultural, pero el significado llega al instante.

O podrías dar un paso audaz: "That boy's another little Hulk". Esta es una elección atrevida. Reemplaza una referencia culturalmente incomprensible por otra culturalmente comprensible. Es una adaptación que trasplanta la "función" en lugar del "contenido" de la referencia. Dependiendo de las instrucciones (los detalles del pedido), esto podría ser el mejor movimiento o uno inapropiado.

¿Cuál es la respuesta correcta? Depende de las condiciones. Depende del lector, el medio, el rango de discreción permitido, el registro del texto circundante y aproximadamente otros doce factores. Y todos esos factores existen por encima del nivel de la oración, invisibles para las métricas que solo miran oraciones.

BLEU elogia las elecciones que coinciden con la traducción de referencia y castiga todo lo demás, independientemente de cuál sea superior. COMET clasifica por distancia semántica y omite toda la cuestión de qué efecto debería tener la traducción en el lector. Ninguna te dice "qué elección se adapta a este trabajo". En primer lugar, la idea de reemplazarlo con Hulk es un salto que un traductor humano podría hacer, pero una métrica entrenada en la proximidad a una traducción de referencia nunca lo recompensará.

Déjame decir algo importante sobre la traducción. No existe una única respuesta correcta. Para cada línea, se abren opciones válidas como un abanico. Cuál tomar es el juicio del traductor. "Like Momotaro", "brave for his age", "a little Hulk"—todas son elecciones defendibles. El trabajo de la evaluación no es adivinar la única traducción correcta. Es mirar el juicio que hizo el traductor y declarar francamente si funciona para este trabajo.

Qué Sucede Cuando Le Preguntas Directamente a un LLM

Si quieres hacerlo a la manera moderna, puedes saltarte las métricas y preguntarle directamente a un LLM. "Aquí está la fuente, aquí está la traducción—¿cómo está?"

Esto funciona mejor de lo que piensas, y peor de lo que esperas.

Funciona mejor de lo que piensas porque los LLM pueden, en principio, razonar sobre cosas como el registro, la audiencia, las referencias culturales y los efectos retóricos—cosas que BLEU y COMET no pueden alcanzar. Puede notar cuando una oración ha perdido su ritmo. Puede señalar que la traducción de Momotaro es opaca.

Las razones por las que funciona peor de lo que esperas son dos, y en la práctica, tienen un efecto acumulativo.

Primero, los ejes de evaluación se desplazan. Si haces la misma pregunta al mismo modelo dos veces, devolverá respuestas con diferentes configuraciones dimensionales. La primera vez podría centrarse en la fluidez, la segunda en la precisión, y la tercera podría inventar una nueva categoría a mitad de camino. No puedes comparar evaluaciones entre múltiples documentos porque lo que se mide no es consistente desde el principio. Mientras estás midiendo, el propio instrumento se está moviendo.

Segundo es la sicofancia (adulación). Los LLM están entrenados bastante fuertemente para complacer a su interlocutor. Si entregas una traducción y preguntas "¿Está bien?", hay una alta probabilidad de que diga "Está bien". Si insistes, estará de acuerdo con tu insistencia. El modelo está optimizando para "fingir que escucha y respeta al usuario", no para "ser un evaluador de sangre fría". Para usos de bajo riesgo, esto está bien. Pero para alguien que envía traducción como producto, alguien que califica traducciones, o alguien que compra traducciones con dinero real, este rasgo es exactamente lo opuesto a lo que se necesita.

Como resultado, ha persistido una situación extraña. Lo que queríamos—un medio para que los no expertos verificaran realmente las traducciones—no existía adecuadamente. Si subcontratabas la traducción, solo tenías que confiar en el proveedor. Si usabas traducción automática, solo tenías que cruzar los dedos y rezar. Las únicas personas que podían verificar de manera confiable una traducción eran revisores senior que ya dominaban ambos idiomas a un nivel en el que no necesitaban la traducción en primer lugar.

Lo Que CATER Está Tratando de Hacer

Existe una herramienta llamada CATER. Estoy del lado del desarrollo de la misma. Creo que este es el primer intento serio de una solución a este problema, así que déjame explicar lo que hace.

CATER evalúa la traducción en seis ejes explícitos: Precisión Gramatical (GP), Integridad Semántica (SI), Consistencia Fáctica (FC), Consistencia Terminológica (TC), Coherencia del Discurso (DC) y Adecuación Comunicativa y Estilística (CSA). Los ejes no se mueven de una ejecución a otra. Son los mismos cada vez. Si comparas la Evaluación A y la Evaluación B, esa comparación tiene significado.

La puntuación en sí no se deja al LLM. El modelo es responsable de identificar y caracterizar errores, y un flujo de trabajo determinista calcula valores numéricos basados en la gravedad, la fuerza obligatoria y la sensibilidad del eje. Si ejecutas la misma entrada dos veces, obtienes los mismos números. Esto podría sonar como un detalle de implementación menor. No lo es. Esta es la línea que separa un "instrumento" de una "atmósfera".

Y lo que quiero dedicar un poco de tiempo a discutir es el Brief de Traducción.

El brief le dice a CATER para qué sirve la traducción. ¿Quién es el lector, cuál es el medio, qué efecto debería producir, qué se puede sacrificar y qué debe conservarse absolutamente? Con un brief, la evaluación ya no es una cuestión de "qué tan cerca está esto de alguna respuesta correcta abstracta". Se convierte en la pregunta: "¿Está haciendo esta traducción el trabajo para el que fue contratada?" Hasta donde sé, esta es la única pregunta que realmente importa.

Cuando proporcionas un brief, el ejemplo de Momotaro se resuelve. Si el brief es "Libro infantil para niños estadounidenses, la legibilidad es la máxima prioridad", entonces "That boy is just like Momotaro" se marca en el eje CSA porque la referencia no aterriza. "That boy's another little Hulk" podría obtener una puntuación alta. Si el brief es "Traducción literaria para una antología académica, conservar la especificidad cultural", el juicio se invierte. Mantener la línea de Momotaro como en el original es correcto, y reemplazarla con Hulk es una domesticación excesiva. Misma fuente, mismas opciones, brief diferente, respuesta correcta diferente. El evaluador puede ver esto porque el brief es una entrada de primera clase.

Si no proporcionas un brief, CATER lo complementa con inferencia. En la práctica real, las traducciones con un brief escrito son minoría. Pero siempre hay un brief implícito. El género, el registro y el público objetivo limitan los límites de una "buena traducción". Un revisor experto lee mientras reconstruye automáticamente el brief en su cabeza. CATER hace lo mismo explícitamente y muestra el brief inferido en la pantalla. Si es incorrecto, un humano puede corregirlo.

Aplicando CATER a una Traducción de Nivel Nobel

Déjame dar un ejemplo concreto. Esto no es salida de traducción automática. Cambiaré la charla a la traducción literaria humana de mucho antes de que apareciera la traducción automática.

"Snow Country" de Yasunari Kawabata, traducido por Edward Seidensticker. Traducido por primera vez en 1956 y revisado posteriormente, esta traducción de Seidensticker fue a la que se refirió el comité de selección cuando Kawabata ganó el Premio Nobel de Literatura en 1968. Se puede llamar la cumbre del siglo XX de la traducción al inglés de la literatura japonesa. Es bastante difícil encontrar una traducción humana que supere esta.

Ejecuté su párrafo inicial a través de CATER. No se proporcionó ningún brief explícito; dejé que el evaluador lo infiriera.

Puntuación general: 58.8/100. El juicio fue "Requiere reelaboración importante". Aquí está el desglose por eje:

Por favor, no saques conclusiones precipitadas. CATER no está diciendo "Seidensticker es malo". La gramática, los hechos y la estructura lógica obtienen puntuaciones perfectas. Lo que está roto son el significado central y los efectos literarios—partes limitadas pero críticas. Y CATER señala exactamente dónde está esa ruptura.

"Yoru no soko ga shiroku natta" (El fondo de la noche se volvió blanco) es traducido por Seidensticker como "The earth lay white under the night sky". El diagnóstico de CATER es este: la expresión metafórica y perceptual "fondo de la noche" ha sido reemplazada por una escena diferente, "el suelo está blanco bajo el cielo nocturno". El efecto semántico del original, donde la blancura surge desde dentro de la noche, no se conserva. Como corrección mínima, se sugiere "The bottom of the night turned white". Esta es la razón principal por la que el eje SI cayó a 25.

Una más. Una escena donde una chica que abre una ventana grita "como si gritara a lo lejos, '¡Jefe de estación! ¡Jefe de estación!'". La traducción de Seidensticker es: "Leaning far out the window, the girl called to the station master as though he were a great distance away". El discurso directo en sí ha sido reemplazado por una descripción resumida. El comentario de CATER: "La resonancia de la llamada en sí y la inmediatez de la escena se pierden. Debido a que se borró el contenido hablado, la sensación de presencia como reproducción literaria se debilita". Esto llevó el eje CSA a 0.

La forma correcta de tomar estos puntos es que Seidensticker debió tener sus propias razones para estas elecciones. Como traducción literaria para lectores de habla inglesa en la década de 1950, eligió conscientemente esto dentro de las normas de traducción de la época. El comentario de CATER en sí no llama a esto una "mala traducción", sino que lo trata como "un problema de interpretación donde el juicio cambia dependiendo del brief". Sin embargo, si encargaras el mismo texto fuente para un proyecto de traducción de literatura japonesa moderna y escribieras un brief que dijera "Priorizar la reproducción de la atmósfera poética del original", el juicio sería que esta traducción no está haciendo su trabajo. Misma traducción, brief diferente, conclusión diferente.

Lo que quiero que saques de esto no es la puntuación en sí, sino tres cosas.

Primero: Incluso una traducción que deja su huella en la historia literaria mundial puede recibir un juicio de "reelaboración" bajo un brief específico. Esto es una prueba de que no hay un techo absoluto para la calidad de la traducción y, al mismo tiempo, una demostración de que la evaluación es una tarea relativa a un brief.

Segundo: CATER no solo dice "esto es malo", proporciona alternativas específicas para "arréglalo así". El diagnóstico y la prescripción están integrados. Debido a esto, el lado que ve los resultados de la evaluación puede dar el siguiente paso.

Tercero: Incluso si la gramática, los hechos y la estructura lógica son perfectos, el trabajo como traducción literaria puede fallar. Las fallas que no se pueden detectar con "leerlo y no sentir ninguna molestia" aparecen correctamente en diferentes ejes. Qué débil es una verificación revisar la salida de la traducción automática diciendo "estaba bien porque no sentí molestia"—esto se vuelve visible al calcular hacia atrás desde el hecho de que incluso una traducción de nivel Seidensticker vacila cuando se desglosa en ejes explícitos.

Por Qué Esto Es Importante Incluso para los No Investigadores de Traducción

La mayor parte de lo que he dicho hasta ahora podría sonar a tecnicismos internos para aquellos fuera de la industria de la localización. He aquí por qué sigue siendo importante.

La traducción es actualmente uno de los usos principales de los LLM. El número de empresas y el volumen de tráfico que pasa por el soporte al cliente, el copy del producto, los avisos internos, los documentos legales y los contratos a través de flujos de traducción automática están a una escala que no existía hace tres años. La actividad económica que se basa en estos flujos es enorme. La capa de verificación que se encuentra sobre ellos es casi nula. La gente está enviando traducciones que no puede verificar. Están enviando cláusulas legales rezando para que el modelo no haya inventado números, no haya debilitado "must" a "should", y no haya eliminado el tono que hizo que el copy de marketing funcionara.

Y repito, esto no es un problema de la traducción automática. Las traducciones subcontratadas a traductores profesionales también se entregan en la misma ausencia de verificación. El cliente lee la traducción entregada y confirma "se lee como japonés". Eso no es un control de calidad de la traducción; es una confirmación de que la entrega está en japonés. La larga distancia que debería existir entre los dos nunca ha sido recorrida por nadie hasta ahora.

La traducción automática en 2026 está en un nivel que es "prácticamente suficiente" para la mayoría de los usos. Esto es cierto. Pero "suficiente para la mayoría de los usos" no es una estrategia de verificación. En situaciones donde los errores pueden ser fatales—documentos clínicos, contratos, declaraciones públicas, traducciones literarias—"no sentí molestia al leerlo" o "le pregunté a un traductor de confianza" ya no son respuestas aceptables.

Lo que nos ha faltado durante mucho tiempo es una capa para que los no expertos verifiquen la salida. No un solo número. No un sello de goma. Un diagnóstico estructurado y legible que diga: "La fortaleza de esta traducción está aquí, el riesgo está aquí, y si valoras X, arregla esta parte".

Eso es CATER. Puedes probarlo gratis en cater.erudaite.ai. La metodología y la teoría detrás de él están disponibles en about.erudaite.ai.

Intenta meter una traducción que tengas a mano—por ejemplo, un correo electrónico antes de enviarlo, materiales internos, un borrador de contrato o un manuscrito recién entregado por un proveedor externo—y mira lo que sale.

Deberías poder confirmar su calidad y las características de la traducción con CATER.

Guardar con un clic

Lee artículos virales en profundidad con IA en YouMind

Guarda la fuente, haz preguntas concretas, resume el argumento y convierte un artículo viral en notas reutilizables en un único espacio de trabajo con IA.

Explora YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales