Recibes un correo largo en inglés de un cliente en el extranjero. No tienes tiempo para redactar una respuesta. Por ahora, lo metes en DeepL o, más recientemente, en ChatGPT para convertirlo a japonés y leerlo en la pantalla. Entiendes el contenido. Puedes formarte un juicio. O al menos, sientes que lo haces.
Lo contrario también es cierto. Necesitas enviar un anuncio en inglés internamente, así que pasas un borrador escrito en japonés por traducción automática, echas un vistazo al resultado en inglés, piensas "tiene buena pinta" y le das a enviar. La respuesta de la otra parte no parece particularmente extraña. Así que piensas: "Esta vez también habrá ido bien".
El problema es que nadie de este lado ha verificado si realmente fue bien. El proceso de alinear los textos fuente y destino y juzgar "esta parte está bien", "esta parte es arriesgada" o "esta parte es fatal" está ausente en los pipelines de traducción modernos.
Esto no se limita a los correos personales. Textos de marketing, avisos internos, borradores de contratos, materiales de relaciones con inversores, preguntas frecuentes de soporte — todo tipo de documentos han pasado por la traducción automática en los últimos años. El volumen se ha disparado. Sin embargo, la capa de verificación de calidad apenas ha aumentado. Algunos creen que están verificando. Le llaman "leer y no sentir ninguna incomodidad" a eso una verificación. No lo es. Eso no es una verificación; es pensar con los deseos.
Y lo que muchos pasan por alto aquí es que esto no es solo cuestión de traducción automática. Incluso para traducciones encargadas a traductores profesionales, actualmente casi no hay forma de que el cliente verifique de forma independiente si la traducción es coherente con su intención en todo el texto. Leen el entregable, piensan "se lee como japonés" o "pasa por inglés", y ya está. Nadie realiza la tarea de verificar, punto por punto, si el trabajo se hizo según las instrucciones para todo el manuscrito debido a problemas de costos. Quizás sea más exacto decir que no hay forma de hacerlo.
El campo de la evaluación de traducciones ha asumido la tarea de resolver este problema. Sin embargo, este campo no lo está haciendo tan bien como los que están fuera de la industria podrían pensar.
La traducción automática no es tan perfecta como todos creen
Primero, hay que desmentir un mito.
La producción de la traducción automática y los LLM en 2026 ciertamente está a un nivel diferente al de hace unos años. Esto es un hecho. Para el 80 % de los usos diarios, los humanos ya no necesitan rehacer el trabajo.
Sin embargo, lo que viene después se malinterpreta. En el 20 % restante — especialmente en situaciones donde la traducción tiene un "objetivo" específico — los sistemas actuales todavía no funcionan de manera consistente. Específicamente, ocurren dos cosas.
Una es la fluctuación de la intención de traducción. Incluso si introduces el mismo texto fuente dos veces en el mismo modelo y le instruyes "traduce como un discurso" ambas veces, las dos traducciones resultantes no tendrán un tono coherente. Una puede ser inflamatoria mientras que la otra es algo moderada. El punto de aterrizaje respecto al objetivo solo se determina de forma probabilística.
La otra es la consistencia en textos largos. Un documento puede traducir "contract" como "keiyaku" en la primera mitad, pero se convierte en "keiyakusho" en la segunda mitad. Un tono que era formal en la primera mitad puede cambiar sutilmente a informal en la segunda mitad. Los nombres propios pueden aparecer en tres notaciones diferentes. Individualmente, no son fatales. Pero para el documento en su conjunto, desgastan la calidad como golpes al cuerpo.
Además, estos problemas son difíciles de notar con solo leer el resultado. Si miras cada frase, todas son "frases correctas". La fuente de la incomodidad ocurre a nivel del documento, no a nivel de la frase. Los lectores que no sienten incomodidad se sienten seguros al presionar el botón de enviar. Si ese es un estado en el que deberían sentirse seguros es otro asunto.
Los mismos problemas estructurales ocurren con los traductores humanos. La fatiga o las fluctuaciones en el juicio se cuelan durante un documento largo. Los detalles del género o registro pueden no coincidir perfectamente entre la primera y la última página. Los veteranos son conscientes de esto, por lo que dedican tiempo a la autoevaluación. Sin embargo, tampoco hay forma de verificar desde fuera si esa autoevaluación está completa.
En resumen, ya sea una máquina o un humano, la industria en su conjunto carece de un mecanismo para verificar de forma independiente si la calidad de una traducción es coherente "en relación con el objetivo" y "en todo el texto". Esta es la situación actual.
Las métricas que tenemos no miden lo que nos importa
No es que no existan mecanismos de verificación. Los hay. El problema es qué están midiendo.
Las dos principales métricas de evaluación automática en la investigación de traducción automática son BLEU y COMET. BLEU compara el resultado con una traducción de referencia y cuenta las secuencias de palabras superpuestas. COMET utiliza un modelo preentrenado para puntuar la similitud semántica. Ambas son útiles para sus propósitos. Y ambas comparten la misma premisa de la que la ingeniería no puede escapar: la premisa de que existe una "respuesta correcta", y que esa respuesta correcta es la traducción de referencia colocada en el conjunto de prueba.
La traducción como actividad no funciona así.
Tomemos prestada una frase de la literatura infantil japonesa: "Ano otokonoko wa marude Momotaro mitai da". Para alguien criado en Japón, Momotaro es un héroe del folclore que derrota ogros con un perro, un mono y un faisán. Llamar a un niño "como Momotaro" conlleva el matiz de que es valiente para su edad, tiene agallas y no se le debe subestimar aunque sea pequeño.
Si traduces esto para un lector inglés que nunca ha oído hablar de Momotaro, hay múltiples opciones.
Podrías escribirlo literalmente: "That boy is just like Momotaro". La superficie del original se conserva perfectamente. Si la traducción de referencia resulta ser la misma, BLEU estará encantado. Pero casi nada se transmitirá al lector inglés. El significado de la frase está completamente encerrado dentro de un nombre que no conocen.
También podrías escribir: "That boy is so brave for his age". Descartas la especificidad cultural, pero el significado llega al instante.
O podrías dar un paso audaz: "That boy's another little Hulk". Esta es una elección atrevida. Reemplaza una referencia culturalmente incomprensible por otra culturalmente comprensible. Es una adaptación que trasplanta la "función" más que el "contenido" de la referencia. Dependiendo de las instrucciones (los detalles del pedido), esta podría ser la mejor jugada o una inapropiada.
¿Cuál es la respuesta correcta? Depende de las condiciones. Depende del lector, del medio, del margen de discreción permitido, del registro del texto circundante y de una docena de otros factores. Y todos esos factores existen por encima del nivel de la frase, invisibles para las métricas que solo miran frases.
BLEU elogia las opciones que coinciden con la traducción de referencia y castiga todo lo demás, independientemente de cuál sea superior. COMET clasifica por distancia semántica y omite toda la cuestión de qué efecto debería tener la traducción en el lector. Ninguna te dice "qué opción se ajusta a este trabajo". En primer lugar, la idea de reemplazarlo con Hulk es un salto que un traductor humano podría dar, pero una métrica entrenada en la proximidad a una traducción de referencia nunca lo recompensará.
Permíteme decir algo importante sobre la traducción. No existe una única respuesta correcta. Por cada línea, se abren opciones válidas como un abanico. Cuál tomar es el juicio del traductor. "Como Momotaro", "valiente para su edad", "un pequeño Hulk" — todas son opciones defendibles. El trabajo de la evaluación no es adivinar la única traducción correcta. Es observar el juicio que hizo el traductor y declarar francamente si funciona para este trabajo.
Qué sucede cuando le preguntas directamente a un LLM
Si quieres hacerlo a la manera moderna, puedes saltarte las métricas y preguntarle directamente a un LLM. "Aquí está el original, aquí está la traducción — ¿qué tal está?"
Esto funciona mejor de lo que crees, y peor de lo que esperas.
Funciona mejor de lo que crees porque los LLM pueden, en principio, razonar sobre cosas como el registro, la audiencia, las referencias culturales y los efectos retóricos — cosas a las que BLEU y COMET no pueden llegar. Puede notar cuando una frase ha perdido su ritmo. Puede señalar que la traducción de Momotaro es opaca.
Las razones por las que funciona peor de lo que esperas son dos, y en la práctica tienen un efecto agravante.
Primero, los ejes de evaluación se desplazan. Si haces la misma pregunta al mismo modelo dos veces, devolverá respuestas con diferentes configuraciones dimensionales. La primera vez puede centrarse en la fluidez, la segunda en la precisión, y la tercera puede inventar una nueva categoría a mitad de camino. No puedes comparar evaluaciones entre múltiples documentos porque lo que se mide no es consistente desde el principio. Mientras mides, el propio instrumento se está moviendo.
Segundo es la sicofancia (adulación). Los LLM están entrenados bastante fuertemente para complacer a su interlocutor. Si le entregas una traducción y le preguntas "¿Está bien?", hay una alta probabilidad de que diga "Está bien". Si insistes, estará de acuerdo con tu insistencia. El modelo está optimizando para "fingir que escucha y respeta al usuario", no para "ser un evaluador de sangre fría". Para usos de bajo riesgo, esto está bien. Pero para alguien que comercializa traducción como producto, alguien que califica traducciones o alguien que compra traducciones con dinero real, este rasgo es exactamente lo opuesto a lo que se necesita.
Como resultado, ha persistido una situación extraña. Lo que queríamos — un medio para que los no expertos verificaran realmente las traducciones — no existía adecuadamente. Si subcontratabas la traducción, solo tenías que confiar en el proveedor. Si usabas traducción automática, solo tenías que cruzar los dedos y rezar. Las únicas personas que podían verificar de manera confiable una traducción eran revisores sénior que ya dominaban ambos idiomas a un nivel en el que no necesitaban la traducción en primer lugar.
Lo que CATER intenta hacer
Existe una herramienta llamada CATER. Estoy en el lado del desarrollo de la misma. Creo que este es el primer intento serio de una solución a este problema, así que déjame explicar lo que hace.
CATER evalúa la traducción en seis ejes explícitos: Precisión Gramatical (GP), Integridad Semántica (SI), Consistencia Factual (FC), Consistencia Terminológica (TC), Coherencia Discursiva (DC) y Adecuación Comunicativa y Estilística (CSA). Los ejes no se mueven de una ejecución a otra. Son los mismos cada vez. Si comparas la Evaluación A y la Evaluación B, esa comparación tiene significado.
La puntuación en sí no se deja al LLM. El modelo es responsable de identificar y caracterizar errores, y un pipeline determinista calcula valores numéricos basados en la gravedad, la fuerza obligatoria y la sensibilidad del eje. Si ejecutas la misma entrada dos veces, obtienes los mismos números. Esto puede sonar como un detalle menor de implementación. No lo es. Esta es la línea que separa un "instrumento" de una "atmósfera".
Y en lo que quiero detenerme un poco es en el Brief de Traducción.
El brief le dice a CATER para qué sirve la traducción. Quién es el lector, cuál es el medio, qué efecto debe producir, qué se puede sacrificar y qué debe conservarse absolutamente. Con un brief, la evaluación ya no es una cuestión de "¿qué tan cerca está esto de alguna respuesta correcta abstracta?" Se convierte en la pregunta: "¿Está haciendo esta traducción el trabajo para el que fue contratada?" Que yo sepa, esta es la única pregunta que realmente importa.
Cuando proporcionas un brief, el ejemplo de Momotaro se resuelve. Si el brief es "Libro infantil para niños estadounidenses, la legibilidad es la máxima prioridad", entonces "That boy is just like Momotaro" se marca en el eje CSA porque la referencia no llega. "That boy's another little Hulk" podría obtener una puntuación alta. Si el brief es "Traducción literaria para una antología académica, preservar la especificidad cultural", el juicio se invierte. Mantener la línea de Momotaro como en el original es correcto, y reemplazarla por Hulk es una domesticación excesiva. Mismo original, mismas opciones, diferente brief, diferente respuesta correcta. El evaluador puede ver esto porque el brief es una entrada de primera clase.
Si no proporcionas un brief, CATER lo suplementa con inferencia. En la práctica real, las traducciones con un brief por escrito son minoría. Pero siempre hay un brief implícito. El género, el registro y la audiencia objetivo limitan los límites de una "buena traducción". Un revisor experto lee mientras reconstruye automáticamente el brief en su cabeza. CATER hace lo mismo de forma explícita y muestra el brief inferido en la pantalla. Si es incorrecto, un humano puede corregirlo.
Aplicando CATER a una traducción de nivel Nobel
Déjame dar un ejemplo concreto. Esto no es resultado de traducción automática. Cambiaré el tema a la traducción literaria humana de mucho antes de que apareciera la traducción automática.
"Snow Country" de Yasunari Kawabata, traducido por Edward Seidensticker. Traducida por primera vez en 1956 y luego revisada, esta traducción de Seidensticker fue la que el comité de selección consultó cuando Kawabata ganó el Premio Nobel de Literatura en 1968. Se puede considerar el pináculo del siglo XX de la traducción al inglés de la literatura japonesa. Es bastante difícil encontrar una traducción humana que supere esta.
Pasé su párrafo inicial por CATER. No se proporcionó ningún brief explícito; dejé que el evaluador lo infiriera.
Puntuación general: 58.8/100. El juicio fue "Requiere reelaboración importante". Aquí está el desglose por eje:
Por favor, no saques conclusiones precipitadas. CATER no está diciendo "Seidensticker es malo". La gramática, los hechos y la estructura lógica obtienen puntuaciones perfectas. Lo que está roto son el significado central y los efectos literarios — partes limitadas pero críticas. Y CATER señala exactamente dónde está esa ruptura.
"Yoru no soko ga shiroku natta" (El fondo de la noche se volvió blanco) es traducido por Seidensticker como "The earth lay white under the night sky". El diagnóstico de CATER es este: la expresión metafórica y perceptiva "fondo de la noche" ha sido reemplazada por una escena diferente, "el suelo es blanco bajo el cielo nocturno". El efecto semántico del original, donde la blancura surge desde dentro de la noche, no se conserva. Como corrección mínima, se sugiere "The bottom of the night turned white". Esta es la razón principal por la que el eje SI cayó a 25.
Una más. Una escena donde una chica que abre una ventana llama "como si gritara a lo lejos, '¡Jefe de estación! ¡Jefe de estación!'" La traducción de Seidensticker es: "Leaning far out the window, the girl called to the station master as though he were a great distance away". El discurso directo en sí ha sido reemplazado por una descripción resumida. El comentario de CATER: "Se pierden la resonancia de la llamada en sí y la inmediatez de la escena. Debido a que se borró el contenido hablado, la sensación de presencia como reproducción literaria se debilita". Esto llevó el eje CSA a 0.
La forma correcta de tomar estos puntos es que Seidensticker debió tener sus propias razones para estas elecciones. Como traducción literaria para lectores de habla inglesa en la década de 1950, eligió esto conscientemente dentro de las normas de traducción de la época. El comentario de CATER en sí mismo no llama a esto una "mala traducción", sino que lo trata como "un problema de interpretación donde el juicio cambia según el brief". Sin embargo, si encargaras el mismo texto fuente para un proyecto de traducción de literatura japonesa moderna y redactaras un brief que dijera "Priorizar la reproducción de la atmósfera poética del original", el juicio sería que esta traducción no está haciendo su trabajo. Misma traducción, diferente brief, diferente conclusión.
Lo que quiero que saques de esto no es la puntuación en sí, sino tres cosas.
Primero: Incluso una traducción que deja su huella en la historia literaria mundial puede recibir un juicio de "reelaboración" bajo un brief específico. Esto es prueba de que no hay un techo absoluto para la calidad de la traducción y, al mismo tiempo, una demostración de que la evaluación es una tarea relativa a un brief.
Segundo: CATER no solo dice "esto está mal", sino que proporciona alternativas específicas de "arréglalo así". Diagnóstico y prescripción están integrados. Debido a esto, el lado que ve los resultados de la evaluación puede dar el siguiente paso.
Tercero: Incluso si la gramática, los hechos y la estructura lógica son perfectos, el trabajo como traducción literaria puede fallar. Los fallos que no pueden ser detectados con "leer y no sentir incomodidad" aparecen correctamente en diferentes ejes. Lo débil que es verificar la producción de la traducción automática diciendo "estaba bien porque no sentí incomodidad" — esto se vuelve visible al calcular hacia atrás desde el hecho de que incluso una traducción de nivel Seidensticker flaquea cuando se desglosa en ejes explícitos.
Por qué esto es importante incluso para los que no son investigadores de traducción
La mayor parte de lo que he dicho hasta ahora puede sonar a tecnicismos internos para los que están fuera de la industria de la localización. He aquí por qué sigue siendo importante.
La traducción es actualmente uno de los usos principales de los LLM. El número de empresas y el volumen de tráfico que pasa por el soporte al cliente, los textos de productos, los avisos internos, los documentos legales y los contratos a través de pipelines de traducción automática están a una escala que no existía hace tres años. La actividad económica que se apoya en estos pipelines es enorme. La capa de verificación que se encuentra sobre ellos es casi nula. La gente está enviando traducciones que no puede verificar. Están enviando cláusulas legales rezando para que el modelo no haya inventado números, no haya debilitado "debe" por "debería", y no haya eliminado el tono que hacía funcionar el texto de marketing.
Y repito, esto no es un problema de la traducción automática. Las traducciones subcontratadas a traductores profesionales también se entregan en la misma ausencia de verificación. El cliente lee la traducción entregada y confirma "se lee como japonés". Eso no es un control de calidad de la traducción; es una confirmación de que la entrega está en japonés. La larga distancia que debería existir entre ambos nunca ha sido recorrida por nadie hasta ahora.
La traducción automática en 2026 está a un nivel que es "prácticamente suficiente" para la mayoría de los usos. Esto es cierto. Pero "suficiente para la mayoría de los usos" no es una estrategia de verificación. En situaciones donde los errores pueden ser fatales — documentos clínicos, contratos, declaraciones públicas, traducciones literarias — "no sentí incomodidad al leerlo" o "le pregunté a un traductor de confianza" ya no son respuestas aceptables.
Lo que nos ha faltado durante mucho tiempo es una capa para que los no expertos verifiquen la producción. No un número único. No un sello de goma. Un diagnóstico estructurado y legible que diga: "La fortaleza de esta traducción está aquí, el riesgo está aquí, y si valoras X, arregla esta parte".
Eso es CATER. Puedes probarlo gratis en cater.erudaite.ai. La metodología y la teoría detrás de él están disponibles en about.erudaite.ai.
Intenta meter una traducción que tengas a mano — por ejemplo, un correo antes de enviarlo, materiales internos, un borrador de contrato o un manuscrito recién entregado por un externo — y mira lo que sale.
Deberías poder confirmar su calidad y las características de la traducción con CATER.





