YouMind
Se connecter

Cette traduction est-elle vraiment correcte ?

@KurandoIida
JAPONAIS21 mai 2026
531K
47
6
4
32

TL;DR

Cet article explore le manque critique d'évaluation objective dans les processus de traduction modernes et présente CATER, un outil qui utilise des briefs structurés pour évaluer la qualité au-delà de la simple fluidité.

Vous recevez un long e-mail en anglais d'un client à l'étranger. Vous n'avez pas le temps de rédiger une réponse. Pour l'instant, vous le jetez dans DeepL ou, plus récemment, dans ChatGPT pour le transformer en japonais et le lire sur votre écran. Vous comprenez le contenu. Vous pouvez prendre une décision. Ou du moins, vous avez l'impression de le pouvoir.

L'inverse est également vrai. Vous devez envoyer une annonce en anglais en interne, alors vous passez un brouillon rédigé en japonais par une traduction automatique, parcourez l'anglais obtenu, pensez « ça a l'air correct » et cliquez sur envoyer. La réponse de l'autre partie ne semble pas particulièrement étrange. Vous vous dites donc : « Ça a dû bien se passer encore cette fois. »

Le problème, c'est que personne de ce côté-ci n'a vérifié si ça s'est vraiment bien passé. Le processus qui consiste à aligner le texte source et le texte cible et à juger « cette partie est OK », « cette partie est risquée » ou « cette partie est fatale » est absent des pipelines de traduction modernes.

Cela ne se limite pas aux e-mails personnels. Des contenus marketing, des avis internes, des projets de contrats, des documents de relations publiques, des FAQ de support client – toutes sortes de documents ont été confiés à la traduction automatique ces dernières années. Le volume a explosé. Pourtant, la couche de contrôle qualité n'a quasiment pas augmenté. Certaines personnes pensent vérifier. Elles appellent « lire et ne ressentir aucune gêne » une vérification. Ce n'en est pas une. Ce n'est pas une vérification, c'est un vœu pieux.

Et ce que beaucoup de gens négligent ici, c'est que cela ne concerne pas uniquement la traduction automatique. Même pour les traductions commandées à des traducteurs professionnels, il n'existe pratiquement aucun moyen pour le client de vérifier de manière indépendante si la traduction correspond à ses intentions sur l'ensemble du texte. Ils lisent le livrable, pensent « ça se lit comme du japonais » ou « ça passe pour de l'anglais », et c'est tout. Personne n'effectue la tâche de vérifier, point par point, si le travail a été réalisé conformément au brief pour l'intégralité du manuscrit en raison des coûts. Il serait plus juste de dire qu'il n'y a tout simplement pas de moyen de le faire.

Le domaine de l'évaluation de la traduction a pris en charge la résolution de ce problème. Cependant, ce domaine ne se porte pas aussi bien que les personnes extérieures au secteur pourraient le penser.

La traduction automatique n'est pas aussi parfaite qu'on le croit

Tout d'abord, il faut dissiper un mythe.

Les résultats de la traduction automatique et des LLM en 2026 sont certes à un niveau différent de ce qu'ils étaient il y a quelques années. C'est un fait. Pour 80 % des usages quotidiens, les humains n'ont plus besoin de refaire le travail.

Cependant, la suite est mal comprise. Dans les 20 % restants – en particulier dans les situations où la traduction a un « objectif » spécifique – les systèmes actuels ne fonctionnent toujours pas de manière cohérente. Plus précisément, deux choses se produisent.

La première est la fluctuation de l'intention de traduction. Même si vous lancez le même texte source dans le même modèle deux fois et que vous lui demandez à chaque fois de « traduire comme un discours », les deux traductions obtenues n'auront pas un ton cohérent. L'une pourrait être enflammée tandis que l'autre sera plus modérée. Le point d'atterrissage par rapport à l'objectif n'est déterminé que de manière probabiliste.

L'autre est la cohérence dans les textes longs. Un document peut traduire « contract » par « contrat » dans la première moitié, mais cela se transforme en « convention » dans la seconde moitié. Un ton formel dans la première moitié peut subtilement glisser vers un ton décontracté dans la seconde. Les noms propres peuvent apparaître sous trois notations différentes. Pris individuellement, ces éléments ne sont pas fatals. Mais pour l'ensemble du document, ils érodent la qualité comme des coups au corps.

De plus, ces problèmes sont difficiles à remarquer en se contentant de lire le résultat. Si vous examinez chaque phrase, ce sont toutes des « phrases correctes ». La source de la gêne se situe au niveau du document, pas au niveau de la phrase. Les lecteurs qui ne ressentent pas de gêne se sentent en sécurité en appuyant sur le bouton d'envoi. Savoir s'ils devraient se sentir en sécurité dans cet état est une autre question.

Les mêmes problèmes structurels se produisent avec les traducteurs humains. La fatigue ou les fluctuations du jugement s'installent au cours d'un long document. Les détails de genre ou de registre peuvent ne pas correspondre parfaitement entre la première et la dernière page. Les vétérans en sont conscients, c'est pourquoi ils consacrent du temps à l'auto-relecture. Cependant, il n'existe pas non plus de moyen de vérifier de l'extérieur si cette auto-relecture est complète.

En bref, qu'il s'agisse d'une machine ou d'un humain, l'industrie dans son ensemble manque d'un mécanisme permettant de vérifier de manière indépendante si la qualité d'une traduction est cohérente « par rapport à l'objectif » et « sur l'ensemble du texte ». Telle est la situation actuelle.

Les métriques dont nous disposons ne mesurent pas ce qui nous importe

Ce n'est pas qu'il n'y ait pas de mécanismes de vérification. Il y en a. Le problème est ce qu'ils mesurent.

Les deux principales métriques d'évaluation automatique dans la recherche en traduction automatique sont BLEU et COMET. BLEU compare la sortie avec une traduction de référence et compte les séquences de mots qui se chevauchent. COMET utilise un modèle pré-entraîné pour évaluer la similarité sémantique. Les deux sont utiles pour les objectifs visés. Et les deux partagent le même postulat dont l'ingénierie ne peut s'affranchir : le postulat qu'une « réponse correcte » existe, et que cette réponse correcte est la traduction de référence placée dans l'ensemble de test.

La traduction en tant qu'activité ne fonctionne pas de cette manière.

Empruntons une phrase à la littérature jeunesse japonaise : « Ano otokonoko wa marude Momotaro mitai da. » Pour quelqu'un qui a grandi au Japon, Momotaro est un héros du folklore qui vainc des ogres avec un chien, un singe et un faisan. Qualifier un enfant de « comme Momotaro » porte la nuance qu'il est courageux pour son âge, qu'il a du cran et qu'il ne faut pas le sous-estimer même s'il est petit.

Si vous traduisez cela pour un lecteur anglais qui n'a jamais entendu parler de Momotaro, plusieurs options s'offrent à vous.

Vous pourriez l'écrire littéralement : « That boy is just like Momotaro ». La surface de l'original est parfaitement préservée. Si la traduction de référence se trouve être la même, BLEU sera ravi. Mais presque rien ne sera transmis au lecteur anglais. Le sens de la phrase est entièrement enfermé dans un nom qu'il ne connaît pas.

Vous pourriez aussi écrire : « That boy is so brave for his age ». Vous abandonnez la spécificité culturelle, mais le sens est saisi instantanément.

Ou vous pourriez faire un pas audacieux : « That boy's another little Hulk ». C'est un choix audacieux. Il remplace une référence culturellement incompréhensible par une autre culturellement compréhensible. C'est une adaptation qui transpose la « fonction » plutôt que le « contenu » de la référence. Selon le brief (les détails de la commande), cela pourrait être la meilleure décision ou une décision inappropriée.

Quelle est la réponse correcte ? Cela dépend des conditions. Cela dépend du lecteur, du support, de la marge de manœuvre autorisée, du registre du texte environnant et d'environ douze autres facteurs. Et tous ces facteurs se situent au-dessus du niveau de la phrase, invisibles pour les métriques qui ne regardent que les phrases.

BLEU récompense les choix qui correspondent par hasard à la traduction de référence et pénalise tout le reste, indépendamment de leur supériorité. COMET classe par distance sémantique et ignore toute la question de l'effet que la traduction devrait avoir sur le lecteur. Aucune des deux ne vous dit « quel choix convient à ce travail ». En premier lieu, l'idée de remplacer par Hulk est un bond qu'un traducteur humain pourrait faire, mais une métrique entraînée sur la proximité avec une traduction de référence ne le récompensera jamais.

Permettez-moi de dire une chose importante à propos de la traduction. Il n'y a pas de réponse unique et correcte. Pour chaque ligne, des options valables s'ouvrent comme un éventail. Laquelle choisir relève du jugement du traducteur. « Comme Momotaro », « courageux pour son âge », « un petit Hulk » – tous sont des choix défendables. Le travail de l'évaluation n'est pas de deviner la seule et unique traduction correcte. C'est d'examiner le jugement rendu par le traducteur et de dire franchement s'il fonctionne pour ce travail.

Que se passe-t-il quand on demande directement à un LLM

Si vous voulez faire les choses à la manière moderne, vous pouvez sauter les métriques et demander directement à un LLM. « Voici la source, voici la traduction – qu'en pensez-vous ? »

Cela fonctionne mieux que vous ne le pensez, et moins bien que vous ne l'espérez.

Cela fonctionne mieux que vous ne le pensez car les LLM peuvent, en principe, raisonner sur des choses comme le registre, le public, les références culturelles et les effets rhétoriques – des choses que BLEU et COMET ne peuvent pas atteindre. Il peut remarquer quand une phrase a perdu son rythme. Il peut souligner que la traduction de Momotaro est opaque.

Les raisons pour lesquelles cela fonctionne moins bien que vous ne l'espérez sont doubles, et en pratique, elles ont un effet cumulatif.

Premièrement, les axes d'évaluation se déplacent. Si vous posez la même question au même modèle deux fois, il renverra des réponses avec des configurations dimensionnelles différentes. La première fois, il pourrait se concentrer sur la fluidité, la deuxième sur l'exactitude, et la troisième pourrait inventer une nouvelle catégorie en cours de route. Vous ne pouvez pas comparer des évaluations sur plusieurs documents car ce qui est mesuré n'est pas cohérent dès le départ. Pendant que vous mesurez, l'instrument lui-même bouge.

Deuxièmement, la sycophantie (la flatterie). Les LLM sont entraînés assez fortement pour plaire à leur interlocuteur. Si vous remettez une traduction et demandez « Est-ce que c'est bien ? », il y a une forte probabilité qu'il réponde « C'est bien ». Si vous insistez, il sera d'accord avec votre insistance. Le modèle optimise pour « faire semblant d'écouter et de respecter l'utilisateur », pas pour « être un évaluateur de sang-froid ». Pour des usages à faible risque, c'est bien. Mais pour quelqu'un qui livre de la traduction en tant que produit, quelqu'un qui note une traduction, ou quelqu'un qui achète une traduction avec de l'argent réel, ce trait est exactement le contraire de ce qui est nécessaire.

En conséquence, une situation étrange a persisté. Ce que nous voulions – un moyen pour les non-experts de vérifier réellement les traductions – n'existait pas correctement. Si vous externalisiez la traduction, vous deviez simplement faire confiance au fournisseur. Si vous utilisiez la traduction automatique, vous deviez simplement croiser les doigts et prier. Les seules personnes capables de vérifier une traduction de manière fiable étaient des relecteurs seniors qui maîtrisaient déjà les deux langues à un niveau où ils n'avaient pas besoin de la traduction en premier lieu.

Ce que CATER essaie de faire

Il existe un outil appelé CATER. Je fais partie de son équipe de développement. Je crois qu'il s'agit de la première tentative sérieuse de solution à ce problème, alors laissez-moi vous expliquer ce qu'il fait.

CATER évalue la traduction sur six axes explicites : Précision grammaticale (GP), Intégrité sémantique (SI), Cohérence factuelle (FC), Cohérence terminologique (TC), Cohérence discursive (DC) et Pertinence communicative et stylistique (CSA). Les axes ne bougent pas d'une exécution à l'autre. Ils sont les mêmes à chaque fois. Si vous comparez l'évaluation A et l'évaluation B, cette comparaison a un sens.

La notation elle-même n'est pas laissée au LLM. Le modèle est responsable de l'identification et de la caractérisation des erreurs, et un pipeline déterministe calcule les valeurs numériques en fonction de la sévérité, de la force obligatoire et de la sensibilité de l'axe. Si vous exécutez la même entrée deux fois, vous obtenez les mêmes chiffres. Cela peut sembler un détail d'implémentation mineur. Ce n'est pas le cas. C'est la ligne qui sépare un « instrument » d'une « atmosphère ».

Et ce sur quoi je veux passer un peu de temps, c'est le Brief de traduction (Translation Brief).

Le brief indique à CATER à quoi sert la traduction. Qui est le lecteur, quel est le support, quel effet doit-elle produire, que peut-on sacrifier, et que faut-il absolument préserver ? Avec un brief, l'évaluation n'est plus une question de « à quel point cette traduction est-elle proche d'une réponse correcte abstraite ? » Elle devient la question : « Cette traduction fait-elle le travail pour lequel elle a été engagée ? » À ma connaissance, c'est la seule question qui compte vraiment.

Lorsque vous fournissez un brief, l'exemple de Momotaro est résolu. Si le brief est « Livre pour enfants destiné aux enfants américains, la lisibilité est la priorité absolue », alors « That boy is just like Momotaro » sera signalé sur l'axe CSA parce que la référence ne porte pas. « That boy's another little Hulk » pourrait obtenir un score élevé. Si le brief est « Traduction littéraire pour une anthologie universitaire, préserver la spécificité culturelle », le jugement est inversé. Garder la ligne Momotaro telle quelle est correct, et la remplacer par Hulk est une domestication excessive. Même source, mêmes options, brief différent, réponse correcte différente. L'évaluateur peut le voir car le brief est une entrée de première classe.

Si vous ne fournissez pas de brief, CATER le supplée par inférence. Dans la pratique réelle, les traductions avec un brief écrit sont minoritaires. Mais il y a toujours un brief implicite. Le genre, le registre et le public cible contraignent les limites d'une « bonne traduction ». Un relecteur expérimenté lit tout en reconstruisant automatiquement le brief dans sa tête. CATER fait la même chose explicitement et affiche le brief inféré à l'écran. S'il est erroné, un humain peut le corriger.

Appliquer CATER à une traduction de niveau Prix Nobel

Donnons un exemple concret. Il ne s'agit pas d'une sortie de traduction automatique. Je vais passer à la traduction littéraire humaine, bien antérieure à l'apparition de la traduction automatique.

« Pays de neige » de Yasunari Kawabata, traduit par Edward Seidensticker. Traduit pour la première fois en 1956 et révisé plus tard, cette traduction de Seidensticker est celle à laquelle le comité de sélection s'est référé lorsque Kawabata a remporté le prix Nobel de littérature en 1968. On peut l'appeler le summum du vingtième siècle de la traduction anglaise de la littérature japonaise. Il est très difficile de trouver une traduction humaine qui la surpasse.

J'ai passé son premier paragraphe dans CATER. Aucun brief explicite n'a été fourni ; j'ai laissé l'évaluateur l'inférer.

Score global : 58,8/100. Le verdict était « Reprise majeure requise ». Voici la répartition par axe :

S'il vous plaît, ne tirez pas de conclusions hâtives. CATER ne dit pas « Seidensticker est mauvais ». La grammaire, les faits et la structure logique obtiennent tous des scores parfaits. Ce qui est cassé, ce sont le sens central et les effets littéraires – des parties limitées mais critiques. Et CATER pointe exactement là où se situe cette cassure.

« Yoru no soko ga shiroku natta » (Le fond de la nuit est devenu blanc) est traduit par Seidensticker par « The earth lay white under the night sky ». Le diagnostic de CATER est le suivant : l'expression métaphorique et perceptuelle « fond de la nuit » a été remplacée par une scène différente, « le sol est blanc sous le ciel nocturne ». L'effet sémantique de l'original, où la blancheur s'élève de l'intérieur de la nuit, n'est pas préservé. Comme correction minimale, « The bottom of the night turned white » est suggéré. C'est la raison principale pour laquelle l'axe SI est tombé à 25.

Encore une. Une scène où une fille ouvrant une fenêtre appelle « comme si elle criait au loin, 'Chef de gare ! Chef de gare !' » La traduction de Seidensticker est : « Leaning far out the window, the girl called to the station master as though he were a great distance away. » Le discours direct lui-même a été remplacé par une description résumée. Commentaire de CATER : « La résonance de l'appel lui-même et l'immédiateté de la scène sont perdues. Parce que le contenu parlé a été effacé, la sensation de présence en tant que reproduction littéraire est affaiblie. » Cela a amené l'axe CSA à 0.

La bonne façon de prendre ces points est que Seidensticker a dû avoir ses propres raisons pour ces choix. En tant que traduction littéraire pour des lecteurs anglophones dans les années 1950, il a consciemment choisi cela dans le cadre des normes de traduction de l'époque. Le commentaire de CATER lui-même n'appelle pas cela une « erreur de traduction » mais le traite comme « un problème d'interprétation où le jugement change selon le brief ». Cependant, si vous aviez commandé le même texte source pour un projet de traduction de littérature japonaise moderne et aviez rédigé un brief disant « Prioriser la reproduction de l'atmosphère poétique de l'original », le verdict serait que cette traduction ne fait pas son travail. Même traduction, brief différent, conclusion différente.

Ce que je veux que vous reteniez, ce n'est pas le score lui-même, mais trois choses.

Premièrement : Même une traduction qui laisse sa marque dans l'histoire de la littérature mondiale peut recevoir un verdict de « reprise » sous un brief spécifique. C'est la preuve qu'il n'y a pas de plafond absolu à la qualité de la traduction, et en même temps, une démonstration que l'évaluation est une tâche relative à un brief.

Deuxièmement : CATER ne se contente pas de dire « c'est mauvais », il fournit des alternatives spécifiques pour « corrigez-le comme ceci ». Diagnostic et prescription sont intégrés. Grâce à cela, le côté qui voit les résultats de l'évaluation peut passer à l'étape suivante.

Troisièmement : Même si la grammaire, les faits et la structure logique sont parfaits, le travail en tant que traduction littéraire peut échouer. Les échecs qui ne peuvent pas être détectés en « lisant et ne ressentant aucune gêne » apparaissent correctement sur différents axes. À quel point la vérification est faible lorsqu'on contrôle une sortie de traduction automatique en disant « c'était correct parce que je n'ai ressenti aucune gêne » – cela devient visible en calculant à rebours à partir du fait que même une traduction de niveau Seidensticker vacille lorsqu'elle est décomposée en axes explicites.

Pourquoi c'est important même pour les non-chercheurs en traduction

La majeure partie de ce que j'ai dit jusqu'à présent peut sembler du jargon interne à ceux qui sont en dehors de l'industrie de la localisation. Voici pourquoi c'est quand même important.

La traduction est actuellement l'une des utilisations principales des LLM. Le nombre d'entreprises et le volume de trafic qui font passer le support client, les textes produits, les avis internes, les documents juridiques et les contrats par des pipelines de traduction automatique sont à une échelle qui n'existait pas il y a trois ans. L'activité économique qui repose sur ces pipelines est énorme. La couche de vérification qui les surmonte est presque nulle. Les gens livrent des traductions qu'ils ne peuvent pas vérifier. Ils envoient des clauses juridiques en priant pour que le modèle n'ait pas inventé des chiffres, n'ait pas affaibli « doit » en « devrait », et n'ait pas supprimé le ton qui faisait fonctionner le texte marketing.

Et je le répète, ce n'est pas un problème avec la traduction automatique. Les traductions externalisées à des traducteurs professionnels sont également livrées dans la même absence de vérification. Le client lit la traduction livrée et confirme « ça se lit comme du français ». Ce n'est pas un contrôle qualité de la traduction ; c'est une confirmation que le livrable est en français. La longue distance qui devrait exister entre les deux n'a jamais été parcourue par personne jusqu'à présent.

La traduction automatique en 2026 est à un niveau « pratiquement suffisant » pour la plupart des usages. C'est vrai. Mais « suffisant pour la plupart des usages » n'est pas une stratégie de vérification. Dans les situations où les erreurs peuvent être fatales – documents cliniques, contrats, déclarations publiques, traductions littéraires – « je n'ai ressenti aucune gêne en le lisant » ou « j'ai demandé à un traducteur fiable » ne sont plus des réponses acceptables.

Ce qui nous a longtemps manqué, c'est une couche pour que les non-experts puissent vérifier les résultats. Pas un chiffre unique. Pas un tampon en caoutchouc. Un diagnostic structuré et lisible qui dit : « La force de cette traduction est ici, le risque est ici, et si vous accordez de l'importance à X, corrigez cette partie. »

Voilà ce qu'est CATER. Vous pouvez l'essayer gratuitement sur cater.erudaite.ai. La méthodologie et la théorie qui la sous-tend sont disponibles sur about.erudaite.ai.

Essayez d'y soumettre une traduction que vous avez sous la main – par exemple, un e-mail avant envoi, des documents internes, un projet de contrat, ou un manuscrit tout juste livré par un prestataire – et voyez ce qui en ressort.

Vous devriez pouvoir confirmer sa qualité et les caractéristiques de la traduction avec CATER.

Enregistrer en un clic

Lire les articles viraux en profondeur avec l’IA de YouMind

Enregistrez la source, posez des questions ciblées, résumez l’argument et transformez un article viral en notes réutilisables dans un seul espace de travail IA.

Découvrir YouMind
Pour les créateurs

Transformez votre Markdown en un article 𝕏 impeccable

Quand vous publiez vos propres textes longs, la mise en forme 𝕏 des images, tableaux et blocs de code est pénible. YouMind transforme un brouillon Markdown complet en un article 𝕏 impeccable, prêt à publier.

Essayer Markdown vers 𝕏

D'autres patterns à décoder

Articles viraux récents

Explorer plus d'articles viraux