La traduction automatique fondée sur l'exemple (EBMT) est une méthode de traduction automatique qui repose sur un corpus bilingue de textes parallèles comme principale base de connaissances au moment de l'exécution. Il s'agit essentiellement d'une traduction par analogie, qui peut être considérée comme une mise en œuvre d'une approche de raisonnement à base de cas pour apprentissage automatique. Contrairement aux systèmes fondés sur des règles qui exigent une analyse linguistique approfondie, l'EBMT traduit en décomposant une phrase source en segments, en traduisant ces segments à l'aide d'exemples tirés du corpus, puis en composant les fragments traduits en une phrase cible.
L'approche a été proposée pour la première fois par Makoto Nagao en 1984, qui a soutenu qu'elle est particulièrement adaptée à la traduction entre deux langues très différentes, comme l'anglais et le japonais. Dans de tels cas, une phrase unique peut correspondre à plusieurs phrases bien structurées dans la langue cible, rendant l'analyse linguistique approfondie moins utile. Depuis, l'EBMT a été explorée comme alternative aux méthodes statistiques et fondées sur des règles, et elle partage l'utilisation de corpus bilingues avec la traduction automatique statistique.
Traduction par analogie
Le principe central de l'EBMT est la traduction par analogie. Cette idée rejette la notion selon laquelle les traducteurs humains effectuent une analyse linguistique approfondie de chaque phrase. Au lieu de cela, elle postule que les traducteurs décomposent une phrase en segments, traduisent chaque segment par analogie avec des traductions rencontrées précédemment, puis composent les segments traduits en un tout cohérent. Dans l'EBMT, ce principe est encodé à travers les exemples de traductions stockés dans le corpus d'entraînement. Le système récupère des exemples analogues du corpus pour guider la traduction de nouvelles entrées.
Histoire et développement
Makoto Nagao a introduit l'EBMT en 1984, soulignant son potentiel pour les paires de langues ayant des structures très différentes, comme l'anglais et le japonais. Son intuition était que pour de telles paires, une phrase peut souvent être rendue par plusieurs phrases bien structurées dans la langue cible, rendant l'analyse linguistique approfondie moins efficace que les méthodes fondées sur l'exemple. Au cours des décennies suivantes, l'EBMT a été développée et affinée, avec des contributions de chercheurs tels que Michael Carl et Andy Way, qui ont édité le volume de 2003 Recent Advances in Example-Based Machine Translation. Bien que l'EBMT ait été largement éclipsée par les approches basées sur réseaux de neurones ces dernières années, ses idées sur l'utilisation de corpus parallèles et l'analogie continuent d'influencer la recherche moderne en traduction automatique.
Comment fonctionne l'EBMT
Les systèmes EBMT sont entraînés sur des corpus bilingues parallèles contenant des paires de phrases, telles que :
- « Combien coûte ce parapluie rouge ? » ↔ « Ano akai kasa wa ikura desu ka. »
- « Combien coûte cette petite caméra ? » ↔ « Ano chiisai kamera wa ikura desu ka. »
À partir de ces paires minimales, le système apprend des unités de traduction : par exemple, « parapluie rouge » correspond à « akai kasa », et « petite caméra » correspond à « chiisai kamera ». Ces unités peuvent être composées pour produire des traductions nouvelles. Par exemple, si le système a vu des phrases comme « Le président Kennedy a été abattu pendant le défilé » et « Le condamné s'est évadé le 15 juillet », il peut traduire « Le condamné a été abattu pendant le défilé » en substituant les parties appropriées.
Verbes à particule et phénomènes de sous-langue
L'EBMT est particulièrement adaptée aux phénomènes de sous-langue comme les verbes à particule, dont les significations sont fortement dépendantes du contexte. Les verbes à particule en anglais se composent d'un verbe suivi d'un adverbe ou d'une préposition (la particule), et leurs significations ne peuvent souvent pas être dérivées des mots individuels. Par exemple, le verbe à particule « put on » peut signifier « allumer » (comme dans « Ram put on the lights ») ou « porter » (comme dans « Ram put on a cap »). En hindoustani, ces significations correspondent à des verbes différents : « jalana » et « pahenna », respectivement. L'EBMT peut gérer de telles ambiguïtés en récupérant des exemples qui correspondent au contexte, plutôt qu'en s'appuyant sur une traduction mot à mot.
Relation avec d'autres approches
L'EBMT est l'une des plusieurs approches guidées par les données pour la traduction automatique. Elle diffère de la traduction automatique fondée sur des règles en évitant l'analyse linguistique approfondie et en utilisant plutôt un corpus d'exemples. Elle diffère également de la traduction automatique statistique, qui utilise des modèles probabilistes sur de grands corpus, bien que les deux reposent sur des données bilingues. Dans les années 2010, les modèles basés sur apprentissage profond et transformeurs, tels que ceux utilisés dans les grands modèles de langage, ont largement supplanté l'EBMT dans les applications pratiques. Cependant, l'accent mis par l'EBMT sur l'analogie et la récupération d'exemples reste pertinent, et des plateformes open source comme Cunei ont exploré des approches hybrides combinant l'EBMT avec des méthodes statistiques.