Traduction automatique

Traduit de l'anglais

La traduction automatique est l'utilisation de logiciels pour traduire automatiquement un texte ou un discours d'une langue à une autre, évoluant des systèmes à base de règles aux méthodes statistiques, jusqu'à la traduction automatique neuronale moderne.

La traduction automatique, ou TA, est l'utilisation de logiciels pour traduire automatiquement un texte ou un discours d'une langue naturelle à une autre. C'est l'un des objectifs les plus anciens de l'intelligence artificielle et du traitement du langage naturel, et son histoire suit de près l'évolution plus large des méthodes d'IA, des règles symboliques aux statistiques en passant par les réseaux neuronaux.

Histoire ancienne

La recherche en traduction automatique a véritablement commencé avec l'expérience Georgetown-IBM en 1954, une démonstration qui traduisait automatiquement un petit ensemble de phrases russes en anglais et s'accompagnait de prédictions optimistes selon lesquelles la traduction entièrement automatique n'était qu'à quelques années. Les progrès se sont révélés bien plus lents que prévu ; le rapport ALPAC de 1966 aux États-Unis a conclu que la traduction automatique avait fait peu de progrès pratiques par rapport à la traduction humaine et a recommandé de réduire le financement, contribuant ainsi à l'hiver de l'IA de cette période. Les décennies suivantes ont produit des systèmes à base de règles qui encodaient manuellement des règles grammaticales et lexicales, obtenant des résultats utilisables mais artificiels pour les paires de langues bien dotées en ressources.

Traduction automatique statistique

À partir de la fin des années 1980 et en mûrissant au cours des années 1990 et 2000, la traduction automatique statistique a remplacé les règles écrites à la main par des modèles entraînés sur de grands corpus bilingues, apprenant les probabilités de traduction directement à partir des données plutôt que de la théorie linguistique. Cette approche s'est étendue plus facilement à différentes paires de langues et ensembles de données, mais produisait souvent des sorties grammaticalement maladroites, car elle modélisait la traduction par morceaux plutôt que comme une phrase cohérente.

Traduction automatique neuronale

Le passage à la traduction automatique neuronale au milieu des années 2010 a marqué une autre amélioration majeure de la qualité. Les premiers systèmes neuronaux utilisaient des architectures Seq2seq, un réseau neuronal récurrent ou LSTM encodeur qui compressait une phrase source en un vecteur et un décodeur qui générait la traduction, affiné par l'ajout d'un mécanisme d'attention permettant au décodeur de se concentrer sur les mots sources pertinents à chaque étape plutôt que de s'appuyer sur un résumé fixe unique. Google a basculé son système de traduction de production vers une architecture neuronale en 2016, rapportant des gains de qualité substantiels. L'architecture Transformer (architecture) de 2017 a encore amélioré à la fois la qualité et l'efficacité de l'entraînement et est devenue l'architecture standard pour les systèmes de traduction.

L'ère des grands modèles de langage

Depuis le début des années 2020, les grands modèles de langage généralistes tels que GPT-4 et Claude (AI model family) sont de plus en plus utilisés pour les tâches de traduction, égalant ou dépassant souvent les systèmes de traduction dédiés sur de nombreuses paires de langues, en particulier pour les textes nécessitant un jugement contextuel ou idiomatique plutôt qu'un rendu littéral. Cette convergence a brouillé la frontière entre la traduction automatique en tant que catégorie de produit distincte et la traduction comme une capacité parmi d'autres au sein d'un modèle généraliste, bien que les systèmes dédiés conservent des avantages en termes de latence, de coût et de prise en charge des langues très peu dotées en ressources.

Applications et limites

La traduction automatique est intégrée dans les navigateurs web, les applications de messagerie, les logiciels d'entreprise et les outils de communication internationale, et elle a considérablement réduit le coût de l'accès à l'information multilingue. Elle continue de rencontrer des difficultés avec les langues peu dotées en ressources qui manquent de grands corpus d'entraînement, les expressions idiomatiques et culturellement spécifiques, et la cohérence sur de longs documents, et les erreurs peuvent avoir des conséquences réelles dans des contextes juridiques, médicaux ou diplomatiques, une préoccupation constante dans le domaine appliqué de l'éthique de l'IA.

Catégories:natural-language-processing·history-of-ai·industry
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique