Traducción automática neuronal de Google

Traducido del inglés

Google Neural Machine Translation (GNMT) fue un sistema de traducción automática neuronal introducido por Google en noviembre de 2016, que utilizaba aprendizaje profundo para mejorar la fluidez y precisión de la traducción en Google Translate. Fue retirado gradualmente hacia 2020 en favor de un sistema basado en transformadores.

Google Neural Machine Translation (GNMT) fue un sistema de traducción automática neuronal desarrollado por Google e introducido en noviembre de 2016. Utilizaba una red neuronal artificial para aumentar la fluidez y la precisión en Google Translate, reemplazando los métodos anteriores de traducción automática estadística. El sistema fue diseñado para traducir oraciones completas a la vez, aprovechando el aprendizaje profundo para mejorar la calidad de la traducción. Para 2020, GNMT había sido reemplazado por un sistema de aprendizaje profundo más nuevo basado en un codificador Transformer y un decodificador RNN.

La arquitectura de GNMT constaba de dos bloques principales: un codificador y un decodificador, ambos basados en redes LSTM (Long Short-Term Memory). Cada bloque tenía 8 capas con 1024 unidades por capa, y un mecanismo de atención de avance simple de 1 capa y 1024 de ancho los conectaba. El número total de parámetros se informó de diversas maneras: más de 160 millones, aproximadamente 210 millones, 278 millones o 380 millones. El sistema utilizaba un tokenizador WordPiece y una estrategia de decodificación por búsqueda de haz, y se ejecutaba en Unidades de Procesamiento de Tensores (TPU).

Historia

El proyecto Google Brain, que sentó las bases para GNMT, se estableció en 2011 en el laboratorio de investigación Google X por el miembro de Google Jeff Dean, el investigador de Google Greg Corrado y el profesor de la Universidad de Stanford Andrew Ng. En noviembre de 2016, se introdujo GNMT, y Google Translate comenzó a utilizar la traducción automática neuronal en lugar de sus métodos estadísticos anteriores, que habían estado en uso desde octubre de 2007.

Entrenar GNMT fue un esfuerzo computacional significativo. Según una estimación de 2018 de OpenAI, requirió del orden de 79 petaFLOP-días (o 7e21 FLOPs) de cómputo, lo que era 1,5 órdenes de magnitud mayor que el modelo Seq2seq de 2014, pero aproximadamente 2 veces menor que GPT-J-6B en 2021.

El nuevo motor se habilitó primero para ocho idiomas: inglés y francés, alemán, español, portugués, chino, japonés, coreano y turco. En marzo de 2017, se añadió soporte para ruso, hindi, vietnamita y tailandés. El hebreo y el árabe se añadieron más tarde ese mes con la ayuda de la Comunidad de Google Translate. A mediados de abril de 2017, se admitieron el neerlandés y otros idiomas europeos relacionados con el inglés. A finales de abril de 2017, se añadieron nueve idiomas indios: hindi, bengalí, maratí, guyaratí, punyabí, tamil, telugú, malayalam y canarés.

Para 2020, Google había eliminado gradualmente GNMT, reemplazándolo por un sistema de red neuronal basado en transformadores.

Tecnología

GNMT utilizaba un método de traducción automática basado en ejemplos, aprendiendo de millones de ejemplos de traducción de idiomas. La arquitectura del sistema se probó por primera vez en más de cien idiomas compatibles con Google Translate. Con un marco de trabajo de extremo a extremo a gran escala, el sistema aprendió con el tiempo a crear traducciones mejores y más naturales. GNMT intentaba traducir oraciones completas a la vez, en lugar de pieza por pieza, y podía realizar traducción automática interlingüe codificando la semántica de la oración, en lugar de memorizar traducciones frase por frase.

La red neuronal se entrenó utilizando técnicas de aprendizaje profundo, y su diseño se basó en conocimientos de psicología y lingüística para encontrar similitudes entre idiomas. No creaba una interlingua universal, sino que apuntaba a codificar el significado de una manera independiente del idioma.

Evaluación

GNMT representó una mejora con respecto al antiguo Google Translate, ya que podía manejar la "traducción de cero disparos", traduciendo directamente un idioma a otro sin pasar por el inglés. Por ejemplo, si se entrenaba con pares japonés-inglés y coreano-inglés, podía realizar la traducción japonés-coreano. El sistema parecía aprender una representación intermedia independiente del idioma, lo que permitía esta capacidad. Anteriormente, Google Translate primero traducía el idioma de origen al inglés y luego al idioma de destino.

Un estudio de julio de 2019 en Annals of Internal Medicine encontró que "Google Translate es una herramienta viable y precisa para traducir ensayos no escritos en inglés". Solo hubo un desacuerdo entre los revisores que leyeron ensayos traducidos automáticamente debido a un error de traducción. Dado que muchos estudios médicos se excluyen de las revisiones sistemáticas debido a las barreras del idioma, GNMT tenía el potencial de reducir el sesgo y mejorar la precisión en dichas revisiones.

Legado

GNMT fue un hito en la aplicación del aprendizaje profundo a la traducción automática, demostrando la efectividad de los enfoques basados en redes neuronales sobre los métodos estadísticos tradicionales. Su arquitectura influyó en desarrollos posteriores en los modelos transformadores, que más tarde se convirtieron en fundamentales para los grandes modelos de lenguaje. El uso de unidades de procesamiento de tensores por parte del sistema también destacó la importancia del hardware especializado para cargas de trabajo de IA. Para 2020, el cambio a modelos basados en transformadores marcó la siguiente evolución en la tecnología de traducción, basándose en el trabajo fundacional establecido por GNMT.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-translation·neural-networks·google·deep-learning
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial