A tradução automática baseada em exemplos (EBMT, na sigla em inglês) é um método de tradução automática que se baseia em um corpus bilíngue de textos paralelos como sua principal base de conhecimento em tempo de execução. É essencialmente uma tradução por analogia e pode ser vista como uma implementação de uma abordagem de raciocínio baseado em casos para o aprendizado de máquina. Diferentemente de sistemas baseados em regras, que exigem análise linguística profunda, a EBMT traduz decompondo uma frase de origem em frases menores, traduzindo essas frases usando exemplos do corpus e, em seguida, compondo os fragmentos traduzidos em uma frase de destino.
A abordagem foi sugerida pela primeira vez por Makoto Nagao em 1984, que argumentou que ela é especialmente adequada para a tradução entre duas línguas muito diferentes, como inglês e japonês. Nesses casos, uma única frase pode mapear para várias frases bem estruturadas no idioma de destino, tornando a análise linguística profunda menos útil. Desde então, a EBMT tem sido explorada como uma alternativa aos métodos estatísticos e baseados em regras, e compartilha o uso de corpora bilíngues com a tradução automática estatística.
Tradução por analogia
O princípio central da EBMT é a tradução por analogia. Essa ideia rejeita a noção de que tradutores humanos realizam uma análise linguística profunda de cada frase. Em vez disso, ela postula que os tradutores decompõem uma frase em frases menores, traduzem cada uma por analogia com traduções encontradas anteriormente e, em seguida, compõem as frases traduzidas em um todo coerente. Na EBMT, esse princípio é codificado por meio dos exemplos de tradução armazenados no corpus de treinamento. O sistema recupera exemplos análogos do corpus para orientar a tradução de novas entradas.
História e desenvolvimento
Makoto Nagao introduziu a EBMT em 1984, destacando seu potencial para pares de idiomas com estruturas muito diferentes, como inglês e japonês. Sua percepção foi que, para tais pares, uma frase pode frequentemente ser renderizada como várias frases bem estruturadas no idioma de destino, tornando a análise linguística profunda menos eficaz do que métodos baseados em exemplos. Nas décadas seguintes, a EBMT foi desenvolvida e refinada, com contribuições de pesquisadores como Michael Carl e Andy Way, que editaram o volume de 2003 Recent Advances in Example-Based Machine Translation. Embora a EBMT tenha sido amplamente ofuscada por abordagens baseadas em redes neurais nos últimos anos, suas ideias sobre o uso de corpora paralelos e analogia continuam a influenciar a pesquisa moderna em tradução automática.
Como a EBMT funciona
Os sistemas de EBMT são treinados em corpora paralelos bilíngues contendo pares de frases, como:
- "How much is that red umbrella?" ↔ "Ano akai kasa wa ikura desu ka."
- "How much is that small camera?" ↔ "Ano chiisai kamera wa ikura desu ka."
A partir de tais pares mínimos, o sistema aprende unidades de tradução: por exemplo, "red umbrella" corresponde a "akai kasa", e "small camera" corresponde a "chiisai kamera". Essas unidades podem ser compostas para produzir traduções novas. Por exemplo, se o sistema já viu frases como "President Kennedy was shot dead during the parade" e "The convict escaped on July 15th", ele pode traduzir "The convict was shot dead during the parade" substituindo as partes apropriadas.
Verbos frasais e fenômenos de sublinguagem
A EBMT é particularmente adequada para fenômenos de sublinguagem, como verbos frasais, que têm significados altamente dependentes do contexto. Verbos frasais em inglês consistem em um verbo seguido por um advérbio ou preposição (a partícula), e seus significados muitas vezes não podem ser derivados das palavras individuais. Por exemplo, o verbo frasal "put on" pode significar "acender" (como em "Ram put on the lights") ou "vestir" (como em "Ram put on a cap"). Em hindustani, esses significados correspondem a verbos diferentes: "jalana" e "pahenna", respectivamente. A EBMT pode lidar com tais ambiguidades recuperando exemplos que correspondem ao contexto, em vez de depender da tradução palavra por palavra.
Relação com outras abordagens
A EBMT é uma das várias abordagens orientadas por dados para tradução automática. Ela difere da tradução automática baseada em regras por evitar análise linguística profunda e, em vez disso, usar um corpus de exemplos. Ela também difere da tradução automática estatística, que usa modelos probabilísticos sobre grandes corpora, embora ambas dependam de dados bilíngues. Na década de 2010, modelos baseados em aprendizado profundo e transformadores, como os usados em grandes modelos de linguagem, superaram amplamente a EBMT em aplicações práticas. No entanto, a ênfase da EBMT na analogia e na recuperação de exemplos permanece relevante, e plataformas de código aberto como Cunei exploraram abordagens híbridas que combinam EBMT com métodos estatísticos.