Traduzido do inglês

Tacotron 2 é um sistema neural de texto para fala desenvolvido pelo Google AI em 2018 que converte texto em mel-espectrogramas e usa um vocoder neural para gerar formas de onda de fala. Ele demonstrou síntese de fala altamente natural, mas exigia dezenas de horas de dados de treinamento para qualidade aceitável.

Tacotron 2 é um sistema de aprendizado profundo de texto-para-fala desenvolvido pela Google AI e lançado em 2018. Ele marcou um avanço significativo na síntese neural de fala ao demonstrar que uma arquitetura de rede neural de ponta a ponta poderia produzir fala altamente natural a partir de texto escrito. O sistema consiste em dois componentes principais: uma rede recorrente de previsão de características do tipo sequência a sequência que gera mel-espectrogramas a partir do texto de entrada, e um vocoder WaveNet modificado que converte esses espectrogramas em formas de onda de áudio brutas. Essa abordagem em dois estágios permitiu que o Tacotron 2 alcançasse naturalidade quase humana em sua saída, embora exigisse dados de treinamento substanciais - tipicamente dezenas de horas de fala gravada - para atingir qualidade aceitável.

O desenvolvimento do Tacotron 2 baseou-se em trabalhos anteriores em síntese de fala com aprendizado profundo. Em setembro de 2016, a DeepMind lançou o WaveNet, que primeiro demonstrou que modelos de aprendizado profundo poderiam modelar formas de onda brutas e gerar fala a partir de características acústicas como espectrogramas ou mel-espectrogramas. O WaveNet era inicialmente computacionalmente caro e lento, mas um ano depois a DeepMind revelou o Parallel WaveNet, um modelo de produção aproximadamente 1.000 vezes mais rápido que o original. O Tacotron 2 integrou esses avanços com um modelo de sequência a sequência baseado em atenção, permitindo que o sistema alinhasse o texto de entrada com as características de fala de saída sem exigir informações explícitas de alinhamento.

Arquitetura

A arquitetura do Tacotron 2 é um autoencoder com mecanismos de atenção que processa o texto de entrada caractere por caractere. O codificador converte a sequência de caracteres em uma representação oculta, que um módulo de atenção então alinha com os quadros do mel-espectrograma de saída. O decodificador gera os quadros do mel-espectrograma de forma autorregressiva, prevendo cada quadro com base nos quadros gerados anteriormente e nos estados do codificador atendidos. A função de perda para treinamento tipicamente usa perdas L1 (erro absoluto médio) ou L2 (erro quadrático médio), que impõem restrições de que as distribuições das características acústicas de saída devem ser gaussianas ou laplacianas. Na prática, a função de perda é projetada para colocar mais penalidade na banda de voz humana, aproximadamente de 300 a 4000 Hz, usando uma combinação ponderada de perdas para a banda humana e outras frequências.

As características acústicas usadas pelo Tacotron 2 são mel-espectrogramas, que capturam a relação tempo-frequência do sinal de fala. Essas características são suficientes para gerar saídas inteligíveis, ao contrário dos coeficientes cepstrais de frequência mel usados no reconhecimento de fala, que reduzem informação demais para fins de síntese. A forma de onda final é produzida pelo vocoder WaveNet, que fatora a probabilidade conjunta de uma forma de onda em um produto de probabilidades condicionais, permitindo a geração de áudio de alta qualidade.

Requisitos de Dados de Treinamento

Uma das principais descobertas do desenvolvimento do Tacotron 2 foi sua sensibilidade à quantidade de dados de treinamento. Quando treinado com dezenas de horas de áudio, o sistema alcançou síntese de fala altamente natural. No entanto, com conjuntos de dados menores, a qualidade da saída degradava visivelmente. Com aproximadamente 2 horas de fala, o Tacotron 2 mantinha fala inteligível, mas com naturalidade reduzida. Com apenas 24 minutos de dados de treinamento, o sistema falhava em produzir fala inteligível por completo. Esse requisito de dados contrastava com sistemas posteriores; em março de 2020, o site gratuito de texto-para-fala 15.ai foi lançado, e seu criador afirmou que 15 segundos de dados de treinamento eram suficientes para clonar a voz de uma pessoa. Essa afirmação foi posteriormente corroborada pela OpenAI em 2024, representando uma redução significativa em relação aos requisitos do Tacotron 2.

Influência e Sucessores

As limitações do Tacotron 2 em velocidade e eficiência de dados estimularam pesquisas subsequentes. Em 2019, a Microsoft Research introduziu o FastSpeech, que abordou as limitações de velocidade dos modelos autorregressivos como o Tacotron 2. O FastSpeech usava uma arquitetura não autorregressiva com uma rede transformer feedforward e regulação de comprimento, permitindo geração paralela de sequências e previsão em uma única etapa da sequência completa de mel-espectrogramas. Isso reduziu significativamente o tempo de inferência enquanto mantinha a qualidade do áudio. No mesmo ano, foi lançado o HiFi-GAN, um vocoder baseado em redes adversariais generativas que melhorou a eficiência da geração de formas de onda enquanto produzia fala de alta fidelidade. Em 2020, o Glow-TTS introduziu uma abordagem baseada em fluxos permitindo inferência rápida e transferência de estilo de voz.

O Tacotron 2 também influenciou a pesquisa em adaptação de locutor com zero disparos. Em junho de 2018, a Google propôs o uso de modelos de verificação de locutor pré-treinados como codificadores de locutor para extrair embeddings de locutor. Esses codificadores tornaram-se parte de modelos neurais de texto-para-fala, permitindo que um único modelo gerasse fala com vários estilos e características de locutor sem retreinamento para cada locutor.

Legado

O Tacotron 2 é amplamente considerado um modelo marcante na história do texto-para-fala neural. Ele demonstrou que abordagens de aprendizado profundo de ponta a ponta poderiam rivalizar com métodos tradicionais de síntese concatenativa e paramétrica em naturalidade. Seu design em dois estágios - geração de características acústicas seguida de vocodificação neural - tornou-se um paradigma comum em sistemas subsequentes. Embora modelos posteriores tenham melhorado velocidade e eficiência de dados, as contribuições do Tacotron 2 para modelagem de sequência a sequência baseada em atenção para fala e sua integração com vocoders neurais permanecem influentes no campo de aprendizado de máquina e IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:text-to-speech·deep-learning·neural-network·google-ai
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico