Traducido del inglés

Tacotron 2 es un sistema neuronal de texto a voz desarrollado por Google AI en 2018 que convierte texto en mel-espectrogramas y utiliza un vocoder neuronal para generar formas de onda de voz. Demostró una síntesis de voz altamente natural, pero requirió decenas de horas de datos de entrenamiento para lograr una calidad aceptable.

Tacotron 2 es un sistema de aprendizaje profundo basado en texto a voz desarrollado por Google AI y lanzado en 2018. Marcó un avance significativo en la síntesis neuronal del habla al demostrar que una arquitectura de red neuronal de extremo a extremo podía producir habla con sonido altamente natural a partir de texto escrito. El sistema consta de dos componentes principales: una red recurrente de predicción de características de secuencia a secuencia que genera mel-espectrogramas a partir del texto de entrada, y un vocoder WaveNet modificado que convierte esos espectrogramas en formas de onda de audio crudas. Este enfoque de dos etapas permitió a Tacotron 2 alcanzar una naturalidad casi humana en su salida, aunque requirió una cantidad sustancial de datos de entrenamiento - típicamente decenas de horas de habla grabada - para lograr una calidad aceptable.

El desarrollo de Tacotron 2 se basó en trabajos anteriores en síntesis de habla con aprendizaje profundo. En septiembre de 2016, DeepMind lanzó WaveNet, que demostró por primera vez que los modelos de aprendizaje profundo podían modelar formas de onda crudas y generar habla a partir de características acústicas como espectrogramas o mel-espectrogramas. WaveNet era inicialmente costoso computacionalmente y lento, pero un año después DeepMind presentó Parallel WaveNet, un modelo de producción aproximadamente 1.000 veces más rápido que el original. Tacotron 2 integró estos avances con un modelo de secuencia a secuencia basado en atención, permitiendo al sistema alinear el texto de entrada con las características de habla de salida sin requerir información de alineación explícita.

Arquitectura

La arquitectura de Tacotron 2 es un autoencoder con mecanismos de atención que procesa el texto de entrada carácter por carácter. El codificador convierte la secuencia de caracteres en una representación oculta, que un módulo de atención alinea luego con los marcos del mel-espectrograma de salida. El decodificador genera marcos de mel-espectrograma de forma autorregresiva, prediciendo cada marco basándose en marcos generados previamente y en los estados del codificador atendidos. La función de pérdida para el entrenamiento utiliza típicamente pérdidas L1 (error absoluto medio) o L2 (error cuadrático medio), que imponen restricciones de que las distribuciones de características acústicas de salida deben ser gaussianas o laplacianas. En la práctica, la función de pérdida está diseñada para imponer más penalización en la banda de voz humana, aproximadamente de 300 a 4000 Hz, utilizando una combinación ponderada de pérdidas para la banda humana y otras frecuencias.

Las características acústicas utilizadas por Tacotron 2 son mel-espectrogramas, que capturan la relación tiempo-frecuencia de la señal de habla. Estas características son suficientes para generar salidas inteligibles, a diferencia de los coeficientes cepstrales de frecuencia mel utilizados en el reconocimiento de habla, que reducen demasiada información para fines de síntesis. La forma de onda final es producida por el vocoder WaveNet, que factoriza la probabilidad conjunta de una forma de onda en un producto de probabilidades condicionales, permitiendo la generación de audio de alta calidad.

Requisitos de Datos de Entrenamiento

Uno de los hallazgos clave del desarrollo de Tacotron 2 fue su sensibilidad a la cantidad de datos de entrenamiento. Cuando se entrenaba con decenas de horas de audio, el sistema lograba una síntesis de habla altamente natural. Sin embargo, con conjuntos de datos más pequeños, la calidad de salida se degradaba notablemente. Con aproximadamente 2 horas de habla, Tacotron 2 mantenía habla inteligible pero con naturalidad reducida. Con solo 24 minutos de datos de entrenamiento, el sistema no lograba producir habla inteligible en absoluto. Este requisito de datos contrastaba con sistemas posteriores; en marzo de 2020, el sitio web gratuito de texto a voz 15.ai se lanzó, y su creador afirmó que 15 segundos de datos de entrenamiento eran suficientes para clonar la voz de una persona. Esta afirmación fue corroborada posteriormente por OpenAI en 2024, representando una reducción significativa respecto a los requisitos de Tacotron 2.

Influencia y Sucesores

Las limitaciones de Tacotron 2 en velocidad y eficiencia de datos impulsaron investigaciones posteriores. En 2019, Microsoft Research introdujo FastSpeech, que abordó las limitaciones de velocidad de los modelos autorregresivos como Tacotron 2. FastSpeech utilizó una arquitectura no autorregresiva con una red transformadora feedforward y regulación de longitud, permitiendo la generación de secuencias en paralelo y la predicción de una sola vez de la secuencia completa de mel-espectrogramas. Esto redujo significativamente el tiempo de inferencia mientras mantenía la calidad de audio. El mismo año se lanzó HiFi-GAN, un vocoder basado en redes generativas adversariales que mejoró la eficiencia de generación de formas de onda mientras producía habla de alta fidelidad. En 2020, Glow-TTS introdujo un enfoque basado en flujos que permitía inferencia rápida y transferencia de estilo de voz.

Tacotron 2 también influyó en la investigación sobre adaptación de hablante de cero disparos. En junio de 2018, Google propuso utilizar modelos de verificación de hablante preentrenados como codificadores de hablante para extraer incrustaciones de hablante. Estos codificadores se convirtieron en parte de los modelos neuronales de texto a voz, permitiendo que un solo modelo generara habla con varios estilos y características de hablante sin reentrenamiento para cada hablante.

Legado

Tacotron 2 es ampliamente considerado un modelo emblemático en la historia del texto a voz neuronal. Demostró que los enfoques de aprendizaje profundo de extremo a extremo podían rivalizar con los métodos tradicionales de síntesis concatenativa y paramétrica en naturalidad. Su diseño de dos etapas - generación de características acústicas seguida de vocoder neuronal - se convirtió en un paradigma común en sistemas posteriores. Aunque modelos posteriores mejoraron la velocidad y la eficiencia de datos, las contribuciones de Tacotron 2 al modelado de secuencia a secuencia basado en atención para el habla y su integración con vocoders neuronales siguen siendo influyentes en el campo del aprendizaje automático y la IA generativa.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:text-to-speech·deep-learning·neural-network·google-ai
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial