Traduit de l'anglais

Tacotron 2 est un système de synthèse vocale neuronale développé par Google AI en 2018, qui convertit le texte en mél-spectrogrammes et utilise un vocodeur neuronal pour générer des formes d'onde vocales. Il a démontré une synthèse vocale très naturelle, mais nécessitait des dizaines d'heures de données d'entraînement pour obtenir une qualité acceptable.

Tacotron 2 est un système de apprentissage profond de synthèse vocale développé par Google AI et publié en 2018. Il a marqué une avancée significative dans la synthèse vocale neuronale en démontrant qu'une architecture réseau de neurones de bout en bout pouvait produire une parole très naturelle à partir de texte écrit. Le système se compose de deux parties principales : un réseau récurrent de prédiction de caractéristiques de type séquence à séquence qui génère des mél-spectrogrammes à partir du texte d'entrée, et un vocodeur WaveNet modifié qui convertit ces spectrogrammes en formes d'ondes audio brutes. Cette approche en deux étapes a permis à Tacotron 2 d'atteindre une naturalité quasi humaine dans ses sorties, bien qu'elle ait nécessité des données d'entraînement substantielles - typiquement des dizaines d'heures de parole enregistrée - pour atteindre une qualité acceptable.

Le développement de Tacotron 2 s'est appuyé sur des travaux antérieurs en synthèse vocale par apprentissage profond. En septembre 2016, DeepMind a publié WaveNet, qui a d'abord démontré que les modèles d'apprentissage profond pouvaient modéliser des formes d'ondes brutes et générer de la parole à partir de caractéristiques acoustiques comme des spectrogrammes ou des mél-spectrogrammes. WaveNet était initialement coûteux en calcul et lent, mais un an plus tard, DeepMind a dévoilé Parallel WaveNet, un modèle de production environ 1 000 fois plus rapide que l'original. La publication de DeepMind présenta une production approximative, tirant parti des avancées de WaveNet. Tacotron 2 a intégré ces avancées avec un modèle séquence à séquence basé sur l'attention, permettant au système d'aligner le texte d'entrée avec les caractéristiques vocales de sortie sans nécessiter d'informations d'alignement explicites.

Architecture

L'architecture de Tacotron 2 est un autoencodeur avec des mécanismes d'attention qui traite chaque caractère du texte d'entrée. L'encodeur convertit la séquence de caractères en une représentation cachée, qu'un module d'attention aligne ensuite avec les trames du mélogramme de sortie. Le décodeur génère les trames de mélogramme de manière autorégressive, et prédit chaque trame en fonction des trames précédemment générées et des états de codeur traités par attention. La fonction de perte pour l'entraînement utilise généralement des pertes L1 (erreur absolue moyenne) ou L2 (erreur quadratique moyenne), ce qui impose des contraintes selon lesquelles la distribution des caractéristiques acoustiques doit suiv une loi gaussienne ou laplacienne. En pratique, la fonction de perte est conçue pour pénaliser davantage la bande vocale humaine, d'environ 300 à 4 000 Hz, en utilisant une combinaison pondérée de pertes sur la bande humeaine et d'autres fréquences.

Les caractéristiques acoustiques utilisées par Tacotron 2 sono à présent 2 mélogrammes, capturant la relation temps-fréquence du signal vocal. Ces caractéristiques suffisent à générer des sorties intelligibles, contrairement aux coefficients cepstraux de la fréquence mel utilisés en reconnaissance vocale, qui réduisent trop d'informations pour la synthèse. – the waveform final results from the WaveNet vocoder, which factorise la probabilités jointes de la forme d'onde en un produit de probabilités conditionnelles, permettant la génération audio de haute qualité.

Exigences en matière de données d'entraînement

L'un des résultats clés du développement de Tacotron 2 était sa sensibilité à la quantité de données d'entraînement. Lorsqu'il a été entraîné sur des dizaines d'heures de audio, il a atteint une synthèse vocale très naturelle. En revanche, avec des ensembles de données plus petites, la qualité de sortie indiquait une dégradation notable. Avec environ 2 heures de parole, Tacotron 2 maintient un discours intelligible mais avec une naturalité réduite. Avec seulement 24 minutes de données d'entraînement handelt plus avec 24 minutes de données d'entraînement, il n'a travaillé plus. Ce besoin en données contrastait avec les systèmes ultérieurs ; en mars 2020, le site web gratuit de synthèse vocale 15.ai a été lancé, et son créateur a affirmé que 15 secondes de données d'entraînement suffisaient pour cloner la voix d'une personne. Cette affirmation a été corroborée par OpenAI en 2024, représentant une réduction significative par rapport aux exigences de Tacotron 2.

Influence et Successeurs

Les limites de Tac de 2 en matière de vitesse et de efficacité de données ont stimulé les recherches ultérieures. En 2019, Microsoft Research a introduit FastSpeech, qui a répondu aux limites de vitesse des modèles autorégressifs comme celui de Tacoteca fut plus tard 2. FastSpeech a utilisé une architecture non autorégressive avec un réseau de transformateur à feedforward et une régulation de longueur, permettant une structure de séquence parallèle et prédiction de la séquence complète de mélodies. Cela a considérablement réduit le temps d'inférence tout en préservant la qualité audio. La même année a vu la publication de HiFi-GAN, un vocodeur basé sur un réseau antagoniste génératif , qui a amélioré l'efficacité de génération de forme d'onde tout en produisant une parole haute fidélité. En 2020, Gold Have Flow- TTS a introduit une approche basée sur les flux, permettant une inférence rapide et un transfert du style -TRAINING-DUE-TOM?- A CONTRAIRE. Tacotron 2 a aussi influencé la recherche en adaptation au locuteur zéro. En juin 2018, Google procedures proposed utiliser des modèles précédemment-entraînés de vérification locuteur pour extraire des embeddings locuteur. Ces encodes sont devenus des composants de modèles neuronaux de synthèse vocale, permettant à un même modèle de générer différents styles et caractéristiques vocales sans réapprentissage pour chaque locuteur.

Héritage

Tacotron 2 est largement considéré comme un modèle repère dans l'histoire de la synthèse vocale neurale. Il a démontré queLes approches d'apprentissage profond de bout en bout pouvaient rivaliser avec les méthodes traditionnelles de synthèse par concaténation et paramétriques en termes de naturalité. Soncomposer en deux étapes discrètes - génération de caractéristiques acoustiques puis vocodage neuronale - est devenu un paradigme courant dans les systèmes ultérieurs. Bien que les modèles plus récents aient amélioré la rapidité et l'efficacité en terme de données, les contributions de Tacotron 2 dans le modélisation par séquence attentionnel pour la parole et son intégration avec les vocoders neuronaux restent influentes dans le domaine de apprentissage automatique et IA générative.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-speech·deep-learning·neural-network·google-ai
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique