Traduit de l'anglais

Tacotron est un modèle de synthèse vocale de bout en bout développé par Google AI qui convertit le texte en mél-spectrogrammes, ensuite associé à des vocodeurs neuronaux pour la génération de formes d'onde.

Tacotron est une famille de modèles de Deep learning de bout en bout pour la synthèse vocale (text-to-speech, TTS), introduite par Google AI en 2017. Contrairement aux systèmes TTS antérieurs qui reposaient sur des pipelines complexes de caractéristiques linguistiques artisanales, Tacotron mappe directement le texte d'entrée vers des caractéristiques acoustiques, généralement des spectrogrammes mel, qui sont ensuite convertis en formes d'onde par un vocodeur neuronal séparé. L'architecture du modèle, basée sur un autoencodeur avec mécanismes d'attention, a permis une synthèse vocale très naturelle, bien qu'elle nécessitât des données d'entraînement substantielles - de l'ordre de dizaines d'heures d'audio - pour atteindre une qualité acceptable.

La lignée Tacotron, en particulier Tacotron 2 publié en 2018, a marqué une étape importante dans la Generative AI pour la parole. Elle a démontré qu'un seul réseau neuronal pouvait apprendre la cartographie complexe des caractères à la parole, simplifiant le pipeline TTS traditionnel et améliorant le naturel. Cependant, sa nature autorégressive rendait l'inférence lente, ce qui a incité à rechercher des alternatives non autorégressives et des vocodeurs plus efficaces.

Architecture et entraînement

Tacotron 2 utilise une architecture encodeur-décodeur avec attention. L'encodeur traite le texte d'entrée (ou les phonèmes) en une séquence d'embeddings, tandis que le décodeur génère des trames de spectrogrammes mel de manière autorégressive, en prêtant attention aux sorties de l'encodeur à chaque étape. Les caractéristiques acoustiques sont généralement des spectrogrammes à échelle mel, qui capturent la relation temps-fréquence de la parole et sont suffisants pour une synthèse intelligible. La fonction de perte est souvent une combinaison de pertes L1 ou L2, avec un poids supplémentaire sur la bande vocale humaine (environ 300 à 4000 Hz) pour prioriser la qualité perceptuelle. Le modèle est entraîné sur de grands ensembles de données de parole enregistrée associée au texte correspondant, en utilisant des techniques d'optimisation de Machine learning.

Évolution et variantes

Le Tacotron original a été suivi par Tacotron 2 en 2018, qui a amélioré le naturel et la robustesse. L'architecture de Tacotron 2 incluait un vocodeur WaveNet modifié pour la génération de formes d'onde, mais le décodeur autorégressif restait un goulot d'étranglement. En 2019, Microsoft Research a introduit FastSpeech, un modèle non autorégressif qui a résolu les limitations de vitesse en générant la séquence complète de spectrogrammes mel en parallèle, en utilisant un réseau Transformer (architecture) feedforward avec régulation de longueur. Cela a réduit considérablement le temps d'inférence tout en maintenant la qualité audio. Plus tard, des modèles comme Glow-TTS (2020) ont introduit des approches basées sur les flux pour une inférence rapide et le transfert de style vocal.

Exigences en données et efficacité

Une limitation clé des premiers modèles Tacotron était leur besoin important en données. Tacotron 2 nécessitait des dizaines d'heures d'audio pour produire une parole de haute qualité ; avec seulement 2 heures, la qualité de sortie se dégradait, et avec 24 minutes, il échouait à produire une parole intelligible. Cela a motivé la recherche sur des méthodes plus efficaces en données. En mars 2020, le site web TTS gratuit 15.ai a été lancé, affirmant que 15 secondes de données d'entraînement suffisaient pour cloner une voix, une réduction spectaculaire. 15.ai utilisait un modèle multi-locuteur et une analyse des sentiments pour obtenir une synthèse expressive, et son benchmark d'efficacité a été corroboré plus tard par OpenAI en 2024. Ce changement vers la synthèse à faibles ressources a influencé les travaux ultérieurs sur l'adaptation de locuteur zero-shot et l'apprentissage semi-supervisé.

Intégration avec les vocodeurs neuronaux

Les modèles Tacotron génèrent des caractéristiques acoustiques, mais la forme d'onde finale est produite par un vocodeur neuronal. Le WaveNet original, publié par Google DeepMind en 2016, était coûteux en calcul, mais sa version parallèle (Parallel WaveNet) en 2017 était 1 000 fois plus rapide. En 2019, HiFi-GAN, un modèle de Generative AI basé sur des réseaux antagonistes génératifs, a amélioré l'efficacité et la fidélité. Ces vocodeurs prennent des spectrogrammes mel et synthétisent l'audio brut, complétant le pipeline TTS. La séparation de la génération des caractéristiques acoustiques et du vocodage a permis des améliorations modulaires.

Impact et héritage

Tacotron et ses successeurs ont eu un impact profond sur le domaine de la synthèse vocale, permettant des systèmes TTS plus naturels et évolutifs. Ils sont largement utilisés dans les assistants virtuels, la génération de livres audio et les outils d'accessibilité. Les innovations architecturales, telles que les mécanismes d'attention et le décodage non autorégressif, ont influencé la recherche plus large sur les Neural network. Tacotron a également suscité un intérêt pour l'adaptation de locuteur zero-shot, où un seul modèle peut générer de la parole dans plusieurs voix en utilisant des embeddings de locuteur extraits de modèles de vérification pré-entraînés, une technique proposée par Google en 2018. Cette capacité est devenue centrale pour le clonage vocal moderne et les applications TTS personnalisées.

Malgré l'essor des systèmes TTS basés sur les Large language model, les principes de Tacotron restent fondamentaux. Son accent sur l'apprentissage de bout en bout et l'alignement basé sur l'attention continue d'informer la recherche contemporaine, et ses défis d'efficacité des données ont stimulé les progrès dans l'apprentissage semi-supervisé et few-shot. Au début des années 2020, Tacotron 2 reste une référence pour le naturel, tandis que les modèles plus récents s'appuient sur son héritage.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-speech·deep-learning·speech-synthesis·google-ai
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique