Traduit de l'anglais

FastSpeech est un modèle de synthèse vocale à anticipation introduit par Microsoft Research en 2019, qui permet la génération parallèle de mél-spectrogrammes, accélérant considérablement l'inférence par rapport aux modèles autorégressifs comme Tacotron 2 tout en préservant le naturel.

FastSpeech est un modèle de synthèse vocale basé sur l'apprentissage profond, développé par Microsoft Research en 2019. Il utilise une architecture de transformateur non autorégressive et à anticipation pour convertir directement le texte d'entrée en mél-spectrogrammes en parallèle, plutôt que de générer chaque trame séquentiellement comme dans des modèles antérieurs tels que Tacotron 2. Ce décodage parallèle permet une inférence nettement plus rapide, le rendant adapté aux applications de synthèse vocale en temps réel et à grande échelle. Le modèle emploie une régulation de longueur pour aligner les plongements de texte avec les trames cibles du spectrogramme et utilise un vocodeur séparé, tel que HiFi-GAN, pour convertir les spectrogrammes en formes d'onde audibles. FastSpeech représente une étape marquante dans la synthèse vocale basée sur Deep learning, en résolvant le goulot d'étranglement de vitesse des systèmes autorégressifs précédents tout en conservant une qualité de sortie naturelle. Il a été largement adopté et étendu dans les recherches ultérieures, y compris des variantes comme FastSpeech 2 et FastSpeech 2s, qui ont amélioré la robustesse et simplifié le pipeline d'entraînement en prédisant directement les durées et en éliminant le besoin de modèles d'alignement externes. La conception de FastSpeech a influencé de nombreux systèmes de synthèse vocale ultérieurs dans des contextes académiques et commerciaux, car elle a démontré que le décodage parallèle peut atteindre une qualité comparable aux modèles autorégressifs sans le coût computationnel. Son architecture s'appuie sur le cadre du Transformer (architecture), exploitant les mécanismes d'attention pour modéliser la relation entre le texte et les caractéristiques acoustiques. Le modèle opère dans le domaine plus large de la Generative AI, où les réseaux neuronaux apprennent à produire des données nouvelles - en l'occurrence, de la parole synthétique. L'entraînement de FastSpeech utilise généralement des ensembles de données appariées texte-audio et emploie des fonctions de perte qui mettent l'accent sur la qualité perceptuelle dans la plage de fréquences de la voix humaine, approximativement de 300 à 4000 Hz. L'approche est fondée sur des travaux antérieurs en synthèse vocale par apprentissage profond, y compris WaveNet de Google DeepMind et Tacotron 2 de Google AI, qui ont démontré que les réseaux neuronaux pouvaient modéliser efficacement les formes d'onde brutes et les mél-spectrogrammes, mais à un coût computationnel élevé. FastSpeech, en revanche, supprime la dépendance autorégressive, permettant de calculer toutes les trames de sortie simultanément. Ce choix architectural réduit le temps d'inférence de plus d'un ordre de grandeur en pratique, permettant un déploiement sur du matériel grand public et dans des applications interactives. Le modèle a influencé les recherches ultérieures sur la synthèse vocale non autorégressive et la génération de séquences parallèles, et il reste un point de référence fondamental pour les vocodeurs neuronaux et les modèles acoustiques modernes. Ses contributions sont particulièrement pertinentes pour le domaine plus large de l'Artificial intelligence, où les architectures neuronales efficaces pour les tâches de séquence à séquence constituent un domaine clé d'investigation. FastSpeech a été développé par une équipe de Microsoft Research, comprenant des auteurs tels que Yi Ren, Yangjun Ruan et Xu Tan, et a été présenté lors d'une conférence majeure sur l'apprentissage automatique en 2019. Le code source et les modèles pré-entraînés ont été rendus publics, facilitant une adoption large et une innovation supplémentaire dans la communauté. En date de 2019, la conception et la méthodologie d'entraînement du modèle ont été intégrées dans divers systèmes de synthèse vocale commerciaux et open source, démontrant son impact pratique. L'approche met également en évidence le passage vers une génération parallèle et non autorégressive dans l'apprentissage profond, une tendance observée dans d'autres domaines tels que le Machine learning et le traitement du langage naturel. Le régulateur de longueur de FastSpeech prédit la durée de chaque jeton d'entrée, qui est ensuite utilisée pour étendre les sorties de l'encodeur afin de correspondre à la longueur cible du spectrogramme, permettant la génération parallèle de la séquence complète. Ce mécanisme remplace l'attention récursive utilisée dans les modèles autorégressifs par une stratégie d'alignement plus efficace et déterministe. Pendant l'entraînement, FastSpeech utilise une approche enseignant-élève, où un modèle enseignant autorégressif fournit des alignements d'attention et des informations de durée, que le modèle élève FastSpeech apprend à reproduire sans dépendances séquentielles. Cette stratégie d'entraînement garantit que le modèle capture des alignements précis tout en permettant un décodage parallèle au moment de l'inférence. FastSpeech est ainsi un exemple pivot de la manière dont l'innovation architecturale peut surmonter les limitations computationnelles dans les systèmes de Machine learning, ouvrant la voie à des technologies de synthèse vocale plus efficaces et accessibles.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:text-to-speech·deep-learning·speech-synthesis·transformer
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique