WaveNet est un réseau de neurones profond destiné à générer de l'audio brut. Il a été créé par des chercheurs de l'entreprise londonienne d'intelligence artificielle DeepMind. La technique, décrite dans un article publié en septembre 2016, est capable de générer des voix humaines au son relativement réaliste en modélisant directement les formes d'onde à l'aide d'une méthode de réseau neuronal entraînée sur des enregistrements de parole réelle. Des tests en anglais américain et en mandarin ont apparemment montré que le système surpasse les meilleurs systèmes de synthèse vocale (TTS) existants de Google, bien qu'en 2016, sa synthèse de la parole à partir de texte soit encore moins convaincante que la parole humaine réelle. La capacité de WaveNet à générer des formes d'onde brutes signifie qu'il peut modéliser tout type d'audio, y compris la musique.
Historique
Générer de la parole à partir de texte est une tâche de plus en plus courante grâce à la popularité de logiciels tels que Siri d'Apple, Cortana de Microsoft, Amazon Alexa et l'Assistant Google. La plupart de ces systèmes utilisent une variante d'une technique qui consiste à concaténer des fragments sonores pour former des sons et des mots reconnaissables. La plus courante est appelée TTS par concaténation. Elle repose sur une vaste bibliothèque de fragments de parole, enregistrés à partir d'un seul locuteur, qui sont ensuite concaténés pour produire des mots et des sons complets. Le résultat semble peu naturel, avec un rythme et un ton étranges. La dépendance à une bibliothèque enregistrée rend également difficile la modification ou le changement de la voix.
Une autre technique, connue sous le nom de TTS paramétrique, utilise des modèles mathématiques pour recréer des sons qui sont ensuite assemblés en mots et en phrases. Les informations nécessaires pour générer les sons sont stockées dans les paramètres du modèle. Les caractéristiques de la parole de sortie sont contrôlées via les entrées du modèle, tandis que la parole est généralement créée à l'aide d'un synthétiseur vocal appelé vocodeur. Cela peut également produire un audio au son peu naturel.
Conception et recherche en cours
Contexte
WaveNet est un type de réseau neuronal à propagation avant connu sous le nom de réseau neuronal convolutif profond (CNN). Dans WaveNet, le CNN prend un signal brut en entrée et synthétise une sortie un échantillon à la fois. Il le fait en échantillonnant à partir d'une distribution softmax (c'est-à-dire catégorielle) d'une valeur de signal encodée à l'aide d'une transformation de compression μ-law et quantifiée en 256 valeurs possibles. Cette approche est ancrée dans les principes du Deep learning, où le réseau apprend des représentations hiérarchiques des données d'entrée.
Concept initial et résultats
Selon l'article de recherche original de DeepMind de septembre 2016 intitulé WaveNet: A Generative Model for Raw Audio, le réseau a été alimenté avec des formes d'onde réelles de parole en anglais et en mandarin. Lorsque celles-ci traversent le réseau, il apprend un ensemble de règles pour décrire comment la forme d'onde audio évolue dans le temps. Le réseau entraîné peut ensuite être utilisé pour créer de nouvelles formes d'onde ressemblant à de la parole à 16 000 échantillons par seconde. Ces formes d'onde incluent des respirations réalistes et des claquements de lèvres - mais ne se conforment à aucune langue.
WaveNet est capable de modéliser avec précision différentes voix, l'accent et le ton de l'entrée étant corrélés à la sortie. Par exemple, s'il est entraîné avec de l'allemand, il produit de la parole allemande. Cette capacité signifie également que si WaveNet est alimenté avec d'autres entrées - comme de la musique - sa sortie sera musicale. Au moment de sa sortie, DeepMind a montré que WaveNet pouvait produire des formes d'onde ressemblant à de la musique classique. Cette polyvalence souligne son potentiel au-delà des applications traditionnelles de Machine learning dans la parole.
Échange de contenu (voix)
Selon l'article de juin 2018 intitulé Disentangled Sequential Autoencoder, DeepMind a utilisé avec succès WaveNet pour l'échange de contenu audio et vocal : le réseau peut remplacer la voix d'un enregistrement audio par une autre voix préexistante tout en conservant le texte et d'autres caractéristiques de l'enregistrement original. « Nous expérimentons également sur des données de séquences audio. Notre représentation désentrelacée nous permet de convertir les identités des locuteurs les unes dans les autres tout en conditionnant sur le contenu de la parole. » (p. 5) « Pour l'audio, cela nous permet de convertir un locuteur masculin en locuteur féminin et vice versa [...] » (p. 1). Selon l'article, un minimum de deux chiffres d'heures (environ 50 heures) d'enregistrements de parole préexistants des voix source et cible doit être fourni à WaveNet pour que le programme apprenne leurs caractéristiques individuelles avant de pouvoir effectuer la conversion d'une voix à une autre avec une qualité satisfaisante. Les auteurs soulignent que « [u]n avantage du modèle est qu'il sépare les caractéristiques dynamiques des caractéristiques statiques [...] » (p. 8), c'est-à-dire que WaveNet est capable de distinguer, d'une part, le texte parlé et les modes de livraison (modulation, vitesse, hauteur, humeur, etc.) à maintenir lors de la conversion d'une voix à une autre, et, d'autre part, les caractéristiques de base des voix source et cible qu'il doit échanger.
L'article de suivi de janvier 2019 intitulé Unsupervised speech representation learning using WaveNet autoencoders détaille une méthode pour améliorer avec succès la reconnaissance automatique et la discrimination appropriées entre les caractéristiques dynamiques et statiques pour l'« échange de contenu », notamment en échangeant les voix sur des enregistrements audio existants, afin de le rendre plus fiable. Un autre article de suivi, Sample Efficient Adaptive Text-to-Speech, daté de septembre 2018 (dernière révision en janvier 2019), indique que DeepMind a réussi à réduire la quantité minimale d'enregistrements réels nécessaires pour échantillonner une voix existante via WaveNet à « seulement quelques minutes de données audio » tout en maintenant des résultats de haute qualité.
Sa capacité à cloner des voix a soulevé des préoccupations éthiques concernant la capacité de WaveNet à imiter les voix de personnes vivantes et décédées. Selon un article de la BBC de 2016, les entreprises travaillant sur des technologies similaires de clonage vocal (comme Adobe Voco) ont l'intention d'insérer des filigranes inaudibles pour les humains afin de prévenir la contrefaçon, tout en maintenant que le clonage vocal satisfaisant, par exemple, les besoins de l'industrie du divertissement serait d'une complexité bien moindre et utiliserait des méthodes différentes de celles nécessaires pour tromper les méthodes de preuve médico-légale et les dispositifs d'identification électronique, de sorte que les voix naturelles et les voix clonées à des fins de divertissement pourraient encore être facilement distinguées par une analyse technologique.
Applications
Au moment de sa sortie, DeepMind a déclaré que WaveNet nécessitait trop de puissance de calcul pour être utilisé dans des applications réelles. En octobre 2017, Google a annoncé une amélioration des performances de 1 000 fois ainsi qu'une meilleure qualité vocale. WaveNet a ensuite été utilisé pour générer les voix de l'Assistant Google en anglais américain et en japonais sur toutes les plateformes Google. En novembre 2017, les chercheurs de DeepMind ont publié un article de recherche détaillant une méthode proposée pour « générer des échantillons de parole haute fidélité à plus de 20 fois plus rapide que le temps réel », appelée « distillation de densité de probabilité ». Lors de la conférence annuelle des développeurs I/O en mai 2018, il a été annoncé que de nouvelles voix de l'Assistant Google étaient disponibles et rendues possibles par WaveNet ; WaveNet a considérablement réduit le nombre d'enregistrements audio nécessaires pour créer un modèle vocal en modélisant l'audio brut des échantillons du comédien. Cette avancée a positionné WaveNet comme une innovation clé dans le Generative AI pour l'audio, influençant les travaux ultérieurs sur la synthèse basée sur les Neural network.