Traducido del inglés

WaveNet es una red neuronal profunda desarrollada por DeepMind para generar formas de onda de audio crudas, presentada en septiembre de 2016. Modela el audio directamente, permitiendo una síntesis de voz realista y generación de música, y fue posteriormente utilizada en las voces de Google Assistant.

WaveNet es una red neuronal profunda diseñada para generar audio crudo. Fue creada por investigadores de la empresa de inteligencia artificial con sede en Londres DeepMind. La técnica, descrita en un artículo en septiembre de 2016, es capaz de generar voces humanas relativamente realistas modelando directamente las formas de onda mediante un método de red neuronal entrenado con grabaciones de habla real. Las pruebas con inglés estadounidense y mandarín mostraron, según se informó, que el sistema supera a los mejores sistemas de texto a voz (TTS) existentes de Google, aunque, a partir de 2016, su síntesis de texto a voz aún era menos convincente que el habla humana real. La capacidad de WaveNet para generar formas de onda crudas significa que puede modelar cualquier tipo de audio, incluida la música.

Historia

Generar habla a partir de texto es una tarea cada vez más común gracias a la popularidad de software como Siri de Apple, Cortana de Microsoft, Amazon Alexa y el Asistente de Google. La mayoría de estos sistemas utilizan una variación de una técnica que implica concatenar fragmentos de sonido para formar sonidos y palabras reconocibles. La más común de estas se llama TTS concatenativo. Consiste en una gran biblioteca de fragmentos de habla, grabados de un solo hablante, que luego se concatenan para producir palabras y sonidos completos. El resultado suena antinatural, con una cadencia y un tono extraños. La dependencia de una biblioteca grabada también dificulta modificar o cambiar la voz.

Otra técnica, conocida como TTS paramétrico, utiliza modelos matemáticos para recrear sonidos que luego se ensamblan en palabras y oraciones. La información necesaria para generar los sonidos se almacena en los parámetros del modelo. Las características del habla de salida se controlan mediante las entradas al modelo, mientras que el habla se crea típicamente usando un sintetizador de voz conocido como vocoder. Esto también puede resultar en audio de sonido antinatural.

Diseño e investigación en curso

Antecedentes

WaveNet es un tipo de red neuronal de retroalimentación conocido como red neuronal convolucional profunda (CNN). En WaveNet, la CNN toma una señal cruda como entrada y sintetiza una salida una muestra a la vez. Lo hace muestreando de una distribución softmax (es decir, categórica) de un valor de señal que se codifica mediante una transformación de compansión μ-law y se cuantifica a 256 valores posibles. Este enfoque se basa en principios de Deep learning, donde la red aprende representaciones jerárquicas de los datos de entrada.

Concepto inicial y resultados

Según el artículo de investigación original de DeepMind de septiembre de 2016, WaveNet: A Generative Model for Raw Audio, la red se alimentó con formas de onda reales de habla en inglés y mandarín. A medida que estas pasan por la red, esta aprende un conjunto de reglas para describir cómo evoluciona la forma de onda de audio a lo largo del tiempo. La red entrenada puede usarse luego para crear nuevas formas de onda similares al habla a 16,000 muestras por segundo. Estas formas de onda incluyen respiraciones realistas y chasquidos de labios, pero no se ajustan a ningún idioma.

WaveNet es capaz de modelar con precisión diferentes voces, con el acento y el tono de la entrada correlacionándose con la salida. Por ejemplo, si se entrena con alemán, produce habla alemana. Esta capacidad también significa que si WaveNet recibe otras entradas, como música, su salida será musical. En el momento de su lanzamiento, DeepMind mostró que WaveNet podía producir formas de onda que suenan como música clásica. Esta versatilidad resalta su potencial más allá de las aplicaciones tradicionales de Machine learning en el habla.

Intercambio de contenido (voz)

Según el artículo de junio de 2018 Disentangled Sequential Autoencoder, DeepMind ha utilizado con éxito WaveNet para el "intercambio de contenido" de audio y voz: la red puede intercambiar la voz en una grabación de audio por otra voz preexistente, manteniendo el texto y otras características de la grabación original. "También experimentamos con datos de secuencias de audio. Nuestra representación desenredada nos permite convertir identidades de hablantes entre sí mientras condicionamos el contenido del habla." (p. 5) "Para audio, esto nos permite convertir un hablante masculino en uno femenino y viceversa [...]." (p. 1) Según el artículo, se requiere una cantidad mínima de dos dígitos de horas (c. 50 horas) de grabaciones de habla preexistentes tanto de la voz fuente como de la objetivo para alimentar a WaveNet, de modo que el programa aprenda sus características individuales antes de poder realizar la conversión de una voz a otra con una calidad satisfactoria. Los autores enfatizan que "[u]na ventaja del modelo es que separa características dinámicas de estáticas [...]." (p. 8), es decir, WaveNet es capaz de distinguir entre el texto hablado y los modos de entrega (modulación, velocidad, tono, estado de ánimo, etc.) que deben mantenerse durante la conversión de una voz a otra, por un lado, y las características básicas de ambas voces, fuente y objetivo, que debe intercambiar, por el otro.

El artículo de seguimiento de enero de 2019, Unsupervised speech representation learning using WaveNet autoencoders, detalla un método para mejorar con éxito el reconocimiento automático y la discriminación adecuados entre características dinámicas y estáticas para el "intercambio de contenido", incluyendo notablemente el intercambio de voces en grabaciones de audio existentes, con el fin de hacerlo más confiable. Otro artículo de seguimiento, Sample Efficient Adaptive Text-to-Speech, con fecha de septiembre de 2018 (última revisión en enero de 2019), afirma que DeepMind ha reducido con éxito la cantidad mínima de grabaciones de la vida real requeridas para muestrear una voz existente mediante WaveNet a "meramente unos pocos minutos de datos de audio" mientras mantiene resultados de alta calidad.

Su capacidad para clonar voces ha planteado preocupaciones éticas sobre la habilidad de WaveNet para imitar las voces de personas vivas y fallecidas. Según un artículo de la BBC de 2016, las empresas que trabajan en tecnologías similares de clonación de voz (como Adobe Voco) pretenden insertar marcas de agua inaudibles para los humanos con el fin de prevenir la falsificación, mientras mantienen que la clonación de voz que satisface, por ejemplo, las necesidades de la industria del entretenimiento sería de una complejidad mucho menor y usaría métodos diferentes a los necesarios para engañar los métodos de evidencia forense y los dispositivos de identificación electrónica, de modo que las voces naturales y las voces clonadas para fines de la industria del entretenimiento aún podrían distinguirse fácilmente mediante análisis tecnológico.

Aplicaciones

En el momento de su lanzamiento, DeepMind dijo que WaveNet requería demasiada potencia de procesamiento computacional para usarse en aplicaciones del mundo real. A partir de octubre de 2017, Google anunció una mejora de rendimiento de 1,000 veces junto con una mejor calidad de voz. WaveNet se usó entonces para generar voces del Asistente de Google en inglés estadounidense y japonés en todas las plataformas de Google. En noviembre de 2017, los investigadores de DeepMind publicaron un artículo de investigación que detallaba un método propuesto para "generar muestras de habla de alta fidelidad a más de 20 veces más rápido que en tiempo real", llamado "Probability Density Distillation". En la conferencia anual de desarrolladores I/O en mayo de 2018, se anunció que nuevas voces del Asistente de Google estaban disponibles y fueron posibles gracias a WaveNet; WaveNet redujo en gran medida el número de grabaciones de audio requeridas para crear un modelo de voz al modelar el audio crudo de las muestras del actor de voz. Este avance posicionó a WaveNet como una innovación clave en Generative AI para audio, influyendo en trabajos posteriores en síntesis basada en Neural network.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·speech-synthesis·audio-generation·google-deepmind
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial