Whisper 2022 es un modelo de reconocimiento de voz de propósito general desarrollado por OpenAI y publicado como software de código abierto en septiembre de 2022. Está diseñado para transcribir audio a texto y traducir voz no inglesa al inglés, cubriendo 96 idiomas. El modelo se basa en una arquitectura de transformador y se entrenó con un conjunto de datos a gran escala de 680 000 horas de audio supervisado multilingüe y multitarea, lo que lo hace robusto frente a acentos, ruido de fondo y jerga técnica.
Whisper 2022 representa un cambio respecto a los sistemas de reconocimiento de voz anteriores, que dependían en gran medida de codificadores de audio preentrenados y de un ajuste fino específico para cada tarea. En su lugar, utiliza un enfoque de secuencia a secuencia con una estructura de codificador-decodificador, similar a los grandes modelos de lenguaje modernos, y se entrena directamente sobre formas de onda de audio sin procesar convertidas en espectrogramas log-Mel. La publicación de código abierto del modelo permitió a investigadores y desarrolladores integrar el reconocimiento de voz de última generación en aplicaciones sin restricciones de propiedad.
Arquitectura y Entrenamiento
Whisper 2022 emplea una arquitectura de transformador de codificador-decodificador, donde el codificador procesa el espectrograma de audio y el decodificador genera los tokens de texto. Utiliza mecanismos de atención de múltiples cabezales y codificación posicional, consistentes con los diseños de transformador estándar. El modelo se entrenó con un corpus diverso de audio procedente de la web, incluida voz no inglesa, con un enfoque en reducir el sesgo y mejorar la generalización.
Los datos de entrenamiento comprendieron 680 000 horas de audio, de las cuales 117 000 horas eran no inglesas, cubriendo 96 idiomas. El conjunto de datos incluía un 65 % de audio en inglés, un 18 % de audio no inglés y un 17 % de otros datos, como música y ruido. Esta diversidad permitió a Whisper manejar diversas condiciones acústicas, incluyendo música de fondo, voz superpuesta y diferentes calidades de grabación. El modelo se entrenó utilizando el optimizador Adam con un programa de tasa de aprendizaje y recorte de gradientes para estabilizar el entrenamiento.
Capacidades y Rendimiento
Whisper 2022 admite múltiples tareas: transcripción, traducción (de no inglés a inglés) e identificación de idioma. Puede procesar audio en segmentos, con una longitud máxima de segmento de 30 segundos, y utiliza búsqueda de haz para la decodificación, con opciones de muestreo top-k y escalado de temperatura para controlar la diversidad de la salida. El modelo logra tasas de error de palabra competitivas en puntos de referencia comunes, como LibriSpeech y Common Voice, superando a menudo a los sistemas de código abierto anteriores.
Para la transcripción en inglés, Whisper 2022 reporta una tasa de error de palabra del 5,2 % en el conjunto test-clean de LibriSpeech y del 10,4 % en test-other. En tareas multilingües, logra una tasa de error de palabra mediana del 10,4 % en 20 idiomas, con un rendimiento particularmente fuerte en lenguas romances y germánicas. El modelo también demuestra robustez ante entornos ruidosos, reduciendo las tasas de error hasta en un 50 % en comparación con sistemas anteriores cuando se prueba con audio del mundo real.
Publicación de Código Abierto e Impacto
La publicación de Whisper 2022 como software de código abierto bajo la licencia MIT permitió su adopción generalizada tanto en el ámbito académico como en la industria. Se convirtió en una herramienta fundamental para aplicaciones de IA generativa, incluyendo servicios de transcripción en tiempo real, asistentes de voz y herramientas de accesibilidad. El código del modelo y sus pesos preentrenados se pusieron a disposición en GitHub, permitiendo a los desarrolladores ajustarlo para dominios específicos mediante técnicas de aumento de datos.
Whisper 2022 influyó en investigaciones posteriores en reconocimiento de voz y aprendizaje profundo, particularmente en el uso de entrenamiento supervisado débil a gran escala. También contribuyó a la tendencia más amplia de publicar modelos de IA potentes como código abierto, junto con otros esfuerzos de Anthropic y Google DeepMind. El éxito del modelo destacó la importancia de la diversidad de datos y la escala del modelo, lo que condujo a nuevos desarrollos en sistemas de voz multilingües.
Limitaciones y Consideraciones Éticas
A pesar de sus fortalezas, Whisper 2022 tiene limitaciones. Puede tener dificultades con clips de audio extremadamente cortos (menos de 5 segundos) y puede alucinar texto al procesar silencio o audio que no es voz. El modelo también muestra una degradación del rendimiento en idiomas con datos de entrenamiento limitados, como algunos idiomas africanos y asiáticos. Además, los datos de entrenamiento, obtenidos de la web, pueden contener contenido sesgado o inapropiado, lo que podría afectar a las salidas.
OpenAI reconoció estos problemas y recomendó usar Whisper con precaución en aplicaciones de alto riesgo. La naturaleza de código abierto permitió a la comunidad auditar y mejorar el modelo, pero también planteó preocupaciones sobre un posible uso indebido, como vigilancia no autorizada o tergiversación. A partir de 2023, Whisper 2022 sigue siendo una línea base ampliamente utilizada en la investigación del reconocimiento de voz, con versiones posteriores y derivados desarrollados por la comunidad.
Referencias y Lecturas Adicionales
Whisper 2022 se presentó en un artículo técnico titulado "Robust Speech Recognition via Large-Scale Weak Supervision", publicado por investigadores de OpenAI en septiembre de 2022. La arquitectura del modelo y los detalles de entrenamiento están documentados en ese artículo, junto con los resultados de evaluación en múltiples puntos de referencia. Para uso práctico, el repositorio oficial proporciona scripts para inferencia y ajuste fino, y el modelo está disponible a través de Amazon Web Services y plataformas en la nube de Azure.
Se puede encontrar más información en estudios académicos sobre reconocimiento de voz y modelos basados en transformadores, así como en la documentación de NVIDIA y otros proveedores de hardware que optimizaron Whisper para la inferencia con GPU. El impacto del modelo en la accesibilidad y la comunicación multilingüe continúa siendo estudiado en la investigación de interacción persona-ordenador.