Lanzamiento de OpenAI Whisper

Traducido del inglés

OpenAI Whisper es un sistema de reconocimiento automático del habla de código abierto lanzado en 2022, entrenado con 680.000 horas de datos multilingües, lo que permite una transcripción y traducción robustas en 98 idiomas.

OpenAI Whisper es un sistema de reconocimiento automático del habla (ASR) publicado como software de código abierto en septiembre de 2022 por OpenAI. Es un modelo de red neuronal entrenado con un conjunto de datos diverso de 680 000 horas de audio supervisado multilingüe y multitarea recopilado de la web, que incluye 117 000 horas de habla no inglesa. El modelo está diseñado para transcribir el habla a texto y traducirlo al inglés, con soporte para 98 idiomas. La arquitectura de Whisper se basa en el marco Transformer codificador-decodificador, un enfoque de aprendizaje profundo que se ha convertido en estándar en aprendizaje automático para tareas de secuencia a secuencia.

El lanzamiento de Whisper marcó un hito significativo en IA generativa para el habla, ya que hizo que las capacidades de ASR de última generación estuvieran disponibles gratuitamente para investigadores y desarrolladores. A diferencia de muchos sistemas comerciales de reconocimiento del habla que eran cerrados o requerían API de pago, la naturaleza de código abierto de Whisper permitió el ajuste fino, el despliegue en hardware local y la integración en diversas aplicaciones. Su robustez ante el ruido de fondo, los acentos y los diversos estilos de habla se atribuyó a la escala y diversidad de sus datos de entrenamiento, que se recopilaron de la web e incluyeron grabaciones tanto limpias como ruidosas.

Arquitectura del modelo y entrenamiento

Whisper emplea una arquitectura Transformer estándar con un codificador que procesa espectrogramas log-Mel del audio y un decodificador que genera tokens de texto. El modelo utiliza atención de múltiples cabezas y codificaciones posicionales para capturar dependencias temporales en la señal de audio. Se entrenó con un objetivo secuencia a secuencia, donde el decodificador predice tokens de texto condicionados a la representación de audio codificada. El proceso de entrenamiento utilizó el optimizador Adam con un programa de tasa de aprendizaje, e incorporó técnicas como abandono y recorte de gradientes para prevenir el sobreajuste.

Una innovación clave en el entrenamiento de Whisper fue el uso de un formato multitarea, donde el modelo se incita con tokens especiales para realizar diferentes tareas, como transcripción, traducción o identificación de idioma. Esto permitió que un solo modelo manejara múltiples idiomas y tareas sin ajuste fino específico de la tarea. Los datos de entrenamiento incluyeron 680 000 horas de audio, con un 65 % en inglés, un 18 % en otros idiomas y un 17 % de traducciones al inglés de habla no inglesa. Esta diversidad contribuyó al sólido rendimiento de Whisper en idiomas con pocos recursos, ya que podía aprovechar la transferencia interlingüística.

Capacidades y rendimiento

Whisper logra tasas de error de palabra (WER) competitivas en puntos de referencia estándar, a menudo igualando o superando a los sistemas comerciales. Para el inglés, reporta un WER de aproximadamente el 5,2 % en el conjunto test-clean de LibriSpeech, y para tareas multilingües, demuestra un fuerte rendimiento en los conjuntos de datos Common Voice y Fleurs. El modelo también admite la traducción de cualquiera de los 98 idiomas al inglés, una característica que se integró en la misma arquitectura. La robustez de Whisper ante el ruido y la reverberación se destacó en las evaluaciones, donde superó a modelos de código abierto anteriores como DeepSpeech y los sistemas basados en Kaldi.

El modelo está disponible en múltiples tamaños, que van desde tiny (39 millones de parámetros) hasta large-v2 (1.5 mil millones de parámetros), lo que permite a los usuarios equilibrar velocidad y precisión. Los modelos más grandes logran un mejor rendimiento pero requieren más recursos computacionales. Whisper también admite la decodificación con búsqueda de haz con opciones para escalado de temperatura y muestreo top-p para controlar la diversidad de la salida.

Impacto de código abierto y adopción

El lanzamiento de código abierto de Whisper bajo la licencia MIT permitió una adopción generalizada en la academia y la industria. Se convirtió en una herramienta fundamental para la investigación en inteligencia artificial en el habla, y se integró en plataformas como Hugging Face (aunque no está en la lista de slugs proporcionada, es un repositorio común) y se utilizó en aplicaciones que van desde servicios de transcripción hasta herramientas de accesibilidad. La capacidad del modelo para ejecutarse en GPU de consumo lo hizo accesible para desarrolladores independientes, fomentando una comunidad de variantes ajustadas para dominios específicos como la transcripción médica y la documentación legal.

En comparación con lanzamientos contemporáneos de Google DeepMind y Anthropic, Whisper se centró específicamente en el habla en lugar de la generación de texto, llenando un vacío en el ecosistema de código abierto. Su éxito también influyó en desarrollos posteriores de modelos de habla, como GPT-4o de OpenAI con capacidades de audio, aunque Whisper siguió siendo una herramienta independiente.

Limitaciones y consideraciones éticas

A pesar de sus fortalezas, Whisper tiene limitaciones. Puede alucinar texto en segmentos silenciosos o solo de música, y su rendimiento se degrada en habla con acentos marcados o cambio de código. Los datos de entrenamiento, obtenidos de la web, pueden contener sesgos, y el modelo puede producir transcripciones que reflejen esos sesgos. OpenAI reconoció estos problemas en la tarjeta del modelo, recomendando un uso cuidadoso en aplicaciones sensibles. Además, el costo computacional de entrenar modelos grandes plantea preocupaciones ambientales, aunque el lanzamiento de código abierto mitigó algunas barreras al permitir la inferencia en hardware modesto.

Legado y direcciones futuras

Whisper estableció un punto de referencia para el ASR de código abierto, influyendo en modelos posteriores como Parakeet de NVIDIA y SeamlessM4T de Meta. Su arquitectura y metodología de entrenamiento se han adoptado en varios proyectos de investigación, y su lanzamiento aceleró el progreso en el reconocimiento del habla multilingüe. A partir de 2025, Whisper sigue siendo ampliamente utilizado, y su sucesor, Whisper large-v3, se lanzó en 2023 con un rendimiento mejorado en idiomas con pocos recursos. La naturaleza de código abierto del modelo continúa apoyando la innovación en aplicaciones de aprendizaje automático y aprendizaje profundo.

Referencias

  • Tarjeta del modelo y informe técnico de OpenAI Whisper (2022)
  • Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (2022)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:speech-recognition·openai·open-source-ai·machine-learning
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial