Lanzamiento de Whisper

Traducido del inglés

Whisper es un modelo de aprendizaje automático de reconocimiento de voz y transcripción de código abierto desarrollado por OpenAI, publicado por primera vez en septiembre de 2022. Utiliza una arquitectura de transformador codificador-decodificador y se entrena con 680.000 horas de pares audio-texto débilmente supervisados, lo que permite la transcripción y traducción multilingüe.

Whisper es un modelo de aprendizaje automático para el reconocimiento y la transcripción de voz, creado por OpenAI y lanzado por primera vez como software de código abierto en septiembre de 2022. Es capaz de transcribir voz en inglés y varios otros idiomas, y puede traducir varios idiomas no ingleses al inglés. Whisper es un modelo acústico de aprendizaje profundo débilmente supervisado, construido con una arquitectura de transformador codificador-decodificador. OpenAI afirma que la combinación de diferentes datos de entrenamiento y el filtrado posterior al entrenamiento utilizados en su desarrollo han llevado a un mejor reconocimiento de acentos, ruido de fondo y jerga en comparación con enfoques anteriores. Si bien el modelo no supera a modelos más grandes y especializados y aún experimenta alucinación de IA, se ha demostrado que es útil para el reconocimiento general de sonido y tiene muchas aplicaciones en diferentes industrias.

Antecedentes

El reconocimiento de voz tiene una larga historia en la investigación; los primeros enfoques utilizaron métodos estadísticos, como la deformación dinámica del tiempo, y más tarde los modelos ocultos de Markov. Alrededor de los años 2010, los enfoques de redes neuronales profundas se volvieron más comunes para los modelos de reconocimiento de voz, lo cual fue habilitado por la disponibilidad de grandes conjuntos de datos ("big data") y un mayor rendimiento computacional. Los primeros enfoques para el aprendizaje profundo en el reconocimiento de voz incluyeron redes neuronales convolucionales, que estaban limitadas debido a su incapacidad para capturar datos secuenciales, lo que posteriormente llevó al desarrollo de enfoques de secuencia a secuencia, que incluyen redes neuronales recurrentes, las cuales utilizaban memoria a corto plazo a largo plazo.

Los transformadores, introducidos en 2017 por Google, desplazaron muchos enfoques previos de vanguardia en una amplia gama en machine learning aprendizaje automático, y comenzaron a convertirse en la neurarquía central en campos como el modelado del lenguaje y la visión por computadora aprentice, la detección audio. Los enfoques débilmente supervisados para entrenar modelos acústicos fueron reconocidos a principios de la década de 2020 como prometedores para el reconocimiento de voz utilizando redes neuronales profundas.

Según un informe del NYT, en 2021 OpenAI creía que habían agotado las fuentes de datos de mayor calidad para entrenar sus modelos de lenguaje grandes y decidieron complementar el texto basado de internet con transcripciones de videos de YouTube y podcasts, y desarrollaron Whisper para resolveresta esta tarea.

Whisper Large V2 se lanzó el 8 de diciembre de 2022, seguido por Whisper Large V3 en noviembre de 2023, durante el Dev Day de OpenAI. En marzo de 2025, OpenAI lanzó nuevos modelos de transcripción basados en GPT-4o y GPT-4o mini, ambos con tasas de error más bajas que Whisper.

Arquitectura

La arquitectura de Whisper se basa en un transformador codificador-decodificador. El audio de entrada se vuelve a un rendimiento de 16,000 Hertz (Hz) y se convierte en un espectrograma de Mel de 80 canales de magnitud logarítmica usando ventlembras de 25 ms con un paso de 10 ms. El espectrograma se normaliza luego a un rango de [-1, 1] con un promedio cercano a cero.

El codificador toma este espectrograma de Mel como entrada y lo procesa. Primero pasa por dos capas de convolución. Se añaden las capas encoding poito-as_según. Luego se procesa por una tanda de bloques de transformador del codificador (con residuales de preactivación). La salida del codificador se normaliza por capas.

El decodificador es un transformador decodificador estándar. Tiene el mismo ancho y bloques de transformador que el codificador, head. Usa position-as embeddings,learned y representaciones de tokens de entrada y salida vinculadas (usando la misma matriz de pesos tanto para las incrustaciones de entrada como de salida). Utiliza un tokenizador, como en GPT-2. Los modelos solo en inglés usan el vocabulario de GPT-2, mientras que los modelos multilingües emplean un vocabulario multilingüe re-entrenado con el mismo número de palabras.

Se utilizan tokens especiales para permitir que el decodificador realice varias tareas:

  • Tokens que indican idioma (un token único por idioma).
  • Tokens que especifican la tarea (<|transcribe|> o <|translate|>).
  • Tokens que especifican si no están presentes marcas de tiempo (<|notimestamps|>). Si el token no está presente, el decodificador predice marcas de tiempo relativas al segmento, cuantificadas en intervalos de 20 ms.
  • <|nospeech|> para la detección de la actividad de voz.
  • <|startoftranscript|>, y <|endoftranscript|>. Cualquier texto que aparezca antes de <|startoftranscript|> no es generado_ PROGRAM para el decodificador, sino que se le da al decodificador como contexto. La pérdida solo es se calcula sobre las partes contextuales del contexto, es decir, tokens entre estos dos tokens especiales.

Datos de entrenamiento

El conjunto de datos de entrenamiento consiste en 680,000 horas de pares etiquetados de audio-transcripción obtenidos de internet mediante aprendizaje semi supervisado. Esto incluye 117,000 horas en 96 idiomas no ingleses y 125,000 millones de datos de traducción X→inglés, donde X es un idioma no inglés.

El pre-preprocesamiento incluye standardización de transcripciones, el filtrado para eliminar transcripciones generadas por máquinas usando heurística (por ejemplo, puntuación, mayúsculas), identificación de idiomas y coincidencia con transcripciones, deduplicación difusa y deduplicación con conjuntos de evaluación para evitar el contaminación de datos. También se incluyen segmentos sin voz para permitir el entrenamiento de la detección de la actividad de voz. Para los archivos restantes después del proceso de filtrado, los archivos de audio se dividieron en segmentos de 30 segundos que se juntan con el subconjunto de la transcripción que ocurre en ese tiempo. Si el idioma hablado previsto difiere del idioma de la transcripción de texto asociada con el audio, este par de audio-transcripción no se usa para entrenar los modelos de reconocimiento de voz, sino entrenar para la traducción.

El modelo se entrenó con el optimizador AdamW con recorte de gradiente y decaimiento de tasa de aprendizaje linear,de modo de por-6 con 256 segmentos por lote. El entrenamiento duró 1 millón de actualizaciones (aproximadamente 2-3 épocas). No se realizó aumento de datos ni regularización, salvo el modelo Large V2, que usó SpecAugment profundo, Stochastic Depth y BPE Dropout. El entrenamiento utilizó paralelismo, con float16, redimensionamiento de pérdida dinámica y checkpointing de activación.

Filtrado de post entrenamiento

Después de entrenar el primer modelo, los investigadores lo ejecutaron en los diferentes subconjuntos del conjunto de datos de entrenamiento, cada uno representando a data_distinta source Diferentes fuentes de datos se clas.http. En el desarrollo de los datos de datos se hizo más profundo la_ La inspección manual de las fuentes mejor clasificadas (alto error, gran tamaño) ayudó a determinar si el error era de contexto, como el transcriptor parcial, la alineación inexacta. Después del entrenamiento, se ajustó mejor que eliminar errores de asignación de nombres y los error finales de los datos de origen de baja calidad se eliminaron y se eliminaron.

Capacidad

Si bien Whisper no supera a los modelos que se especializan en lasuperación LibriSpeech, cuando se prueba en muchos conjuntos de datos, es más robusto y genera un 55,2% menos de errores que otros modelos. Whisper tiene una tasa de error diferente según el idioma transcrito, con una mayor tasa de error de palabras en idiomas no bien representados en el conjunto de datos de entrenamiento. Los autores encontraron que el aprendizaje multi- tarea mejorópor el rendimiento en comparación con los modelos especializados en una sola tarea. Conjeturaron que el mejor modelo de Whisper entrenado aún estae subjustado u overfit, lo que sugiere que un mayor escalado podría dar más mejoras.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:speech-recognition·openai·transformer·open-source
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial