Traducido del inglés

Un sistema de reconocimiento automático del habla de código abierto lanzado por OpenAI en septiembre de 2022, entrenado con 680,000 horas de audio multilingüe y ampliamente adoptado para aplicaciones de transcripción, subtitulado e interfaces de voz.

Whisper es un sistema automático de reconocimiento de voz lanzado por OpenAI en septiembre de 2022 como un modelo de código abierto, con tanto el código como los pesos entrenados disponibles públicamente. A diferencia de la mayoría de los lanzamientos posteriores de OpenAI, Whisper se publicó con un artículo técnico detallado que describe sus datos de entrenamiento y metodología, lo que lo convierte en uno de los lanzamientos más transparentes de un laboratorio importante de IA durante este período.

Entrenamiento y arquitectura

Whisper es un modelo codificador-decodificador basado en Transformer (architecture) entrenado de manera en gran parte supervisada y débilmente etiquetada con 680,000 horas de audio recopilado de la web, junto con transcripciones correspondientes. Aproximadamente un tercio de ese audio era no inglés, abarcando alrededor de 100 idiomas, y una parte de los datos de entrenamiento consistió en pares de traducción, lo que le da al modelo capacidad de traducción integrada de voz a texto junto con la transcripción. Esta escala y diversidad de datos débilmente supervisados fue un contraste deliberado con los sistemas de reconocimiento de voz anteriores entrenados en conjuntos de datos académicos más pequeños y más curados, en consonancia con hallazgos más amplios en el campo sobre el escalamiento y la diversidad de datos que mejoran la robustez. El modelo se lanzó en varios tamaños, desde una versión ligera llamada "tiny" adecuada para uso en el dispositivo hasta un modelo grande que ofrece la mayor precisión, un enfoque que luego se siguió con las actualizaciones v2 y v3 que mejoraron el rendimiento en varios idiomas.

Adopción e impacto

Debido a que los pesos de Whisper se publicaron bajo una licencia abierta simple, fue rápidamente integrado en una amplia gama de productos de terceros y proyectos de código abierto, como herramientas como herramientas de transcripción de reuniones, generadores de subtítulos, asistentes de voz y software de accesibilidad. Su robustez frente a acentos, ruido de fondo y vocabulario técnico, en comparación con los sistemas de ASR comerciales anteriores, lo convirtió en una elección predeterminada común para desarrolladores que construyen con pipelines de procesamiento de lenguaje natural que necesitan un front -end de voz a texto. Whisper también se convirtió en un componente en sistemas de interacción multimodales multimodales y de interacción con voz, móvil en un procesamiento de texto especificado en modelos de voz y automatización de llamadas, y su robustez en el proceso de entrenamiento específico.

El lanzamiento del lanzamiento contribuyó a una tendencia más amplia de lanzamientos de estilo de modelo de conjunto de datos abiertos de laboratorios importantes, incluso cuando los mismos laboratorios mantenían . Los modelos generativos de los distintos generativos de manera técnica en sus descubrimientos destacados, y las primeras voces como la integración temprana en. text-to-speech|el texto a voz]] pipelines para productos de determinada GPU. Y sigue siendo comúnmente útil como técnica de 2025.

Limitaciones

Whisper no está sin limitaciones: puede alucinar texto que nunca se dijo, sobre todo en silencios o en audio no como, porque funciona modulo que se relaciona de manera constante con las Hallucination (AI) más generales en los modelos de lenguaje generativo. La precisión también varía de manera el idioma, con errores más altos errores de error en el que los recursos menores en que los recursos menores como el inglés. Un resultado en el que los recursos menores.

Se han documentado casos de que el modelo ha generado frases inventadas en transcripciones médicas y en contextos de alto riesgo, lo que resalta a monitoreo cuidadoso sobre el uso no supervisado en contextos sensibles

Categorías:speech-recognition·open-source-ai·openai-models
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial