OpenAI Whisper est un système de reconnaissance automatique de la parole (ASR) publié en tant que logiciel open-source en septembre 2022 par OpenAI. Il s'agit d'un modèle réseau de neurones entraîné sur un ensemble de données diversifié de 680 000 heures d'audio supervisé multilingue et multitâche collecté sur le web, comprenant 117 000 heures de parole non anglaise. Le modèle est conçu pour transcrire la parole en texte et la traduire en anglais, prenant en charge 98 langues. L'architecture de Whisper repose sur le cadre Transformer encodeur-décodeur, une approche d'apprentissage profond devenue standard en apprentissage automatique pour les tâches séquence-à-séquence.
La publication de Whisper a marqué une étape importante dans la IA générative pour la parole, car elle a rendu les capacités d'ASR de pointe librement accessibles aux chercheurs et aux développeurs. Contrairement à de nombreux systèmes commerciaux de reconnaissance vocale fermés ou nécessitant des API payantes, la nature open-source de Whisper a permis un ajustement fin, un déploiement sur du matériel local et une intégration dans diverses applications. Sa robustesse face au bruit de fond, aux accents et aux styles de parole variés a été attribuée à l'échelle et à la diversité de ses données d'entraînement, collectées sur le web et incluant des enregistrements propres et bruyants.
Architecture du modèle et entraînement
Whisper utilise une architecture Transformer standard avec un encodeur qui traite les spectrogrammes log-Mel de l'audio et un décodeur qui génère des jetons de texte. Le modèle utilise attention multi-têtes et encodages positionnels pour capturer les dépendances temporelles dans le signal audio. Il a été entraîné avec un objectif séquence-à-séquence, où le décodeur prédit des jetons de texte conditionnés par la représentation audio encodée. Le processus d'entraînement a utilisé l'optimiseur Adam avec un programme de taux d'apprentissage, et a incorporé des techniques telles que le dropout et le clipping de gradient pour prévenir le surapprentissage.
Une innovation clé dans l'entraînement de Whisper a été l'utilisation d'un format multitâche, où le modèle est sollicité avec des jetons spéciaux pour effectuer différentes tâches, telles que la transcription, la traduction ou l'identification de la langue. Cela a permis à un seul modèle de gérer plusieurs langues et tâches sans ajustement fin spécifique à la tâche. Les données d'entraînement comprenaient 680 000 heures d'audio, avec 65 % d'anglais, 18 % d'autres langues et 17 % de traductions anglaises de parole non anglaise. Cette diversité a contribué aux performances solides de Whisper sur les langues à faibles ressources, car il pouvait tirer parti du transfert interlingue.
Capacités et performances
Whisper atteint des taux d'erreur de mots (WER) compétitifs sur les benchmarks standard, égalant ou dépassant souvent les systèmes commerciaux. Pour l'anglais, il rapporte un WER d'environ 5,2 % sur l'ensemble test-clean de LibriSpeech, et pour les tâches multilingues, il démontre de fortes performances sur les ensembles de données Common Voice et Fleurs. Le modèle prend également en charge la traduction de l'une des 98 langues vers l'anglais, une fonctionnalité intégrée dans la même architecture. La robustesse de Whisper face au bruit et à la réverbération a été soulignée dans les évaluations, où il a surpassé les modèles open-source antérieurs comme DeepSpeech et les systèmes basés sur Kaldi.
Le modèle est disponible en plusieurs tailles, allant de tiny (39 millions de paramètres) à large-v2 (1,5 milliard de paramètres), permettant aux utilisateurs de faire un compromis entre vitesse et précision. Les modèles plus grands obtiennent de meilleures performances mais nécessitent plus de ressources computationnelles. Whisper prend également en charge le décodage par recherche en faisceau avec des options de réglage de température et d'échantillonnage top-p pour contrôler la diversité des sorties.
Impact open-source et adoption
La publication open-source de Whisper sous licence MIT a permis une adoption généralisée dans le monde académique et industriel. Il est devenu un outil fondamental pour la recherche en intelligence artificielle dans le domaine de la parole, et a été intégré dans des plateformes comme Hugging Face et utilisé dans des applications allant des services de transcription aux outils d'accessibilité. La capacité du modèle à fonctionner sur des GPU grand public l'a rendu accessible aux développeurs indépendants, favorisant une communauté de variantes ajustées pour des domaines spécifiques tels que la transcription médicale et la documentation juridique.
En comparaison avec les publications contemporaines de Google DeepMind et Anthropic, Whisper s'est concentré spécifiquement sur la parole plutôt que sur la génération de texte, comblant une lacune dans l'écosystème open-source. Son succès a également influencé les développements ultérieurs dans les modèles de parole, comme GPT-4o d'OpenAI avec des capacités audio, bien que Whisper soit resté un outil autonome.
Limitations et considérations éthiques
Malgré ses forces, Whisper présente des limitations. Il peut halluciner du texte dans des segments silencieux ou uniquement musicaux, et ses performances se dégradent sur la parole fortement accentuée ou avec alternance codique. Les données d'entraînement, provenant du web, peuvent contenir des biais, et le modèle peut produire des transcriptions reflétant ces biais. OpenAI a reconnu ces problèmes dans la fiche du modèle, recommandant une utilisation prudente dans les applications sensibles. De plus, le coût computationnel de l'entraînement de grands modèles soulève des préoccupations environnementales, bien que la publication open-source ait atténué certains obstacles en permettant l'inférence sur du matériel modeste.
Héritage et orientations futures
Whisper a établi une référence pour l'ASR open-source, influençant des modèles ultérieurs comme Parakeet de NVIDIA et SeamlessM4T de Meta. Son architecture et sa méthodologie d'entraînement ont été adoptées dans divers projets de recherche, et sa publication a accéléré les progrès dans la reconnaissance vocale multilingue. En 2025, Whisper reste largement utilisé, et son successeur, Whisper large-v3, a été publié en 2023 avec des performances améliorées sur les langues à faibles ressources. La nature open-source du modèle continue de soutenir l'innovation dans les applications de apprentissage automatique et de apprentissage profond.
Références
- Fiche du modèle et rapport technique d'OpenAI Whisper (2022)
- Radford et al., « Robust Speech Recognition via Large-Scale Weak Supervision » (2022)