Whisper 2022 est un modèle de reconnaissance vocale à usage général développé par OpenAI et publié en tant que logiciel open-source en septembre 2022. Il est conçu pour transcrire l'audio en texte et traduire la parole non anglophone en anglais, couvrant 96 langues. Le modèle repose sur une architecture transformeur et est entraîné sur un ensemble de données à grande échelle de 680 000 heures de données audio supervisées multilingues et multitâches, ce qui le rend robuste aux accents, aux bruits de fond et au jargon technique.
Whisper 2022 représente un changement par rapport aux systèmes de reconnaissance vocale antérieurs qui reposaient fortement sur des encodeurs audio pré-entraînés et un ajustement fin spécifique à la tâche. Au lieu de cela, il utilise une approche séquence-à-séquence avec une structure encodeur-décodeur, similaire aux grands modèles de langage modernes, et est entraîné directement sur des formes d'onde audio brutes converties en spectrogrammes log-Mel. La publication open-source du modèle a permis aux chercheurs et aux développeurs d'intégrer une reconnaissance vocale de pointe dans des applications sans restrictions propriétaires.
Architecture et entraînement
Whisper 2022 utilise une architecture de transformeur encodeur-décodeur, où l'encodeur traite le spectrogramme audio et le décodeur génère des jetons de texte. Il utilise des mécanismes de attention multi-têtes et de encodage positionnel, conformément aux conceptions standard des transformeurs. Le modèle a été entraîné sur un corpus diversifié d'audio provenant du web, y compris de la parole non anglophone, en mettant l'accent sur la réduction des biais et l'amélioration de la généralisation.
Les données d'entraînement comprenaient 680 000 heures d'audio, dont 117 000 heures non anglophones, couvrant 96 langues. L'ensemble de données comprenait 65 % d'audio en anglais, 18 % d'audio non anglophone et 17 % d'autres données telles que la musique et le bruit. Cette diversité a permis à Whisper de gérer diverses conditions acoustiques, y compris la musique de fond, la parole superposée et différentes qualités d'enregistrement. Le modèle a été entraîné en utilisant l'optimiseur Adam avec un calendrier de taux d'apprentissage et un écrêtage de gradient pour stabiliser l'entraînement.
Capacités et performances
Whisper 2022 prend en charge plusieurs tâches : transcription, traduction (du non-anglais vers l'anglais) et identification de la langue. Il peut traiter l'audio par segments, avec une longueur maximale de segment de 30 secondes, et utilise la recherche en faisceau pour le décodage, avec des options pour l'échantillonnage top-k et la mise à l'échelle de température afin de contrôler la diversité des sorties. Le modèle atteint des taux d'erreur de mots compétitifs sur des références courantes, telles que LibriSpeech et Common Voice, surpassant souvent les systèmes open-source antérieurs.
Pour la transcription en anglais, Whisper 2022 rapporte un taux d'erreur de mots de 5,2 % sur l'ensemble test-clean de LibriSpeech et de 10,4 % sur test-other. Pour les tâches multilingues, il atteint un taux d'erreur de mots médian de 10,4 % sur 20 langues, avec des performances particulièrement solides sur les langues romanes et germaniques. Le modèle démontre également une robustesse aux environnements bruyants, réduisant les taux d'erreur jusqu'à 50 % par rapport aux systèmes précédents lorsqu'il est testé sur de l'audio réel.
Publication open-source et impact
La publication de Whisper 2022 en tant que logiciel open-source sous licence MIT a permis une adoption généralisée dans le monde académique et industriel. Il est devenu un outil fondamental pour les applications de IA générative, y compris les services de transcription en temps réel, les assistants vocaux et les outils d'accessibilité. Le code du modèle et les poids pré-entraînés ont été mis à disposition sur GitHub, permettant aux développeurs de l'ajuster finement pour des domaines spécifiques en utilisant des techniques de augmentation de données.
Whisper 2022 a influencé les recherches ultérieures en reconnaissance vocale et en apprentissage profond, en particulier dans l'utilisation d'un entraînement faiblement supervisé à grande échelle. Il a également contribué à la tendance plus large de l'open-sourcing de modèles d'IA puissants, aux côtés d'autres efforts de Anthropic et Google DeepMind. Le succès du modèle a souligné l'importance de la diversité des données et de l'échelle du modèle, conduisant à d'autres développements dans les systèmes de parole multilingues.
Limites et considérations éthiques
Malgré ses points forts, Whisper 2022 présente des limites. Il peut avoir des difficultés avec des clips audio extrêmement courts (moins de 5 secondes) et peut halluciner du texte lors du traitement du silence ou d'audio non vocal. Le modèle montre également une dégradation des performances sur les langues avec des données d'entraînement limitées, comme certaines langues africaines et asiatiques. De plus, les données d'entraînement, provenant du web, peuvent contenir du contenu biaisé ou inapproprié, ce qui pourrait affecter les sorties.
OpenAI a reconnu ces problèmes et a recommandé d'utiliser Whisper avec prudence dans les applications à enjeux élevés. La nature open-source a permis à la communauté d'auditer et d'améliorer le modèle, mais a également soulevé des préoccupations concernant une utilisation abusive potentielle, telle que la surveillance non autorisée ou la désinformation. En 2023, Whisper 2022 reste une référence largement utilisée dans la recherche en reconnaissance vocale, avec des versions ultérieures et des dérivés développés par la communauté.
Références et lectures complémentaires
Whisper 2022 a été introduit dans un article technique intitulé « Robust Speech Recognition via Large-Scale Weak Supervision », publié par les chercheurs d'OpenAI en septembre 2022. L'architecture et les détails d'entraînement du modèle sont documentés dans cet article, ainsi que les résultats d'évaluation sur plusieurs références. Pour une utilisation pratique, le dépôt officiel fournit des scripts pour l'inférence et l'ajustement fin, et le modèle est disponible via les plateformes cloud Amazon Web Services et Azure.
Des informations supplémentaires peuvent être trouvées dans des enquêtes académiques sur la reconnaissance vocale et les modèles basés sur les transformeurs, ainsi que dans la documentation de NVIDIA et d'autres fournisseurs de matériel qui ont optimisé Whisper pour l'inférence GPU. L'impact du modèle sur l'accessibilité et la communication multilingue continue d'être étudié dans la recherche en interaction homme-machine.