Traduit de l'anglais

LibriSpeech est un corpus à grande échelle et open source de parole issue de livres audio en anglais, largement utilisé pour l'entraînement et l'évaluation des systèmes de reconnaissance automatique de la parole et de synthèse vocale.

LibriSpeech est un corpus à grande échelle de parole anglaise dérivé de livres audio, créé par Vassil Panayotov et ses collègues de l'Université Johns Hopkins et publié en 2015. Il est devenu une référence standard pour l'entraînement et l'évaluation des systèmes de reconnaissance automatique de la parole (ASR) et de synthèse vocale (TTS). Le corpus comprend environ 1 000 heures de parole lue, échantillonnée à 16 kHz, et est organisé en sous-ensembles de difficulté variable pour l'entraînement et le test des modèles.

Le jeu de données a été construit à partir d'enregistrements audio de livres audio du domaine public issus du projet LibriVox, associés à leurs textes correspondants provenant de Project Gutenberg. Les créateurs ont appliqué un pipeline rigoureux d'alignement et de filtrage pour garantir des transcriptions précises et une qualité audio optimale. LibriSpeech se distingue par sa taille, la diversité des locuteurs (plus de 2 400 locuteurs) et la prosodie naturelle de la parole lue, ce qui en fait une ressource précieuse pour faire progresser la recherche en apprentissage automatique et en apprentissage profond dans le traitement de la parole.

Structure du corpus et sous-ensembles

LibriSpeech est divisé en plusieurs sous-ensembles : train-clean-100, train-clean-360, train-other-500, dev-clean, dev-other, test-clean et test-other. Les sous-ensembles « clean » contiennent des enregistrements avec un bruit de fond minimal et des locuteurs à l'articulation claire, tandis que les sous-ensembles « other » incluent des conditions plus difficiles, telles que des accents variés ou un léger bruit. Les sous-ensembles d'entraînement totalisent environ 960 heures, tandis que les ensembles de développement et de test contiennent chacun environ 5 heures. Cette structure permet aux chercheurs d'entraîner des modèles sur des données propres et d'évaluer leur robustesse sur des conditions plus difficiles.

Chaque énoncé est fourni sous forme de fichier audio FLAC accompagné d'une transcription textuelle. Le corpus inclut également des identifiants de locuteurs et des informations de chapitre, permettant des expériences dépendantes du locuteur ou multi-locuteurs. Les sous-ensembles « other » sont particulièrement utiles pour tester la robustesse des systèmes ASR face à une variabilité réaliste.

Rôle dans la recherche en reconnaissance vocale

LibriSpeech est devenu la référence de facto pour l'ASR. De nombreux modèles pionniers, y compris ceux basés sur des architectures de réseaux de neurones, rapportent leurs performances sur les ensembles de test de LibriSpeech. Par exemple, les modèles basés sur le transformeur et les systèmes vocaux intégrant des grands modèles de langage citent souvent le taux d'erreur de mots (WER) sur test-clean et test-other comme métriques clés. La taille du corpus et sa disponibilité ouverte ont permis des comparaisons reproductibles entre différentes approches, allant des modèles de Markov cachés traditionnels aux systèmes de bout en bout modernes.

Les chercheurs ont également utilisé LibriSpeech pour l'apprentissage par transfert et le pré-entraînement. Des modèles comme wav2vec 2.0 et HuBERT ont été pré-entraînés sur LibriSpeech ou ses variantes plus grandes, démontrant l'utilité du corpus au-delà de l'apprentissage supervisé simple. La disponibilité de textes alignés a également facilité la recherche en alignement forcé et en modélisation de la prononciation.

Extensions et variantes

Plusieurs extensions de LibriSpeech ont été publiées pour répondre à des besoins de recherche spécifiques. LibriSpeech-100 et LibriSpeech-360 sont des sous-ensembles des données d'entraînement originales. LibriTTS, dérivé de LibriSpeech, fournit un audio de meilleure qualité à 24 kHz avec une segmentation au niveau de la phrase, conçu pour la recherche en TTS. Libri-Light est un corpus non étiqueté beaucoup plus vaste (plus de 60 000 heures) extrait de la même source de livres audio, destiné à l'apprentissage auto-supervisé. Ces variantes ont élargi l'impact du corpus original sur différentes tâches vocales.

De plus, LibriSpeech a été utilisé pour créer des versions bruitées ou réverbérantes pour les études ASR robustes, comme LibriSpeech avec un bruit de fond ajouté provenant du corpus MUSAN. Ces adaptations permettent aux chercheurs d'évaluer les performances des modèles dans des conditions défavorables sans collecter de nouvelles données.

Impact et limites

LibriSpeech a considérablement accéléré les progrès dans la technologie vocale en fournissant une ressource vaste, gratuite et bien documentée. Son succès a inspiré des corpus similaires dans d'autres langues et domaines. Cependant, le corpus présente des limites : il ne contient que de la parole lue issue de livres audio, ce qui diffère de la parole conversationnelle spontanée. Le vocabulaire est également limité au langage littéraire, sans termes spécifiques à certains domaines. De plus, la distribution des locuteurs est biaisée vers certaines démographies, ce qui peut introduire des biais dans les modèles entraînés.

Malgré ces limites, LibriSpeech reste une ressource fondamentale dans la recherche en intelligence artificielle. Son utilisation continue dans les milieux académiques et industriels souligne son importance en tant que référence pour les tâches liées à la parole, de l'ASR à la vérification du locuteur et à la reconnaissance des émotions.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:speech-recognition·dataset·natural-language-processing·audio
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique