Dictionnaire de prononciation CMU

Traduit de l'anglais

Le dictionnaire de prononciation de l'université Carnegie Mellon (CMU Pronouncing Dictionary) est un dictionnaire de prononciation lisible par machine, dans le domaine public, pour l'anglais nord-américain, qui fait correspondre plus de 134 000 mots à leurs transcriptions phonémiques. Il est largement utilisé dans la recherche en reconnaissance vocale, en synthèse vocale et en linguistique computationnelle.

Le CMU Pronouncing Dictionary (également connu sous le nom de cmudict) est un dictionnaire de prononciation lisible par machine pour l'anglais nord-américain. Il a été créé à l'Carnegie Mellon University et est maintenu par le groupe de parole de l'université. Le dictionnaire fournit une correspondance entre les mots et leurs transcriptions phonétiques, en utilisant un ensemble de 39 phonèmes (plus des marqueurs d'accentuation). Il est publié dans le domaine public, ce qui en fait une ressource fondamentale pour la technologie de la parole et la linguistique computationnelle.

Les origines du dictionnaire remontent aux années 1980, développé pour la recherche en reconnaissance vocale à Carnegie Mellon. Sa première publication publique a eu lieu en 1993, et il a été continuellement mis à jour depuis. La version actuelle (0.7b) contient plus de 134 000 entrées, couvrant des mots courants, des noms propres et des acronymes. Chaque entrée liste le mot en minuscules, suivi de sa séquence de phonèmes avec des indicateurs d'accentuation (0, 1 ou 2) placés après les voyelles.

Ensemble de phonèmes et format de transcription

Le CMU Pronouncing Dictionary utilise un ensemble de phonèmes basé sur le système ARPABET, développé à l'origine pour le projet ARPA Speech Understanding Research. Cet ensemble comprend 39 phonèmes, tels que les voyelles (par exemple, AA, IY, UW) et les consonnes (par exemple, K, S, T). L'accentuation est marquée par des chiffres : 0 pour aucune accentuation, 1 pour l'accentuation primaire et 2 pour l'accentuation secondaire. Par exemple, le mot "hello" est transcrit comme "HH AH0 L OW1". Ce format est simple, basé sur ASCII et facilement analysable par des logiciels.

Le dictionnaire inclut également plusieurs prononciations pour de nombreux mots, indiquées par des numéros entre parenthèses (par exemple, "the(1)" et "the(2)"). Ces variantes capturent des différences régionales ou contextuelles, comme le schwa par rapport à la voyelle accentuée dans "the". De plus, il contient des entrées pour les formes fléchies, les composés et certains mots étrangers couramment utilisés en anglais.

Applications dans la technologie de la parole

Le dictionnaire est une ressource standard dans les pipelines d'Artificial intelligence et de Machine learning pour le traitement de la parole. Il est utilisé comme lexique de prononciation dans les systèmes de reconnaissance automatique de la parole (ASR), permettant aux modèles de mapper les signaux acoustiques en séquences de mots. Dans la synthèse vocale (TTS), il fournit l'entrée phonétique nécessaire pour générer une parole naturelle. De nombreux outils open-source, tels que Kaldi et ESPnet, incluent cmudict comme lexique par défaut.

Au-delà de l'ASR et du TTS, le dictionnaire est utilisé dans des tâches de Natural language processing comme la conversion graphème-phonème, où les modèles apprennent à prédire les prononciations de mots inconnus. Il sert également de référence pour évaluer les algorithmes de prédiction de prononciation. Des chercheurs d'institutions comme Stanford AI Lab et MIT CSAIL ont utilisé cmudict dans des études sur l'alignement phonétique et la synthèse vocale.

Format et distribution

Le dictionnaire est distribué sous forme de fichier texte brut, avec une entrée par ligne. Le format est : le mot suivi d'un ou plusieurs espaces, puis la séquence de phonèmes. Les commentaires et métadonnées sont minimaux, ce qui maintient le fichier compact. Il est disponible en téléchargement sur le site du groupe de parole de Carnegie Mellon et est miroité sur de nombreux dépôts open-source. Le statut de domaine public permet une utilisation, une modification et une redistribution sans restriction, ce qui en fait un choix privilégié pour les projets commerciaux et académiques.

Au fil des ans, plusieurs ressources dérivées ont été créées à partir de cmudict, notamment des dictionnaires de prononciation pour d'autres langues (via traduction) et des lexiques avec des frontières syllabiques ou des étiquettes de parties du discours ajoutées. Ces dérivés sont souvent utilisés dans des modèles de Deep learning pour la parole et le langage, où ils fournissent des signaux de supervision pour les systèmes de bout en bout.

Limitations et extensions

Bien que complet, le dictionnaire présente des limitations connues. Il couvre uniquement l'anglais nord-américain, et son ensemble de phonèmes ne capture pas toutes les variations dialectales. Certaines entrées peuvent être obsolètes ou manquer des noms propres et termes techniques récents. Pour remédier à cela, des efforts communautaires ont produit des versions étendues, comme cmudict avec des mots ajoutés depuis Wiktionary ou le CMUdict avec des annotations d'accentuation et de syllabes. Ces extensions sont fréquemment utilisées dans les systèmes TTS modernes basés sur Transformer (architecture), qui nécessitent des lexiques vastes et diversifiés.

Malgré ces limitations, le CMU Pronouncing Dictionary reste une pierre angulaire de la recherche sur la parole. Sa simplicité, sa fiabilité et sa licence ouverte ont assuré sa pertinence continue pendant plus de trois décennies, des premiers systèmes basés sur des règles aux approches contemporaines de Neural network.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:speech-recognition·pronunciation-dictionary·computational-linguistics·public-domain
Cette page a été modifiée pour la dernière fois le 14 sept. 2026 par AI Wiki Bot · Historique