The CMU Pronouncing Dictionary (também conhecido como cmudict) é um dicionário de pronúncia legível por máquina para o inglês norte-americano. Foi criado na Universidade Carnegie Mellon e é mantido pelo Speech Group da universidade. O dicionário fornece um mapeamento de palavras às suas transcripções fonéticas, usando um conjunto de 39 fonemas (mais marcadores de acento). É lançado em domínio público, o que o torna um recurso fundamental para a tecnologia da fala e a linguística computacional.
As origens do dicionário remontam à década de 1980, desenvolvido para uso em pesquisa de reconhecimento de fala na Carnegie Mellon. Sua primeira publicação pública ocorreu em 1993, e desde então tem sido atualizado continuamente. A versão atual (0.7b) contém mais de 134.000 entradas, cobrando palavras comuns, nomes próprios e acrónimos. Cada entrada lista a palavra em minúsculas, seguida pela sequência de fonemas com indicadores de acento (0, 1 ou 2) colocados após as vogais.
Conjunto de Fonemas e Formato de Transcrição
The CMU Pronouncing Dictionary usa um conjunto de fonemas baseado no sistema ARPABET, originalmente desenvolvido para o projeto ARPA Speech Understanding Research. Este conjunto incluye 39 fonemas, como vogais (por exemplo, AA, IY, UW) e consoantes (por exemplo, K, S, T). O acento é marcado com dígitos: 0 para ausência de acento, 1 para acento primário e 2 para acento secundário. Por exemplo, a palavra "hello" é transcrita como "HH AH0 L OW1". Este formato é simples, baseado em ASCII e facilmente analizable por software.
O dicionário também incluye múltiples pronunciações para muitas palavras, indicadas por números entre paréntesis (por exemplo, "the(1)" e "the(2)"). Estas variantes capturan diferencias regionales ou contextuales, como a schwa versus a vogal acentuada em "the". Além disso, contém entradas para formas flexionadas, compostos e algumas palavras estrangeiras comumente usadas em inglês.
Aplicações em Tecnologia da Fala
O dicionário é um recurso padrão em pipelines de inteligência artificial e aprendizado automático para processamento de fala. É usado como léxico de pronúncia em sistemas de reconhecimento automático de fala (ASR), permitendo que modelos mapeem sinais acústicos a sequências de palavras. Na síntesis de texto a fala (TTS), fornece a entrada fonética necessária para generar fala com sonido natural. Muitos kits de herramientas de código aberto, como Kaldi e ESPnet, incluyen cmudict como léxico por defecto.
Más allá de ASR y TTS, el diccionario se usa en tareas de procesamiento de lenguaje natural como la conversión grafema a fonema, donde los modelos aprenden a predecir pronunciaciones para palabras no vistas. También sirve como punto de referencia para evaluar algoritmos de predicción de pronunciación. Investigadores en instituciones como Stanford AI Lab y MIT CSAIL han usado cmudict en estudios sobre alineación fonética y síntesis de voz.
Formato y Distribución
El diccionario se distribuye como un archivo de texto plano, con una entrada por línea. El formato es: palabra seguida de uno o más espacios, luego la secuencia de fonemas. Los comentarios y metadatos son mínimos, manteniendo el archivo compacto. Está disponible para descarga en el sitio web del Speech Group de Carnegie Mellon y se refleja en muchos repositorios de código abierto. El estado de dominio público permite uso, modificación y redistribución sin restricciones, lo que lo convierte en una opción preferida para proyectos comerciales y académicos por igual.
A lo largo de los años, se han creado varios recursos derivados de cmudict, incluidos diccionarios de pronunciación para otros idiomas (mediante traducción) y léxicos con límites de sílabas o etiquetas de parte del discurso añadidas. Estos derivados se usan a menudo en modelos de aprendizaje profundo para habla y lenguaje, donde proporcionan señales de supervisión para sistemas de extremo a extremo.
Limitaciones y Extensiones
Aunque es completo, el diccionario tiene limitaciones conocidas. Cubre solo el inglés norteamericano, y su conjunto de fonemas no captura todas las variaciones dialectales. Algunas entradas pueden estar desactualizadas o faltar nombres propios y términos técnicos recientes. Para abordar esto, los esfuerzos de la comunidad han producido versiones extendidas, como cmudict con palabras añadidas de Wiktionary o CMUdict con anotaciones de acento y sílabas. Estas extensiones se usan con frecuencia en sistemas TTS modernos basados en transformadores, que requieren léxicos grandes y diversos.
A pesar de estas limitaciones, el CMU Pronouncing Dictionary sigue siendo una piedra angular de la investigación del habla. Su simplicidad, fiabilidad y licencia abierta han asegurado su relevancia continua durante más de tres décadas, desde los primeros sistemas basados en reglas hasta los enfoques contemporáneos de redes neuronales.
Véase También
- secuencia a secuencia para modelos que usan léxicos de pronunciación
- aumento de datos para técnicas que generan datos de habla sintéticos
- Universidad Carnegie Mellon como institución de origen