El Diccionario de Pronunciación CMU (también conocido como cmudict) es un diccionario de pronunciación legible por máquina para el inglés norteamericano. Fue creado en la Universidad Carnegie Mellon y es mantenido por el Grupo de Habla de la universidad. El diccionario proporciona una correspondencia de palabras a sus transcripciones fonéticas, utilizando un conjunto de 39 fonemas (más marcadores de acento). Está liberado en el dominio público, lo que lo convierte en un recurso fundamental para la tecnología del habla y la lingüística computacional.
Los orígenes del diccionario se remontan a la década de 1980, desarrollado para su uso en la investigación de reconocimiento de habla en Carnegie Mellon. Su primera publicación pública ocurrió en 1993, y ha sido actualizado continuamente desde entonces. La versión actual (0.7b) contiene más de 134,000 entradas, que cubren palabras comunes, nombres propios y acrónimos. Cada entrada lista la palabra en minúsculas, seguida de su secuencia de fonemas con indicadores de acento (0, 1 o 2) colocados después de las vocales.
Conjunto de Fonemas y Formato de Transcripción
El Diccionario de Pronunciación CMU utiliza un conjunto de fonemas basado en el sistema ARPABET, desarrollado originalmente para el proyecto de Investigación de Comprensión del Habla de ARPA. Este conjunto incluye 39 fonemas, como vocales (por ejemplo, AA, IY, UW) y consonantes (por ejemplo, K, S, T). El acento se marca con dígitos: 0 para ausencia de acento, 1 para acento primario y 2 para acento secundario. Por ejemplo, la palabra "hello" se transcribe como "HH AH0 L OW1". Este formato es simple, basado en ASCII y fácilmente analizable por software.
El diccionario también incluye múltiples pronunciaciones para muchas palabras, indicadas con números entre paréntesis (por ejemplo, "the(1)" y "the(2)"). Estas variantes capturan diferencias regionales o contextuales, como la schwa frente a la vocal acentuada en "the". Además, contiene entradas para formas flexionadas, compuestos y algunas palabras extranjeras de uso común en inglés.
Aplicaciones en Tecnología del Habla
El diccionario es un recurso estándar en los flujos de trabajo de inteligencia artificial y aprendizaje automático para el procesamiento del habla. Se utiliza como léxico de pronunciación en sistemas de reconocimiento automático de habla (ASR), permitiendo que los modelos mapeen señales acústicas a secuencias de palabras. En la síntesis de texto a voz (TTS), proporciona la entrada fonética necesaria para generar habla con sonido natural. Muchos kits de herramientas de código abierto, como Kaldi y ESPnet, incluyen cmudict como léxico predeterminado.
Más allá de ASR y TTS, el diccionario se utiliza en tareas de procesamiento del lenguaje natural como la conversión de grafema a fonema, donde los modelos aprenden a predecir pronunciaciones para palabras no vistas. También sirve como punto de referencia para evaluar algoritmos de predicción de pronunciación. Investigadores en instituciones como el Laboratorio de IA de Stanford y el CSAIL del MIT han utilizado cmudict en estudios sobre alineación fonética y síntesis de habla.
Formato y Distribución
El diccionario se distribuye como un archivo de texto plano, con una entrada por línea. El formato es: la palabra seguida de uno o más espacios, luego la secuencia de fonemas. Los comentarios y metadatos son mínimos, manteniendo el archivo compacto. Está disponible para descarga en el sitio web del Grupo de Habla de Carnegie Mellon y se refleja en muchos repositorios de código abierto. El estado de dominio público permite uso, modificación y redistribución sin restricciones, lo que lo convierte en una opción preferida para proyectos comerciales y académicos por igual.
A lo largo de los años, se han creado varios recursos derivados de cmudict, incluidos diccionarios de pronunciación para otros idiomas (mediante traducción) y léxicos con límites de sílabas o etiquetas de partes del discurso añadidas. Estos derivados se utilizan a menudo en modelos de aprendizaje profundo para habla y lenguaje, donde proporcionan señales de supervisión para sistemas de extremo a extremo.
Limitaciones y Extensiones
Aunque es completo, el diccionario tiene limitaciones conocidas. Cubre solo el inglés norteamericano, y su conjunto de fonemas no captura todas las variaciones dialectales. Algunas entradas pueden estar desactualizadas o carecer de nombres propios y términos técnicos recientes. Para abordar esto, los esfuerzos de la comunidad han producido versiones extendidas, como cmudict con palabras añadidas de Wiktionary o el CMUdict con anotaciones de acento y sílabas. Estas extensiones se utilizan con frecuencia en sistemas TTS modernos basados en transformers, que requieren léxicos grandes y diversos.
A pesar de estas limitaciones, el Diccionario de Pronunciación CMU sigue siendo una piedra angular de la investigación del habla. Su simplicidad, fiabilidad y licencia abierta han asegurado su relevancia continua durante más de tres décadas, desde los primeros sistemas basados en reglas hasta los enfoques contemporáneos de redes neuronales.
Véase También
- secuencia a secuencia para modelos que utilizan léxicos de pronunciación
- aumento de datos para técnicas que generan datos de habla sintéticos
- Universidad Carnegie Mellon como institución de origen