Dicionário de Pronúncias da CMU

Traduzido do inglês

O CMU Pronouncing Dictionary é um dicionário de pronúncia legível por máquina, de domínio público, para o inglês norte-americano, que mapeia mais de 134.000 palavras para suas transcrições fonêmicas. Ele é amplamente utilizado em reconhecimento de fala, síntese de fala e pesquisa em linguística computacional.

The CMU Pronouncing Dictionary (também conhecido como cmudict) é um dicionário de pronúncia legível por máquina para o inglês norte-americano. Foi criado na Universidade Carnegie Mellon e é mantido pelo Speech Group da universidade. O dicionário fornece um mapeamento de palavras às suas transcripções fonéticas, usando um conjunto de 39 fonemas (mais marcadores de acento). É lançado em domínio público, o que o torna um recurso fundamental para a tecnologia da fala e a linguística computacional.

As origens do dicionário remontam à década de 1980, desenvolvido para uso em pesquisa de reconhecimento de fala na Carnegie Mellon. Sua primeira publicação pública ocorreu em 1993, e desde então tem sido atualizado continuamente. A versão atual (0.7b) contém mais de 134.000 entradas, cobrando palavras comuns, nomes próprios e acrónimos. Cada entrada lista a palavra em minúsculas, seguida pela sequência de fonemas com indicadores de acento (0, 1 ou 2) colocados após as vogais.

Conjunto de Fonemas e Formato de Transcrição

The CMU Pronouncing Dictionary usa um conjunto de fonemas baseado no sistema ARPABET, originalmente desenvolvido para o projeto ARPA Speech Understanding Research. Este conjunto incluye 39 fonemas, como vogais (por exemplo, AA, IY, UW) e consoantes (por exemplo, K, S, T). O acento é marcado com dígitos: 0 para ausência de acento, 1 para acento primário e 2 para acento secundário. Por exemplo, a palavra "hello" é transcrita como "HH AH0 L OW1". Este formato é simples, baseado em ASCII e facilmente analizable por software.

O dicionário também incluye múltiples pronunciações para muitas palavras, indicadas por números entre paréntesis (por exemplo, "the(1)" e "the(2)"). Estas variantes capturan diferencias regionales ou contextuales, como a schwa versus a vogal acentuada em "the". Além disso, contém entradas para formas flexionadas, compostos e algumas palavras estrangeiras comumente usadas em inglês.

Aplicações em Tecnologia da Fala

O dicionário é um recurso padrão em pipelines de inteligência artificial e aprendizado automático para processamento de fala. É usado como léxico de pronúncia em sistemas de reconhecimento automático de fala (ASR), permitendo que modelos mapeem sinais acústicos a sequências de palavras. Na síntesis de texto a fala (TTS), fornece a entrada fonética necessária para generar fala com sonido natural. Muitos kits de herramientas de código aberto, como Kaldi e ESPnet, incluyen cmudict como léxico por defecto.

Más allá de ASR y TTS, el diccionario se usa en tareas de procesamiento de lenguaje natural como la conversión grafema a fonema, donde los modelos aprenden a predecir pronunciaciones para palabras no vistas. También sirve como punto de referencia para evaluar algoritmos de predicción de pronunciación. Investigadores en instituciones como Stanford AI Lab y MIT CSAIL han usado cmudict en estudios sobre alineación fonética y síntesis de voz.

Formato y Distribución

El diccionario se distribuye como un archivo de texto plano, con una entrada por línea. El formato es: palabra seguida de uno o más espacios, luego la secuencia de fonemas. Los comentarios y metadatos son mínimos, manteniendo el archivo compacto. Está disponible para descarga en el sitio web del Speech Group de Carnegie Mellon y se refleja en muchos repositorios de código abierto. El estado de dominio público permite uso, modificación y redistribución sin restricciones, lo que lo convierte en una opción preferida para proyectos comerciales y académicos por igual.

A lo largo de los años, se han creado varios recursos derivados de cmudict, incluidos diccionarios de pronunciación para otros idiomas (mediante traducción) y léxicos con límites de sílabas o etiquetas de parte del discurso añadidas. Estos derivados se usan a menudo en modelos de aprendizaje profundo para habla y lenguaje, donde proporcionan señales de supervisión para sistemas de extremo a extremo.

Limitaciones y Extensiones

Aunque es completo, el diccionario tiene limitaciones conocidas. Cubre solo el inglés norteamericano, y su conjunto de fonemas no captura todas las variaciones dialectales. Algunas entradas pueden estar desactualizadas o faltar nombres propios y términos técnicos recientes. Para abordar esto, los esfuerzos de la comunidad han producido versiones extendidas, como cmudict con palabras añadidas de Wiktionary o CMUdict con anotaciones de acento y sílabas. Estas extensiones se usan con frecuencia en sistemas TTS modernos basados en transformadores, que requieren léxicos grandes y diversos.

A pesar de estas limitaciones, el CMU Pronouncing Dictionary sigue siendo una piedra angular de la investigación del habla. Su simplicidad, fiabilidad y licencia abierta han asegurado su relevancia continua durante más de tres décadas, desde los primeros sistemas basados en reglas hasta los enfoques contemporáneos de redes neuronales.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:speech-recognition·pronunciation-dictionary·computational-linguistics·public-domain
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico