CMU发音词典(又称cmudict)是一本面向北美英语的机器可读发音词典。它由Carnegie Mellon University创建,并由该大学的语音组维护。该词典使用39个音素(外加重音标记)提供从单词到其音标转写的映射。它已发布到公共领域,使其成为语音技术和计算语言学的基础资源。
该词典的起源可以追溯到20世纪80年代,最初是为卡内基梅隆大学的语音识别研究而开发。其首次公开发布是在1993年,此后不断更新。当前版本(0.7b)包含超过134,000个条目,涵盖常用词、专有名词和缩写词。每个条目以单词的小写形式列出,后跟其音素序列,并在元音后放置重音标记(0、1或2)。
音素集与转写格式
CMU发音词典使用基于ARPABET系统的音素集,该系统最初为ARPA语音理解研究项目开发。该音素集包括39个音素,如元音(例如,AA、IY、UW)和辅音(例如,K、S、T)。重音用数字标记:0表示无重音,1表示主重音,2表示次重音。例如,单词“hello”被转写为“HH AH0 L OW1”。这种格式简单、基于ASCII,且易于软件解析。
该词典还包含许多单词的多种发音,用括号数字表示(例如,“the(1)”和“the(2)”)。这些变体捕捉了地区或语境差异,如“the”中的中央元音与重读元音。此外,它还包含屈折形式、复合词以及英语中常用的一些外来词的条目。
在语音技术中的应用
该词典是Artificial intelligence和Machine learning语音处理流程中的标准资源。它在自动语音识别(ASR)系统中用作发音词典,使模型能够将声学信号映射到单词序列。在文本到语音(TTS)合成中,它提供生成自然语音所需的语音输入。许多开源工具包,如Kaldi和ESPnet,都将cmudict作为默认词典。
除了ASR和TTS之外,该词典还用于Natural language processing任务,如字素到音素转换,其中模型学习预测未见单词的发音。它还可作为评估发音预测算法的基准。Stanford AI Lab和MIT CSAIL等机构的研究人员已在语音对齐和语音合成研究中使用了cmudict。
格式与分发
该词典以纯文本文件形式分发,每行一个条目。格式为:单词后跟一个或多个空格,然后是音素序列。注释和元数据极少,保持文件紧凑。它可从卡内基梅隆大学语音组网站下载,并在许多开源存储库中镜像。其公共领域状态允许不受限制的使用、修改和再分发,使其成为商业和学术项目的首选。
多年来,从cmudict衍生出了多种资源,包括其他语言的发音词典(通过翻译)以及带有音节边界或词性标注的词典。这些衍生版本常用于Deep learning语音和语言模型中,为端到端系统提供监督信号。
局限与扩展
尽管内容全面,该词典仍存在已知局限。它仅覆盖北美英语,且其音素集未捕捉所有方言变体。一些条目可能过时,或缺少近期出现的专有名词和技术术语。为解决这些问题,社区努力产生了扩展版本,如从维基词典添加单词的cmudict,或带有重音和音节标注的CMUdict。这些扩展版本常用于现代基于Transformer (architecture)的TTS系统,这些系统需要大型、多样的词典。
尽管存在这些局限,CMU发音词典仍是语音研究的基石。其简单性、可靠性和开放许可确保了其在三十多年中的持续相关性,从早期基于规则的系统到当代Neural network方法。
参见
- Sequence-to-Sequence (Seq2Seq),用于使用发音词典的模型
- Data Augmentation,用于生成合成语音数据的技术
- Carnegie Mellon University,作为起源机构