CMU 발음 사전(또한 cmudict로 알려짐)은 북미 영어를 위한 기계 판독 가능한 발음 사전이다. 이 사전은 Carnegie Mellon University에서 만들어졌으며, 대학의 음성 그룹이 유지 관리하고 있다. 이 사전은 39개의 음소(강세 표시 포함) 집합을 사용하여 단어에서 음성 전사로의 매핑을 제공한다. 공개 도메인으로 공개되어 음성 기술과 전산 언어학의 기초 자원이 되고 있다.
이 사전의 기원은 1980년대 카네기 멜론 대학의 음성 인식 연구를 위해 개발된 데서 시작된다. 첫 공개 릴리스는 1993년에 이루어졌으며, 이후 지속적으로 업데이트되었다. 현재 버전(0.7b)에는 134,000개 이상의 항목이 포함되어 있으며, 일반 단어, 고유 명사, 약어를 다룬다. 각 항목은 소문자 단어와 모음 뒤에 배치된 강세 표시(0, 1, 2)가 있는 음소 시퀀스를 나열한다.
음소 집합 및 전사 형식
CMU 발음 사전은 원래 ARPA 음성 이해 연구 프로젝트를 위해 개발된 ARPABET 시스템에 기반한 음소 집합을 사용한다. 이 집합에는 모음(예: AA, IY, UW)과 자음(예: K, S, T)을 포함한 39개의 음소가 포함된다. 강세는 숫자로 표시된다: 0은 무강세, 1은 주강세, 2는 부강세를 나타낸다. 예를 들어, "hello"라는 단어는 "HH AH0 L OW1"로 전사된다. 이 형식은 간단하고, ASCII 기반이며, 소프트웨어로 쉽게 파싱할 수 있다.
이 사전은 또한 많은 단어에 대해 괄호 숫자로 표시된 여러 발음을 포함한다(예: "the(1)" 및 "the(2)"). 이러한 변형은 "the"에서 슈와 대 강세 모음과 같은 지역적 또는 맥락적 차이를 포착한다. 또한 굴절 형태, 복합어, 영어에서 흔히 사용되는 일부 외래어에 대한 항목도 포함한다.
음성 기술에서의 응용
이 사전은 음성 처리를 위한 Artificial intelligence 및 Machine learning 파이프라인의 표준 자원이다. 자동 음성 인식(ASR) 시스템에서 발음 어휘로 사용되어 모델이 음향 신호를 단어 시퀀스에 매핑할 수 있게 한다. 음성 합성(TTS)에서는 자연스러운 음성을 생성하는 데 필요한 음성 입력을 제공한다. Kaldi 및 ESPnet과 같은 많은 오픈 소스 툴킷은 cmudict를 기본 어휘로 포함한다.
ASR 및 TTS 외에도, 이 사전은 Natural language processing 작업, 예를 들어 그래핌-음소 변환에서 사용되며, 모델이 보이지 않는 단어에 대한 발음을 예측하는 방법을 학습한다. 또한 발음 예측 알고리즘을 평가하기 위한 벤치마크 역할도 한다. Stanford AI Lab 및 MIT CSAIL과 같은 기관의 연구자들은 음성 정렬 및 음성 합성 연구에서 cmudict를 사용해 왔다.
형식 및 배포
이 사전은 일반 텍스트 파일로 배포되며, 각 줄에 하나의 항목이 있다. 형식은 단어 다음에 하나 이상의 공백, 그 다음 음소 시퀀스이다. 주석과 메타데이터는 최소화되어 파일을 간결하게 유지한다. 카네기 멜론 음성 그룹의 웹사이트에서 다운로드할 수 있으며, 많은 오픈 소스 저장소에 미러링되어 있다. 공개 도메인 상태는 무제한 사용, 수정, 재배포를 허용하므로 상업 및 학술 프로젝트 모두에서 선호되는 선택이다.
수년에 걸쳐 cmudict에서 여러 파생 자원이 만들어졌으며, 여기에는 다른 언어용 발음 사전(번역을 통한) 및 음절 경계나 품사 태그가 추가된 어휘가 포함된다. 이러한 파생물은 Deep learning 음성 및 언어 모델에서 자주 사용되며, 종단 간 시스템에 감독 신호를 제공한다.
한계 및 확장
포괄적이지만, 이 사전에는 알려진 한계가 있다. 북미 영어만 다루며, 음소 집합은 모든 방언 변형을 포착하지 못한다. 일부 항목은 오래되었거나 최근 고유 명사 및 기술 용어가 누락될 수 있다. 이를 해결하기 위해 커뮤니티 노력으로 Wiktionary의 단어가 추가된 cmudict 또는 강세 및 음절 주석이 있는 CMUdict와 같은 확장 버전이 생산되었다. 이러한 확장은 크고 다양한 어휘를 필요로 하는 현대 Transformer (architecture) 기반 TTS 시스템에서 자주 사용된다.
이러한 한계에도 불구하고, CMU 발음 사전은 음성 연구의 초석으로 남아 있다. 단순성, 신뢰성, 개방형 라이선스 덕분에 초기 규칙 기반 시스템에서 현대 Neural network 접근 방식에 이르기까지 30년 이상 지속적인 관련성을 보장해 왔다.
같이 보기
- 발음 어휘를 사용하는 모델에 대한 Sequence-to-Sequence (Seq2Seq)
- 합성 음성 데이터를 생성하는 기술에 대한 Data Augmentation
- 기원 기관으로서의 Carnegie Mellon University