Conformer는 신경망 아키텍처로, 자동 음성 인식을 위해 설계되었으며, 2020년 연구 논문에서 Google의 엔지니어들에 의해 처음 제안되었습니다. 이 이름은 "합성곱"과 "트랜스포머"의 합성어로, 두 접근 방식의 강점을 결합한 하이브리드 설계를 반영합니다. Conformer는 초기 시퀀스-투-시퀀스 모델의 한계를 해결하기 위해 개발되었으며, 이러한 모델은 음성 신호에서 단거리 음향 패턴과 장거리 맥락적 관계를 효율적으로 포착하는 데 어려움을 겪었습니다.
이 아키텍처는 일련의 Conformer 블록을 통해 오디오 특징을 처리하며, 각 블록은 피드-포워드 모듈, 다중 헤드 자기-주의 메커니즘, 합성곱 모듈, 및 두 번째 피드-포워드 모듈을 포함한 일련의 하위 레이어를 포함합니다. 합성곱 모듈은 커널 크기가 31인 깊이별 분리 합성곱을 사용하며, 이는 일반적인 합성곱 필터보다 크며, 모델이 더 넓은 시간 창에 걸쳐 로컬 의존성을 포착할 수 있게 합니다. Transformer (architecture) 아키텍처에서 차용된 자기-주의 구성 요소는 전체 입력 시퀀스에 걸쳐 전역 의존성을 처리합니다. 이 조합은 Conformer가 세밀한 음향 세부 사항과 더 넓은 음운론적 또는 언어적 맥락을 동시에 모델링할 수 있게 합니다.
아키텍처 세부 사항
각 Conformer 블록은 특정 배열을 따릅니다: 반-스텝 피드-포워드 레이어, 자기-주의 레이어, 합성곱 레이어, 및 최종 피드-포워드 레이어이며, 잔여 연결과 레이어 정규화가 전체에 적용됩니다. 피드-포워드 레이어는 모델의 임베딩 크기보다 네 배 큰 숨은 차원을 사용하며, Swish 활성화 함수를 사용합니다. 자기-주의 메커니즘은 상대적 정현파 위치 인코딩을 사용하며, 이는 모델이 오디오 프레임 간의 상대적 타이밍을 이해하는 데 도움을 줍니다. 합성곱 모듈은 포인트별 합성곱, 게이트 선형 유닛, 깊이별 합성곱, 및 또 다른 포인트별 합성곱으로 구성되며, 깊이별 단계 후 배치 정규화가 적용됩니다
성능 및 벤치마크
LibriSpeech 벤치마크에서, 음성 인식 평가를 위한 표준 데이터셋으로, Conformer는 외부 언어 모델과 결합했을 때 test-clean 세트에서 2.1% 및 test-other 세트에서 ㅇ4.3%의 단어 오류율을 달성했습니다. 언어 모델 없이도, 이 아키텍처는 여전히 경쟁력 있는 성능을 보였으며, 각각 2.3% 및 4.9%에 도달했습니다. 이러한 결과는 트랜스포머 기반 Speech-Transformer 및 합성곱 기반 DeepSpeech2와 같은 이전 최첨단 모델에 비해 상당한 개선을 나타냈으며, 특히 시끄럽거나 다양한 음성 조건을 처리하는 데 두드러졌습니다. 모델의 효율성도 두드러졌으며, 비교 가능한 트랜스포머-전용 시스템보다 적은 매개변수를 요구하면서 더 나은 정확도를 달성했습니다
변형 및 적응
연구자들은 다양한 배포 시나리오에 맞게 Conformer의 여러 변형을 개발했습니다. Conformer-Tiny, Conformer-Small, 및 Conformer-Middle 구성은 리소스-제약된 환경, 예를 들어 모바일 폰 또는 임베디드 시스템의 온-디바이스 음성 인식에서 모델의 깊이와 너비를 축소합니다. 2021년에, Google은 Streaming Conformer를 도입했으며, 이는 주의 메커니즘을 수정하여 인과적, 왼쪽-맥락-전용 방식으로 작동하게 하여, 최소 지연 시간으로 실시간 전사를 가능하게 합니다. 또 다른 주목할 만한 적응은 Squeezeformer이며, 이는 중복 피드-포워드 레이어를 줄이고 주의 패턴을 조정하여 Conformer 블록을 단순화하며, 비교 가능한 정확도를 유지하면서 더 빠른 추론 속도를 달성합니다
응용 및 영향
Conformer 아키텍처는 현대 음성 인식 시스템에서 기초 구성 요소가 되었습니다. 이는 Google의 프로덕션 음성-투-텍스트 서비스에 통합되어, Android 기기의 음성 검색, 받아쓰기, 및 실시간 캡셔닝과 같은 기능을 지원합니다. 이 아키텍처는 또한 화자 검증, 오디오 이벤트 분류, 및 음악 정보 검색을 포함한 다른 영역에도 영향을 미쳤으며, 여기서 오디오의 로컬 및 전역 패턴을 모두 포착하는 것이 중요합니다. 더 넓은 딥 러닝 분야에서, Conformer는 합성곱 및 주의 메커니즘을 결합한 하이브리드 아키텍처가 순차 데이터에 대해 순수 트랜스포머 설계보다 우수할 수 있음을 입증했으며, 음성 외의 머신 러닝 연구에서 유사한 접근 방식을 고무했습니다
미래 방향
후속 작업은 대규모 언어 모델과 Conformer를 통합하여 종단-투-종단 음성 이해 작업, 예를 들어 음성 질문 응답 및 음성 번역을 탐구했습니다. 연구자들은 또한 지식 증류 및 양자화를 포함한 효율적인 훈련 기술을 조사하여, Conformer 모델의 계산 비용을 줄였습니다. 2024년 현재, Conformer는 여전히 활발한 연구 영역이며, 다양한 억양, 배경 소음, 및 다국어 입력에 대한 견고성을 개선하려는 지속적인 노력이 있습니다. 이 아키텍처의 유연성과 입증된 성능은 가까운 시일 내에 음성 처리 혁신을 위한 기준선으로 계속 역할을 할 것임을 시사합니다
참고 문헌
원래 Conformer 논문, 제목 "Conformer: Convolution-augmented Transformer for Speech Recognition,"은 2020년 Interspeech 컨퍼런스에서 발표되었습니다. 후속 출판물은 Streaming Conformer 및 Squeezeformer 변형을 상세히 설명했으며, 소스 코드와 사전 훈련된 모델은 학술 및 상업적 사용을 위해 오픈-소스 라이선스로 공개되었습니다.