Whisper 2022는 OpenAI에서 개발하고 2022년 9월에 오픈소스 소프트웨어로 출시된 범용 음성 인식 모델이다. 오디오를 텍스트로 변환하고 비영어 음성을 영어로 번역하도록 설계되었으며, 96개 언어를 지원한다. 이 모델은 트랜스포머 아키텍처를 기반으로 하며, 680,000시간의 다국어 및 다중 작업 지도 오디오 데이터로 구성된 대규모 데이터셋으로 훈련되어 억양, 배경 소음, 기술 용어에 강건하다.
Whisper 2022는 사전 훈련된 오디오 인코더와 작업별 미세 조정에 크게 의존했던 기존 음성 인식 시스템과의 전환점을 나타낸다. 대신, 현대 대규모 언어 모델과 유사한 인코더-디코더 구조를 갖춘 시퀀스-투-시퀀스 접근 방식을 사용하며, 로그-멜 스펙트로그램으로 변환된 원시 오디오 파형에서 직접 훈련된다. 이 모델의 오픈소스 출시는 연구자와 개발자가 독점적 제한 없이 최첨단 음성 인식을 애플리케이션에 통합할 수 있게 했다.
아키텍처 및 훈련
Whisper 2022는 인코더-디코더 트랜스포머 아키텍처를 사용하며, 인코더는 오디오 스펙트로그램을 처리하고 디코더는 텍스트 토큰을 생성한다. 멀티 헤드 어텐션과 위치 인코딩 메커니즘을 사용하며, 이는 표준 트랜스포머 설계와 일치한다. 이 모델은 비영어 음성을 포함한 웹의 다양한 오디오 말뭉치로 훈련되었으며, 편향을 줄이고 일반화를 개선하는 데 중점을 두었다.
훈련 데이터는 680,000시간의 오디오로 구성되었으며, 그중 117,000시간은 96개 언어를 포괄하는 비영어 음성이었다. 데이터셋은 65%의 영어 오디오, 18%의 비영어 오디오, 그리고 음악과 소음과 같은 기타 데이터 17%를 포함했다. 이러한 다양성 덕분에 Whisper는 배경 음악, 중첩 음성, 다양한 녹음 품질을 포함한 다양한 음향 조건을 처리할 수 있었다. 모델은 Adam 옵티마이저와 학습률 스케줄, 그리고 기울기 클리핑을 사용하여 훈련 안정성을 높였다.
기능 및 성능
Whisper 2022는 전사, 번역(비영어에서 영어로), 언어 식별과 같은 여러 작업을 지원한다. 오디오를 세그먼트로 처리할 수 있으며, 최대 세그먼트 길이는 30초이고, 디코딩에는 빔 서치를 사용하며, 출력 다양성을 제어하기 위해 top-k 샘플링과 온도 스케일링 옵션을 제공한다. 이 모델은 LibriSpeech 및 Common Voice와 같은 일반적인 벤치마크에서 경쟁력 있는 단어 오류율을 달성하며, 종종 기존 오픈소스 시스템을 능가한다.
영어 전사의 경우, Whisper 2022는 LibriSpeech test-clean 세트에서 5.2%의 단어 오류율을, test-other에서 10.4%를 보고한다. 다국어 작업에서는 20개 언어에 걸쳐 중앙값 단어 오류율 10.4%를 달성하며, 특히 로망스어와 게르만어 계열 언어에서 강력한 성능을 보인다. 또한 이 모델은 소음이 많은 환경에 대한 강건성을 입증하여, 실제 오디오로 테스트했을 때 이전 시스템에 비해 오류율을 최대 50%까지 줄였다.
오픈소스 출시 및 영향
Whisper 2022가 MIT 라이선스 하에 오픈소스 소프트웨어로 출시되면서 학계와 산업계 전반에서 광범위하게 채택되었다. 이 모델은 실시간 전사 서비스, 음성 비서, 접근성 도구를 포함한 생성형 AI 애플리케이션의 기반 도구가 되었다. 모델의 코드와 사전 훈련된 가중치는 GitHub에서 제공되었으며, 개발자는 데이터 증강 기법을 사용하여 특정 도메인에 맞게 미세 조정할 수 있었다.
Whisper 2022는 음성 인식 및 딥러닝 연구, 특히 대규모 약한 지도 훈련의 사용에 영향을 미쳤다. 또한 Anthropic 및 Google DeepMind의 노력과 함께 강력한 AI 모델을 오픈소스화하는 광범위한 추세에 기여했다. 이 모델의 성공은 데이터 다양성과 모델 규모의 중요성을 강조하며, 다국어 음성 시스템의 추가 발전으로 이어졌다.
한계 및 윤리적 고려 사항
강점에도 불구하고 Whisper 2022에는 한계가 있다. 극도로 짧은 오디오 클립(5초 미만)에서 어려움을 겪을 수 있으며, 침묵이나 비음성 오디오를 처리할 때 텍스트를 환각할 수 있다. 또한 훈련 데이터가 제한적인 일부 아프리카 및 아시아 언어에서는 성능이 저하된다. 추가로, 웹에서 수집된 훈련 데이터에는 편향되거나 부적절한 내용이 포함될 수 있으며, 이는 출력에 영향을 줄 수 있다.
OpenAI는 이러한 문제를 인정하고 고위험 애플리케이션에서 Whisper를 주의해서 사용할 것을 권장했다. 오픈소스 특성 덕분에 커뮤니티가 모델을 감사하고 개선할 수 있었지만, 무단 감시나 잘못된 표현과 같은 잠재적 오용에 대한 우려도 제기되었다. 2023년 기준으로 Whisper 2022는 음성 인식 연구에서 널리 사용되는 기준 모델로 남아 있으며, 커뮤니티에서 후속 버전과 파생 모델이 개발되었다.
참고 문헌 및 추가 자료
Whisper 2022는 2022년 9월 OpenAI 연구자들이 발표한 "Robust Speech Recognition via Large-Scale Weak Supervision"이라는 기술 논문에서 소개되었다. 모델의 아키텍처와 훈련 세부 사항은 해당 논문에 문서화되어 있으며, 여러 벤치마크에 대한 평가 결과도 포함된다. 실용적인 사용을 위해 공식 저장소는 추론 및 미세 조정 스크립트를 제공하며, 모델은 Amazon Web Services 및 Azure 클라우드 플랫폼을 통해 사용할 수 있다.
추가 정보는 음성 인식 및 트랜스포머 기반 모델에 대한 학술 조사와, Whisper를 GPU 추론에 최적화한 NVIDIA 및 기타 하드웨어 공급업체의 문서에서 찾을 수 있다. 이 모델이 접근성과 다국어 커뮤니케이션에 미친 영향은 인간-컴퓨터 상호작용 연구에서 계속 연구되고 있다.