OpenAI Whisper 출시

영어에서 번역됨

OpenAI Whisper는 2022년에 출시된 오픈소스 자동 음성 인식 시스템으로, 680,000시간의 다국어 데이터로 훈련되어 98개 언어에 걸친 강력한 전사 및 번역을 가능하게 한다.

OpenAI Whisper는 2022년 9월 OpenAI가 오픈소스 소프트웨어로 출시한 자동 음성 인식(ASR) 시스템이다. 이는 68만 시간의 다국어 및 멀티태스크 감독 웹 수집 오디오로 구성된 다양한 데이터 세트로 훈련된 신경망 모델로, 여기에는 11만 7천 시간의 비영어 음성이 포함된다. 이 모델은 음성을 텍스트로 전사하고 영어로 번역하도록 설계되었으며, 98개 언어를 지원한다. Whisper의 아키텍처는 Transformer 인코더-디코더 프레임워크를 기반으로 하며, 이는 기계 학습에서 시퀀스 간 작업을 위한 표준이 된 딥러닝 접근 방식이다.

Whisper의 출시는 음성 분야의 생성형 AI에 중요한 이정표를 세웠으며, 최첨단 ASR 기능을 연구자와 개발자에게 무료로 제공했다. 폐쇄적이거나 유료 API를 요구했던 많은 상용 음성 인식 시스템과 달리, Whisper의 오픈소스 특성은 미세 조정, 로컬 하드웨어 배포, 다양한 애플리케이션 통합을 가능하게 했다. 배경 소음, 억양, 다양한 말하기 스타일에 대한 견고성은 웹에서 수집되고 깨끗한 녹음과 잡음이 있는 녹음을 모두 포함한 훈련 데이터의 규모와 다양성에 기인했다.

모델 아키텍처 및 훈련

Whisper는 오디오의 로그 멜 스펙트로그램을 처리하는 인코더와 텍스트 토큰을 생성하는 디코더를 갖춘 표준 Transformer 아키텍처를 사용한다. 이 모델은 멀티 헤드 어텐션위치 인코딩을 사용하여 오디오 신호의 시간적 종속성을 포착한다. 디코더가 인코딩된 오디오 표현에 조건화된 텍스트 토큰을 예측하는 시퀀스 간 목적 함수로 훈련되었다. 훈련 과정은 Adam 옵티마이저학습률 스케줄을 활용했으며, 드롭아웃그래디언트 클리핑과 같은 기법을 통합하여 과적합을 방지했다.

Whisper 훈련의 핵심 혁신은 멀티태스크 형식의 사용으로, 모델이 전사, 번역 또는 언어 식별과 같은 다양한 작업을 수행하도록 특수 토큰으로 프롬프트되었다. 이를 통해 단일 모델이 작업별 미세 조정 없이 여러 언어와 작업을 처리할 수 있었다. 훈련 데이터에는 68만 시간의 오디오가 포함되었으며, 65%는 영어, 18%는 기타 언어, 17%는 비영어 음성의 영어 번역이었다. 이러한 다양성은 교차 언어 전이를 활용할 수 있게 하여 저자원 언어에 대한 Whisper의 강력한 성능에 기여했다.

기능 및 성능

Whisper는 표준 벤치마크에서 경쟁력 있는 단어 오류율(WER)을 달성하며, 종종 상용 시스템과 일치하거나 능가한다. 영어의 경우 LibriSpeech test-clean 세트에서 약 5.2%의 WER을 보고했으며, 다국어 작업의 경우 Common Voice 및 Fleurs 데이터 세트에서 강력한 성능을 입증했다. 이 모델은 또한 98개 언어 중 어느 언어에서든 영어로 번역하는 기능을 지원하며, 이 기능은 동일한 아키텍처에 통합되었다. Whisper의 소음 및 잔향에 대한 견고성은 평가에서 강조되었으며, DeepSpeech 및 Kaldi 기반 시스템과 같은 이전 오픈소스 모델을 능가했다.

이 모델은 tiny(3,900만 매개변수)부터 large-v2(15억 매개변수)까지 다양한 크기로 제공되어 사용자가 속도와 정확성을 절충할 수 있다. 더 큰 모델은 더 나은 성능을 달성하지만 더 많은 계산 리소스가 필요하다. Whisper는 또한 출력 다양성을 제어하기 위해 온도 스케일링top-p 샘플링 옵션과 함께 빔 서치 디코딩을 지원한다.

오픈소스 영향 및 채택

MIT 라이선스 하에 Whisper의 오픈소스 출시는 학계와 산업 전반에 걸쳐 광범위한 채택을 가능하게 했다. 이는 음성 분야의 인공지능 연구를 위한 기초 도구가 되었으며, Hugging Face와 같은 플랫폼에 통합되고(제공된 슬러그 목록에는 없지만 일반적인 저장소임) 전사 서비스에서 접근성 도구에 이르는 애플리케이션에 사용되었다. 소비자 GPU에서 실행할 수 있는 모델의 능력은 독립 개발자에게 접근성을 제공했으며, 의료 전사 및 법률 문서화와 같은 특정 도메인을 위한 미세 조정 변형 커뮤니티를 조성했다.

Google DeepMindAnthropic의 동시대 출시와 비교할 때, Whisper는 텍스트 생성보다는 음성에 중점을 두어 오픈소스 생태계의 공백을 메웠다. 그 성공은 오디오 기능을 갖춘 OpenAI의 GPT-4o와 같은 이후 음성 모델 개발에도 영향을 미쳤지만, Whisper는 독립형 도구로 남아 있었다.

한계 및 윤리적 고려 사항

강점에도 불구하고 Whisper에는 한계가 있다. 조용한 구간이나 음악 전용 구간에서 텍스트를 환각할 수 있으며, 억양이 강하거나 코드 스위칭된 음성에서는 성능이 저하된다. 웹에서 수집된 훈련 데이터는 편향을 포함할 수 있으며, 모델은 이러한 편향을 반영하는 전사를 생성할 수 있다. OpenAI는 모델 카드에서 이러한 문제를 인정했으며, 민감한 애플리케이션에서 신중한 사용을 권장했다. 또한 대규모 모델 훈련의 계산 비용은 환경적 우려를 제기하지만, 오픈소스 출시는 적당한 하드웨어에서 추론을 허용하여 일부 장벽을 완화했다.

유산 및 향후 방향

Whisper는 오픈소스 ASR의 벤치마크를 확립했으며, NVIDIA의 Parakeet 및 Meta의 SeamlessM4T와 같은 이후 모델에 영향을 미쳤다. 그 아키텍처와 훈련 방법론은 다양한 연구 프로젝트에서 채택되었으며, 그 출시는 다국어 음성 인식의 발전을 가속화했다. 2025년 현재 Whisper는 여전히 널리 사용되고 있으며, 후속 모델인 Whisper large-v3는 2023년에 저자원 언어에 대한 개선된 성능으로 출시되었다. 모델의 오픈소스 특성은 기계 학습딥러닝 애플리케이션의 혁신을 계속 지원하고 있다.

참고 문헌

  • OpenAI Whisper 모델 카드 및 기술 보고서 (2022)
  • Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (2022)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:speech-recognition·openai·open-source-ai·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사