영어에서 번역됨

오픈AI가 2022년 9월에 출시한 오픈소스 자동 음성 인식 시스템으로, 68만 시간의 다국어 오디오로 학습되었으며 전사, 자막 생성, 음성 인터페이스 애플리케이션에 널리 채택되었습니다.

Whisper는 2022년 9월 OpenAI가 오픈소스 모델로 공개한 자동 음성 인식 시스템으로, 코드와 학습된 가중치가 모두 공개적으로 제공되었다. OpenAI의 이후 대부분의 릴리스와 달리, Whisper는 훈련 데이터와 방법론을 설명하는 상세한 기술 논문과 함께 출판되어, 이 기간 동안 주요 AI 연구소의 릴리스 중 하나로 더 투명한 공개 사례가 되었다.

훈련 및 아키텍처

Whisper는 트랜스포머 기반 인코더-디코더 모델로, 웹에서 수집한 680,000시간의 오디오와 해당 전사 텍스트를 쌍으로 사용하여 대체로 지도 방식, 약한 라벨링 방식으로 훈련되었다. 해당 오디오의 약 3분의 1은 비영어권이었으며, 약 100개 언어에 걸쳐 있었고, 훈련 데이터의 일부는 번역 쌍으로 구성되어 모델에 전사 기능과 함께 음성-텍스트 번역 기능을 내장하게 했다. 이렇게 규모가 크고 다양한 약한 지도 데이터는 더 작고 선별된 학술 데이터 세트로 훈련된 초기 음성 인식 시스템과 의도적으로 대비되었으며, 확장과 데이터 다양성이 견고성을 향상시킨다는 분야의 광범위한 발견을 반영했다. 모델은 장치 내 사용에 적합한 경량 "tiny" 버전부터 최고 정확도를 제공하는 대형 모델까지 여러 크기로 출시되었으며, 이 접근 방식은 이후 여러 언어에서 성능을 개선한 v2 및 v3 업데이트에서도 이어졌다.

채택 및 영향

Whisper의 가중치가 허용적인 오픈 라이선스로 공개되었기 때문에, 회의 전사 도구, 자막 생성기, 음성 비서, 접근성 소프트웨어를 포함한 다양한 타사 제품과 오픈소스 프로젝트에 빠르게 통합되었다. 이전 상용 ASR 시스템에 비해 억양, 배경 소음, 기술 용어에 대한 견고성 덕분에, Whisper는 자연어 처리 파이프라인에서 음성-텍스트 프론트 엔드가 필요한 개발자들의 일반적인 기본 선택이 되었다. Whisper는 또한 더 큰 멀티모달 및 음성 상호작용 시스템의 구성 요소가 되었으며, 전사된 텍스트를 대형 언어 모델에 공급하여 음성 비서와 콜센터 자동화에 사용되었고, 그 전사본은 다른 오디오 및 음성 프로젝트의 훈련 데이터 소스로도 활용되었다.

이 모델의 공개는 주요 연구소들이 플래그십 생성 모델은 비공개로 유지하면서도 오픈 가중치 기반의 파운데이션 모델 스타일 릴리스를 내놓는 더 넓은 추세에 기여했으며, 이는 1년 전 CLIP에서도 볼 수 있었던 패턴이다. 전사 및 번역 기능의 구축 비용을 낮췄기 때문에, Whisper는 음성 기반 AI 애플리케이션 실험을 가속화하는 요인으로 자주 언급되었으며, 초기에는 텍스트-음성음성 복제 파이프라인에 공급되어 더빙 및 현지화 제품에 사용되는 통합 사례도 포함되었다. 2025년 현재에도 학술 및 산업 음성 연구에서 벤치마크이자 백본으로 널리 사용되고 있다.

한계

Whisper는 약점이 없는 것은 아니다: 특히 침묵이나 비음성 오디오 중에 말해지지 않은 텍스트를 환각할 수 있으며, 이는 생성 언어 모델에서 보이는 더 광범위한 환각 문제와 관련이 있지만 구별되는 실패 모드이다. 정확도는 언어에 따라 크게 달라지며, 저자원 언어는 영어 및 훈련 데이터에서 잘 표현된 다른 언어보다 오류율이 높다. 또한 연구자들은 모델이 의료 및 기타 고위험 전사본에 허구적 구절을 삽입하는 사례를 문서화하여, 민감한 맥락에서 감독되지 않은 사용에 대한 주의를 촉구했다.

분류:speech-recognition·open-source-ai·openai-models
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사