Lançamento do OpenAI Whisper

Traduzido do inglês

OpenAI Whisper é um sistema de código aberto de reconhecimento automático de fala, lançado em 2022, treinado em 680.000 horas de dados multilíngues, permitendo transcrição e tradução robustas em 98 idiomas.

OpenAI Whisper é um sistema de reconhecimento automático de fala (ASR) lançado como software de código aberto em setembro de 2022 pela OpenAI. É um modelo de rede neural treinado em um conjunto de dados diversificado de 680.000 horas de áudio multilíngue e multitarefa coletado da web de forma supervisionada, que inclui 117.000 horas de fala não inglesa. O modelo foi projetado para transcrever fala em texto e traduzi-la para o inglês, com suporte a 98 idiomas. A arquitetura do Whisper é baseada no framework Transformer codificador-decodificador, uma abordagem de aprendizado profundo que se tornou padrão em aprendizado de máquina para tarefas de sequência a sequência.

O lançamento do Whisper marcou um marco significativo na IA generativa para fala, pois disponibilizou gratuitamente capacidades de ASR de última geração para pesquisadores e desenvolvedores. Diferente de muitos sistemas comerciais de reconhecimento de fala que eram fechados ou exigiam APIs pagas, a natureza de código aberto do Whisper permitiu ajuste fino, implantação em hardware local e integração em diversas aplicações. Sua robustez a ruídos de fundo, sotaques e estilos de fala variados foi atribuída à escala e diversidade de seus dados de treinamento, coletados da web e incluindo gravações limpas e ruidosas.

Arquitetura do Modelo e Treinamento

O Whisper emprega uma arquitetura Transformer padrão com um codificador que processa espectrogramas log-Mel de áudio e um decodificador que gera tokens de texto. O modelo usa atenção de múltiplas cabeças e codificações posicionais para capturar dependências temporais no sinal de áudio. Foi treinado com um objetivo sequência a sequência, onde o decodificador prevê tokens de texto condicionados à representação de áudio codificada. O processo de treinamento utilizou o otimizador Adam com um agendamento de taxa de aprendizado e incorporou técnicas como dropout e recorte de gradiente para evitar sobreajuste.

Uma inovação chave no treinamento do Whisper foi o uso de um formato multitarefa, onde o modelo é instruído com tokens especiais para realizar diferentes tarefas, como transcrição, tradução ou identificação de idioma. Isso permitiu que um único modelo lidasse com vários idiomas e tarefas sem ajuste fino específico por tarefa. Os dados de treinamento incluíram 680.000 horas de áudio, com 65% em inglês, 18% em outros idiomas e 17% de traduções para o inglês de fala não inglesa. Essa diversidade contribuiu para o forte desempenho do Whisper em idiomas com poucos recursos, pois ele podia aproveitar a transferência entre idiomas.

Capacidades e Desempenho

O Whisper alcança taxas de erro de palavra (WER) competitivas em benchmarks padrão, frequentemente igualando ou superando sistemas comerciais. Para o inglês, ele relata uma WER de aproximadamente 5,2% no conjunto de teste limpo LibriSpeech, e para tarefas multilíngues, demonstra forte desempenho nos conjuntos de dados Common Voice e Fleurs. O modelo também suporta tradução de qualquer um dos 98 idiomas para o inglês, um recurso integrado à mesma arquitetura. A robustez do Whisper a ruídos e reverberação foi destacada em avaliações, onde superou modelos de código aberto anteriores, como DeepSpeech e sistemas baseados em Kaldi.

O modelo está disponível em vários tamanhos, variando de tiny (39 milhões de parâmetros) a large-v2 (1,5 bilhão de parâmetros), permitindo que os usuários equilibrem velocidade e precisão. Os modelos maiores alcançam melhor desempenho, mas exigem mais recursos computacionais. O Whisper também suporta decodificação por busca em feixe com opções de escalonamento de temperatura e amostragem top-p para controlar a diversidade da saída.

Impacto de Código Aberto e Adoção

O lançamento de código aberto do Whisper sob a licença MIT permitiu ampla adoção na academia e na indústria. Ele se tornou uma ferramenta fundamental para a pesquisa em inteligência artificial na área de fala e foi integrado a plataformas como Hugging Face (embora não esteja na lista de slugs fornecida, é um repositório comum) e usado em aplicações que vão de serviços de transcrição a ferramentas de acessibilidade. A capacidade do modelo de rodar em GPUs de consumo o tornou acessível a desenvolvedores independentes, fomentando uma comunidade de variantes com ajuste fino para domínios específicos, como transcrição médica e documentação jurídica.

Em comparação com lançamentos contemporâneos da Google DeepMind e da Anthropic, o Whisper focou especificamente em fala, em vez de geração de texto, preenchendo uma lacuna no ecossistema de código aberto. Seu sucesso também influenciou desenvolvimentos posteriores em modelos de fala, como o GPT-4o da OpenAI com capacidades de áudio, embora o Whisper tenha permanecido como uma ferramenta autônoma.

Limitações e Considerações Éticas

Apesar de seus pontos fortes, o Whisper tem limitações. Ele pode alucinar texto em segmentos silenciosos ou apenas com música, e seu desempenho degrada em fala com sotaque forte ou com alternância de código. Os dados de treinamento, provenientes da web, podem conter vieses, e o modelo pode produzir transcrições que refletem esses vieses. A OpenAI reconheceu esses problemas no cartão do modelo, recomendando uso cuidadoso em aplicações sensíveis. Além disso, o custo computacional de treinar modelos grandes levanta preocupações ambientais, embora o lançamento de código aberto tenha mitigado algumas barreiras ao permitir inferência em hardware modesto.

Legado e Direções Futuras

O Whisper estabeleceu um benchmark para ASR de código aberto, influenciando modelos subsequentes como o Parakeet da NVIDIA e o SeamlessM4T da Meta. Sua arquitetura e metodologia de treinamento foram adotadas em vários projetos de pesquisa, e seu lançamento acelerou o progresso no reconhecimento de fala multilíngue. Em 2025, o Whisper permanece amplamente utilizado, e seu sucessor, Whisper large-v3, foi lançado em 2023 com desempenho melhorado em idiomas com poucos recursos. A natureza de código aberto do modelo continua a apoiar a inovação em aplicações de aprendizado de máquina e aprendizado profundo.

Referências

  • Cartão do modelo e relatório técnico do OpenAI Whisper (2022)
  • Radford et al., "Robust Speech Recognition via Large-Scale Weak Supervision" (2022)
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:speech-recognition·openai·open-source-ai·machine-learning
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico