Traduzido do inglês

Um sistema de reconhecimento automático de fala de código aberto lançado pela OpenAI em setembro de 2022, treinado em 680.000 horas de áudio multilíngue e amplamente adotado para aplicações de transcrição, legendagem e interfaces de voz.

Whisper é um sistema automático de reconhecimento de fala lançado pela OpenAI em setembro de 2022 como um modelo de código aberto, com tanto o código quanto os pesos treinados disponibilizados publicamente. Diferentemente da maioria dos lançamentos posteriores da OpenAI, o Whisper foi publicado com um artigo técnico detalhado descrevendo seus dados de treinamento e metodologia, tornando-o um dos lançamentos mais transparentes de um grande laboratório de IA durante esse período.

Treinamento e arquitetura

O Whisper é um modelo codificador-decodificador baseado em transformador, treinado de forma amplamente supervisionada e fracamente rotulada em 680.000 horas de áudio coletado da web, emparelhado com transcrições correspondentes. Aproximadamente um terço desse áudio era em idiomas não ingleses, abrangendo cerca de 100 línguas, e uma parte dos dados de treinamento consistia em pares de tradução, dando ao modelo capacidade integrada de tradução de fala para texto, além da transcrição. Essa escala e diversidade de dados fracamente supervisionados foi um contraste deliberado com sistemas anteriores de reconhecimento de fala treinados em conjuntos de dados acadêmicos menores e mais curados, ecoando descobertas mais amplas no campo sobre leis de escala e diversidade de dados melhorando a robustez. O modelo foi lançado em vários tamanhos, desde uma versão "tiny" leve, adequada para uso em dispositivos, até um modelo grande que oferece a maior precisão, uma abordagem posteriormente seguida pelas atualizações v2 e v3, que melhoraram o desempenho em vários idiomas.

Adoção e impacto

Como os pesos do Whisper foram lançados sob uma licença aberta permissiva, ele foi rapidamente integrado a uma ampla gama de produtos de terceiros e projetos de código aberto, incluindo ferramentas de transcrição de reuniões, geradores de legendas, assistentes de voz e software de acessibilidade. Sua robustez a sotaques, ruídos de fundo e vocabulário técnico, em comparação com sistemas comerciais anteriores de reconhecimento de fala, tornou-o uma escolha padrão comum para desenvolvedores que construíam pipelines de processamento de linguagem natural que precisavam de um front-end de fala para texto. O Whisper também se tornou um componente em sistemas maiores multimodais e de interação por voz, alimentando texto transcrito em modelos de linguagem de grande porte para assistentes de voz e automação de centrais de atendimento, e suas transcrições têm sido usadas como fonte de dados de treinamento para outros projetos de áudio e fala.

O lançamento do modelo contribuiu para uma tendência mais ampla de lançamentos de pesos abertos no estilo de modelos de fundação por grandes laboratórios, mesmo enquanto esses mesmos laboratórios mantinham seus modelos generativos principais fechados, um padrão também observado com o CLIP um ano antes. Como reduziu o custo de construir recursos de transcrição e tradução, o Whisper foi frequentemente citado como um fator que acelerou a experimentação com aplicações de IA orientadas por voz, incluindo integrações iniciais em pipelines de texto para fala e clonagem de voz para produtos de dublagem e localização, e permanece amplamente utilizado como referência e espinha dorsal na pesquisa acadêmica e industrial sobre fala até 2025.

Limitações

O Whisper não está isento de fraquezas: ele pode alucinar texto que nunca foi falado, particularmente durante silêncios ou áudio sem fala, um modo de falha relacionado, mas distinto, do problema mais amplo de alucinação visto em modelos de linguagem generativos. A precisão também varia substancialmente entre idiomas, com línguas de menos recursos apresentando taxas de erro mais altas do que o inglês e outras línguas bem representadas em seus dados de treinamento, e pesquisadores documentaram casos do modelo inserindo frases fabricadas em transcrições médicas e outras de alto risco, o que gera cautela quanto ao uso não supervisionado em contextos sensíveis.

Categorias:speech-recognition·open-source-ai·openai-models
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico