Lançamento do Whisper

Traduzido do inglês

Whisper é um modelo de aprendizado de máquina de código aberto para reconhecimento de fala e transcrição, desenvolvido pela OpenAI, lançado pela primeira vez em setembro de 2022. Ele usa uma arquitetura de transformador codificador-decodificador e é treinado em 680.000 horas de pares de áudio-texto com supervisão fraca, suportando transcrição multilíngue e tradução.

Whisper é um modelo de aprendizado de máquina para reconhecimento de fala e transcrição, criado pela OpenAI e lançado pela primeira vez como software de código aberto em setembro de 2022. Ele é capaz de transcrever fala em inglês e vários outros idiomas, e pode traduzir diversos idiomas não ingleses para o inglês. Whisper é um modelo acústico de aprendizado profundo fracamente supervisionado, construído usando uma arquitetura de transformer codificador-decodificador. A OpenAI afirma que a combinação de diferentes dados de treinamento e filtragem pós-treinamento usada em seu desenvolvimento levou a um reconhecimento melhorado de sotaques, ruído de fundo e jargões em comparação com abordagens anteriores. Embora o modelo não supere modelos maiores e mais especializados e ainda sofra de alucinação de IA, ele se mostrou útil para reconhecimento geral de som e tem muitas aplicações em diferentes setores.

Histórico

O reconhecimento de fala tem uma longa história em pesquisa; as primeiras abordagens usavam métodos estatísticos, como alinhamento temporal dinâmico, e posteriormente modelos ocultos de Markov. Por volta dos anos 2010, abordagens com redes neurais profundas tornaram-se mais comuns para modelos de reconhecimento de fala, possibilitadas pela disponibilidade de grandes conjuntos de dados ("big data") e pelo aumento do desempenho computacional. As primeiras abordagens de aprendizado profundo no reconhecimento de fala incluíam redes neurais convolucionais, que eram limitadas devido à sua incapacidade de capturar dados sequenciais, o que posteriormente levou ao desenvolvimento de abordagens sequência-a-sequência, que incluem redes neurais recorrentes, que faziam uso de memória de longo prazo.

Transformers, introduzidos em 2017 pelo Google, deslocaram muitas abordagens anteriores de estado da arte em uma ampla gama de aprendizado de máquina, e começaram a se tornar a arquitetura neural central em campos como modelagem de linguagem e visão computacional. Abordagens fracamente supervisionadas para treinar modelos acústicos foram reconhecidas no início dos anos 2020 como promissoras para abordagens de reconhecimento de fala usando redes neurais profundas.

De acordo com um relatório do NYT, em 2021 a OpenAI acreditava ter esgotado as fontes de dados de maior qualidade para treinar seus grandes modelos de linguagem e decidiu complementar o texto raspado da web com transcrições de vídeos do YouTube e podcasts, e desenvolveu o Whisper para resolver essa tarefa.

O Whisper Large V2 foi lançado em 8 de dezembro de 2022, seguido pelo Whisper Large V3, lançado em novembro de 2023, durante o OpenAI Dev Day. Em março de 2025, a OpenAI lançou novos modelos de transcrição baseados em GPT-4o e GPT-4o mini, ambos com taxas de erro menores que o Whisper.

Arquitetura

A arquitetura do Whisper é baseada em um transformer codificador-decodificador. O áudio de entrada é reamostrado para 16.000 Hertz (Hz) e convertido em um espectrograma de Mel de magnitude logarítmica de 80 canais usando janelas de 25 ms com um passo de 10 ms. O espectrograma é então normalizado para uma faixa de [-1, 1] com média próxima de zero.

O codificador recebe este espectrograma de Mel como entrada e o processa. Ele primeiro passa por duas camadas convolucionais. Embeddings posicionais senoidais são adicionados. Em seguida, é processado por uma série de blocos de transformer codificadores (com conexões residuais de pré-ativação). A saída do codificador é normalizada por camada.

O decodificador é um decodificador transformer padrão. Ele tem a mesma largura e blocos de transformer que o codificador. Ele usa embeddings posicionais aprendidos e representações de tokens de entrada-saída amarradas (usando a mesma matriz de pesos para os embeddings de entrada e saída). Ele usa um tokenizador de codificação por pares de bytes, do mesmo tipo usado no GPT-2. Modelos somente em inglês usam o vocabulário do GPT-2, enquanto modelos multilíngues empregam um vocabulário multilíngue retreinado com o mesmo número de palavras.

Tokens especiais são usados para permitir que o decodificador execute múltiplas tarefas:

  • Tokens que denotam idioma (um token único por idioma).
  • Tokens que especificam a tarefa (<|transcribe|> ou <|translate|>).
  • Tokens que especificam se não há carimbos de tempo presentes (<|notimestamps|>). Se o token não estiver presente, o decodificador prevê carimbos de tempo relativos ao segmento, quantizados em intervalos de 20 ms.
  • <|nospeech|> para detecção de atividade de voz.
  • <|startoftranscript|> e <|endoftranscript|>. Qualquer texto que apareça antes de <|startoftranscript|> não é gerado pelo decodificador, mas fornecido a ele como contexto. A perda é calculada apenas sobre as partes não contextuais da sequência, ou seja, tokens entre esses dois tokens especiais.

Dados de treinamento

O conjunto de dados de treinamento consiste em 680.000 horas de pares de áudio-transcrição rotulados obtidos da internet usando aprendizado semissupervisionado. Isso inclui 117.000 horas em 96 idiomas não ingleses e 125.000 horas de dados de tradução X→inglês, onde X representa qualquer idioma não inglês.

O pré-processamento envolveu padronização das transcrições, filtragem para remover transcrições geradas por máquina usando heurísticas (por exemplo, pontuação, capitalização), identificação de idioma e correspondência com transcrições, deduplicação difusa e deduplicação com conjuntos de dados de avaliação para evitar contaminação de dados. Segmentos sem fala também foram incluídos para permitir o treinamento de detecção de atividade de voz. Para os arquivos que permaneceram após o processo de filtragem, os arquivos de áudio foram então divididos em segmentos de 30 segundos emparelhados com o subconjunto da transcrição que ocorre dentro desse período. Se o idioma falado previsto diferisse do idioma da transcrição de texto associada ao áudio, esse par áudio-transcrição não era usado para treinar os modelos de reconhecimento de fala, mas sim para treinar tradução.

O modelo foi treinado usando o otimizador AdamW com recorte de norma de gradiente e decaimento linear da taxa de aprendizado com aquecimento, com tamanho de lote de 256 segmentos. O treinamento prosseguiu por 1 milhão de atualizações (aproximadamente 2-3 épocas). Nenhuma aumento de dados ou regularização, exceto para o modelo Large V2, que usou SpecAugment, Stochastic Depth e BPE Dropout. O treinamento usou paralelismo de dados com float16, escalonamento dinâmico de perda e checkpointing de ativação.

Filtragem pós-treinamento

Após treinar o primeiro modelo, os pesquisadores o executaram em diferentes subconjuntos dos dados de treinamento, cada um representando uma fonte distinta. As fontes de dados foram classificadas por uma combinação de sua taxa de erro e tamanho. A inspeção manual das fontes mais bem classificadas (alto erro, grande tamanho) ajudou a determinar se a fonte era de baixa qualidade (por exemplo, transcrições parciais, alinhamento impreciso). Após o treinamento, o modelo foi ajustado para suprimir a previsão de nomes de falantes e fontes de baixa qualidade foram então removidas.

Capacidade

Embora o Whisper não supere modelos especializados no conjunto de dados LibriSpeech, quando testado em muitos conjuntos de dados, ele é mais robusto e comete 55,2% menos erros do que outros modelos. O Whisper tem uma taxa de erro diferente em relação à transcrição de diferentes idiomas, com uma maior taxa de erro de palavras em idiomas não bem representados nos dados de treinamento. Os autores descobriram que o aprendizado multitarefa melhorou o desempenho geral em comparação com modelos especializados em uma única tarefa. Eles conjecturaram que o melhor modelo Whisper treinado ainda está subajustado, sugerindo que mais escalonamento poderia gerar melhorias adicionais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:speech-recognition·openai·transformer·open-source
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico