Traduzido do inglês

LibriSpeech é um corpus de código aberto e em larga escala de fala de audiolivros em inglês, amplamente utilizado para treinar e avaliar sistemas de reconhecimento automático de fala e de texto-para-fala.

LibriSpeech é um corpus em larga escala de fala inglesa derivado de audiolivros, criado por Vassil Panayotov e colegas da Universidade Johns Hopkins e lançado em 2015. Tornou-se um benchmark padrão para treinar e avaliar sistemas de reconhecimento automático de fala (ASR) e de síntese de fala (TTS). O corpus consiste em aproximadamente 1.000 horas de fala lida, amostrada a 16 kHz, e é organizado em subconjuntos de dificuldade variada para treinamento e teste de modelos.

O conjunto de dados foi construído a partir de gravações de áudio de audiolivros de domínio público do projeto LibriVox, emparelhadas com seus textos correspondentes do Projeto Gutenberg. Os criadores aplicaram um pipeline rigoroso de alinhamento e filtragem para garantir transcrições precisas e qualidade de áudio. LibriSpeech é notável por seu tamanho, diversidade de falantes (mais de 2.400 falantes) e pela prosódia natural da fala lida, tornando-o um recurso valioso para avançar a pesquisa em aprendizado de máquina e aprendizado profundo no processamento de fala.

Estrutura e Subconjuntos do Corpus

LibriSpeech é dividido em vários subconjuntos: train-clean-100, train-clean-360, train-other-500, dev-clean, dev-other, test-clean e test-other. Os subconjuntos 'clean' contêm gravações com ruído de fundo mínimo e falantes com articulação clara, enquanto os subconjuntos 'other' incluem condições mais desafiadoras, como sotaques variados ou leve ruído. Os subconjuntos de treinamento totalizam cerca de 960 horas, com os conjuntos de desenvolvimento e teste contendo aproximadamente 5 horas cada. Essa estrutura permite que pesquisadores treinem modelos em dados limpos e avaliem a robustez em condições mais difíceis.

Cada enunciado é fornecido como um arquivo de áudio FLAC junto com uma transcrição de texto. O corpus também inclui IDs de falantes e informações de capítulo, permitindo experimentos dependentes de falante ou com múltiplos falantes. Os subconjuntos 'other' são particularmente úteis para testar sistemas de ASR sob variabilidade realista.

Papel na Pesquisa em Reconhecimento de Fala

LibriSpeech tornou-se o benchmark padrão de fato para ASR. Muitos modelos seminais, incluindo aqueles baseados em arquiteturas de redes neurais, relatam desempenho nos conjuntos de teste do LibriSpeech. Por exemplo, modelos baseados em transformers e sistemas de fala integrados a modelos de linguagem de grande escala frequentemente citam a taxa de erro de palavras (WER) em test-clean e test-other como métricas-chave. O tamanho do corpus e sua disponibilidade aberta permitiram comparações reproduzíveis entre diferentes abordagens, desde modelos tradicionais de Markov ocultos até sistemas modernos de ponta a ponta.

Pesquisadores também usaram LibriSpeech para aprendizado por transferência e pré-treinamento. Modelos como wav2vec 2.0 e HuBERT foram pré-treinados em LibriSpeech ou em suas variantes maiores, demonstrando a utilidade do corpus além do treinamento supervisionado simples. A disponibilidade de texto alinhado também facilitou a pesquisa em alinhamento forçado e modelagem de pronúncia.

Extensões e Variantes

Várias extensões do LibriSpeech foram lançadas para atender a necessidades específicas de pesquisa. LibriSpeech-100 e LibriSpeech-360 são subconjuntos dos dados de treinamento originais. LibriTTS, derivado do LibriSpeech, fornece áudio de maior qualidade a 24 kHz com segmentação em nível de frase, projetado para pesquisa em TTS. Libri-Light é um corpus não rotulado muito maior (mais de 60.000 horas) extraído da mesma fonte de audiolivros, destinado ao aprendizado autossupervisionado. Essas variantes expandiram o impacto do corpus original em diferentes tarefas de fala.

Além disso, LibriSpeech foi usado para criar versões ruidosas ou com reverberação para estudos de ASR robusto, como LibriSpeech com ruído de fundo adicionado do corpus MUSAN. Essas adaptações permitem que pesquisadores avaliem o desempenho do modelo sob condições adversas sem coletar novos dados.

Impacto e Limitações

LibriSpeech acelerou significativamente o progresso na tecnologia de fala ao fornecer um recurso grande, gratuito e bem documentado. Seu sucesso inspirou corpora semelhantes em outros idiomas e domínios. No entanto, o corpus tem limitações: contém apenas fala lida de audiolivros, que difere da fala conversacional espontânea. O vocabulário também é limitado à linguagem literária, carecendo de termos específicos de domínio. Além disso, a distribuição de falantes é enviesada para certos grupos demográficos, o que pode introduzir vieses em modelos treinados.

Apesar dessas limitações, LibriSpeech permanece um recurso fundamental na pesquisa em inteligência artificial. Seu uso contínuo em ambientes acadêmicos e industriais ressalta sua importância como benchmark para tarefas relacionadas à fala, desde ASR até verificação de locutor e reconhecimento de emoções.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:speech-recognition·dataset·natural-language-processing·audio
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico