Traduzido do inglês

LJSpeech é um conjunto de dados de fala em inglês de domínio público, com um único falante, composto por 13.100 clipes de áudio curtos extraídos de audiolivros do LibriVox, amplamente utilizado para treinar modelos de [[text-to-speech|texto para fala]] e [[voice-cloning|clonagem de voz]].

LJSpeech é um conjunto de dados de fala amplamente utilizado, consistindo em 13.100 pequenos clipes de áudio de uma única locutora feminina lendo passagens de sete livros de não ficção. Os clipes totalizam aproximadamente 24 horas de fala e foram derivados de gravações do LibriVox de audiolivros de domínio público. Cada clipe é acompanhado por uma transcrição de texto, tornando o conjunto de dados adequado para treinamento supervisionado de sistemas de texto-para-fala (TTS) e outros modelos de processamento de fala. O conjunto de dados foi criado por Keith Ito e lançado em 2017 sob uma dedicação de domínio público, o que contribuiu para sua popularidade tanto em pesquisa acadêmica quanto em aplicações comerciais.

A locutora é identificada apenas como uma mulher com sotaque de inglês americano, e as gravações foram originalmente feitas em 1984. O áudio é amostrado a 22050 Hz com uma profundidade de bits de 16 bits, e os clipes variam de cerca de 1 a 10 segundos de duração. O conjunto de dados é frequentemente usado como referência para TTS de locutor único, e muitas arquiteturas modernas de TTS neural, como Tacotron 2 e FastSpeech, foram avaliadas nele. Devido às suas gravações limpas e identidade consistente do locutor, o LJSpeech serve como um ponto de referência padrão para comparar o desempenho de modelos.

Estrutura e Conteúdo do Conjunto de Dados

O conjunto de dados é distribuído como um único arquivo contendo três arquivos: um CSV de metadados, uma pasta de arquivos de áudio WAV e um README. O arquivo de metadados lista o ID de cada clipe, o texto transcrito e o livro e capítulo originais de onde a passagem foi retirada. Os livros incluem títulos como A History of England e The Scientific American, e as passagens cobrem uma variedade de tópicos, fornecendo conteúdo fonético diversificado. As transcrições preservam a pontuação e capitalização originais, o que auxilia no treinamento de modelos que lidam com prosódia e pontuação. Os arquivos de áudio são nomeados com números sequenciais, e o conjunto de dados inclui uma sugestão de divisão de treino/validação no README, embora nenhuma divisão oficial seja imposta.

Aplicações em Síntese de Fala

O LJSpeech é usado principalmente para treinar modelos de IA que convertem texto em áudio falado. Ele tem sido um recurso chave para o desenvolvimento de sistemas de TTS baseados em aprendizado profundo, incluindo aqueles baseados em redes neurais e arquiteturas de transformadores. Por exemplo, o modelo Tacotron 2, desenvolvido por pesquisadores da Google DeepMind e Google, usou o LJSpeech para treinamento e avaliação. Da mesma forma, os modelos FastSpeech e FastSpeech 2 da Microsoft usaram este conjunto de dados. A natureza de locutor único do conjunto de dados permite que os pesquisadores isolem os desafios de prosódia e pronúncia sem a complexidade adicional da variabilidade de múltiplos locutores. Ele também é usado em conversão de voz e pesquisa de IA generativa, onde modelos aprendem a sintetizar fala na mesma voz.

Licenciamento e Disponibilidade

O conjunto de dados é lançado sob a Dedicação de Domínio Público Universal Creative Commons CC0 1.0, o que significa que pode ser usado para qualquer finalidade sem atribuição. Esta licença permissiva o tornou um elemento básico em projetos de fala de código aberto e produtos comerciais. Ele está hospedado no site do LibriVox e também espelhado em plataformas como Kaggle e Hugging Face. As gravações originais são do LibriVox, que por si só fornece audiolivros de domínio público lidos por voluntários. A identidade do locutor não é divulgada, preservando a privacidade enquanto ainda fornece uma voz consistente para treinamento.

Limitações e Alternativas

Apesar de sua popularidade, o LJSpeech tem limitações. Ele contém apenas um locutor, o que restringe seu uso para TTS de múltiplos locutores ou pesquisa de adaptação de locutor. As gravações são de 1984, então a qualidade do áudio, embora limpa, pode não refletir os padrões modernos de gravação. O vocabulário é limitado ao conteúdo dos livros, que pode não cobrir todos os termos conversacionais ou técnicos. Para cobertura mais ampla, os pesquisadores frequentemente recorrem a conjuntos de dados como LibriTTS, VCTK ou o corpus Common Voice. No entanto, o LJSpeech continua sendo uma primeira escolha padrão para prototipagem e benchmarking devido à sua simplicidade e confiabilidade.

Impacto e Legado

Desde seu lançamento, o LJSpeech foi citado em centenas de artigos de pesquisa e se tornou um padrão de facto na comunidade de síntese de fala. Seu status de domínio público também facilitou pesquisa reproduzível, permitindo que qualquer pessoa o baixe e use sem barreiras legais. Em meados da década de 2020, ele continua sendo ativamente usado, mesmo com o surgimento de conjuntos de dados mais novos com mais dados e maior qualidade. Seu legado está ligado ao avanço rápido do TTS neural, que passou de métodos concatenativos e paramétricos para métodos de aprendizado profundo, amplamente habilitado por conjuntos de dados acessíveis como este.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:speech-dataset·text-to-speech·open-data·machine-learning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico