Traducido del inglés

LibriSpeech es un corpus de habla de audiolibros en inglés, a gran escala y de código abierto, ampliamente utilizado para entrenar y evaluar sistemas de reconocimiento automático del habla y de conversión de texto a voz.

LibriSpeech es un corpus a gran escala de habla inglesa derivado de audiolibros, creado por Vassil Panayotov y sus colegas de la Universidad Johns Hopkins y publicado en 2015. Se ha convertido en un punto de referencia estándar para entrenar y evaluar sistemas de reconocimiento automático del habla (ASR) y de síntesis de voz a texto (TTS). El corpus consta de aproximadamente 1,000 horas de habla leída, muestreadas a 16 kHz, y está organizado en subconjuntos de dificultad variable para el entrenamiento y la evaluación de modelos.

El conjunto de datos se construyó a partir de grabaciones de audio de audiolibros de dominio público del proyecto LibriVox, emparejadas con su texto correspondiente del Proyecto Gutenberg. Los creadores aplicaron un riguroso proceso de alineación y filtrado para garantizar transcripciones precisas y calidad de audio. LibriSpeech destaca por su tamaño, la diversidad de hablantes (más de 2,400 hablantes) y la prosodia natural del habla leída, lo que lo convierte en un recurso valioso para avanzar en la investigación de aprendizaje automático y aprendizaje profundo en el procesamiento del habla.

Estructura del Corpus y Subconjuntos

LibriSpeech se divide en varios subconjuntos: train-clean-100, train-clean-360, train-other-500, dev-clean, dev-other, test-clean y test-other. Los subconjuntos 'clean' contienen grabaciones con ruido de fondo mínimo y hablantes con articulación clara, mientras que los subconjuntos 'other' incluyen condiciones más desafiantes, como acentos variados o algo de ruido. Los subconjuntos de entrenamiento suman aproximadamente 960 horas, y los conjuntos de desarrollo y prueba contienen cada uno alrededor de 5 horas. Esta estructura permite a los investigadores entrenar modelos con datos limpios y evaluar la robustez en condiciones más difíciles.

Cada enunciado se proporciona como un archivo de audio FLAC junto con una transcripción de texto. El corpus también incluye identificadores de hablante e información de capítulo, lo que permite experimentos dependientes del hablante o con múltiples hablantes. Los subconjuntos 'other' son particularmente útiles para poner a prueba los sistemas ASR bajo variabilidad realista.

Papel en la Investigación del Reconocimiento del Habla

LibriSpeech se ha convertido en el punto de referencia estándar de facto para ASR. Muchos modelos pioneros, incluidos aquellos basados en arquitecturas de red neuronal, reportan su rendimiento en los conjuntos de prueba de LibriSpeech. Por ejemplo, los modelos basados en transformadores y los sistemas de habla integrados con modelos de lenguaje grandes a menudo citan la tasa de error de palabra (WER) en test-clean y test-other como métricas clave. El tamaño del corpus y su disponibilidad abierta han permitido comparaciones reproducibles entre diferentes enfoques, desde los modelos tradicionales de Markov ocultos hasta los sistemas modernos de extremo a extremo.

Los investigadores también han utilizado LibriSpeech para el aprendizaje por transferencia y el preentrenamiento. Modelos como wav2vec 2.0 y HuBERT fueron preentrenados en LibriSpeech o en sus variantes más grandes, lo que demuestra la utilidad del corpus más allá del entrenamiento supervisado simple. La disponibilidad de texto alineado también ha facilitado la investigación en alineación forzada y modelado de pronunciación.

Extensiones y Variantes

Se han publicado varias extensiones de LibriSpeech para abordar necesidades de investigación específicas. LibriSpeech-100 y LibriSpeech-360 son subconjuntos de los datos de entrenamiento originales. LibriTTS, derivado de LibriSpeech, proporciona audio de mayor calidad a 24 kHz con segmentación a nivel de oración, diseñado para la investigación en TTS. Libri-Light es un corpus no etiquetado mucho más grande (más de 60,000 horas) extraído de la misma fuente de audiolibros, destinado al aprendizaje autosupervisado. Estas variantes han ampliado el impacto del corpus original en diferentes tareas de habla.

Además, LibriSpeech se ha utilizado para crear versiones ruidosas o reverberantes para estudios de ASR robusto, como LibriSpeech con ruido de fondo añadido del corpus MUSAN. Estas adaptaciones permiten a los investigadores evaluar el rendimiento del modelo en condiciones adversas sin recopilar nuevos datos.

Impacto y Limitaciones

LibriSpeech ha acelerado significativamente el progreso en la tecnología del habla al proporcionar un recurso grande, gratuito y bien documentado. Su éxito ha inspirado corpus similares en otros idiomas y dominios. Sin embargo, el corpus tiene limitaciones: contiene solo habla leída de audiolibros, que difiere del habla conversacional espontánea. El vocabulario también se limita al lenguaje literario, careciendo de términos específicos de dominio. Además, la distribución de hablantes está sesgada hacia ciertos grupos demográficos, lo que puede introducir sesgos en los modelos entrenados.

A pesar de estas limitaciones, LibriSpeech sigue siendo un recurso fundamental en la investigación de inteligencia artificial. Su uso continuo en entornos académicos e industriales subraya su importancia como punto de referencia para tareas relacionadas con el habla, desde ASR hasta verificación de hablante y reconocimiento de emociones.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:speech-recognition·dataset·natural-language-processing·audio
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial