译自英文

LJSpeech是一个公有领域的单说话人英语语音数据集,包含来自LibriVox有声书的13,100个短音频片段,广泛用于训练[[text-to-speech|文本转语音]]和[[voice-cloning|语音克隆]]模型。

LJSpeech 是一个广泛使用的语音数据集,包含 13,100 个短音频片段,由一位女性朗读者朗读七本非虚构类书籍的段落。这些片段总计约 24 小时的语音,源自 LibriVox 对公有领域有声书的录音。每个片段都附有文本转写,使得该数据集适用于文本转语音(TTS)系统及其他语音处理模型的监督式训练。该数据集由 Keith Ito 创建,并于 2017 年以公有领域奉献的形式发布,这促成了其在学术研究和商业应用中的普及。

该朗读者仅被标识为一位带有美国英语口音的女性,录音最初制作于 1984 年。音频的采样率为 22050 Hz,位深为 16 位,片段时长约为 1 到 10 秒不等。该数据集常被用作单说话人 TTS 的基准,许多现代神经 TTS 架构(如 Tacotron 2 和 FastSpeech)都在其上进行了评估。由于其录音清晰且说话人身份一致,LJSpeech 成为比较模型性能的标准参考点。

数据集结构与内容

该数据集以单个压缩包形式分发,包含三个部分:一个元数据 CSV 文件、一个 WAV 音频文件文件夹,以及一个 README 文件。元数据文件列出了每个片段的 ID、转写文本,以及段落来源的书籍和章节。书籍包括《英格兰史》和《科学美国人》等标题,段落内容涵盖多种主题,提供了丰富的语音多样性。转写保留了原始标点和大小写,这有助于训练能够处理韵律和标点的模型。音频文件按顺序编号命名,数据集中还包含一个建议的训练/验证集划分,但并未强制规定。

在语音合成中的应用

LJSpeech 主要用于训练 AI 模型,将文本转换为语音。它是开发 深度学习 驱动的 TTS 系统的关键资源,包括基于 神经网络Transformer 架构 的系统。例如,由 Google DeepMind 和 Google 研究人员开发的 Tacotron 2 模型,以及微软的 FastSpeech 和 FastSpeech 2 模型,都使用了该数据集进行训练和评估。该数据集的单说话人特性使研究人员能够专注于韵律和发音的挑战,而无需考虑多说话人带来的变异性。它也被用于语音转换研究,以及 生成式 AI 领域,其中模型学习以相同的语音进行合成。

许可与可用性

该数据集以知识共享 CC0 1.0 通用公有领域奉献协议发布,这意味着它可以用于任何目的,无需署名。这一宽松的许可使其成为开源语音项目和商业产品的常用基础数据。数据集托管在 LibriVox 网站上,并在 Kaggle 和 Hugging Face 等平台上提供镜像。原始录音来自 LibriVox,该平台由志愿者朗读公有领域有声书。说话人的身份未被披露,以保护隐私,同时仍为训练提供一致的语音。

局限性与替代方案

尽管 LJSpeech 广受欢迎,但它也存在局限性。它仅包含一位说话人,这限制了其在多说话人 TTS 或说话人自适应研究中的使用。录音制作于 1984 年,因此音频质量虽然清晰,但可能无法反映现代录音标准。词汇量受限于书籍内容,可能无法覆盖所有日常会话或技术术语。为了获得更广泛的覆盖,研究人员通常会转向 LibriTTS、VCTK 或 Common Voice 等数据集,这些数据集包含多位说话人和更多样化的内容。然而,由于其简洁性和可靠性,LJSpeech 仍然是原型开发和基准测试的首选标准数据集。

影响与遗产

自发布以来,LJSpeech 已被数百篇研究论文引用,并成为语音合成领域事实上的标准。它的成功也启发了类似的单说话人数据集,例如 Nancy Corpus 和 Blizzard Challenge 数据。该数据集的公有领域状态也促进了可复现研究,因为任何人都可以无法律障碍地下载和使用它。截至 2020 年代中期,尽管出现了数据量更大、质量更高的新数据集,LJSpeech 仍被持续使用。其遗产与神经 TTS 的快速发展紧密相连,该领域从拼接式和参数式方法转向了端到端深度学习,而像 LJSpeech 这样易于获取的数据集在很大程度上推动了这一转变。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:speech-dataset·text-to-speech·open-data·machine-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史