请提供需要翻译的维基文本内容。

英語からの翻訳

WikiTextは、Wikipediaの記事から派生した大規模な言語モデリングデータセットであり、自然言語処理におけるニューラルネットワークモデルの訓練と評価に広く使用されている。

请将这篇百科文章正文从英语翻译成中文。请遵守以下规则:

  1. 保留所有Markdown语法(如##标题、列表、粗体代码)。
  2. 链接格式:目标slug必须始终为小写kebab-case(例如use of tools),且必须与英文原文完全一致。对于可见文本,只翻译可见文本部分,slug保持不变。
  3. 保留所有模型名称、数据集名称、专有名词(如GPT-2、BERT、WikiText、Penn Treebank、Wall Street Journal等),不翻译。
  4. 禁止使用破折号(、或–),改用中文标点如逗号、句号、分号等。
  5. 只输出翻译内容,不要添加任何额外说明。

---

数据集描述

WikiText是一个由英语百科文章组成的语料库,旨在为语言模型提供比传统基准(如Penn Treebank)更真实、更丰富的文本数据。它包含两个版本:WikiText-2和WikiText-103,分别包含约200万和1.03亿个token。该数据集保留了原始文章的格式,包括标题、列表和链接,同时将出现频率较低的单词替换为<unk>标记,以测试模型对罕见词汇的处理能力。

用途

WikiText主要用于语言建模任务,例如预测下一个单词或评估模型的困惑度(perplexity)。它也被广泛用于训练和评估各种Transformer架构的模型,如GPT-2和BERT。由于数据集的规模较大且包含长距离依赖关系,它特别适合测试模型对上下文的理解能力。

与其他数据集的比较

与Penn Treebank相比,WikiText提供了更大的词汇量和更长的文档,因此更具挑战性。Penn Treebank仅包含约100万token,且词汇量有限,而WikiText-103包含超过10万个不同的单词,并保留了原始的大小写和标点符号,使得模型需要学习更复杂的语言模式。

局限性与批评

尽管WikiText被广泛使用,但它也存在一些局限性。首先,它仅包含英语文本,缺乏多语言支持。其次,由于数据来自Wikipedia,其风格偏向正式和百科全书式,可能无法代表日常对话或非正式文本。此外,<unk>标记的使用虽然有助于处理罕见词,但也可能导致模型对未知词汇的预测不够准确。

未来方向

随着大型语言模型的发展,WikiText的简单性可能不足以满足更复杂任务的需求。因此,研究者们正在开发新的数据集,如The Pile和多语言WikiText,以涵盖更多语言和更广泛的文本类型。这些新数据集旨在提供更丰富的训练材料,帮助模型更好地理解和生成自然语言。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·natural-language-processing·language-modeling·wikipedia
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴