译自英文

分词器将文本分割成更小的单元(称为词元)以供模型输入,这是自然语言处理和大型语言模型中的关键步骤。

分词器是自然语言处理中的一个组件,它将原始文本分解为更小的单元,称为词元,这些词元作为机器学习模型(尤其是大型语言模型)的基本输入。分词是将人类可读文本转换为模型可处理的数值格式的第一步。分词器的选择会显著影响模型性能、词汇量大小和计算效率。

在大型语言模型的背景下,分词涉及将文本分割为可能对应单词、子词或单个字符的词元。这一过程使模型能够处理庞大的词汇量,同时管理词汇表外的单词并减少计算所需的序列长度。分词器通常在大规模语料库上进行训练,以学习最优的分割策略,例如字节对编码(BPE)或WordPiece,这些策略在词汇量大小和词元频率之间取得平衡。

分词器类型

分词器可以根据其生成的词元粒度进行分类。单词分词器按空格和标点符号分割文本,生成整个单词作为词元。然而,它们难以处理罕见词或复合词,并且需要较大的词汇量。字符分词器将每个字符视为一个词元,导致序列非常长,但词汇量很小。子词分词器(如BPE和WordPiece)介于这两者之间,通过将单词分解为频繁出现的子词单元来工作。这种方法允许在保持可管理的词汇量的同时,保留形态信息并通过组合子词词元来处理未见过的单词。

大型语言模型中的分词

现代大型语言模型,包括由OpenAIAnthropicGoogle DeepMind开发的模型,依赖于子词分词。例如,GPT系列使用BPE,而BERT等模型使用WordPiece。这些分词器在大型文本语料库上进行训练,以学习优化序列长度和词汇量之间权衡的子词单元。分词器的词汇量是模型架构的关键组成部分,其设计影响模型泛化到新文本的能力。分词还影响模型的上下文窗口,因为词元数量直接决定了可以一次处理的文本量。

搜索引擎索引中的分词

在信息检索中,分词是索引和查询的预处理步骤。搜索引擎将文档和查询分词为词项,然后用于构建倒排索引。分词器必须处理标点符号、大小写和特定语言的规则,以确保有效匹配。词干提取和词形还原等技术通常在分词后应用,以规范化词项。分词质量直接影响搜索相关性和召回率。

数据安全中的分词

分词也指一种安全技术,其中敏感数据(如信用卡号)被替换为非敏感的占位符,称为令牌。此过程用于支付系统和数据存储,以降低数据泄露的风险。与加密不同,分词不使用数学密钥将令牌还原为原始值;相反,安全的令牌库将令牌映射到原始数据。这种方法在金融和医疗保健领域被广泛采用,以符合PCI DSS和HIPAA等法规。

金融中的分词

资产代币化是将现实世界资产(如房地产、艺术品或商品)表示为区块链上的数字代币的过程。这实现了部分所有权、提高流动性和更便捷的转移。金融中的代币化利用智能合约来管理代币的发行和交易,可能使投资机会民主化。然而,监管和技术挑战仍然存在,包括法律认可和互操作性。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:natural-language-processing·tokenization·machine-learning·data-security
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史