自然语言处理(NLP)是人工智能的子领域,专注于使计算机能够处理、解释并生成人类语言,无论是口语还是书面语。它涵盖从狭窄任务(如拼写检查和词性标注)到开放任务(如翻译、摘要和对话)的广泛范围,并且是大型语言模型技术的母领域,该技术在2020年代中期主导了AI讨论。
早期时代:规则与符号
从1950年代到1980年代,最早的NLP系统基于手工编写的语言规则和符号逻辑构建,,这种方法与符号AI一致。ELIZA,1966年由Joseph Weizenbaum创建的聊天机器人,,使用简单模式匹配来模拟罗杰斯式心理治疗师,,成为该领域雄心的早期(尽管有限)示范。在此期间也开发了基于规则的机器翻译系统,,但成效参差不齐。
统计时代
从1980年代末到2000年代,NLP转向统计方法,,使用从文本语料库中学到的概率而非手工规则来处理翻译、标注和解析等任务。这一时期产生了n-gram语言模型和统计机器翻译等技术,,并确立了大型标注语料库作为核心研究基础设施,,这是现代对训练数据规模重视的先驱。
神经与Transformer时代
神经方法在2010年代初开始取代统计流程,,得益于词级嵌入(如Word2vec(2013年))将词表示为捕捉语义关系的密集向量,,以及循环神经网络和LSTM架构用于Seq2seq任务(如翻译))。2017年Transformer (architecture)架构的引入对该领域具有变革性意义,,使得在大型文本语料库上进行更高效的训练成为可能。BERT(2018年)展示了大规模预训练对语言理解的力量,,而GPT系列则证明了一个在足够规模下训练于下一个词预测的单一自回归模型能够执行大量NLP任务,,无需任务特定架构,,最终催生了通用大型语言模型。
##现代范围
当代NLP研究和应用涵盖机器翻译、语音识别、语义搜索、情感分析、摘要、问答以及支撑聊天机器人和语音助手的对话系统等自大型语言模型兴起以来,,许多先前独立的NLP子任务现在通常通过提示单个通用模型来解决,,而非训练专门架构,,这一转变减少了对狭窄监督系统的需求,,但引发了新的评估和可靠性问题,,包括幻觉。
##挑战
NLP系统继续在缺乏大型训练语料库的低资源语言、文化特定习语和语境以及一致的事实可靠性方面面临困难。训练文本中存在的偏见可能在模型输出中被重现或放大,,这一担忧在随机鹦鹉批评中被突出提出,,并且仍然是活跃的研究领域,,与算法偏见缓解的更广泛努力并行。