大型语言模型

译自英文

大型语言模型是一种神经网络,通常基于[[transformer|Transformer]]架构构建,在海量文本语料库上训练以预测下一个词元,从而获得广泛的语言理解和生成能力。

大型语言模型(LLM)是一种神经网络,通常基于Transformer架构构建,在大量文本数据上进行训练,以预测序列中的下一个文本单元,即词元。尽管训练目标狭窄,但在足够规模下训练的LLM展现出广泛的语言理解、生成、翻译、摘要和推理能力,并构成了ChatGPTClaudeGemini等助手的核心技术基础。

历史

基于Transformer的语言模型在该架构于2017年引入后不久便出现。BERT(2018年)证明了大规模预训练对语言理解任务的价值,而OpenAI的GPT系列则追求规模不断增大的生成式自回归训练,最终达到GPT-3(2020年),其1750亿参数和强大的少样本学习性能引起了广泛关注。GPT-4(2023年)通过多模态输入和更强的能力扩展了这一范式,而2022年11月基于GPT-3.5模型发布的ChatGPT使对话式LLM进入主流应用,促使包括Google的Gemini系列和Meta的开源权重Llama系列在内的竞争者迅速跟进。

工作原理

LLM在预训练阶段使用自监督目标在庞大且大多未经整理的文本语料库上进行训练,学习根据先前上下文预测下一个词元。这产生了一个自回归模型,能够一次一个词元地生成流畅文本。预训练的“基础”模型通常通过微调和基于人类反馈的强化学习进一步调整,以遵循指令并安全对话,这一过程对ChatGPT和Claude等模型至关重要。模型在一次交互中能处理的文本量受其上下文窗口限制,该窗口已从早期模型的约几千个词元增长到2025年时代某些系统中的超过一百万个。

规模与能力

被称为缩放定律的经验关系描述了模型损失如何随着参数数量、训练数据和计算量共同增加而可预测地改善。某些能力,如多步算术或遵循复杂指令,似乎在超过特定规模阈值后相对突然地出现,这一现象称为涌现能力,尽管研究人员对这在多大程度上是模型的真实属性还是能力测量方式的产物存在争议。

局限性

LLM容易产生幻觉,生成流畅但事实错误的陈述,且不向用户发出输出不可靠的信号。由于它们基于学习的统计模式而非验证过的知识生成文本,它们也可能再现训练数据中存在的偏见,并仍易受对抗性提示技术(如越狱)的攻击。缓解措施包括将输出基于检索到的外部文档,这一技术称为检索增强生成,以及日益增多的“推理模型”,这些模型在回答前使用额外的测试时计算来检查自身工作。

分类:large-language-models·fundamentals
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史