Jurassic-1是由以色列人工智能公司AI21 Labs开发的大型语言模型(LLM)家族。该模型于2021年8月发布,是首批在规模上可与OpenAI的GPT-3相媲美的商用LLM之一,其中最大的变体Jurassic-1 Jumbo包含1780亿个参数。这些模型设计用于广泛的自然语言处理任务,包括文本生成、摘要、问答和代码生成,并可通过商业API访问。
Jurassic-1基于Transformer (architecture)架构构建,具体为自回归解码器专用模型,与GPT-3类似。它在一个包含公开文本和代码的大型语料库上进行训练,重点在于高质量过滤和去重。该模型家族包括两个主要变体:Jurassic-1 Jumbo(1780亿参数)和Jurassic-1 Large(75亿参数),两者共享相同的架构,但规模不同。模型使用词汇量为25万个标记的分词器,大于GPT-3的5万个标记词汇量,从而能够更高效地编码文本。
架构与训练
Jurassic-1模型采用标准的解码器专用Transformer (architecture),包含多头注意力和前馈层。它们使用Layer Normalization和残差连接结构,配置与其他大规模LLM相似。训练过程结合了Adam优化、Gradient Clipping以及带有预热和余弦衰减的学习率调度。模型在约3000亿个标记的数据集上进行训练,数据来源包括网页、书籍和其他公开文本,其中大部分为英语,但也包含其他语言。
AI21 Labs强调使用自定义数据过滤流程来移除低质量或重复内容。训练在NVIDIA GPU集群上进行,但具体硬件细节未完全公开。该公司还引入了一种称为“结构化提示”的技术,以改善模型遵循指令和执行问答及推理等任务的能力。
能力与性能
Jurassic-1在多种基准测试中表现出色,包括SuperGLUE和其他NLP任务,通常在类似评估中达到或超过GPT-3的结果。模型更大的词汇量和训练数据使其能够更有效地处理罕见词和多语言文本。除了标准文本生成外,Jurassic-1还能通过少样本学习执行命名实体识别、情感分析和文本分类等任务,而无需微调。
该模型还支持“零样本”推理功能,即无需先前示例即可回答问题或解决问题。AI21 Labs发布了公共游乐场和API,使开发者能够将Jurassic-1集成到应用程序中。API提供了温度控制、top-p采样和其他生成参数的选项。
与同期模型的比较
在发布时,Jurassic-1被定位为OpenAI于2020年发布的GPT-3的直接竞争对手。GPT-3拥有1750亿个参数,而Jurassic-1 Jumbo拥有1780亿个,使其略大。然而,Jurassic-1的分词器使用更大的词汇量,减少了给定文本所需的标记数量,可能提高推理速度和降低成本。AI21 Labs还强调了模型处理更长上下文的能力,最大序列长度为2048个标记,与GPT-3类似。
与Anthropic后来的模型或Google DeepMind的工作不同,Jurassic-1在发布时并未专注于基于人类反馈的强化学习(RLHF),而是侧重于监督学习和少样本提示。这使得它在方法上更接近原始的GPT-3。
影响与遗产
Jurassic-1是来自OpenAI以外公司的首批主要LLM之一,帮助AI21 Labs确立了在生成式AI领域的重要地位。它被用于各种商业应用,包括写作辅助、客户服务聊天机器人和内容生成。该模型的发布也促进了模型规模不断增大的趋势,以及大型语言模型即服务的发展。
AI21 Labs后续的模型,如Jurassic-2,在Jurassic-1的架构和经验基础上进行了改进,纳入了训练数据和对齐方面的优化。该公司在一段时间内继续通过API提供Jurassic-1,但最终因更新模型的推出而将其弃用。Jurassic-1仍然是人工智能研究史上的一个重要里程碑,证明了在最大科技公司之外也能开发出具有竞争力的LLM。
接受度与批评
Jurassic-1因其性能和可访问性而获得积极评价,许多开发者称赞API的易用性以及模型生成连贯且上下文相关文本的能力。然而,与其他LLM一样,它也面临关于训练数据中潜在偏见以及训练如此大型模型的环境影响的批评。AI21 Labs承认了这些担忧,并发布了关于负责任使用的文档,但未公开模型权重,限制了独立研究。
一些研究人员指出,Jurassic-1在某些推理任务上的表现并未显著优于较小模型,突显了仅靠规模的局限性。尽管存在这些批评,该模型的发布促进了LLM市场的竞争,推动了该领域的快速发展。