侏罗纪(AI21)

译自英文

Jurassic是由以色列人工智能公司AI21 Labs开发的一系列大型语言模型。这些模型专为生成式AI任务设计,包括文本生成、摘要和问答。

Jurassic 是一个大型语言模型家族,由AI21 Labs开发,这是一家成立于2017年的以色列人工智能公司。Jurassic 系列是最早的商业化大规模基于 Transformer 的模型之一,定位为 OpenAIAnthropic 模型的竞争对手。该家族包括多个世代,从2021年发布的原始 Jurassic-1 到较新的 Jurassic-2 及专门变体,均设计用于自然语言理解和生成任务,如文本补全、摘要和问答。

这些模型基于 Transformer 架构构建,这是一种在2017年引入的深度学习框架,支撑了大多数现代生成式 AI 系统。AI21 Labs 使用广泛的文本语料库训练 Jurassic 模型,采用神经网络技术和优化方法,如Adam学习率调度。Jurassic 模型可通过 AI21 Labs 的专有 API 以及包括Amazon Web Services(AWS)、Microsoft AzureGoogle Cloud在内的云平台访问,使开发者和企业能够使用。

历史与发展

AI21 Labs 于2021年8月发布了 Jurassic-1,提供两种模型规模:J1-Jumbo(1780亿参数)和 J1-Large(75亿参数)。当时,J1-Jumbo 是公开可用的最大语言模型之一,与拥有1750亿参数的 OpenAI GPT-3 相当。开发团队包括 AI21 联合创始人Eilon ReshefDafna Sharon,以及具有机器学习和计算语言学背景的研究人员。

2022年,AI21 Labs 发布了 Jurassic-2,引入了指令跟随和推理方面的改进。Jurassic-2 家族包括 J2-Jumbo、J2-Grande 和 J2-Mid 等模型,参数数量从78亿到1780亿不等。这些模型针对特定用例进行了优化,包括客户服务、内容创作和代码生成中的生成式 AI应用。

到2023年,AI21 Labs 扩展了 Jurassic 系列,推出了专门模型。2023年10月,该公司发布了 Jurassic-2 Ultra,这是一个具有增强多语言能力的1780亿参数模型。次年,AI21 推出了 Jurassic-2 Mid 和 Jamba,后者是一种结合 Transformer 层与状态空间模型的混合架构,提高了长上下文任务的效率。

架构与训练

Jurassic 模型基于 Transformer 架构,具体是仅解码器变体,这也被 OpenAI 的 GPT 系列使用。这些模型采用多头注意力机制处理输入序列,并使用位置编码来捕捉词序。训练在某些变体中使用交叉注意力,但核心架构是自回归的,预测序列中的下一个标记。

AI21 Labs 使用大规模分布式计算资源训练 Jurassic 模型,可能基于 NVIDIA GPU,但具体硬件细节未公开记录。训练过程涉及数据增强课程学习策略以提高泛化能力。优化依赖于随机梯度下降变体(如 Adam),并使用梯度裁剪层归一化来稳定训练。

这些模型使用top-ktop-p采样方法进行文本生成,以及温度缩放来控制输出随机性。对于需要更确定性输出的任务(如翻译或摘要),可使用束搜索

能力与特性

Jurassic 模型支持广泛的自然语言处理任务。它们可以执行文本补全、摘要、释义和问答。这些模型还处理代码生成和补全,使其对软件开发工作流有用。Jurassic-2 及更高版本包括指令跟随能力,允许用户以自然语言指定任务而无需微调。

一个显著特性是支持多种语言。Jurassic-2 模型在超过100种语言的数据上训练,特别擅长英语、西班牙语、法语、德语和希伯来语,反映了 AI21 Labs 的以色列背景。这些模型还支持结构化输入,如 JSON 和 SQL,便于与数据库和 API 集成。

AI21 Labs 提供了一个开发者平台,其 API 包括自定义模型微调、语义搜索和事实核查工具等功能,称为“Wordtune Read”和“Wordtune Write”,这些是独立产品但共享底层技术。

与其他模型的比较

Jurassic 模型直接与 OpenAI 的 GPT-3 和 GPT-4、Anthropic 的 Claude 以及 Google DeepMind 的 Gemini 竞争。在基准评估中,Jurassic-1 Jumbo 在 SuperGLUE 和 LAMBADA 等任务上表现与 GPT-3 相当,但在某些推理基准上落后。Jurassic-2 在这些分数上有所改进,特别是在多轮对话和指令跟随方面。

一个关键区别是 AI21 Labs 对企业应用的关注。该公司强调数据隐私,并提供本地部署选项,这吸引了具有严格合规要求的组织。此外,Jurassic 模型可通过 Amazon Bedrock 在 AWS 上使用,通过 Microsoft 的 AI 服务在 Azure 上使用,以及通过 Google Cloud Vertex AI 使用,提供多种集成路径。

应用与用例

Jurassic 模型用于各个行业。在客户服务中,它们驱动聊天机器人和虚拟助手处理查询和解决问题。在内容创作中,它们协助起草文章、营销文案和社交媒体帖子。法律和金融公司使用 Jurassic 进行文档摘要和合同分析。

AI21 Labs 还提供基于 Jurassic 的专门工具,如 Wordtune,这是一个 AI 驱动的写作助手,建议改写和语气调整。该公司已与 Samsung 合作,将 AI 功能集成到移动设备中,并与 Intel 合作进行硬件优化。

性能与基准

Jurassic 模型已在标准 NLP 基准上进行了评估。在 SuperGLUE 基准上,J1-Jumbo 得分82.4,略低于 GPT-3 的83.5。在 LAMBADA 语言建模测试中,J1-Jumbo 达到82.5%的准确率。Jurassic-2 模型在少样本学习方面有所改进,J2-Jumbo 在 MMLU 基准的多个任务上优于 GPT-3。

2023年,AI21 Labs 报告称 Jurassic-2 Ultra 在 HELM 基准的某些任务上取得了最先进的结果,但独立验证有限。该公司在其网站上发布性能指标,但详细的评估方法并不总是公开。

可用性与定价

Jurassic 模型可通过 AI21 Labs 的 API 访问,该 API 提供基于处理标记数的按需付费定价模型。截至2024年,最小模型的定价为每1000个标记0.01美元起,较大模型则相应增加。API 支持同步和异步请求,大多数模型的最大上下文长度为8192个标记。

AI21 Labs 还为开发者提供免费层级以试验模型。企业客户可以协商定制合同,包括专用基础设施和服务水平协议。这些模型还可通过云市场(如 AWS Marketplace 和 Azure Marketplace)获得。

未来方向

AI21 Labs 继续开发 Jurassic 家族,重点是提高效率和降低计算成本。该公司已探索模型剪枝残差网络技术,以创建更小、更快且性能损失不大的模型。2024年,AI21 宣布研究结合 Transformer 层与循环组件的混合架构,旨在更高效地处理更长序列。

该公司还投资于对齐和安全性,使用基于 AI 反馈的强化学习等方法减少有害输出。随着生成式 AI领域的发展,Jurassic 模型预计将集成更多多模态能力,可能处理图像和音频以及文本。

反响与影响

Jurassic 模型因其强大性能和可访问性而受到 AI 社区的广泛好评。AI21 Labs 已筹集大量资金,包括2022年的2.08亿美元 C 轮融资,使公司估值超过14亿美元。这些模型已用于学术研究和行业应用,促进了大型语言模型在美国主导科技公司之外的更广泛采用。

批评者指出,Jurassic 模型尚未达到 GPT-4 或 Claude 的公众认知度,部分原因是营销力度较弱。然而,这些模型因其多语言能力和企业关注而受到尊重,使 AI21 Labs 成为竞争激烈的 AI 领域中的显著参与者。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·generative-ai·artificial-intelligence·ai21-labs
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史