AI21 Jamba 1.5 发布

译自英文

2024年8月,AI21 Labs发布了Jamba 1.5系列大型语言模型,该系列模型在效率上有所提升,并能处理长达256,000个令牌的长期上下文,其构建于混合的[[mamba|Mamba]]-[[transformer|Transformer]]架构之上。

2024年8月Jamba 1.5的发布标志着AI21 Labs在大型语言模型演进中迈出了重要一步,该公司是一家专注于自然语言处理的以色列企业。此次发布推出了两个模型,即Jamba 1.5 Large和Jamba 1.5 Mini,旨在以更高的效率和长上下文处理能力提供高性能表现。这些模型基于一种混合架构构建,结合了Transformer和Mamba状态空间模型的优势,并采用混合专家方法在计算成本与输出质量之间取得平衡。

Jamba 1.5模型支持高达256,000个令牌的上下文窗口,使其能够处理并推理非常长的文档,例如整本书籍或庞大的代码库。这一能力加上对效率的关注,使Jamba 1.5在开放权重模型中成为具有竞争力的选择,尤其适用于需要处理大量文本的企业应用。

背景与发展

AI21 Labs于2017年11月由Yoav Shoham、Ori Goshen和Amnon Shashua在以色列特拉维夫创立。该公司最初凭借Wordtune获得关注,这是一款基于AI的写作助手,于2020年10月推出,后来被谷歌评为2021年最喜爱的扩展之一。2021年8月,AI21 Labs推出了AI21 Studio和Jurassic-1语言模型,其令牌词汇量超过250,000个。

该公司的发展轨迹包括多轮融资:2019年1月的950万美元种子轮,2021年11月来自Walden Catalyst的2000万美元投资,由Pitango First领投的2500万美元A轮,2022年7月的6400万美元B轮,以及2023年8月的1.55亿美元C轮,其中谷歌和英伟达参与投资。这些投资支持了日益复杂模型的开发,包括2023年3月发布的Jurassic-2。

Jamba 1.5的直接前身是原始Jamba模型,于2024年3月29日发布。Jamba是一个开放权重模型,基于混合Mamba-SSM Transformer架构并采用混合专家设计,支持高达256,000个令牌的上下文长度。Jamba 1.5系列对这一方法进行了优化,提升了效率和性能。

技术架构

Jamba 1.5模型采用混合架构,将Transformer中的多头注意力与Mamba状态空间模型相结合。这种组合旨在捕捉两者的优势:Transformer建模复杂依赖关系的能力,以及状态空间模型处理长序列的效率。混合专家(MoE)机制仅为每个令牌激活模型参数的一个子集,从而在保持高容量的同时降低计算成本。

这种设计使Jamba 1.5能够处理长上下文,而无需纯Transformer模型典型的二次方扩展,从而在文档摘要、长文本问答和代码分析等任务中更加高效。这些模型在多样化数据集上进行了训练,其开放权重特性允许研究人员和开发者针对特定应用进行微调。

发布与可用性

Jamba 1.5于2024年8月发布,包含两个变体:Jamba 1.5 Large和Jamba 1.5 Mini。这些模型在开放许可下提供,允许广泛使用和修改。2024年9月,AI21 Labs与Amazon Web Services(AWS)合作,在Amazon Bedrock上提供Jamba 1.5系列,这是一项托管服务,可将AI模型集成到企业应用中。这一合作促进了寻求利用Jamba长上下文能力的企业进行部署。

此次发布使Jamba 1.5成为来自OpenAIAnthropicGoogle DeepMind等组织开放权重模型的竞争对手,尽管这些公司主要提供专有模型。Jamba 1.5对效率和长上下文处理的重视吸引了那些需要处理大型数据集而无需承担高计算成本的开发者。

性能与基准测试

AI21 Labs报告称,Jamba 1.5模型在各种基准测试中取得了有竞争力的结果,包括自然语言理解、推理和代码生成任务。这些模型在长上下文任务中的表现尤为突出,能够在高达256,000个令牌的序列中保持准确性。这是一个关键的差异化因素,因为当时许多模型难以处理如此扩展的上下文。

混合架构带来的效率提升使Jamba 1.5能够以低于类似能力模型的推理成本实现这些结果。这使其对计算资源有限的组织具有吸引力。

企业采用与合作伙伴关系

2024年9月与AWS的合作是迈向企业采用的重要一步。通过在Amazon Bedrock上提供Jamba 1.5,AI21 Labs使企业能够利用AWS的安全性和可扩展性将模型集成到其工作流程中。此举是AI公司与云提供商合作以覆盖更广泛受众的更广泛趋势的一部分。

2025年3月,AI21 Labs发布了Jamba 1.6,用于私有企业部署,声称其在多个基准测试中优于其他开放模型。同月,该公司推出了Maestro,一个AI规划和编排系统,旨在提高GPT-4o和Claude 3.5 Sonnet等模型在复杂任务中的准确性。这些发展表明AI21 Labs持续专注于企业解决方案。

影响与反响

Jamba 1.5的发布在AI社区中受到好评,尤其是其创新的混合架构和长上下文能力。它促进了人们对状态空间模型作为纯Transformer架构替代方案的兴趣日益增长,而自2017年Transformer问世以来,后者一直主导该领域。研究人员和从业者赞赏开放权重的方法,这允许进行实验和定制。

这些模型还引发了关于AI效率的讨论,因为混合专家设计降低了运行大型模型的环境和财务成本。这与业界推动AI更具可持续性的更广泛努力相一致。

未来方向

在Jamba 1.5之后,AI21 Labs继续迭代其模型系列,于2025年3月发布了Jamba 1.6,为企业使用提供了改进的性能。该公司还通过Maestro扩展了其产品生态系统,旨在增强AI系统在复杂多步骤任务中的可靠性。这些努力表明其战略侧重于实用、可部署的AI解决方案,而不仅仅是提升基准分数。

Jamba模型中开创的混合架构可能会影响机器学习的未来发展,因为研究人员正在探索结合不同模型类型以实现更好效率和能力的方法。Jamba 1.5的成功证明,状态空间模型可以有效地与Transformer集成,为研究开辟了新的途径。

参见

参考文献

  1. AI21 Labs官方文档和新闻稿。
  2. 关于Jamba 1.5发布的行业报告。
  3. 关于混合Transformer-状态空间模型的学术论文。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai21-labs·large-language-models·event·natural-language-processing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史