SambaNova Cloud是由SambaNova Systems开发的基于云的推理平台,该公司专注于AI硬件和软件。该平台使开发者和企业能够使用SambaNova定制的专用集成电路(ASIC,称为SambaNova数据流处理单元(DPU))以高速运行开源大语言模型(LLM)。SambaNova Cloud于2023年推出,提供了一个托管环境,用户可以在其中访问Llama 3.1、Llama 3.2、Qwen 2.5等模型以及其他流行的开源模型,而无需管理底层基础设施。该服务提供免费的实验用playground和用于生产环境的付费API,重点在于低延迟推理和成本效率。
该平台基于SambaNova的SN40L芯片构建,这是第二代DPU,集成了1040亿个晶体管,并支持高达256 GB的片上内存。这种硬件架构旨在加速基于Transformer的模型,而Transformer是现代大多数LLM的基础。SambaNova Cloud声称其推理速度显著快于基于GPU的替代方案,一些基准测试显示,对于Llama 3.1 405B等模型,吞吐量提升高达3倍。该服务支持文本生成和多模态任务,包括视觉语言模型,并提供批处理、流式响应以及微调功能等特性。
历史与发展
SambaNova Systems成立于2017年,由斯坦福大学教授Kunle Olukotun和同为斯坦福教授的Chris Ré以及一支工程师和研究人员团队共同创立。公司最初专注于为企业客户构建全栈AI解决方案,包括硬件和软件,在2023年,SambaNova转向云优先战略,推出SambaNova Cloud作为公共平台,以普及高性能AI推理的访问权限,该平台的首次公开发布发生在2023年9月,提供对Llama 2和CodeLlama等模型的访问,此后,平台扩展了其模型目录,并引入了诸如SambaNova Cloud API等功能,该API与OpenAI的API格式兼容,使开发者能够轻松从其他提供商迁移过来。
在2024年,SambaNova Cloud获得了显著的发展势头,尤其是在Llama 3.1发布之后,该平台以高速提供该模型的服务,公司还宣布与包括美国能源部在内的各种组织建立合作伙伴关系,为科学研究提供AI推理能力,到2025年初,SambaNova Cloud已处理了数十亿个token,,并被数千名开发者和企业使用。
##硬件与性能
SambaNova Cloud的核心是SN40L芯片,这是一种可重构的数据流架构,不同于传统的GPU,,与使用固定指令集的GPU不同,SN40L可以动态重新配置,以优化特定模型架构的数据流,这使得Transformer模型能够高效执行,减少内存瓶颈并提高吞吐量,,SN40L芯片包含1040亿个晶体管,,并配备256 GB的片上高带宽内存(HBM),这对于处理大型模型而无需过多数据移动至关重要,,SambaNova声称,与领先的基于GPU的解决方案相比,这种架构使Llama 3.1 405B等模型的推理速度提升高达3倍,,同时功耗更低,,
在实践中,SambaNova Cloud在第三方基准测试中展示了令人印象深刻的性能,,例如,,在2024年Artificial Analysis的一项评估中,,SambaNova Cloud在Llama 3.1 405B上实现了最高吞吐量,,每位用户每秒处理超过200个token,,该平台还支持低延迟响应,,许多模型的首token时间通常低于1秒,,这些性能特征使SambaNova Cloud对聊天机器人、代码生成和摘要等实时应用具有吸引力,,,
##模型目录与功能
SambaNova Cloud提供不断增长的开源模型目录,,包括Llama 3.1(8B、70B、405B)、Llama 3.2(1B、3B、11B、90B)、Qwen 2.5(7B、14B、72B)和Mistral 7B,,平台还支持专门的模型,,如用于代码生成的CodeLlama以及Llama 3.2 Vision等视觉语言模型,,用户可以通过Web playground、REST API或Python SDK访问这些模型,,该API设计为与OpenAI的API直接兼容,,允许开发者以最小改动进行迁移,,此外,,SambaNova Cloud还提供JSON模式、函数调用和流式响应等功能,,这些对于构建生产级应用程序至关重要,,,
对于企业而言,,SambaNova Cloud提供专用容量选项,,包括私有集群和本地部署,,平台还支持在自定义数据集上对模型进行微调,,使组织能够将开源模型适应其特定领域,,安全功能包括传输中和静态数据加密,,以及符合SOC 2等标准,,,
##竞争格局
SambaNova Cloud与包括OpenAI的API、Anthropic的Claude以及Google Cloud的Vertex AI在内的其他云AI推理提供商竞争,,同时也与Cerebras和Groq等专业AI硬件公司竞争,,虽然基于GPU的云服务如AWS Trainium和Microsoft Azure提供通用AI服务,,但SambaNova Cloud通过专门专注于开源模型并在定制硬件上提供高速推理来实现差异化,,与同样在专用芯片上提供快速推理的Groq相比,,SambaNova Cloud支持更大的模型(例如405B)并提供更全面的功能集,,对于高吞吐量工作负载,,该平台的定价通常低于基于GPU的替代方案,,使其成为推理密集型应用的经济高效选择,,,
##使用案例与采用
SambaNova Cloud被金融、医疗保健和技术等多个行业使用,,例如,,金融机构使用该平台进行实时文档分析和风险评估,,而医疗保健组织则利用其进行医学文献摘要和临床决策支持,,该平台也被学术研究人员和初创公司用于原型设计和部署AI应用程序,,2024年,,SambaNova Cloud被美国能源部橡树岭国家实验室选中,,为科学研究提供AI推理支持,,凸显了其可靠性和性能,,此外,,该平台已集成到LangChain和LlamaIndex等工具中,,使开发者更容易构建复杂的AI工作流,,,
##未来方向
SambaNova Systems持续投资于改进SambaNova Cloud,,计划扩展其模型目录并增强其微调能力,,公司还在开发下一代硬件,,如SN50芯片,,预计将进一步提升性能和效率,,随着对开源LLM推理需求的增长,,SambaNova Cloud旨在将自己定位为高速、经济高效AI部署的领先平台,,然而,,竞争格局依然激烈,,主要云提供商和专业初创公司都在争夺市场份额,,SambaNova的成功将取决于其保持性能优势并建立由开发者和企业客户组成的强大生态系统的能力,,,