Scale AI,Inc.是一家美国人工智能基础设施和软件公司,总部位于加利福尼亚州旧金山。公司最初专注于数据标注,现亦提供基于人类反馈的强化学习(RLHF)服务、大型语言模型(LLM)评估,以及用于构建和部署AI应用的企业软件套件。其研究部门,,安全、评估与对齐实验室,,专注于评估和对齐LLM,并共同创建了基准测试“人类最后的考试”。
Scale AI通过其子公司外包数据标注业务,其中Remotasks专注于计算机视觉和自动驾驶汽车,Outlier则专注于为LLM标注数据。公司运营着一个LLM红队,进行人类对抗性测试,以识别AI模型中的漏洞、偏见和安全风险,并与OpenAI、Google DeepMind等组织以及各国AI安全研究所合作。商业客户包括Google、Microsoft、Meta、General Motors、OpenAI和Time,同时公司也与政府合作,包括美国(涉及军事相关项目)和卡塔尔(涉及社会项目效率)。
历史
早期岁月(2016–2019年)
Scale由Alexandr Wang和Lucy Guo于2016年通过Y Combinator创立,此前两人曾在Quora共事。初始投资者包括Dragoneer Investment Group、Tiger Global Management和Index Ventures。Guo于2018年被解雇。2019年8月,在Peter Thiel的Founders Fund投资1亿美元后,Scale的估值超过10亿美元,获得独角兽地位。
增长(2019–2025年)
Scale于2020年与美国国防部签订合同。2021年5月,特朗普政府时期的前美国首席技术官Michael Kratsios加入公司,担任董事总经理兼战略主管。到2021年7月,在Greenoaks、Dragoneer和Tiger Global领投的一轮融资后,Scale估值达到70亿美元,这得益于各行业对数据标注需求的增加。
2022年1月,Scale赢得一份价值2.5亿美元的合同,使美国联邦机构能够使用其工具套件。2022年2月,公司开发了自动损坏识别服务,以应对俄罗斯入侵乌克兰,通过分析卫星图像来测量建筑损坏,并为人道主义组织添加地理标签报告。2022年11月,Scale入选《Time》杂志2022年最佳发明榜单,并在圣路易斯开设了办事处。
2023年1月,Scale裁减了20%的员工。2023年5月,公司与美国陆军第十八空降军签署协议,成为首家在机密网络上部署其LLM(名为Donovan)的AI公司。2023年8月,Scale成为OpenAI微调GPT-3.5的首选合作伙伴,其服务被用于创建ChatGPT。同月,Scale的评估平台在DEF CON上用于首次生成式AI红队活动,测试了多家公司的模型。2023年12月,Scale为Meta的Purple Llama计划做出贡献,该计划是一个面向开放生成式AI模型的安全框架。
2024年2月,Scale被国防部选中,根据一份为期一年的合同,测试和评估其LLM用于军事目的。2024年3月,在Accel领投另一轮融资后,Scale估值达到近130亿美元。2024年5月,公司额外筹集了10亿美元,新投资者包括Amazon和Meta,估值达到140亿美元。2024年8月,Scale与美国AI安全研究所(由商务部下属的国家标准与技术研究所管理)签署协议,合作开展研究、测试和评估。
2024年12月,Scale被一名前员工起诉,指控其存在工资盗窃和工人分类错误;次月,另一名员工提起了类似诉讼。2025年1月,数名承包商起诉Scale,声称因接触令人不安的内容而遭受心理伤害。当月,《The Conversation》报道称,Scale和Meta此前曾合作创建并销售Defense Llama,这是一种面向军事风格防御目的的LLM产品。Scale还在《华盛顿邮报》上刊登整版广告,呼吁唐纳德·特朗普总统“赢得AI战争”。1月下旬,Scale与AI安全中心发布了“人类最后的考试”,这是一个面向AI系统的基准测试,Scale还协助开发了基准测试EnigmaEval、MultiChallenge和MASK。
2025年2月,Scale与卡塔尔政府达成五年合作伙伴关系,通过AI工具和培训改善政府服务,包括预测分析、自动化和高级数据分析,该协议在Web Qatar 2025峰会上签署。同月,Scale成为美国AI安全研究所的第三方AI模型评估机构。2025年3月,Scale与国防部达成价值数百万美元的协议,开发Thunderforge项目,这是美国军事自动化的重大一步,旨在利用AI规划和协助执行舰船、飞机及其他资产的调动。该合同由国防创新部门授予Scale、Anduril Industries和Microsoft,最初计划用于美国印太司令部和欧洲司令部。2025年4月,Scale发布了Scale Evaluation,这是一个平台,用于根据基准测试LLM,以找出弱点并标记额外训练数据可改进模型的地方。
Meta的额外投资(2025年)
2025年6月10日,Meta Platforms同意以148亿美元收购Scale AI 49%的无投票权股份。公司仍作为独立实体运营,与Meta保持分离。作为交易的一部分,前首席执行官Alexandr Wang在Meta内部担任高级职位,并由公司首席战略官、前Uber高管Jason Droege接替。
Scale Labs
2026年3月,公司推出了Scale Lab,这是一项旨在推进AI研究和开发的计划,不过截至当时,其具体运营细节并未广泛公开。
服务与产品
Scale AI提供一套数据标注工具,包括图像、视频和文本标注,这些对于训练机器学习模型至关重要。其RLHF服务帮助将LLM与人类偏好对齐,这是开发大型语言模型等系统的关键步骤。公司的评估平台(如Scale Evaluation)允许组织根据基准测试模型性能,识别弱点并改进训练数据。对于企业客户,Scale提供软件套件以构建和部署AI应用,包括模型监控和安全测试工具。
LLM红队进行对抗性测试,以发现漏洞、偏见和安全风险,通常模拟复杂的威胁,如网络安全攻击、越狱和代理型AI行为。这项工作支持商业客户和政府机构,包括各国AI安全研究所。
政府与军事工作
Scale AI拥有大量政府合同组合。其与美国国防部的工作包括Thunderforge项目(旨在自动化军事规划和执行)以及早期测试和评估LLM用于军事目的的合同。公司还与卡塔尔政府合作,通过AI增强社会项目,并与美国AI安全研究所合作进行模型评估。这些合作因AI在军事背景下的伦理问题而受到关注,但Scale已将自己定位为安全和对齐AI部署的领导者。
研究与基准测试
Scale的安全、评估与对齐实验室专注于评估和对齐LLM,为开发“人类最后的考试”等基准测试做出贡献,该测试在广泛的知识和推理任务中检验AI系统。公司还协助创建了EnigmaEval、MultiChallenge和MASK,这些基准针对推理、多步问题解决和安全性等特定能力。研究人员和开发者使用这些基准来评估模型性能并指导改进。
法律与伦理问题
Scale面临与劳动实践相关的法律挑战。2024年12月,一名前员工起诉公司,指控工资盗窃和工人分类错误,2025年1月又出现类似诉讼。此外,承包商于2025年1月起诉Scale,声称在数据标注任务中接触令人不安的内容而遭受心理伤害。这些案例凸显了数据标注员工作条件的持续担忧,他们经常处理敏感或创伤性材料。截至2026年初,Scale尚未公开解决这些案件。
领导层与结构
Alexandr Wang共同创立了Scale,并担任首席执行官直至2025年6月,当时他离开公司加入Meta,作为投资交易的一部分。曾任首席战略官、此前在Uber工作的Jason Droege接替他担任首席执行官。公司总部位于加利福尼亚州旧金山,并运营子公司Remotasks和Outlier用于数据标注。Scale的董事会和领导层包括Michael Kratsios等人物,他于2021年加入公司负责战略。