安全人工智能联盟是一个行业联盟,旨在解决人工智能系统的安全性、可靠性和可信度问题。该联盟的成立是为了应对生成式人工智能和大语言模型技术的快速普及,汇集了科技公司、研究机构和个别专家,共同制定共享框架、技术标准和最佳实践,以确保人工智能的安全部署。其工作涵盖对抗鲁棒性、模型评估、透明度和治理等领域,目标是在降低风险的同时,促进人工智能生态系统的创新。
该联盟作为一个由成员驱动的组织运作,参与者贡献技术专长、研究发现和工程资源。它强调实用、可操作的成果,包括开源工具、基准数据集和指导文档,而非仅仅进行政策倡导。通过协调行业和学术界的工作,该联盟旨在补充现有举措,并填补人工智能安全研究和实施中的空白。
成立背景与动机
安全人工智能联盟成立于2024年,这一年既见证了人工智能能力的快速进步,也伴随着公众和监管机构对相关风险日益增长的审视。涉及偏见输出、数据泄露和生成式人工智能工具滥用等备受关注的事件,凸显了行业协调行动的必要性。创始成员包括几家主要科技公司,如AMD、Intel、Samsung Electronics和Qualcomm,以及Amazon Web Services、Microsoft Azure、Google Cloud和Oracle Cloud Infrastructure等云服务提供商。这些公司认识到,人工智能中的安全挑战往往是系统性的,需要在硬件、软件和服务层面进行协作。
该联盟的成立还源于一个观察:许多人工智能安全努力是零散的,各公司各自追求专有解决方案。一个共享的中立平台被视为制定互操作标准和避免重复工作的关键。该组织的章程强调开放性,所有成果在可能的情况下均以宽松许可证公开发布。
组织结构
该联盟由一个从成员组织中选出的董事会管理,并由一个小型执行团队负责日常运营。其总部位于加利福尼亚州旧金山,这是人工智能行业的中心位置。任何对人工智能安全表现出坚定承诺的组织都可以加入,包括公司、初创企业、大学和非营利组织。个别研究人员也可以作为附属成员加入,在无需机构赞助的情况下参与工作组。
工作组是该联盟活动的核心,每个工作组专注于一个特定的技术领域。当前的小组包括对抗鲁棒性、模型评估与基准测试、数据隐私与安全、透明度与可解释性,以及人工智能治理与合规。每个小组至少由两个成员组织的代表共同主持,以确保观点的多样性。这些小组定期举行虚拟和面对面的会议,并发布进度报告和技术论文。
关键技术重点领域
该联盟的主要重点领域之一是对抗鲁棒性,这涉及使人工智能模型能够抵抗旨在引发错误或绕过安全控制的恶意输入。这包括对梯度裁剪、数据增强和其他防御技术的研究,以及标准化攻击基准的开发。该联盟维护着一个公开的对抗性示例和评估套件存储库,研究人员可以用它来测试他们的模型。
另一个关键领域是模型评估与基准测试。该联盟开发了一套标准化测试,用于评估大语言模型和其他人工智能系统的安全性、公平性和可靠性。这些基准涵盖幻觉率、输出偏见和分布偏移下的性能等主题。这些基准设计为可复现,并定期更新以反映新出现的威胁。
数据隐私与安全是第三个支柱,涉及训练数据泄露、成员推断攻击以及用于协作模型训练的安全多方计算等问题。该联盟发布了关于隐私保护机器学习的指南,并支持差分隐私和联邦学习等技术的研究。
与研究机构的合作
该联盟与几个领先的学术实验室保持着正式合作伙伴关系,包括MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)和University of Toronto。这些伙伴关系促进了前沿研究向实用工具和标准的转化。例如,联合项目探索了使用残差网络架构构建更稳健的视觉模型,以及应用Reinforcement Learning from AI Feedback (RLAIF)(基于人工智能反馈的强化学习)来使模型行为与安全指南保持一致。
与该联盟相关的个别研究人员在该领域做出了显著贡献。Aleksander Madry以其在对抗性示例方面的工作而闻名,曾担任鲁棒性项目的顾问。加州理工学院的Anima Anandkumar为可扩展评估方法做出了贡献。Michael I. Jordan是机器学习领域的先驱,为安全指标的统计基础提供了指导。该联盟还赞助博士后奖学金和研究生研究,帮助培养下一代人工智能安全专家。
出版物与开源工具
该联盟持续发布技术报告、白皮书和开源软件。值得注意的出版物包括对对抗性攻击方法的全面综述、一份关于在不牺牲安全性的情况下实现模型剪枝效率的实用指南,以及一份关于鲁棒性损失函数的比较分析。所有出版物在发布前都经过成员专家的内部同行评审。
在其开源工具中,该联盟开发了一个安全测试框架,可与流行的深度学习库集成。该框架自动化了对抗性扰动的生成、模型置信度校准的评估以及潜在数据投毒的检测。它已被几家成员公司用于内部质量保证。该联盟还维护着一个模型安全基准排行榜,允许组织将其系统与行业标准进行比较。
与其他人工智能安全倡议的关系
安全人工智能联盟将其定位为对其他主要安全努力的补充,例如由OpenAI和Anthropic领导的那些努力。虽然这些组织主要关注其自身前沿模型的安全,但该联盟旨在提供中立、跨行业的基础设施。它与BAIR (Berkeley AI Research)实验室和Stanford AI Lab等学术倡议合作举办联合研讨会和共享数据集。该联盟还与政府机构和标准制定机构协调,但不进行直接游说。
该联盟已与OpenPanel建立了正式联络关系,这是一个国际人工智能研究人员小组,旨在分享关于新出现威胁的发现。它还参加神经信息处理系统会议和国际学习表征会议等会议,并在这些会议上举办安全主题的会议。
挑战与批评
与许多行业联盟一样,安全人工智能联盟面临着与成员激励相关的挑战。批评者指出,公司可能不愿分享专有的安全漏洞,或采用可能增加成本的标准。该联盟试图通过专注于竞争前研究和使工作组参与自愿来缓解这一问题。然而,一些观察人士认为,缺乏约束性承诺限制了其建议的影响。
另一个挑战是人工智能发展的快速步伐,这可能超过该联盟更新其基准和指南的能力。该组织通过采用敏捷方法论来应对,工作组发布临时更新,而不是等待全面修订。尽管做出了这些努力,一些专家呼吁采取更积极的时间表,并提高成员合规性的透明度。
未来方向
展望未来,该联盟计划将其重点扩展到新兴领域,如神经网络可解释性、用于多模态模型的交叉注意力机制,以及Transformer (architecture)架构的安全影响。它还在探索与硬件制造商合作开发安全的人工智能加速器,基于AMD和Intel等成员的工作。该联盟打算增加与全球社区的接触,包括向亚洲和欧洲的研究人员开展外联活动。
一个关键的优先事项是开发人工智能产品的认证计划,类似于其他行业的安全认证。该联盟正在与成员公司合作,定义安全部署的标准,涵盖从数据处理到模型监控的各个方面。虽然这种认证仍处于规划阶段,但它代表了朝着制度化人工智能安全实践迈出的重要一步。
安全人工智能联盟继续随着人工智能格局的变化而演变。通过促进合作和提供实用资源,它旨在确保人工智能的好处得以实现,而不会损害安全和保障。其成功将取决于其成员和更广泛研究社区的持续参与。
成员资格与治理
该联盟的成员资格是分级的,具有不同的财务贡献和参与权利。创始成员在董事会中拥有永久席位,而普通成员每年选举代表。准成员,通常是较小的初创公司或学术团体,可以访问资源,但投票权有限。该联盟发布年度报告,详细说明其活动、财务和成员参与情况。
日常决策由执行董事和一个小型工作人员做出,重大战略决策需要董事会批准。该联盟为其成员制定了一套行为准则,强调道德研究实践和负责任地披露漏洞。争议通过内部监察员解决,如有必要可升级到董事会。
该联盟还运行一个实习项目,在夏季接待来自合作大学的学生参与项目。这些实习生为工作组做出贡献,并获得人工智能安全研究的实践经验。该项目广受好评,许多参与者后来进入了该领域。
影响与反响
安全人工智能联盟在技术界普遍受到好评,其基准和工具在众多学术论文中被引用。行业分析师称赞其协作方法,指出它填补了学术研究和商业实践之间的空白。然而,一些隐私倡导者对联盟专注于技术解决方案可能掩盖更广泛的社会问题(如算法偏见和劳动力替代)表示担忧。该联盟通过增加一个关于伦理人工智能的工作组来回应,尽管其产出在很大程度上仍是技术性的。
在具体影响方面,该联盟的对抗鲁棒性基准已被几家主要云服务提供商采纳,作为其安全测试协议的一部分。其关于数据隐私的指南已为Amazon Web Services和Microsoft Azure中新功能的开发提供了信息。随着人工智能系统越来越融入关键基础设施,该联盟的影响力预计将增长,使安全成为部署的先决条件。
总体而言,安全人工智能联盟代表了在科技行业内将人工智能安全制度化的一次重要尝试。其成功不仅将以其出版物和工具来衡量,还将以其在多大程度上改变组织开发和部署人工智能系统的方法来衡量。随着该领域的不断成熟,该联盟作为中立协调者和知识中心的角色可能会变得越来越重要。