以数据为中心的AI(Data-centric AI)是一种人工智能范式,它将开发的主要焦点从以模型为中心的改进(例如调整神经网络架构或超参数)转移到对用于训练和评估的数据进行系统性增强。该方法认为,在许多实际应用中,数据集的质量、相关性和覆盖范围对最终模型性能的决定性作用大于对学习算法本身的改进。它在2010年代末和2020年代初作为一种独特的运动兴起,主要是回应这样一种观察:最先进的模型在固定数据集上往往趋于平稳,而针对性的数据干预可以带来显著收益。
这一理念与传统的以模型为中心的观点形成对比,后者将数据视为静态输入,并将工程精力集中于模型。以数据为中心的AI将数据集视为动态的、一流的工件,需要持续的管理、标注和验证。这包括识别和纠正标签错误、去除重复项和异常值、确保类别平衡以及设计数据增强策略等活动。该方法在数据稀缺或噪声较大的领域尤其相关,例如医学影像、自动驾驶和自然语言处理,在这些领域中获取高质量数据的成本很高。
历史背景
以数据为中心的思维根源可追溯到早期机器学习实践,其中特征工程和数据预处理被认为至关重要。然而,“以数据为中心的AI”这一明确术语在2021年左右获得 prominence,由Andrew Ng及其在斯坦福AI实验室的团队推广。Ng通过课程、研讨会以及创办Landing AI等公司进行的倡导,帮助规范了这一方法论。该运动还借鉴了早期关于数据集管理的学术工作,例如创建ImageNet等基准数据集,这些工作表明,大型且精心管理的数据集合可以推动深度学习的突破。
关键原则与技术
以数据为中心的AI基于几个核心原则运作。首先,数据质量优先于数量:一个较小但干净的数据集通常优于一个较大但嘈杂的数据集。技术包括自动化和人在回路的标签验证,使用工具标记潜在的错误标签,以及基于共识的重新标注。其次,数据覆盖和多样性:确保数据集代表真实世界场景的完整分布,包括边缘情况,以防止模型偏差和失败模式。这通过主动学习实现,其中模型识别最值得人工审查的样本,并通过针对性收集稀有示例来实现。
第三,数据增强和合成:通过变换(如图像的旋转、裁剪或噪声注入,或文本的释义)生成新的训练示例。高级方法使用生成模型创建合成数据,尽管这引入了分布偏移的风险。第四,数据版本化和溯源:跟踪数据集随时间的变化,类似于代码版本控制,以确保可复现性,并在数据更改导致性能下降时支持回滚。DVC(数据版本控制)和lakeFS等工具支持这些工作流。
与以模型为中心的方法的关系
以数据为中心的AI并不拒绝模型创新;相反,它认为当数据存在缺陷时,模型改进的收益递减。例如,一个在包含重复句子和事实错误的网络抓取文本上训练的大型语言模型,其输出质量将低于在精心过滤的语料库上训练的较小模型。这两种方法是互补的:以模型为中心的工作可能引入新的transformer架构,而以数据为中心的工作则确保训练集没有矛盾和偏见。在实践中,许多组织采用混合策略,同时迭代模型和数据,但以数据为中心的AI强调,数据干预通常更便宜且更具影响力。
应用与案例研究
在计算机视觉领域,以数据为中心的技术已被用于改进制造业中的缺陷检测,其中几千张稀有缺陷的标注图像可能比数百万张通用图像更有价值。在医疗保健领域,Commure等初创公司将以数据为中心的方法应用于电子健康记录,清理和规范化非结构化数据以训练预测模型。在自动驾驶领域,Waymo和特斯拉自动驾驶在数据管理上投入大量资源,为其训练集选择最具信息量的驾驶场景。在自然语言处理领域,OpenAI和Anthropic等公司使用数据过滤和人类反馈来优化数据集以实现对齐,这一过程与RLHF相关。
批评与局限性
批评者认为,以数据为中心的AI可能耗时且劳动密集,需要大量人工标注和审查,这可能无法扩展到前沿AI中使用的海量数据集。还存在对管理后数据过拟合的风险,导致在未见分布上泛化能力差。此外,该方法无法解决标签模糊性或概念漂移等根本问题,其中类别的定义随时间变化。一些研究人员,如Aleksander Madry,指出以数据为中心的方法需要严格的框架来衡量数据质量,因为主观判断可能引入新的偏见。尽管存在这些挑战,该范式已成为机器学习生命周期中的标准部分,许多工具和最佳实践现已集成到AWS、Google Cloud和Azure等主流平台中。
未来方向
以数据为中心的AI的未来可能涉及数据质量评估的更大自动化,使用模型本身来检测异常并提出修正建议。使用生成模型进行数据增强的兴起,包括使用扩散模型进行合成图像生成,是一个活跃的研究领域。此外,该领域正朝着标准化数据质量指标和基准的方向发展,类似于模型基准,以便对数据管理流程进行客观比较。随着AI系统在更多关键领域部署,对可信、有据可查数据的重视只会增加,使以数据为中心的原则成为负责任AI发展的基石。