译自英文

合成数据是人工生成的数据,通常由AI模型自身产生,用于在真实数据稀缺、成本高昂或敏感时训练或增强机器学习系统。

合成数据是指由模型或模拟人为生成的数据,而非从真实世界事件或人类创作内容中收集而来,用于训练、微调或评估机器学习系统。在现代大语言模型的语境下,合成数据通常指由现有AI模型生成的文本、代码或对话,并经常在过滤后用作另一模型的训练数据,这种做法有时被描述为一种蒸馏形式,即较强模型的输出用于教导较弱模型。

合成数据的重要性在2020年代中期日益增长,,因为领先实验室接近研究人员所称的数据墙,,即互联网上现成高质量人类生成文本的增长放缓,,这使得模型生成的数据成为持续扩展中人类文本的重要补充。

用途

合成数据在AI开发中具有多种用途。它可以扩充稀缺的数据类别,,例如生成稀有语言的额外示例、数学或代码等专业领域的数据,,或难以大规模从人类收集的多轮对话。它在基于人类反馈的强化学习流程及其后继方法中被广泛使用,,其中模型或模型集成生成候选响应,,然后进行排序或过滤以产生训练信号。合成数据在训练推理模型中也发挥核心作用,,在数学和编程等可验证领域中,,模型自身生成的解决方案可被自动检查,,正确的方案被重用为训练示例,,这是DeepSeek-R1等系统背后强化学习方法的核心途径。除文本外,,合成数据在计算机视觉和机器人技术中被广泛使用,,其中模拟环境生成标记图像或交互数据,,这些数据若通过物理方式收集将成本高昂

##模型崩溃争论

大约从2023年开始的一系列研究提出了对模型崩溃的担忧,,这是一种假设的模型质量退化现象,,如果模型反复且不加选择地训练于先前模型生成的数据上,,则可能发生,,其理论是每一代都会放大错误并失去原始人类生成分布中稀有但重要模式的覆盖范围;后续研究和行业实践表明,,模型崩溃主要是在合成数据被粗心使用且缺乏质量过滤或与真实数据混合时构成真实风险,,而经过仔细筛选或验证的合成数据,,特别是在可验证领域中,,不会表现出同样的退化,,并能大幅提升模型质量;到2025年,,大多数前沿实验室将大量精选合成数据作为训练的标准组成部分,,而非回避它

##质量与验证

由于合成数据继承并可能放大生成它的模型的偏见、错误和风格怪癖,,从业者通常应用过滤步骤,,例如使用单独的、通常能力更强的模型或基于规则的检查器来评分或验证质量,,然后再将生成的示例纳入训练集;在正确性可自动验证的领域中,,如可执行的代码和可检查的数学,,被认为特别适合合成数据生成,,因为低质量示例可通过算法过滤掉,,而开放式创意或事实性文本则更难自动验证,,且对基于其训练的模型带来更大的悄然退化风险;

分类:machine-learning·training-data
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史