2017年,一位化名为“deepfakes”的Reddit用户发布了一款换脸工具,允许用户利用Machine learning技术将一个人的面部叠加到另一个人的视频中。该工具依赖于Deep learning方法,如人工神经网络,标志着合成媒体公开可用性的一个转折点。它使得制作逼真但虚构的视频成为可能,通常描绘名人在妥协或虚构的场景中,并催生了“deepfakes”这一术语,作为“深度学习”和“伪造”的合成词。
该工具的出现立即引起了研究人员、记者和政策制定者的关注。它展示了生成式人工智能如何被非专家用于操纵视觉内容,引发了对视频证据可靠性的质疑,以及在虚假信息、骚扰和欺诈等领域被滥用的可能性。这一事件被广泛视为现代深度伪造现象的催化剂,此后已演变成一个更广泛的合成媒体领域,既有创造性应用,也有恶意应用。
技术基础
2017年的工具建立在Deep learning架构之上,特别是变分自编码器和生成对抗网络(GANs)。这些技术使系统能够从图像数据集中学习目标人物的面部特征,然后将这些特征映射到视频中另一个人的面部上。GANs的使用,在2010年代中期开发,是一个关键进步,因为它通过让两个竞争网络相互对抗--一个生成内容的生成器和一个评估其真实性的判别器--来生成高度逼真的图像。
在此之前,面部重新动画和操纵需要大量手动工作或专业设备。1997年的“Video Rewrite”和2016年的“Face2Face”等学术项目已经证明了自动面部操纵的可行性,但它们并未广泛向公众开放。2017年的Reddit工具将这些方法简化为用户友好的应用程序,降低了技术门槛,使任何拥有计算机和足够训练数据的人都能制作令人信服的假视频。
公众与学术回应
该工具的发布引发了一波关于深度伪造创建和检测的学术研究浪潮。计算机视觉研究人员开始开发识别操纵媒体的方法,通常使用在大量真实和虚假视频数据集上训练的Machine learning分类器。与此同时,社会科学家和人文学者审视了该技术的文化、伦理和政治影响。研究探讨了深度伪造如何被用于传播错误信息、干预选举或创建未经同意的亲密图像,并调查了推动社交媒体平台上此类内容参与度的因素。
研究人员还指出,“deepfake”一词在英语中带有负面含义,侧重于欺骗和伤害。相比之下,中文术语“换脸”更中立地框架了该技术,导致了不同的监管和社会回应。这种文化分歧突显了合成媒体的感知如何受语言和背景影响。
行业与监管发展
在2017年之后的几年里,信息技术行业和政府提出了各种措施来检测和减轻深度伪造的有害使用。OpenAI和其他AI研究组织开发了生成和检测合成媒体的工具,而谷歌云和亚马逊网络服务等平台提供了可用于创建和分析的服务。一些司法管辖区引入了专门针对深度伪造相关犯罪的法律,如未经同意的色情内容和选举干预,尽管执法仍然具有挑战性。
该技术还在娱乐、教育和可访问性领域找到了合法应用。电影制作人使用深度伪造来使演员年轻化或重现历史人物,教育工作者则利用它们制作逼真的培训模拟。然而,滥用的可能性继续推动对更强保障措施的呼吁,包括水印、认证标准和公众意识宣传活动。
遗产与持续挑战
2017年深度伪造工具的出现常被视为合成媒体进入公众意识的时刻。它证明了Machine learning技术可以被专业知识有限的个人利用,并为随后几年AI生成内容的迅速扩散奠定了基础。截至2020年代中期,深度伪造技术已变得越来越复杂和可访问,生成模型能够实时生成逼真的音频、视频和图像。
尽管检测方面取得了进展,但创建者和检测者之间的军备竞赛仍在继续。研究人员表明,深度伪造甚至可用于操纵医学图像,例如在CT扫描中注入或移除肺癌,欺骗放射科医生和基于AI的诊断工具。这突显了该技术超越娱乐和政治的更广泛影响,影响到视觉证据至关重要的领域。因此,2017年工具的遗产是双重的:它民主化了一种强大的创造性能力,但也暴露了一个日益依赖视觉媒体获取信息和信任的社会的脆弱性。