对抗性文体测量学是通过改变写作风格来降低文体测量学发现作者身份或其特征的可能性的实践。这项任务也被称为作者身份混淆或作者身份匿名化。文体测量学在揭示匿名作者身份或将笔名与作者的其他身份关联起来方面构成了重大的隐私挑战,例如,这给举报人、活动人士以及恶作剧者和欺诈者带来了困难。随着机器学习技术和文本语料库的发展,这种隐私风险预计会增长。
所有对抗性文体测量学都共享一个核心思想,即忠实地改写源文本,使含义不变但风格信号被模糊化。这种忠实的改写是文体测量分类器的一个对抗性示例。存在几种广泛的方法,其中有些有所重叠:模仿,即用他人的风格替换作者自己的风格;翻译,即应用机器翻译,希望这能消除源文本中的特征性风格;以及混淆,即故意修改文本的风格,使其不再像作者自己的风格。
手动模糊风格是可能的,但很费力;在某些情况下,这是更可取或必要的。自动化工具,无论是半自动还是全自动的,都可以帮助作者。如何最好地执行这项任务以及此类工具的设计是一个开放的研究问题。虽然一些方法已被证明能够击败特定的文体测量分析,特别是那些不考虑对抗性可能性的分析,但在面对未知分析时确保安全性是一个问题。确保改写的忠实性对于自动化工具来说是一个关键挑战。
对抗性文体测量学的实践本身是否可检测尚不确定。一些研究发现特定方法在输出文本中留下了信号,但一个不确定可能使用了哪些方法的文体测量学家可能无法可靠地检测到它们。
历史
Rao & Rohatgi (2000) 是对抗性文体测量学的早期工作,它指出了机器翻译的可能性,但注意到当时可用的翻译器质量带来了严峻的挑战。Kacmarcik & Gamon (2006) 是另一项早期工作。Brennan, Afroz & Greenstadt (2012) 对对抗性文体测量方法在实际文本上进行了首次评估。
Brennan & Greenstadt (2009) 引入了第一个专门用于评估文体测量方法的对抗性作者文本语料库;其他语料库包括国际模仿海明威竞赛、福克纳赝品竞赛以及恶作剧博客《大马士革的一位同性恋女孩》。
动机
Rao & Rohatgi (2000) 提出,短篇、未署名的文档(即匿名帖子)不受文体测量识别的风险,但那些没有实践对抗性文体测量学、产生了数千词语料库的笔名作者可能容易受到攻击。Narayanan 等人 (2012) 尝试对 100,000 名博客作者进行大规模去匿名化,结果喜忧参半:识别结果显著优于随机猜测,但只有五分之一的时间能准确匹配博客和作者;随着作者在语料库中发布的帖子数量增加,识别效果有所改善。即使作者未被识别,他们的某些特征仍可能通过文体测量学被推断出来,或者文体测量学可能将潜在作者的匿名集缩小到足够小,以便其他信息完成识别。检测作者特征(例如性别或年龄)通常比从大量、可能开放的候选集中识别作者要简单。
现代机器学习技术为识别提供了强大的工具;语料库和计算文体测量技术的进一步发展可能会引发更多隐私问题。Gröndahl & Asokan (2020a) 表示,文体测量学所依据的假设,,即作者具有不变的、与内容无关的“风格指纹”,,的普遍有效性尚不确定,但“去匿名化攻击是一个真实的隐私担忧”。
那些有兴趣实践对抗性文体测量学和风格欺骗的人包括:寻求避免报复的举报人;记者和活动人士;欺诈和恶作剧的实施者;虚假评论的作者;文学伪造者;试图向调查人员隐瞒身份的罪犯;以及,一般来说,任何渴望匿名或笔名的人。作者,或代表作者行事的代理人,也可能试图移除作者特征(例如种族或性别)的风格线索,以便这些特征的知识不能被用于歧视(例如,通过算法偏见)。对抗性文体测量学的另一个可能用途是将自动生成的文本伪装成人类创作的文本。
方法
通过模仿,作者试图通过将自己的风格与另一位作者的风格相匹配来误导文体测量学。不完整的模仿,即真实作者的一些独特特征与模仿作者的特征同时出现,可能是使用对抗性文体测量学的可检测信号。模仿可以通过风格迁移系统自动执行,尽管这通常需要系统从目标风格的大量语料库中学习。
另一种方法是翻译,它利用机器翻译源文本以消除特征性风格,通常通过多个翻译器依次进行以产生往返翻译。这种链式翻译可能导致文本被显著改变,甚至达到难以理解的程度;改进的翻译工具降低了这种风险。结构更简单的文本更容易在不丢失原始含义的情况下进行机器翻译。机器翻译与直接风格模仿或通过自动化风格迁移实现的混淆模糊了界限,后者可以被视为输入和输出为同一种语言的“翻译”。使用低质量的翻译工具时,作者可能需要手动纠正主要的翻译错误,同时避免重新引入风格特征的危险。Wang, Juola & Riddell (2022) 发现,Google Translate 引入的重大错误很少见,但在多次中间翻译时更常见,,然而,源文本中偶尔出现的简单或短句以及拼写错误会原样出现在输出中,可能提供识别信号。链式翻译会在文档中留下其应用的痕迹,这可能允许重建所使用的中间语言和执行的翻译步骤数量。
混淆涉及故意改变文本的风格,以通过某种度量减少其与其他文本的相似性;这可以在写作时通过有意识的修改来执行,或者作为修订过程的一部分,以目标度量的反馈作为输入来决定文本何时已被充分混淆。
自动化工具与研究
用于对抗性文体测量学的半自动和全自动工具是一个活跃的研究领域。此类工具的设计必须平衡模糊风格的需求与保留含义的要求。一些方法已被证明能够击败特定的文体测量分析,尤其是那些不考虑对抗性可能性的分析。然而,确保面对未知未来分析的安全性仍然是一个挑战。改写的忠实性是一个关键问题;自动化系统可能产生语法正确但微妙改变原始含义的文本。
Large language model 和 Generative AI 的最新进展为风格迁移和改写生成开辟了新的可能性。这些模型可用于以不同风格重写文本同时保留内容,但它们也引入了可检测伪影的风险。研究继续致力于如何使此类系统更健壮且更不易被检测。
检测与对策
检测文本是否经过对抗性风格化本身就是一个难题。一些研究已经识别出特定方法留下的信号,例如翻译错误或异常词汇选择的存在。然而,如果文体测量学家不知道使用了哪种方法,可靠检测可能是不可能的。这造成了那些寻求匿名化文本的人和那些寻求揭示作者身份的人之间的军备竞赛。
伦理与法律考量
对抗性文体测量学的使用引发了伦理问题。虽然它可以保护隐私并促进言论自由,但它也可能被用于恶意目的,例如欺诈或传播虚假信息。法律框架因司法管辖区而异,在某些背景下,这种做法可能受到监管。与许多隐私增强技术一样,对抗性文体测量学的双重用途性质使其成为持续辩论的主题。
参见
参考文献
- Brennan, M., & Greenstadt, R. (2009). Practical attacks against authorship recognition techniques.
- Brennan, M., Afroz, S., & Greenstadt, R. (2012). Adversarial stylometry: Circumventing authorship recognition to preserve privacy and anonymity.
- Gröndahl, T., & Asokan, N. (2020). Text analysis in adversarial settings.
- Kacmarcik, G., & Gamon, M. (2006). Obfuscating document stylometry to preserve author anonymity.
- Narayanan, A., et al. (2012). On the feasibility of internet-scale author identification.
- Rao, J. R., & Rohatgi, P. (2000). Can pseudonymity really guarantee privacy?
- Wang, Y., Juola, P., & Riddell, A. (2022). Translation as a means of authorship obfuscation.