Dirk Hovy是一位计算社会科学家,其研究聚焦于自然语言处理(NLP)、机器学习以及人工智能中的公平性。他尤其以在语言模型中的人口统计偏见和算法公平性方面的工作而闻名,研究社会属性(如性别、年龄和国籍)如何被编码在文本中,以及这些偏见如何通过AI系统传播。Hovy为开发检测和缓解NLP中偏见的方法做出了贡献,其工作影响了关于负责任AI发展的讨论。
Hovy任职于意大利米兰的博科尼大学,领导数据与营销洞察部门,并担任计算科学系教授。他还曾在南加州大学和哥本哈根大学任职。他的研究弥合了计算方法与社会科学之间的鸿沟,探讨语言如何反映和塑造社会结构的问题。
早年生活与教育
Dirk Hovy出生于德国,早年对计算机科学和语言学都产生了兴趣。他在蒂宾根大学攻读计算语言学本科,期间接触了语言与计算的交叉领域。随后,他前往美国攻读研究生,在南加州大学(USC)获得计算机科学博士学位。他的博士研究聚焦于统计机器翻译以及NLP模型中句法信息的应用,为他后来在社会维度语言方面的研究奠定了基础。
学术生涯
完成博士学位后,Hovy加入南加州大学信息科学研究所担任研究科学家。在此期间,他与同事合作开展了涉及多语言NLP以及为低资源语言开发资源等项目。2015年,他转至哥本哈根大学,先后担任副教授和正教授。在哥本哈根,他创立了NLP部门,并领导了计算社会科学研究,包括关于语言使用的人口统计相关性的研究。
2021年,Hovy加入博科尼大学担任正教授。在那里,他建立了一个专注于AI公平性和透明度的研究小组,特别强调NLP应用。他还参与了欧洲研究计划,包括由欧洲研究委员会资助的项目,并曾担任ACL、EMNLP和NAACL等主要NLP会议的程序委员会委员。
研究贡献
Hovy的研究为理解和缓解NLP系统中的偏见做出了重要贡献。他的著名作品之一《学习157种语言的词向量》引入了一个多语言词嵌入模型,该模型已被广泛用于跨语言NLP任务。他还发表了关于从文本自动推断人口统计属性的有影响力的论文,证明模型可以从写作风格预测一个人的性别、年龄和其他特征。这一研究方向引发了关于隐私以及此类预测可能被滥用的重要伦理问题。
在公平性领域,Hovy调查了训练数据中的偏见如何导致机器学习模型中的歧视性结果。他的工作表明,词嵌入和大型语言模型常常编码刻板印象,例如将某些职业与特定性别关联。他提出了缓解这些模型偏见的方法,包括后处理技术和数据增强策略。他的研究发表在顶级场所,包括《计算语言学协会会刊》和《人工智能研究杂志》。
影响与认可
Hovy的工作被广泛引用,并影响了学术研究和行业实践。他关于NLP偏见的发现已被OpenAI和Google DeepMind等组织在负责任AI发展指南中引用。他曾受邀在世界各地的会议和研讨会上发言,包括公平性、问责制与透明度会议(FAccT)和国际机器学习会议(ICML)。
2020年,Hovy因其“社会感知自然语言处理”项目获得了欧洲研究委员会的著名资助,该项目旨在开发对社会背景更敏感且不易产生偏见的NLP模型。他还多次获得会议最佳论文奖,包括因其人口统计推断工作在EMNLP 2016上获得荣誉提名。
精选出版物
Hovy已撰写超过100篇同行评审论文。他一些被引用最多的作品包括:
- 《学习157种语言的词向量》(与Anders Søgaard合作,2017年)
- 《来自文本的人口统计信息:综述》(与他人合作,2019年)
- 《德语句子级主观性检测语料库》(与他人合作,2013年)
- 《自然语言处理的社会影响》(与他人合作,2021年)
他的研究得到了国家科学基金会、欧盟和私人基金会的多项资助。