Dirk Hovy는 자연어 처리(NLP), 기계 학습, 인공지능의 공정성을 연구하는 전산사회과학자이다. 그는 언어 모델의 인구통계학적 편향과 알고리즘 공정성에 대한 연구로 특히 잘 알려져 있으며, 성별, 연령, 국적과 같은 사회적 속성이 텍스트에 어떻게 인코딩되는지, 그리고 이러한 편향이 AI 시스템을 통해 어떻게 전파되는지를 조사한다. Hovy는 NLP에서 편향을 탐지하고 완화하는 방법 개발에 기여했으며, 그의 연구는 책임 있는 AI 개발에 관한 논의에 영향을 미쳤다.
Hovy는 이탈리아 밀라노의 보코니 대학교에 소속되어 있으며, 데이터 및 마케팅 인사이트 부서를 이끌고 컴퓨팅 과학과의 교수로 재직 중이다. 그는 또한 서던캘리포니아 대학교와 코펜하겐 대학교에서도 직책을 맡은 바 있다. 그의 연구는 전산 방법과 사회 과학을 연결하며, 언어가 사회 구조를 어떻게 반영하고 형성하는지에 대한 질문을 다룬다.
초기 생애와 교육
Dirk Hovy는 독일에서 태어나 컴퓨터 과학과 언어학 모두에 일찍 관심을 갖게 되었다. 그는 튀빙겐 대학교에서 전산언어학 학부 과정을 마치며 언어와 계산의 교차점을 접했다. 이후 미국으로 건너가 대학원 과정을 밟았고, 서던캘리포니아 대학교(USC)에서 컴퓨터 과학 박사 학위를 받았다. 그의 박사 연구는 통계적 기계 번역과 NLP 모델에서의 구문 정보 사용에 초점을 맞추었으며, 이는 이후 언어의 사회적 차원에 대한 연구의 기초가 되었다.
학문적 경력
박사 학위를 마친 후 Hovy는 서던캘리포니아 대학교의 정보과학연구소에 연구 과학자로 합류했다. 이 기간 동안 그는 다국어 NLP와 저자원 언어를 위한 리소스 개발 프로젝트에서 동료들과 협력했다. 2015년에는 코펜하겐 대학교로 옮겨 부교수, 이후 정교수가 되었다. 코펜하겐에서 그는 NLP 섹션을 설립하고 언어 사용의 인구통계학적 상관관계에 대한 연구를 포함한 전산사회과학 연구를 이끌었다.
2021년, Hovy는 보코니 대학교의 정교수로 합류했다. 그곳에서 그는 NLP 응용에 특히 중점을 둔 AI의 공정성과 투명성 연구 그룹을 설립했다. 그는 또한 유럽연구위원회가 자금을 지원하는 프로젝트를 포함한 유럽 연구 이니셔티브에 참여했으며, ACL, EMNLP, NAACL과 같은 주요 NLP 학회의 프로그램 위원회에서 활동했다.
연구 기여
Hovy의 연구는 NLP 시스템의 편향을 이해하고 완화하는 데 상당한 기여를 했다. 그의 주목할 만한 연구 중 하나인 "Learning Word Vectors for 157 Languages"는 다국어 단어 임베딩 모델을 도입했으며, 이는 교차 언어 NLP 작업에서 널리 사용되고 있다. 그는 또한 텍스트에서 인구통계학적 속성을 자동으로 추론하는 것에 대한 영향력 있는 논문을 발표하여, 모델이 글쓰기 스타일만으로 사람의 성별, 연령 및 기타 특성을 예측할 수 있음을 보여주었다. 이 연구는 프라이버시와 그러한 예측의 오용 가능성에 대한 중요한 윤리적 질문을 제기했다.
공정성 분야에서 Hovy는 훈련 데이터의 편향이 기계 학습 모델에서 차별적 결과를 어떻게 초래하는지 조사했다. 그의 연구는 단어 임베딩과 대규모 언어 모델이 특정 직업을 특정 성별과 연관 짓는 것과 같은 고정관념을 종종 인코딩한다는 것을 보여주었다. 그는 이러한 모델을 디바이어싱하기 위한 방법으로 후처리 기술과 데이터 증강 전략을 제안했다. 그의 연구는 전산언어학회 논문집과 인공지능 연구 저널을 포함한 최고의 학술지에 게재되었다.
영향과 인정
Hovy의 연구는 널리 인용되었으며 학술 연구와 산업 관행 모두에 영향을 미쳤다. NLP 편향에 대한 그의 발견은 OpenAI 및 Google DeepMind와 같은 조직의 책임 있는 AI 개발 지침에 참조되었다. 그는 공정성, 책임성, 투명성 학회(FAccT)와 국제 기계 학습 학회(ICML)를 포함한 전 세계의 학회와 워크숍에서 초청 연사로 활동했다.
2020년, Hovy는 사회적 맥락에 더 민감하고 편향에 덜 취약한 NLP 모델을 개발하는 것을 목표로 하는 "사회적 인식 자연어 처리" 프로젝트에 대해 유럽연구위원회로부터 권위 있는 보조금을 받았다. 그는 또한 여러 학회에서 최우수 논문상을 수상했으며, 2016년 EMNLP에서 인구통계학적 추론 연구로 명예로운 언급을 받았다.
주요 출판물
Hovy는 100편 이상의 동료 검토 논문을 저술했다. 가장 많이 인용된 연구 중 일부는 다음과 같다:
- "Learning Word Vectors for 157 Languages" (Anders Søgaard와 공저, 2017)
- "Demographic Information from Text: A Survey" (공저, 2019)
- "A Corpus for Sentence-Level Subjectivity Detection in German" (공저, 2013)
- "The Social Impact of Natural Language Processing" (공저, 2021)
그의 연구는 미국 국립과학재단, 유럽 연합, 민간 재단의 여러 보조금으로 지원되었다.