Amy Zhang은 인간 중심 AI, 강화 학습, 해석 가능성에 중점을 둔 인공지능 연구자이다. 그녀는 워싱턴 대학교의 조교수이자 Meta AI(이전 Facebook AI Research)의 연구 과학자이다. 그녀의 연구는 AI 시스템을 더 투명하고, 상호작용적이며, 인간의 가치와 일치하도록 만드는 것을 목표로 하며, 종종 기계 학습과 인지 과학 및 인간-컴퓨터 상호작용의 통찰을 결합한다.
Zhang은 캘리포니아 대학교 버클리에서 컴퓨터 과학 박사 학위를 받았으며, Pieter Abbeel의 지도를 받았다. 그녀의 박사 연구는 인간 피드백으로부터 학습하는 방법과 강화 학습을 더 표본 효율적으로 만드는 방법을 개발했다. 그녀는 또한 Google Brain과 몬트리올 학습 알고리즘 연구소(MILA)에서 방문 연구원으로 시간을 보냈다. 박사 학위 전에는 워털루 대학교에서 컴퓨터 과학 학사 학위를 취득했다.
강화 학습과 인간 피드백
Zhang의 초기 연구는 강화 학습, 특히 에이전트가 희소 보상과 시연으로부터 학습하는 방법에 초점을 맞췄다. 그녀는 모방 학습과 보상 형성을 결합한 알고리즘 개발에 기여하여, 에이전트가 소수의 인간 예시로부터 복잡한 행동을 학습할 수 있게 했다. 주목할 만한 프로젝트인 "Learning by Playing"은 비지도 탐색을 사용하여 하류 작업에 재사용할 수 있는 기술을 학습함으로써 희소 보상 작업을 해결하는 방법을 도입했다.
그녀의 연구에서 중심 주제는 AI 훈련을 안내하는 인간 피드백의 사용이다. 그녀는 선호 기반 강화 학습 기술에 대해 연구했으며, 여기서 모델은 명시적 보상보다 궤적의 쌍별 비교로부터 학습한다. 이 접근 방식은 로봇 공학이나 대화 시스템과 같이 보상 함수를 설계하기 어려운 영역에서 특히 유용하다. 이 분야의 그녀의 연구는 널리 인용되었으며, 현대 대규모 언어 모델 훈련의 핵심 구성 요소인 RLHF에 대한 후속 연구에 영향을 미쳤다.
해석 가능성과 투명성
Zhang은 또한 기계 학습의 해석 가능성에 상당한 기여를 했다. 그녀는 신경망이 학습한 것을 시각화하고 이해하는 방법, 특히 강화 학습 에이전트의 맥락에서 이를 개발했다. "saliency maps"와 "concept activation vectors"에 대한 그녀의 연구는 연구자들이 모델의 결정에서 어떤 입력 특징이 가장 영향력 있는지 식별하는 데 도움을 준다. 이 연구 라인은 의료나 자율 주행과 같은 고위험 응용 분야에서 AI 시스템에 대한 신뢰를 구축하는 데 중요하다.
널리 인용된 논문에서 Zhang과 동료들은 "TCAV"(Testing with Concept Activation Vectors)를 도입했는데, 이는 개념(예: "줄무늬" 또는 "점박이")이 모델의 예측에 얼마나 기여하는지 정량화하는 기술이다. 이 방법은 사용자가 단순한 특징 귀속을 넘어 인간이 이해할 수 있는 용어로 모델의 추론을 조사할 수 있게 한다. 이 연구는 Google DeepMind와 OpenAI의 산업 팀에서 모델 감사에 채택되었다.
인간 중심 AI
Zhang의 연구 의제는 명시적으로 인간 중심이다: 그녀는 사람들과 자연스럽게 상호작용하고 그들의 피드백으로부터 학습할 수 있는 AI 시스템을 설계한다. 그녀는 사용자가 자연어로 실수를 수정하거나 원하는 행동을 시연함으로써 AI 어시스턴트를 더 유용하게 만드는 방법을 탐구했다. 여기에는 모델이 사용자 입력에 따라 시간이 지남에 따라 개선되는 상호작용 학습과 AI 목표를 인간 선호에 맞추는 작업이 포함된다.
그녀의 프로젝트 중 하나인 "Reward Learning from Human Preferences"는 로봇이 비전문가 사용자의 피드백을 받아 작업을 수행하는 방법을 학습할 수 있음을 입증했다. 사용자 연구에서 참가자들은 간단한 예/아니오 피드백을 제공하여 시뮬레이션된 로봇에게 탐색 및 물체 조작을 가르쳤다. 결과는 로봇이 최소한의 인간 노력으로 효과적으로 학습할 수 있음을 보여주었으며, 이는 맞춤형 AI로 가는 실용적인 경로를 제시한다.
학문적 경력 및 교육
Zhang은 2021년 워싱턴 대학교 Paul G. Allen 컴퓨터 과학 및 공학 학교에 조교수로 합류했다. 그녀는 인간 중심 AI 연구소를 이끌며 대학원생과 박사후 연구원을 지도한다. 그녀의 교육에는 강화 학습과 기계 학습의 공정성, 책임성, 투명성에 관한 과정이 포함된다. 그녀는 2023년 UW 공과대학 우수 교육상을 포함한 여러 교육 상을 받았다.
MIT CSAIL과 스탠포드 AI 연구소에서 그녀는 연구에 대한 초청 강연을 했다. 그녀는 또한 UW 공공 정보 센터의 소속 교수로, 잘못된 정보와 알고리즘 편향을 포함한 AI의 사회적 영향을 연구한다.
산업 경험
학문적 임용 전에 Zhang은 2020년부터 2021년까지 Meta AI에서 연구 과학자로 일했다. Meta에서 그녀는 강화 학습 전문 지식을 추천 시스템 개선과 유해 콘텐츠 탐지 도구 개발에 적용했다. 그녀는 또한 Anthropic의 팀과 안전 연구에 협력하여 확장 가능한 감독에 대한 초기 작업에 기여했다.
Zhang은 또한 Google Brain과 버클리 AI 연구 (BAIR)에서 연구 인턴으로 일했다. 이러한 경험은 그녀에게 AI 연구가 제품과 정책으로 어떻게 전환되는지에 대한 넓은 시각을 제공했다.
수상 및 인정
Zhang은 그녀의 연구로 여러 영예를 받았다. 2022년에는 AI2050 이니셔티브에 의해 AI 분야의 떠오르는 별로 선정되었다. 2023년에는 "상호작용적이고 해석 가능한 강화 학습" 프로젝트로 NSF CAREER 상을 받았다. 그녀의 논문은 국제 기계 학습 회의(ICML)와 신경 정보 처리 시스템 회의(NeurIPS)를 포함한 주요 회의에서 최우수 논문상을 수상했다. 그녀는 또한 2024년 컴퓨터 과학 분야 Sloan 연구 펠로우십을 받았다.
주요 출판물
Zhang은 최상위 학술지에 40편 이상의 논문을 발표했다. 가장 많이 인용된 연구 중 일부는 다음과 같다:
- "TCAV: Relative Concept Importance Testing" (ICML 2018) - 개념 기반 해석 가능성 방법을 도입.
- "Learning by Playing: Solving Sparse Reward Tasks from Scratch" (ICML 2018) - 탐색을 위한 자기 대결 커리큘럼 제안.
- "Reward Learning from Human Preferences" (NeurIPS 2019) - 실용적인 선호 기반 RL을 입증.
- "Interactive Learning from Policy-Dependent Human Feedback" (ICML 2020) - 에이전트가 개선됨에 따라 피드백이 어떻게 변하는지 연구.
그녀의 연구는 국립 과학 재단, 해군 연구소, 민간 재단의 보조금으로 지원되었다.
미래 방향
Zhang의 현재 연구는 대규모 언어 모델을 더 해석 가능하고 제어 가능하게 만드는 데 초점을 맞추고 있다. 그녀는 모델에서 정직한 불확실성을 이끌어내는 방법과 사용자가 재훈련 없이 모델 행동을 조종할 수 있게 하는 방법을 조사하고 있다. 그녀는 또한 여러 AI 시스템이 상호작용하는 다중 에이전트 강화 학습과 그러한 시스템이 안전하고 인간 목표와 일치하도록 보장하는 데 관심이 있다.
2025년 현재 Zhang은 워싱턴 대학교에서 계속 가르치고 연구를 이끌고 있다. 그녀의 기여는 기술적 기계 학습과 인간 요구 사이의 격차를 메우며 인간 중심 AI의 새로운 분야를 형성하는 데 도움을 주었다.