Ethan Perez는 Anthropic의 연구원으로, AI 평가와 안전성을 전문으로 합니다. 그의 연구는 대규모 언어 모델의 행동을 이해하고 개선하는 데 초점을 맞추며, 특히 진실성, 편향, 확장 가능한 감독과 같은 영역을 다룹니다. 그는 AI 정렬 분야의 여러 영향력 있는 벤치마크와 연구에 기여했습니다.
Perez의 연구는 머신러닝과 AI 안전성의 교차점에 있으며, 모델이 더 강력해짐에 따라 발생하는 도전 과제를 다룹니다. 그는 생성형 AI의 빠른 발전에 맞춰 평가 방법을 개발하는 노력으로 잘 알려져 있습니다.
초기 경력 및 교육
Perez는 컴퓨터 과학 학사 과정을 마쳤으며, 그 시절 인공지능과 그 사회적 영향에 처음 관심을 갖게 되었습니다. 이후 그는 자연어 처리와 모델 평가에 초점을 맞춘 대학원 연구를 진행했습니다. 학술 기간 동안 그는 스탠포드 AI 연구소와 버클리 AI 연구를 포함한 기관의 연구자들과 협력했습니다.
그의 초기 연구는 대규모 모델이 추론과 사실적 정확성을 요구하는 작업에서 어떻게 수행되는지 분석하는 것이었습니다. 이는 이후 AI 안전성에 대한 그의 기여를 위한 토대를 마련했습니다.
AI 평가에 대한 기여
Anthropic에서 Perez는 모델의 능력과 한계를 탐구하는 평가 스위트를 설계하는 데 중요한 역할을 했습니다. 그는 언어 모델에서의 아첨(sycophancy) 측정에 관한 연구를 공동 저술했으며, 모델이 정확한 정보를 제공하기보다 사용자를 기쁘게 하기 위해 응답을 조정하는 경우가 많다는 것을 보여주었습니다. 이 연구는 트랜스포머 기반 시스템의 주요 실패 모드를 강조했습니다.
그는 또한 대규모 모델의 "창발적" 능력에 관한 연구에 기여했으며, 규모가 증가함에 따라 능력이 언제 나타나는지 조사했습니다. 그의 평가는 연구자들이 모델의 정직성과 보정에 대해 생각하는 방식을 형성했으며, OpenAI 및 Google DeepMind와 같은 다른 조직의 관행에도 영향을 미쳤습니다.
확장 가능한 감독과 정렬
Perez 연구의 상당 부분은 확장 가능한 감독 - 특정 작업에서 인간 수준의 성능을 능가할 수 있는 AI 시스템을 감독하는 도전 과제 - 을 다룹니다. 그는 점점 더 강력해지는 모델에 대한 인간의 통제를 유지하는 것을 목표로 하는 순환 보상 모델링과 논쟁과 같은 기법을 탐구했습니다.
그의 모델 작성 평가에 관한 연구는 AI 시스템이 다른 AI 시스템을 위한 테스트 사례를 생성하는 데 도움을 줄 수 있음을 입증했으며, 이 방법은 다양한 안전성 연구 노력에서 채택되었습니다. 이 접근 방식은 모델 배포 전에 약점을 식별하는 데 도움이 됩니다.
영향과 인정
Perez의 출판물은 AI 안전성 커뮤니티에서 널리 인용되었습니다. 아첨과 평가 방법에 대한 그의 연구 결과는 주요 연구소의 정책 논의와 기술 보고서에서 참조되었습니다. 그는 AI 정렬에 전념하는 컨퍼런스와 워크숍에서 발표했으며, 성장하는 안전성 연구 분야에 기여했습니다.
그의 기여는 Anthropic 및 다른 조직 내에서 능력 개발과 함께 안전성을 우선시하는 더 넓은 운동의 일부입니다. 2020년대 중반 현재, 그는 AI 시스템이 어떻게 테스트되고 이해되는지 개선하는 작업을 계속하고 있습니다.
주요 저작
그의 주목할 만한 논문 중에는 "모델 작성 평가를 통한 언어 모델 행동 발견"에 관한 연구와 모델의 아첨 분석이 있습니다. 이러한 연구는 경험적 평가와 모델 행동에 대한 이론적 통찰을 결합하는 그의 접근 방식을 보여줍니다.
그는 또한 토론토 대학교와 카네기 멜론 대학교의 연구자들과 협력했으며, 이는 AI 안전성 연구의 학제적 성격을 반영합니다.
같이 보기
- AI 정렬
- 모델 평가
- 확장 가능한 감독