AI 안전 센터(Center for AI Safety, CAIS)는 샌프란시스코에 본부를 둔 미국 비영리 단체로, 인공지능의 안전한 개발과 배포를 촉진한다. CAIS의 활동은 기술적 AI 안전 및 AI 윤리 연구, 옹호 활동, AI 안전 연구 분야의 성장 지원을 포함한다. 2022년 댄 헨드릭스(Dan Hendrycks)와 올리버 장(Oliver Zhang)이 설립했다.
2023년 5월, CAIS는 수백 명의 AI 교수, 주요 AI 기업 리더, 기타 공인들이 서명한 AI 멸종 위험에 관한 성명을 발표했다. 이 조직은 고급 인공지능 시스템으로 인한 잠재적 피해를 완화하는 데 초점을 맞춘 연구자, 정책 입안자, 산업 파트너를 위한 허브 역할을 한다.
연구
CAIS 연구진은 위험 시나리오와 위험 완화 전략을 상세히 설명하는 "치명적 AI 위험 개요(An Overview of Catastrophic AI Risks)"를 발표했다. 설명된 위험에는 자율 전쟁에서의 AI 사용이나 전염병 설계, 그리고 AI의 기만 및 해킹 능력이 포함된다. 카네기 멜론 대학교 연구진과 공동으로 수행한 또 다른 연구는 안전 조치를 우회하는 대규모 언어 모델에 대한 적대적 공격을 발견하는 자동화된 방법을 설명하며, 현재 안전 시스템의 부적절성을 강조했다.
이 조직의 기술 연구는 머신러닝 견고성, 신경망 해석 가능성, 딥러닝 시스템의 정렬과 같은 분야에 걸쳐 있다. CAIS 연구진은 또한 생성형 AI의 실패 모드를 조사하고 배포 전 위험한 능력을 평가하기 위한 프레임워크를 제안했다.
활동
2023년, CAIS의 AI 멸종 위험에 관한 성명은 Anthropic의 다리오 아모데이(Dario Amodei), OpenAI의 샘 알트만(Sam Altman) 및 다른 AI 업계 리더들의 지지를 얻었다. 같은 해, 암호화폐 거래소 FTX(2022년 11월 파산)는 그해 초 CAIS에 기부한 650만 달러를 회수하려 시도했다.
다른 이니셔티브로는 AI 안전 연구를 지원하는 컴퓨팅 클러스터, "ML 안전 입문(Intro to ML Safety)"이라는 온라인 강좌, 개념적 문제를 다루기 위한 철학 교수 펠로우십이 있다. AI 안전 센터 행동 기금(Center for AI Safety Action Fund)은 캘리포니아 법안 SB 1047, 즉 "프런티어 인공지능 모델을 위한 안전하고 확실한 혁신법(Safe and Secure Innovation for Frontier Artificial Intelligence Models Act)"의 후원자이다.
옹호 및 정책
CAIS는 주 및 연방 차원의 정책 입안자들과 협력하여 프런티어 AI 시스템에 대한 규제 프레임워크를 촉진한다. 이 조직은 모델 안전 평가, 인간 피드백 기반 강화 학습, 트랜스포머 기반 아키텍처의 위험과 같은 주제에 대한 브리핑을 발표했다. 옹호 활동은 배포 전 테스트와 투명성 기준의 필요성을 강조한다.
커뮤니티 구축
이 센터는 버클리 AI 연구 및 옥스퍼드 대학교와 같은 학술 기관과의 협력, 보조금, 워크숍을 통해 더 넓은 AI 안전 생태계를 지원한다. 또한 안전 연구자 디렉토리를 유지 관리하고 Google DeepMind, Anthropic 및 기타 주요 연구소의 전문가들을 모으는 정기 세미나를 조직한다.
같이 보기
참고 자료
위키백과에서 가져온 사실 (CC BY-SA).
외부 링크
공식 웹사이트