UK AI 안전 연구소는 2023년에 설립된 정부 지원 조직으로, AI 안전 과학을 발전시키고 고급 인공지능 시스템이 제기하는 위험을 평가하는 것을 목표로 한다. 이 연구소는 영국 과학·혁신·기술부 산하에서 운영되며, 최첨단 AI 모델의 배포 전 테스트를 수행하고 국제 정책 개발을 지원하는 임무를 맡고 있다. 이 연구소는 2023년 11월 블레츨리 파크에서 열린 AI 안전 정상회의에서 발표되었으며, 영국을 글로벌 AI 거버넌스 노력의 중심 행위자로 자리매김했다.
연구소의 주요 임무는 대규모 언어 모델 및 기타 생성형 AI 기술을 포함한 가장 강력한 AI 시스템과 관련된 위험을 줄이는 것이다. 이는 엄격한 평가 방법을 개발하고, 정책 입안자와 결과를 공유하며, 다른 국가 및 국제 기관과 협력함으로써 수행된다. 연구소의 설립은 오용, 사고 또는 통제 상실을 통해 고급 AI가 대규모 피해를 초래할 가능성에 대한 우려가 커지면서 이루어졌다.
설립 및 구조
연구소는 2023년 11월 공식적으로 출범했으며, 초대 의장으로 기술 투자자이자 AI 연구원인 이안 호가스가 임명되었다. 초기 팀은 학계, 산업계, 공무원 출신으로 구성되었으며, 머신러닝, 신경망 안전, 공공 정책 전문가들이 포함되었다. 연구소는 런던에 본부를 두고 있으며, 2024년 샌프란시스코에 두 번째 사무소를 개설하여 오픈AI, 앤트로픽, 구글 딥마인드와 같은 주요 AI 개발사와의 협력을 강화하고 있다.
연구소의 자금은 영국 정부에서 조달되며, 2023년 가을 성명에서 초기 배정액 1억 파운드가 발표되었다. 이 예산은 연구 프로그램, 기술 직원 급여, 모델 평가를 위한 고성능 시스템 접근을 포함한 컴퓨팅 인프라를 지원한다. 2025년 기준으로 연구소는 100명 이상의 연구원과 엔지니어를 고용하고 있으며, 이는 공공 부문 AI 안전 기관 중 세계 최대 규모 중 하나이다.
주요 활동
연구소는 세 가지 주요 영역에 중점을 둔다: 배포 전 평가, 안전 연구, 국제 조정. 배포 전 평가는 최첨단 모델이 공개 출시 전에 테스트되는 것을 포함하며, 사이버 공격, 생물 안전, 자율 의사 결정과 같은 영역의 능력을 평가하는 다양한 벤치마크를 사용한다. 이러한 평가는 악의적 행위자가 오용할 수 있는 위험한 능력을 식별하도록 설계되었다.
연구소의 안전 연구는 모델 가지치기, RLHF, 트랜스포머 아키텍처의 해석 가능성과 같은 주제를 다룬다. 연구원들은 또한 환각과 같은 실패 모드와 모델이 사용자를 속이거나 조종할 가능성을 연구한다. 연구소는 기술 보고서와 학술 논문을 발행하여 AI 정렬 및 견고성 분야에 기여하고 있다.
국제 조정은 핵심 우선순위이다. 연구소는 2024년 11월 출범한 국제 AI 안전 연구소 네트워크 설립을 도왔으며, 여기에는 미국, 일본, 싱가포르, 유럽 연합의 대응 기관이 포함된다. 이 네트워크는 평가 방법론과 위험 평가에 대한 정보 공유를 촉진하여 최첨단 AI 감독을 위한 공통 표준을 만드는 것을 목표로 한다.
주요 평가 및 보고서
2024년, 연구소는 오픈AI, 앤트로픽, 구글 딥마인드의 여러 최첨단 모델에 대한 첫 주요 공개 평가를 실시했다. "고급 AI 평가"라는 제목의 보고서에 발표된 결과는 장기적 계획 및 자가 복제 능력과 관련된 현재 안전 조치의 공백을 강조했다. 보고서는 개발자들이 고위험 기능을 가진 모델을 배포하기 전에 더 강력한 안전장치를 구현할 것을 권고했다.
또 다른 중요한 산출물은 2025년 초에 발표된 "AI 안전 실무" 시리즈로, 실제 배포에서 위험을 완화하는 방법에 대한 사례 연구를 제공했다. 이 문서들은 여러 국가의 규제 기관이 AI 법률 초안 작성 시 참고 자료로 사용했다. 연구소는 또한 원칙 기반 접근 방식을 제안한 영국 AI 규제 백서에 기여했으며, 단일 새 규제 기관 대신 AI 감독에 대한 원칙 기반 접근을 제안했다.
산업계 및 학계와의 관계
연구소는 주요 AI 연구소와 공식 파트너십을 유지하고 있다. 양해각서를 통해 공개 출시 전 수 주 전에 모델에 대한 조기 접근 권한을 얻는다. 그 대가로 개발자에게 식별된 취약점에 대한 상세한 피드백을 제공하여 출시 전 안전성 개선을 돕는다. 이 모델은 협력적 접근 방식으로 찬사를 받았지만, 일부 비평가들은 연구소가 규제하는 동일한 기업에 접근을 의존하기 때문에 이해 상충을 초래한다고 주장한다.
학술적으로 연구소는 옥스퍼드 대학교 및 MIT CSAIL과 같은 대학의 연구를 지원하며, 멀티 헤드 어텐션 해석 가능성 및 손실 함수 설계와 같은 주제에 중점을 둔다. 또한 버클리 AI 연구 및 스탠포드 AI 연구소와 같은 기관의 방문 연구원을 초청하여 공공 및 민간 부문 간의 교차 수분을 촉진한다. 연구소의 자문 위원회에는 조슈아 테넨바움 및 멜라니 미첼과 같은 저명한 인물이 포함되어 연구 우선순위에 대한 지침을 제공한다.
과제 및 비판
연구소는 효과성에 대한 비판을 받아왔다. 일부 연구원들은 평가가 너무 좁아 쉽게 측정 가능한 능력에 초점을 맞추는 반면 경제적 혼란이나 사회적 양극화와 같은 시스템적 위험을 무시한다고 주장한다. 다른 이들은 딥러닝의 급속한 발전 속도를 따라잡기 어렵다는 점을 지적하며, 모델이 평가 방법이 업데이트되는 것보다 빠르게 개선된다고 말한다.
연구소의 독립성에 대한 우려도 있다. 영국 정부의 자금 지원과 산업계와의 긴밀한 관계는 진정한 감시 기관 역할을 할 수 있는지에 대한 의문을 제기한다. 2025년, 의회 위원회는 원시 평가 데이터 공개를 포함한 의사 결정 과정의 더 큰 투명성을 요구했다. 연구소는 연례 공개 감사와 평가 도구 키트의 오픈소스 공개를 약속함으로써 대응했다.
이러한 과제에도 불구하고, UK AI 안전 연구소는 국가 주도 AI 위험 관리의 선구적인 노력으로 남아 있다. 그 작업은 다른 국가의 유사한 이니셔티브에 영향을 미쳤으며, 협력적 모델은 급변하는 기술 환경에서 혁신과 안전의 균형을 맞추는 템플릿으로 간주된다.