미국 AI 안전 연구소(US AISI)는 미국 상무부 산하 기관인 국립표준기술연구소(NIST) 산하에 2023년 11월 설립된 정부 지원 기관입니다. 주요 임무는 고급 인공지능(AI) 모델, 특히 프론티어 AI 모델로 알려진 모델의 안전성을 평가하고 보장하는 것입니다. 이 연구소는 영국에서 개최된 AI 안전 정상회의에서 설립되었으며, 이 회의에서 영국과 미국은 각각의 AI 안전 기관 설립을 발표했습니다. 이는 급속히 발전하는 AI 기술, 특히 대규모 언어 모델 및 기타 생성형 AI 시스템과 관련된 잠재적 위험을 해결하기 위한 국제적 노력에서 중요한 단계를 의미했습니다.
US AISI의 설립은 연구자와 업계 지도자들의 공개적인 선언에서 강조된 바와 같이 AI가 초래할 수 있는 잠재적 실존적 위험에 대한 2023년의 인식 증가를 반영했습니다. 이 연구소는 NIST 내에서 운영되며, 측정 표준과 기술 평가 분야의 기관 전문성을 활용합니다. 그 작업은 테스트 방법론 개발, 안전 평가 수행, 그리고 AI 감독을 위한 일관된 프레임워크를 구축하기 위한 다른 국가 및 국제 기관과의 협력에 중점을 둡니다. US AISI는 2023년과 2024년의 외교적 노력에서 비롯된 더 넓은 국제 AI 안전 연구소 네트워크의 일부입니다.
설립 및 초기 임무
US AISI는 2023년 11월 1일 영국 블레츨리 파크에서 열린 AI 안전 정상회의에서 공식적으로 설립되었습니다. 당시 리시 수나크 총리가 주최한 이 정상회의에는 정부, AI 기업, 학계 대표들이 모여 프론티어 AI의 안전한 개발을 논의했습니다. 미국 정부는 NIST를 통해 AI 안전에 관한 연구와 평가를 수행할 전용 연구소 설립을 약속했습니다. 연구소의 초기 초점은 AI 모델에 대한 표준화된 테스트 절차 개발이었으며, 여기에는 머신 러닝, 딥 러닝, 신경망과 같은 분야의 능력 평가가 포함되었습니다.
초기 몇 달 동안 US AISI는 더 넓은 미국 AI 정책 환경 내에서의 역할을 정의하는 데 주력했습니다. 백악관 과학기술정책실을 포함한 다른 연방 기관과 조정하여 활동을 국가 우선순위와 일치시켰습니다. 또한 연구소는 OpenAI, Anthropic, Google DeepMind와 같은 주요 AI 개발자들과 협력하여 배포 전 안전 테스트를 위해 가장 진보된 모델에 대한 접근 권한을 얻기 시작했습니다. 이러한 협력적 접근 방식은 AI 기업이 안전 평가 측면에서 '자신의 숙제를 스스로 채점'할 수 없다는 우려를 해결하는 것을 목표로 했습니다.
영국 AI 안전 연구소와의 협력
US AISI 초기 작업의 핵심 측면은 2023년 11월 정상회의에서 동시에 설립된 영국 AI 안전 연구소(UK AISI)와의 파트너십이었습니다. 두 연구소는 공통 평가 규칙과 절차를 개발하기 위해 협력하기로 합의했으며, 이는 분산된 국가적 노력보다 통합된 접근 방식이 더 효과적일 것이라는 인식을 바탕으로 했습니다. 2024년 4월, 미국과 영국은 공유 AI 모델에 대해 최소 한 번의 공동 안전 테스트를 수행하는 합의를 공식적으로 체결했습니다. 이 협력은 AI 거버넌스에서 국제 협력의 모델로 간주되었습니다.
이 파트너십은 연구 결과와 방법론 공유도 포함했습니다. US AISI와 UK AISI는 모델 견고성, 인간 가치와의 일치, AI 시스템이 민감한 정보를 유출하거나 사이버 공격에 악용될 가능성과 같은 문제를 공동으로 탐구했습니다. 그들의 작업은 국제 표준 개발에 정보를 제공했으며, UK AISI는 2024년 5월 주요 AI 기업에 더 가까이 가기 위해 샌프란시스코에 사무소를 개설할 것이라고 발표했는데, 이는 US AISI의 NIST 내 위치를 보완하는 조치였습니다.
국제 네트워크 형성
2024년 5월 AI 서울 정상회의에서 국제 지도자들은 미국과 영국 간의 양자 협력을 바탕으로 AI 안전 연구소 네트워크를 구성하기로 합의했습니다. 네트워크는 처음에 영국, 미국, 일본, 프랑스, 독일, 이탈리아, 싱가포르, 한국, 호주, 캐나다, 유럽 연합의 연구소로 구성되었습니다. US AISI는 이 네트워크에서 중심 역할을 하며 공동 연구 프로젝트와 평가 활동을 조정하는 데 기여했습니다. 2025년 7월, 네트워크는 AI 에이전트 평가 문제, 특히 민감한 정보 유출과 사이버 보안 위험에 관한 문제를 탐구하는 훈련을 실시했습니다. 네트워크 회원들은 또한 샌디에이고에서 열린 NeurIPS 2025에서 새로운 도전 과제를 논의하기 위해 만났습니다.
US AISI의 국제 네트워크 참여는 AI 안전에 대한 글로벌 규범을 수립하려는 더 넓은 노력의 일부였습니다. 연구소는 트랜스포머 아키텍처, 멀티 헤드 어텐션 및 AI 시스템의 다른 기술적 측면과 같은 주제에 대한 논의에 기여하여 안전 평가가 현장의 급속한 발전을 따라잡을 수 있도록 했습니다. 네트워크는 또한 혁신과 예방적 조치의 균형을 맞추는 방법을 포함한 거버넌스 문제를 다루었습니다.
발전 및 이름 변경
2025년, US AISI는 중요한 조직적 변화를 겪었습니다. AI 표준 및 혁신 센터(CAISI)로 이름이 변경되었으며, 이는 AI 안전에서 표준 개발과 혁신 촉진으로 초점이 이동했음을 반영합니다. 이 이름 변경은 같은 해 영국 AI 안전 연구소도 AI 보안 연구소로 이름이 변경된 더 넓은 추세의 일부였습니다. 이 변화는 순수한 안전 중심 평가에서 책임 있는 AI 개발 및 배포 촉진을 포함한 더 포괄적인 접근 방식으로의 이동을 의미했습니다.
CAISI로의 전환은 연구소의 핵심 임무를 변경하지 않았지만 범위를 확장했습니다. 프론티어 AI 모델에 대한 안전 평가를 계속 수행했지만, 모범 사례와 자발적 표준을 개발하기 위해 업계와 더 긴밀하게 협력하기 시작했습니다. 이러한 발전은 AI 분야의 성숙도 증가와 헬스케어, 교통, 금융을 포함한 다양한 부문에 AI 시스템이 더 통합됨에 따라 지속적인 감독의 필요성에 대한 대응으로 여겨졌습니다.
기술적 중점 분야
US AISI의 기술적 작업은 AI 연구 및 개발의 여러 분야에 걸쳐 있습니다. 모델의 잠재적 편향, 적대적 입력에 대한 견고성, 의도된 행동과의 일치성을 평가합니다. 연구소는 또한 AI 시스템의 해석 가능성을 조사하여 신경망이 결정을 내리는 방식을 이해하려고 노력합니다. 여기에는 모델 신뢰성을 개선하기 위한 레이어 정규화, 배치 정규화, 드롭아웃과 같은 기술 연구가 포함됩니다.
또 다른 초점은 자율적 의사 결정이 가능한 시스템인 AI 에이전트의 안전입니다. US AISI는 AI 에이전트가 민감한 정보를 유출하거나 유해한 행동을 수행하도록 조작될 수 있는 시나리오를 탐구했습니다. 또한 미묘한 편향이나 오류를 도입할 수 있는 AI 생성 피드백에 의존하는 RLAIF 및 기타 훈련 방법의 영향을 조사했습니다. 연구소의 연구는 정부와 업계 모두에서 사용하는 평가 벤치마크와 테스트 프로토콜 개발에 기여합니다.
영향 및 향후 방향
US AISI의 설립은 AI 정책 환경에 상당한 영향을 미쳤습니다. 기업의 자율 규제 노력을 보완하는 AI 기술에 대한 정부 차원의 독립적 감독 메커니즘을 제공했습니다. 연구소의 작업은 미국과 국제적으로 입법 및 규제 제안에 정보를 제공했습니다. 2025년 현재, 연구소는 연구 역량을 확장하고 국제 협력을 심화할 계획과 함께 계속 발전하고 있습니다.
미래를 전망할 때, US AISI(현재 CAISI)는 더 강력한 모델과 새로운 응용 프로그램의 출현을 포함한 AI 개발의 빠른 속도와 관련된 도전에 직면하고 있습니다. 또한 안전과 혁신 사이의 적절한 균형 및 경쟁 우선순위 간 자원 배분에 관한 질문을 해결해야 합니다. 연구소의 성공은 변화하는 기술적 및 정치적 상황에 적응하면서 AI 시스템의 독립적 평가자로서의 신뢰성을 유지하는 능력에 달려 있습니다.