국제 AI 안전 보고서(International AI Safety Report)는 고급 인공지능과 관련된 위험에 대한 획기적인 과학적 평가이다. 정부와 국제기구 연합이 의뢰한 이 보고서는 2025년에 처음 발표되었으며, 전 세계 전문가 집단이 정책 입안자를 위해 AI 위험을 체계적으로 평가한 최초의 사례를 기록했다. 주요 목적은 국가 및 국제 AI 규제를 위한 엄격하고 증거 기반의 토대를 제공하여 빠르게 발전하는 기술과 느린 입법 과정 사이의 격차를 해소하는 것이다.
이 보고서는 다양한 국제 과학자 및 엔지니어 패널의 연구 결과를 모아 즉각적인 알고리즘 피해부터 장기적인 실존적 우려까지 다양한 위협을 다룬다. 특정 정책을 옹호하지는 않지만, 정부와 기업이 참조할 수 있는 공유된 사실적 기준선을 확립하는 것을 목표로 한다. 초판 발표 기준으로 이 보고서는 AI 위험을 체계화하기 위한 지금까지의 가장 광범위한 글로벌 노력으로 묘사되었으며, 저자들은 이 분야가 너무 빠르게 진화하여 정기적인 업데이트가 필요하다는 점을 인정한다.
범위 및 위험 분류 체계
이 보고서는 AI 위험을 현재 또는 단기 위험, 중간 능력 위험, 고급 미래 시스템 위험의 세 가지 시간적 범주로 구성한다. 단기 우려에는 기계 학습 시스템의 편향, 개인정보 침해, 허위 정보 생성, 사이버 보안 취약성, 일자리 대체가 포함된다. 중간 위험은 대규모 언어 모델 조작의 확산과 같은 문제를 다룬다. 장기 위험은 초인적 능력을 가진 인공지능 시스템에 대한 인간 통제 상실 가능성에 초점을 맞춘다. 보고서는 먼 미래에 확률을 할당하는 것을 의도적으로 피하며, 높은 불확실성을 근거로 든다.
방법론 및 전문가 기여
초안 작성 과정은 영국 AI 안전 정상회의 프레임워크 아래 설립된 정부 간 사무국을 통해 조정된 학계 및 산업계의 100명 이상의 전문가 패널에 의존했다. 주요 기여자로는 옥스퍼드 대학교, 버클리 AI 연구소, MIT CSAIL, 스탠포드 AI 연구소의 연구자와 오픈AI, 앤트로픽, 구글 딥마인드 같은 주요 개발사 대표가 포함되었다. 보고서는 구조화된 전문가 도출 방식을 사용하여 문헌 검토와 익명 설문을 결합해 합의를 측정했다. 투명성을 강조했다: 모든 결과는 인용된 연구에 귀속되며, 상당한 의견 차이가 있는 경우 반대 의견도 기록된다.
기술적 위험에 대한 주요 결과
핵심 장에서는 현재 시스템의 신뢰성을 분석하며, 신경망 모델이 강력함에도 불구하고 취약성을 보인다고 지적한다. 예로는 적대적 변형 하에서의 이미지 오분류와 트랜스포머 기반 언어 모델의 환각이 있다. 보고서는 특히 내부 추론이 불투명한 딥러닝 시스템에서 AI 행동 검증의 어려움을 강조한다. 생성형 AI에 대한 표준화된 스트레스 테스트와 같은 개선된 평가 프레임워크를 권장하며, 모델 가지치기와 데이터 증강의 부분적 완화 중요성을 강조한다. 그러나 저자들은 외부 감사 없이는 기술적 해결책만으로 충분하지 않다고 경고한다.
지정학적 및 경제적 차원
보고서는 AI 개발이 구글 클라우드, 애저, 아마존 웹 서비스를 포함한 소수의 기업에 집중되어 있어 시장 집중과 상호 운용성에 대한 우려를 제기한다고 강조한다. 대부분의 최첨단 연구가 미국, 중국, 영국에서 이루어지며 인도와 일본 같은 국가들이 투자를 늘리고 있다고 지적한다. AI 훈련에 사용되는 칩을 생산하는 TSMC 제조 생태계는 중요한 병목 지점으로 식별된다. 보고서는 수출 통제와 공유 안전 기준에 대한 국제 협력을 권장하면서도, 그러한 협정을 복잡하게 만드는 지정학적 긴장을 인정한다.
반응 및 정책 영향
보고서에 대한 초기 반응은 엇갈렸다. 일부 정책 입안자들은 균형 잡힌 어조와 폭넓은 범위를 칭찬했지만, 비평가들은 선거 개입과 같은 긴급한 위험을 과소평가한다고 주장했다. 2025년 말까지 캐나다와 싱가포르를 포함한 여러 국가가 초안 법안에서 이 보고서를 언급했다. 유럽연합의 AI 법은 권장된 평가 절차 중 여러 가지를 통합했다. 민간 부문의 반응은 다양했다: 애플과 삼성전자는 보고서의 범주에 맞춘 연례 자체 평가를 공개적으로 약속한 반면, 일부 스타트업은 과도한 부담이라고 비판했다.
한계 및 향후 개정
저자들은 보고서에 공백이 있다는 점을 인정한다. 주로 영어 연구를 다루며 비서구 학문을 과소 대표한다. 위험 분류 체계는 AI를 단일 기술로 취급하지만, reinforcement-learning-from-human-feedback(인간 피드백 기반 강화 학습)과 확산 모델 같은 도구는 뚜렷한 실패 모드를 가진다. 2판은 2028년에 예상되며, 시민 사회와 노동조합의 더 많은 의견을 포함할 계획이다. 보고서는 또한 AI 안전을 모니터링할 독립적인 상설 기구 설립을 촉구하며, 이 제안은 현재 작성 시점에서 협상 중이다.