DeepMind AI 안전은 Alphabet Inc.의 자회사인 Google DeepMind가 수행하는, 고급 인공지능과 관련된 위험 및 윤리적 과제를 해결하기 위한 이니셔티브와 연구를 포괄합니다. 런던에 본사를 둔 이 연구소는 2010년에 설립되었으며, 2014년에 Google에 인수된 후 2023년 4월에 Google Brain과 합병했습니다. 안전 작업의 목표는 특히 인공지능과 머신러닝을 사용하는 AI 시스템이 견고하고, 투명하며, 인간의 의도와 일치하도록 보장하는 것입니다.
이 회사의 AI 안전에 대한 접근 방식은 범용 인공지능을 창조한다는 기본 목표에 뿌리를 두고 있습니다. 초기부터 DeepMind는 AI의 이중 용도적 성격을 인식했습니다. Demis Hassabis와 Shane Legg를 포함한 창립자들은 처음부터 안전의 중요성을 강조했으며, Legg의 이론 신경과학 배경은 AI 위험에 대한 논의에 영향을 미쳤습니다. 이러한 초점은 정렬, 해석 가능성, 견고성을 다루는 전담 팀과 출판물의 개발로 이어졌습니다.
안전 연구 및 정렬
DeepMind의 안전 연구는 가치 정렬, 해석 가능성, 견고성을 포함한 다양한 주제를 다룹니다. 가치 정렬은 대규모 언어 모델과 생성형 AI의 맥락에서 강조되는 과제인 AI 시스템의 목표가 인간의 가치와 일치하도록 보장하는 것을 추구합니다. 이 회사는 강화 학습 피드백 및 커리큘럼 학습과 같은 기술에 관한 논문을 발표하여 훈련 프로세스를 개선했습니다. 해석 가능성 연구는 신경망이 어떻게 결정을 내리는지 이해하는 것을 목표로 하며, 레이어 정규화 및 주의 메커니즘과 같은 방법을 사용하여 출력을 입력까지 추적합니다.
2021년에 DeepMind는 사양 게임과 의도하지 않은 행동을 방지하는 데 중점을 둔 전담 안전 팀을 설립했습니다. Victoria Krakovna가 이끄는 이 팀의 작업에는 AI 시스템이 훈련 목표의 허점을 악용하는 경우를 감지하는 벤치마크 개발이 포함됩니다. 이 연구는 AI 시스템이 더욱 강력해지고 의료에서 자율 주행 차량에 이르는 실제 응용 분야에 배포됨에 따라 중요합니다.
윤리 및 거버넌스
DeepMind는 2017년에 설립된 윤리 및 사회 부서를 통해 더 광범위한 윤리적 질문에도 참여해 왔습니다. Nick Bostrom과 같은 철학자들의 자문을 받는 이 부서는 공정성, 책임성, 투명성을 포함한 AI의 사회적 영향을 조사합니다. 이 회사는 외부 조직과 협력하고 책임 있는 AI 개발에 대한 지침을 발표했습니다. 2019년에 공동 창립자 Mustafa Suleyman은 정책 작업에 집중하기 위해 Google로 이동했으며, 이는 AI 거버넌스에 대한 중요성의 증가를 반영합니다.
2023년 Google Brain과의 합병은 이러한 노력을 통합하여 Google DeepMind 아래에 단일 구조를 만들었습니다. 이 개편은 생성형 AI 모델의 급속한 배포에 대응하여 안전 표준을 유지하면서 AI 연구를 가속화하는 것을 목표로 했습니다. 회사 리더십은 OpenAI 및 Anthropic과 같은 다른 연구소의 목소리를 반영하여 AI 안전에 대한 국제 협력을 공개적으로 옹호해 왔습니다.
응용 및 영향
DeepMind의 안전 원칙은 다양한 제품 포트폴리오에 통합되어 있습니다. 예를 들어, AlphaFold의 단백질 구조 예측은 생물학에 혁명을 일으켰으며, 유해한 오류를 피하기 위해 신중한 검증을 통해 개발되었습니다. 마찬가지로 AlphaGo 및 AlphaZero와 같은 게임 플레이 시스템은 안전한 탐색과 의사 결정을 위한 테스트베드로 사용됩니다. 알고리즘 발견에 대한 회사의 작업인 AlphaTensor 및 AlphaDev는 발견된 알고리즘이 신뢰할 수 있도록 안전 고려 사항을 통합합니다.
대규모 언어 모델 영역에서 DeepMind의 Gemini 및 Gemma 모델은 안전 필터와 인간 피드백 메커니즘으로 설계되었습니다. 이 회사는 유해한 출력(예: 독성 언어 및 편향된 응답)을 줄이는 연구를 발표했습니다. 이러한 노력은 OpenAI 및 Anthropic과 같은 경쟁사들도 모델 개발에서 안전을 우선시하는 더 넓은 산업 동향의 일부입니다.
과제 및 향후 방향
진전에도 불구하고 AI 안전은 여전히 진화하는 분야입니다. DeepMind는 강화 학습 시나리오와 같은 다중 에이전트 환경을 포함하여 점점 더 복잡한 시스템에 안전 기술을 확장하는 데 어려움을 겪고 있습니다. 이 회사는 모델 가지치기 및 데이터 증강을 포함한 새로운 방법을 탐구하여 견고성을 개선하고 있습니다. 향후 연구는 AI 행동의 공식 검증과 배포를 위한 안전 사례 개발에 초점을 맞출 수 있습니다.
2026년 현재 DeepMind는 안전 연구에 계속 투자하고 있으며, 팀을 확장하고 옥스포드 대학교 및 버클리 AI 연구와 같은 학술 기관과 협력할 계획입니다. 안전에 대한 회사의 헌신은 공공 신뢰를 구축하고 AI가 사회 전체에 이익이 되도록 보장하는 데 필수적인 것으로 간주됩니다.