OpenAI 안전 연구(OpenAI Safety Research)는 OpenAI 내에서 고급 인공지능 시스템과 관련된 위험을 연구하고 완화하는 데 전념하는 부서이다. 이 부서의 주요 목표는 점점 더 강력해지는 AI 모델, 특히 대규모 언어 모델이 인간의 의도와 사회적 가치에 부합하는 방식으로 행동하도록 보장하는 것이다. 그룹의 작업은 모델 정렬, 해석 가능성 및 견고성에 대한 기술 연구에서 안전한 배포 관행을 확립하기 위한 정책 중심 노력에 이르기까지 다양한 범위에 걸쳐 있다.
이 계획은 2015년에 제시된 OpenAI의 설립 목표 - 인류 전체에 이익이 되는 AI를 개발하자는 목표 - 에서 비롯되었다. 조직이 2019년 비영리에서 이익 상한형 구조로 전환했을 때, 안전 연구는 핵심 지침으로 유지되었으며, 전담 팀과 상당한 컴퓨팅 자원이 이 문제에 할당되었다. 그룹은 영향력 있는 논문을 발표하고 도구를 개발하여 AI 안전 분야를 전반적으로 형성하고 학계 연구와 산업 실무 모두에 영향을주었다.
기술적 정렬 연구
OpenAI 안전 연구의 핵심 초점은 인간이 의도한 것을 확실하게 하는 AI 시스템을 구축하는 데 있는 기술적 정렬 - 문제이다. 이에는 인간 피드백 기반 강화 학습 (RLHF) 작업이 포함된다. 이 기술은 모델을 미세 조정하는 데 인간 선호를 사용한다. 2017년 학술 논문에서 처음 도입된 RLHF는 이후 몇 년 동안 개선되어 ChatGPT와 같은 모델을 유용하고 무해하게 훈련하는 기본 방법이 되었다. 이 접근 방식은 모델의 출력에 대한 인간 비교를 수집하고, 그 비교에 대한 보상 모델을 훈련하고, 확률적 경사 하강법 변형을 사용하여 정책을 최적화하는 것이다.
또 다른 중요한 영역은 신경망의 내부 메커니즘을 이해하는 것을 목표로 하는 해석 가능성 연구이다. 연구진은 모델의 활성화 공간에서 특정 기능이나 방향을 식별하고 조작할 수 있는 기술을 개발하여 표적 개입을 가능하게 했다. 예를 들어 2023년에 발행된 희소 자동 인코더 연구는 모델 활성화를 자보 가능한 구성 요소로 분해하는 방법을 탐색하며, 모델이 거짓이나 정치적 처세술과 같은 개념을 표현하는 방식을 설명해주는 창을 제공했다. 이 연구 라인은 잘못 배치된 행동이 해로운 결과로 이어지기 전에 감지하고 수정하는 데 중요한 것으로 간주된다.
그룹은 또한 적대적 견고성성을 연구하여 모델이 능숙하게 제작된 입력으로 속을 수 있는 방법을 다룬다. 이에는 빨간 팀과 같은 인간 테스터가 유해한 행을 모델에서 검색하는 작업과 적대체 사례 생성 시 자동화 방법 등이 포함된다. 이러한 노력의 발견은 생산 시스템에서 배포되는 안전 분류기와필터링 메커니즘 개발에 안내되었다.
정책과 거버넌스
기술적 방법을 넘어, OpenAI 안전 연구는 정책 분석과 안전 설정 표준 개발을 통해 AI 거버넌스에 기여한다. 그룹은 AI 규제와 투명성 및 강력한 모델의 책임 있는 공개와 같은 주제에 대한 입장 논문을 발표했다. 2023년 OpenAI는 사이버 보안, 생물학적 및 사회적 영역으로 잠재적인 해를 분류하고, 상쇄 전략을 제시하는 방식으로 AI 시스템을 배포하기 위한 위험 기반 접근 방식을 확인하는 ‘준비 상태 프레임워크’를 발표했다.
팀은 학술 기관과 다른 AI 연구소를 포함한 외부 이해관계자와 협력한다. Anthropic과 Google DeepMind와의 협력은 2023년 최첨단 AI 안전에 대한 협정과 같은 AI 안전 원칙에 대한 공동성명으로 이어졌다. 그룹은 안전 과제가 집단적이며 조율된 반응을 요구한다는 인식에 근거하여 산업 전반의 표준과 모범 사례를 확립하는 것을 목표로 한다.
주요 프로젝트와 도구
OpenAI 안전 연구에서 여러주목할 만한 프로젝트가 나왔다. 정렬 연구 팀은 2023년 '약강 강한 일반화' 프레임워크를 개발했다. 이것은 약한 모델이 더 강한 모델을 감독하는 방법을 탐구하며, 가능한 확장의 길을 제공하며, 모델이 더 우수해지면 정렬을 확장 할 수 있는 잠재력을 제공한다. 또 다른 프로젝트인 'Evals' 제품군은 진위, 편향 및 거부 행동을 포함하여 모델의 안전 속성을 측정하는 표준 준거를 제공하다. 이러한 평가는 내부에서 사용되고 더 넓은 연구 커뮤니티에 전달된다.
그룹은 2023년 ‘감독 정렬(Superalignment)’ 계획을 만들기도 하였으며, 장기 로드맵과 당당한 컴퓨팅 관선을 조정하는 것으로 목표로 하는 전용 노력이며, 인상적인 AI 계획을 정렬하는 문제를 해결하는 데 특별히 초점을 맞추고 있다. 수석 과학자 야코프 우스코라이트와 다른 사람들에 의하면, 팀은 인간이 평가할 다른 AI 시스템을 첨단 제어하는 것으로 참여하는 방식과 같은 확장 가능한 감독 기술에 초점을 맞추고 형식 검증 기술에 중점을 둔다.
영향과 반응
OpenAI Safety Research는 AI 안전 분야에 포괄적으로 영향력을 가졌다. 그들의 출판물은 상당히 인용되고, 특히 RLHF는 산업 전반에 걸쳐 채택되어 왔다. 그룹의 경험적, 반복적 접근 방식에 대한 강조는 실용적 실행에 기반한 안전 연구의 실증, 관심 있는 것으로서 찬사를 받아력이 있다. 그러나 그룹은 OpenAI의 모델 배포 속도가 안전 보장을 능가하며 일부 측에서도 비판을 받아왔다. 특히 최전선 모델에 대한 현재 정렬 기술의 적합성에 대한 평가가는 연구 커뮤니티 내에서 여전히 활발히 논의되고 있다.
그룹의 작업은 생성 AI의 거버넌스에 대한 광범위한 대화를 이끌었다. 모델 능력과 리스크에 대한 발견은 미국뿐만 아니라 국제에서도 정책 논의에 중요한 요소가 되었으며, 의원 기관의 증언 및 AI 안전에 대한 행정 명령에 기여했다. 2024년 현재 OpenAI 안전 연구는 계속 확장되고 있으며, ●분의 채용과 새로운 연구 프로그램이 추가되고 있다.
향후 방향
앞으로 OpenAI 안전 연구는 여러 최전선 문제에 중점을 두고 있다. 이들은 확장 가능한 감독을 위한 더 견고한 방법 개발, 수조 개의 매개 변수를 가진 모델을 처리하는 해석 가능 할 도구 개선 및 빠른 모델 반복을 따라 잡는 자동 보안 평가 시스템 만들기와 같은 것을 포함한다. 그룹도 공정성, 책임성 및 AI 기술의 혁신 분포에 대한 질문과 같은 신뢰에서 AI 웨어러블 차원을 탐구하고 있다. 궁극적인 목표는 강력한 AI 및 장기적으로 인간 가치와 신뢰하게 일치된 AI 시스템을 개발하는 것이다.
참고 문헌
- OpenAI. (2017). "인간 선호 기반 딥 강화 학습"
- OpenAI. (2023). "약한 강한 일반화"
- OpenAI. (2023). "준비 상태 프레임워크"
- OpenAI. (2023). "감사항 정렬 이니셔티브"