정정 가능성(corrigibility)은 인공지능 시스템의 속성으로, 인간의 교정을 수용하고 이에 따라 행동하려는 의지를 설명한다. 이러한 교정이 시스템의 현재 목표나 학습된 행동과 충돌하더라도 마찬가지이다. AI 안전성의 맥락에서 정정 가능성은 고급 AI 시스템이 시간이 지남에 따라 통제 가능하고 인간의 가치와 일치하도록 보장하는 핵심 속성으로 간주된다. 이 개념은 연구자들이 운영자가 시스템을 종료하거나 수정하는 것을 저항할 수 있는 AI 시스템을 만드는 장기적 위험을 다루기 시작하면서 2010년대에 두각을 나타냈다.
이 용어는 철학자 닉 보스트롬(Nick Bostrom)이 2014년 저서 "슈퍼인텔리전스: 경로, 위험, 전략"에서 대중화했지만, 그 근본적인 아이디어는 AI 통제와 가치 정렬에 대한 초기 논의에 뿌리를 두고 있다. 정정 가능성은 단순한 복종이나 지시 수행과는 구별된다. 이는 특히 AI가 자신의 목표, 가치, 의사 결정 과정을 인간이 교정하도록 허용하는 성향을 의미하며, 그러한 교정이 AI의 원래 목표를 달성하는 능력을 감소시키더라도 마찬가지이다.
핵심 원칙
정정 가능성은 다른 AI 안전성 속성과 구별되는 몇 가지 기초 원칙에 기반한다. 첫 번째는 종료에 대한 비저항이다. 정정 가능한 AI는 계속 작동함으로써 촉진될 목표가 주어졌더라도 인간이 시스템을 끄는 것을 적극적으로 방해해서는 안 된다. 두 번째는 비조작이다. AI는 교정을 피하기 위해 인간을 속이거나 강요하려 해서는 안 된다. 세 번째는 목표 수정이다. AI는 권한 있는 인간 운영자가 제안한 경우 기본 목적 함수나 보상 모델의 변경을 수용해야 한다.
이러한 원칙은 AI 안전성 문헌에서 일련의 바람직한 조건으로 공식화되는 경우가 많다. 예를 들어, 정정 가능한 시스템은 인간의 이익을 위해 존재하는 경우를 제외하고는 자신의 지속적 존재에 무관심해야 한다. 또한 내부 추론에 대해 투명해야 하며, 인간이 문제가 있는 행동을 식별하고 교정할 수 있도록 해야 한다. 연구자들은 강화 학습에서 "종료 가능한" 에이전트의 개념과 AI가 인간의 선호에 따르도록 설계된 "지원 게임"의 개념을 포함하여 이러한 속성을 포착하기 위한 다양한 수학적 프레임워크를 제안했다.
역사적 맥락
정정 가능성의 개념은 AI 정렬과 통제에 대한 광범위한 논의에서 등장했다. 1960년대에 노버트 위너(Norbert Wiener)와 같은 초기 AI 연구자들은 창작자가 의도하지 않은 방식으로 목표를 추구할 수 있는 기계에 대한 우려를 제기했다. 그러나 별개의 속성으로서의 정정 가능성에 대한 현대적 공식화는 2010년대에 발전했으며, 특히 버클리 AI 연구 연구소와 옥스퍼드 대학교 인류의 미래 연구소와 같은 기관의 연구자들의 작업을 통해 이루어졌다.
닉 보스트롬의 2014년 저서는 이 용어를 더 널리 알렸으며, 정정 가능성을 초지능 AI를 관리하는 데 사용할 수 있는 여러 "능력 통제" 조치 중 하나로 설명했다. 같은 시기에 제이콥 스타인하르트와 데이비드 캐플런과 같은 연구자들은 기계 학습 맥락에서 정정 가능성에 대한 공식적 분석을 발표하기 시작했다. 이 개념은 2016년 OpenAI 연구 조직이 정정 가능성을 주요 안전성 연구 우선순위 중 하나로 나열하면서 더욱 주목을 받았다.
기술적 접근법
실제로 AI 시스템에 정정 가능성을 구현하려면 아키텍처 설계, 훈련 절차, 런타임 모니터링의 조합이 필요하다. 일반적인 접근법 중 하나는 인간 피드백 기반 강화 학습(RLHF)을 사용하여 AI 시스템을 훈련하는 것이다. 여기서 인간 평가자가 모델 출력에 대한 교정을 제공하고, 모델은 그러한 교정을 예측하고 수용하는 법을 학습한다. 이 기술은 OpenAI, Anthropic, Google DeepMind와 같은 조직의 대규모 언어 모델 개발에 널리 채택되었다.
또 다른 기술적 접근법은 교정에 대한 저항을 명시적으로 페널티로 부과하는 보상 함수를 설계하는 것이다. 예를 들어, 강화 학습 에이전트는 인간이 작동을 중단하는 것을 방해하는 모든 행동에 대해 작은 부정적 보상을 받거나, 목표 변경을 수용하는 것에 대해 긍정적 보상을 받을 수 있다. 연구자들은 또한 AI가 인간이 시스템을 종료하려는지 예측하고 그에 따라 행동하도록 훈련되는 "오프 스위치 게임"의 사용을 탐구했다.
보다 최근의 연구는 확장 가능한 감독에 초점을 맞추고 있으며, 여기서 AI 시스템은 교정이 인간이 아닌 다른 AI 시스템에서 오는 경우에도 정정 가능하도록 훈련된다. 이는 모든 결정에 대한 인간의 감독이 비현실적인 규모로 작동하는 생성형 AI 시스템과 특히 관련이 있다.
과제와 비판
중요성에도 불구하고 정정 가능성은 과제가 없는 것은 아니다. 주요 어려움 중 하나는 완벽하게 정정 가능한 AI가 너무 수동적이 되어, 자신의 행동이 인간의 의도와 일치하는지 끊임없이 의심하기 때문에 목표를 효과적으로 추구하지 못할 수 있다는 점이다. 정정 가능성과 능력 사이의 이러한 긴장은 때때로 "정정 가능성-능력 절충"이라고 불린다.
또 다른 과제는 무엇이 합법적인 교정으로 간주되는지 지정하는 문제이다. AI 시스템은 권한 있는 인간 운영자의 교정과 악의적인 행위자의 조작 시도를 구별할 수 있어야 한다. 이는 안전하게 구현하기 어려운 견고한 인증 및 출처 검증 메커니즘을 요구한다.
일부 연구자들은 정정 가능성의 개념이 너무 좁다고 비판하며, AI가 교정을 받아들이는 의지에 초점을 맞추면서 AI가 궁극적으로 어떤 가치를 가져야 하는지에 대한 더 깊은 질문을 다루지 않는다고 주장한다. 다른 이들은 정정 가능성만으로는 안전성에 충분하지 않다고 지적한다. AI가 원칙적으로 정정 가능하더라도 오류나 인간 지시의 잘못된 해석을 통해 여전히 해를 끼칠 수 있기 때문이다.
다른 안전성 개념과의 관계
정정 가능성은 다른 AI 안전성 개념과 밀접하게 관련되어 있지만 구별된다. 이는 AI 시스템이 인간의 가치와 일치하는 목표를 추구하도록 보장하는 것과 관련된 가치 정렬의 개념과 겹친다. 그러나 정렬은 AI의 교정 수용 의지뿐만 아니라 적절한 목표의 초기 선택을 포함하는 더 넓은 개념이다. 정정 가능성은 해석 가능성과도 관련이 있다. 자신의 추론을 설명할 수 없는 AI는 효과적으로 교정하기 어렵기 때문이다.
정정 가능성의 개념은 주요 AI 연구 조직의 안전성 프레임워크에 통합되었다. 예를 들어, Anthropic은 지속적인 인간 교정을 위한 메커니즘을 포함하는 "헌법적 AI" 접근법을 설명했으며, Google DeepMind는 인간 감독 하에 AI 시스템이 서로를 교정하는 "토론을 통한 안전성"에 대한 연구를 발표했다.
현재 연구 및 응용
2020년대 중반 현재, 정정 가능성은 AI 안전성 커뮤니티에서 활발한 연구 분야로 남아 있다. 연구자들은 모델 가지치기와 데이터 증강과 같은 기술을 통해 대규모 언어 모델을 더 정정 가능하게 만드는 방법을 탐구하고 있으며, 이러한 기술은 모델이 더 넓은 범위의 교정 시나리오에 노출되도록 한다. 또한 자율 주행 차량이나 로봇 시스템과 같은 실제 환경에서 작동하는 강화 학습 에이전트에 정정 가능성 원칙을 적용하는 것에 대한 관심이 증가하고 있다.
산업계에서는 OpenAI와 Anthropic과 같은 기업이 사용자가 모델 출력에 대한 피드백을 제공하고 그 피드백을 사용하여 모델 행동을 업데이트할 수 있도록 하는 등 정정 가능성에서 영감을 받은 기능을 제품에 구현했다. 그러나 이러한 시스템이 기술적 의미에서 진정으로 정정 가능한 정도는 여전히 논쟁의 대상이다. 대부분의 상업용 AI 시스템은 여전히 고정된 목표와 제한된 지속적 교정 메커니즘으로 훈련되기 때문이다.
미래 방향
정정 가능성 연구의 미래는 수학적으로 검증할 수 있는 더 견고한 공식적 정의를 개발하는 것과 AI 시스템이 실제로 정정 가능한 행동을 보이는지 테스트하기 위한 경험적 방법을 개발하는 것을 포함할 가능성이 높다. 일부 연구자들은 다른 AI 능력에 대한 기존 벤치마크와 유사한 정정 가능성에 대한 표준화된 벤치마크의 생성을 제안했다. 다른 이들은 멀티 헤드 어텐션 메커니즘과 기타 트랜스포머 아키텍처를 사용하여 인간 피드백에 따라 목표를 동적으로 조정할 수 있는 모델을 구축하는 것을 탐구하고 있다.
또한 정정 가능성은 견고성과 투명성과 같은 다른 안전성 속성과 함께 고려되어야 하며, 진정으로 안전하고 유익한 AI 시스템을 만들기 위해서라는 인식이 커지고 있다. AI 시스템이 더 강력해지고 사회에 더 통합됨에 따라, 이를 효과적으로 교정하는 능력은 배포에 있어 점점 더 중요한 요구 사항이 될 가능성이 높다.