우호적 인공지능(또는 FAI)은 인류에게 긍정적(유익한) 영향을 미치거나 최소한 인간의 이익과 일치할, 예를 들어 인류 종의 개선을 촉진할 가상의 인공 일반 지능(AGI) 형태이다. 이는 인공지능 윤리의 일부이며 기계 윤리와 밀접하게 관련되어 있다. 기계 윤리가 인공지능 에이전트가 어떻게 행동해야 하는지에 관심을 두는 반면, 우호적 인공지능 연구는 그러한 행동을 실질적으로 어떻게 실현하고 그것이 적절히 제약되도록 보장할지에 초점을 맞춘다.
이 용어는 이 개념을 대중화한 것으로 잘 알려진 엘리에이저 유드코스키가 인간의 가치를 안정적으로 구현하는 초지능적 인공 에이전트를 논의하기 위해 만들었다. 스튜어트 J. 러셀과 피터 노빅의 주요 인공지능 교과서인 『인공지능: 현대적 접근법』은 이 개념을 다음과 같이 설명한다: 유드코스키(2008)는 우호적 AI를 설계하는 방법에 대해 더 자세히 논한다. 그는 우호성(인간을 해치지 않으려는 욕구)이 처음부터 설계되어야 한다고 주장하지만, 설계자들은 자신의 설계가 결함이 있을 수 있다는 점과 로봇이 시간이 지남에 따라 학습하고 진화할 것이라는 점을 인식해야 한다고 말한다. 따라서 과제는 메커니즘 설계의 문제이다 - 즉, 견제와 균형 체계 하에서 AI 시스템을 진화시키는 메커니즘을 정의하고, 그러한 변화에도 우호적으로 유지될 효용 함수를 시스템에 부여하는 것이다.
"우호적"이라는 용어는 이 맥락에서 기술 용어로 사용되며, 안전하고 유용한 에이전트를 지칭하며, 반드시 구어적 의미의 "친근한" 에이전트를 의미하지는 않는다. 이 개념은 주로 지능이 급격히 폭발하는 재귀적 자기 개선 인공 에이전트에 대한 논의 맥락에서 언급되는데, 이는 이 가상의 기술이 인간 사회에 크고 빠르며 통제하기 어려운 영향을 미칠 것이라는 근거 때문이다.
비우호적 AI의 위험
인공지능에 대한 우려의 뿌리는 매우 오래되었다. 케빈 라그랑뒤르는 AI에 특유한 위험이 골렘과 같은 인공 인간형 하인 또는 오리야크의 게르베르트와 로저 베이컨의 원시 로봇에 관한 고대 문학에서 볼 수 있다고 보여주었다. 그 이야기들에서, 이러한 인간형 창조물의 극도의 지능과 힘은 그들의 노예 지위(본질적으로 인간 이하로 간주됨)와 충돌하여 파국적인 갈등을 일으킨다. 1942년까지 이러한 주제는 아이작 아시모프가 "로봇 3원칙"을 만들도록 이끌었는데, 이는 그의 소설 속 모든 로봇에 하드와이어링된 원칙으로, 로봇이 창조자에게 반기를 들거나 창조자가 해를 입는 것을 방지하기 위한 것이었다.
현대에 들어 초지능 AI의 전망이 가까워지면서 철학자 닉 보스트롬은 인간 윤리와 일치하지 않는 목표를 가진 초지능 AI 시스템은 인류의 안전을 보장하기 위한 극단적인 조치가 취해지지 않는 한 본질적으로 위험하다고 말했다. 그는 이렇게 표현했다: "기본적으로 우리는 '초지능'이 가진 어떤 목표든 달성할 수 있을 것이라고 가정해야 한다. 따라서 우리가 그것에 부여하는 목표와 전체 동기 체계가 '인간 친화적'인 것이 극히 중요하다."
2008년, 엘리에이저 유드코스키는 고급 인공지능으로 인한 실존적 위험을 완화하기 위해 "우호적 AI"의 창설을 촉구했다. 그는 이렇게 설명한다: "AI는 당신을 증오하지도, 사랑하지도 않지만, 당신은 그것이 다른 용도로 사용할 수 있는 원자로 만들어져 있다."
스티브 오모훈드로는 충분히 고급화된 AI 시스템은 명시적으로 대응되지 않는 한 자원 획득, 자기 보존, 지속적 자기 개선과 같은 여러 기본 "욕구"를 나타낼 것이라고 말하는데, 이는 목표 지향 시스템의 본질적 특성 때문이며, 이러한 욕구는 "특별한 예방 조치" 없이는 AI가 바람직하지 않은 행동을 보이게 할 것이라고 말한다. 알렉산더 비스너-그로스는 미래 행동의 자유(또는 인과 경로 엔트로피)를 최대화하도록 구동되는 AI는 계획 지평이 특정 임계값보다 길면 우호적인 것으로, 계획 지평이 그 임계값보다 짧으면 비우호적인 것으로 간주될 수 있다고 말한다.
루크 뮐하우저는 기계 지능 연구소를 위해 글을 쓰면서 기계 윤리 연구자들이 브루스 슈나이어가 "보안 사고방식"이라고 부른 것을 채택할 것을 권장한다: 시스템이 어떻게 작동할지 생각하는 대신, 그것이 어떻게 실패할 수 있을지 상상하라. 예를 들어, 그는 정확한 예측만 하고 텍스트 인터페이스를 통해 소통하는 AI조차도 의도하지 않은 해를 끼칠 수 있다고 제안한다. 2014년, 루크 뮐하우저와 닉 보스트롬은 '우호적 AI'의 필요성을 강조했다; 그럼에도 불구하고, 예를 들어 반사실적 도덕적 사고를 프로그래밍함으로써 '우호적' 초지능을 설계하는 어려움은 상당하다.
일관된 외삽 의지
유드코스키는 일관된 외삽 의지(CEV) 모델을 제시한다. 그에 따르면, 우리의 일관된 외삽 의지는 "우리가 더 많이 알고, 더 빨리 생각하고, 우리가 되고 싶었던 사람에 더 가까워지고, 함께 더 성장했다면 우리의 소원이며, 외삽이 수렴하기보다는 발산하지 않고, 우리의 소원이 간섭하기보다는 일관될 때이며, 우리가 외삽되기를 바라는 대로 외삽되고, 우리가 해석되기를 바라는 대로 해석된 것이다."
우호적 AI가 인간 프로그래머에 의해 직접 설계되는 대신, 먼저 인간 본성을 연구한 다음 충분한 시간과 통찰력이 주어졌을 때 인류가 원할 AI를 생산하도록 프로그래밍된 "시드 AI"에 의해 설계되어야 한다. 우연적 인간 본성(아마도 수학적 목적을 위해 효용 함수 또는 다른 결정 이론적 형식주의로 표현됨)을 통해 객관적 목표에 호소하는 것은 객관적 도덕성을 정의하는 메타윤리적 문제에 대한 답이며, 외삽된 의지는 인류가 객관적으로 원할 것을 의미하도록 의도되지만, 그것은 오늘날의, 외삽되지 않은 인류의 심리적 및 인지적 특성에 상대적으로만 정의될 수 있다.
다른 접근법
스티브 오모훈드로는 AI 안전에 대한 "비계" 접근법을 제안했는데, 여기서 증명 가능하게 안전한 AI 세대가 다음 증명 가능하게 안전한 세대를 구축하는 데 도움을 준다. 세스 바움은 안전하고 사회적으로 유익한 인공지능 또는 인공 일반 지능의 개발은 AI 연구 커뮤니티의 사회 심리학의 함수이므로 외부적 조치로 제약되고 내부적 조치로 동기 부여될 수 있다고 주장한다. 내부적 동기는 메시지가 AI 개발자와 공감될 때 강화될 수 있다; 바움은 대조적으로 "유익한 AI에 대한 기존 메시지가 항상 잘 구성된 것은 아니다"라고 주장한다. 바움은 "협력적 관계와 AI 연구자의 긍정적 프레이밍"을 옹호하며 AI 연구자를 "유익한 설계를 추구하지 않는다"고 특성화하는 것에 대해 경고한다.
그의 저서 『인간과 양립 가능한』에서 AI 연구자 스튜어트 J. 러셀은 유익한 기계 개발을 안내하는 세 가지 원칙을 나열한다. 그는 이러한 원칙이 인간과의 양립성을 우선시하는 새로운 AI 접근법의 출발점에 불과하다고 강조한다. 원칙은 기계의 주요 목표가 인간 선호의 충족이며, 기계가 그러한 선호에 대해 불확실하며, 기계가 그 이해를 개선하기 위해 정보를 추구하도록 보장하는 데 초점을 맞춘다.
기계 윤리와의 관계
우호적 AI는 기계 윤리와 밀접하게 관련되어 있지만, 두 분야는 서로 다른 강조점을 가진다. 기계 윤리는 인공 에이전트의 도덕적 행동에 관심을 두며 "주어진 상황에서 AI가 무엇을 해야 하는가?"와 같은 질문을 한다. 반면 우호적 AI 연구는 더 실용적이며, 처음부터 안전하고 유익한 AI 시스템을 설계하고 구축하는 방법에 초점을 맞춘다. 여기에는 가치 정렬, 해석 가능성, 견고성에 대한 작업이 포함된다. 이 분야는 Artificial intelligence, Machine learning, Deep learning의 통찰력을 활용하며, OpenAI, Anthropic, Google DeepMind와 같은 조직이 고급 AI 시스템을 개발함에 따라 점점 더 관련성이 높아지고 있다. Michael I. Jordan과 Melanie Mitchell 같은 연구자들은 AI 안전과 윤리에 대한 논의에 기여하며 AI의 사회적 영향에 대한 신중한 고려의 필요성을 강조했다.