일관된 외삽 의지

영어에서 번역됨

일관된 외삽 의지(CEV)는 2004년 엘리에저 유드코스키가 제안한 이론적 AI 정렬 프레임워크로, 인공 초지능이 현재의 인간 선호가 아닌 이상화되고 외삽된 버전의 인간 선호에 따라 행동할 수 있는 방법을 설명합니다.

일관된 외삽 의지(CEV)는 AI 정렬 분야의 이론적 프레임워크로, 인공 초지능(ASI)이 인류의 현재 개인적 또는 집단적 선호와는 달리, 인간이 더 지식이 풍부하고, 더 합리적이며, 생각할 시간이 더 많고, 사회로서 함께 성숙했다면 원했을 것이라는 자애로운 가정에 따라 행동하는 방식을 설명한다. 이 개념은 2004년 엘리에저 유드코스키가 친화적 AI에 관한 연구의 일환으로 제안했다.

이 개념은 인간의 지능을 능가할 수 있는 고급 AI 시스템의 목표를 지정하는 문제를 다룬다. 고정된 규칙이나 가치 집합을 인코딩하는 대신, CEV는 ASI가 인류의 의지를 외삽하여 목표를 도출해야 하며, 이상적인 인식론적 및 도덕적 조건에서 사람들이 원할 수 있는 것을 반영하는 것을 목표로 한다고 제안한다.

개념

CEV는 고급 AI 시스템이 인류의 의지를 외삽하여 목표를 도출해야 한다고 제안한다. 이는 인간의 선호를 집계하고 투영하여 이상적인 인식론적 및 도덕적 조건에서 사람들이 원할 수 있는 것을 반영하는 과정을 의미한다. 목표는 AI 시스템이 인류의 진정한 이익을 침해하지 않고, 일시적이거나 정보가 부족한 선호를 따르지 않으며, 인류의 의지가 아직 예측 불가능한 문제를 결정하지 않도록 하는 것이다.

시적으로 표현하면, 우리의 일관된 외삽 의지는 우리가 더 많이 알고, 더 빨리 생각하고, 우리가 되고 싶었던 사람에 더 가까워지고, 함께 더 성장했다면 우리의 소원이다. 여기서 외삽은 발산하기보다 수렴하고, 우리의 소원은 간섭하기보다 일관되며, 우리가 그렇게 외삽되기를 바라는 대로 외삽되고, 우리가 그렇게 해석되기를 바라는 대로 해석된다.

이 프레임워크는 인간의 가치를 나열하려고 시도하는 대신 그 근원을 포착함으로써 인간적이고 자기 교정적이도록 설계되었다. 명시적이고 고정된 규칙 목록을 제시하는 어려움을 피한다. 도덕적 성장을 포함하여 결함이 있는 현재의 도덕적 신념이 고정되는 것을 방지한다. 소수의 프로그래머 그룹이 ASI가 가치를 두는 것에 미칠 수 있는 영향을 제한하여 ASI를 먼저 구축하려는 인센티브를 줄인다. 그리고 인류가 자신의 운명을 주도하도록 유지한다.

논쟁

유드코스키와 닉 보스트롬은 CEV가 몇 가지 흥미로운 속성을 가지고 있지만 상당한 이론적 및 실천적 과제에 직면한다고 지적한다. 보스트롬은 CEV가 "다양한 방식으로 지정될 수 있는 여러 자유 매개변수를 가지고 있어 제안의 다른 버전을 산출한다"고 지적한다. 그러한 매개변수 중 하나는 외삽 기반(누구의 외삽 의지가 고려되는지)이다. 예를 들어, 중증 치매 환자, 식물 상태의 환자, 태아 또는 배아를 포함해야 하는지 여부가 있다. 그는 또한 CEV의 외삽 기반이 인간만 포함한다면 결과가 다른 동물과 디지털 마음에 대해 너그럽지 않을 위험이 있다고 지적한다. 한 가지 가능한 해결책은 CEV의 외삽 기반을 확장하는 메커니즘을 포함하는 것이다.

이러한 논쟁은 고급 AI 시스템이 인간의 가치와 이익에 따라 행동하도록 보장하는 방법을 검토하는 AI 정렬AI 안전에 관한 더 넓은 담론의 일부이다.

변형 및 대안

CEV에 대한 제안된 이론적 대안은 인공 초지능의 우수한 인지 능력에 의존하여 도덕적으로 옳은 것을 파악하고 그에 따라 행동하도록 하는 것이다. 또한 두 기술을 결합하는 것도 가능하다. 예를 들어 ASI가 도덕적으로 허용되지 않는 경우를 제외하고 CEV를 따르는 방식이다.

또 다른 검토에서 철학적 분석은 자율 시스템의 사회적 신뢰라는 렌즈를 통해 CEV를 탐구한다. 앤서니 기든스의 "능동적 신뢰" 개념을 바탕으로 저자는 CEV를 "일관되고, 외삽되고, 군집된 의지"(CECV)로 진화시킬 것을 제안한다. 이 공식은 다양한 문화 집단의 도덕적 선호를 더 잘 반영하는 것을 목표로 하여, 공공 신뢰를 얻으면서 사회적 다양성을 수용하는 AI 시스템을 설계하기 위한 더 실용적인 윤리적 프레임워크를 제공한다.

다른 AI 개념과의 관계

CEV는 특히 인류에게 유익한 시스템을 설계하는 방법에 대한 논의에서 인공 지능 연구의 더 넓은 분야 내에 위치한다. 이는 명시적 규칙 기반 시스템이나 인간 피드백 학습에 의존하는 접근 방식과 대조된다. 예를 들어 현대 대규모 언어 모델에서 사용되는 RLHF(인간 피드백 기반 강화 학습)가 있다. RLHF는 반복적 피드백을 통해 모델을 현재 인간 선호에 정렬하는 것을 목표로 하는 반면, CEV는 그러한 선호의 더 야심찬 외삽을 제안한다.

이 프레임워크는 또한 AI 시스템의 합리성과 의사 결정에 관한 질문과 관련이 있다. 이상적인 조건에서 인간이 수렴할 일관된 선호 집합이 존재한다고 가정하는데, 이는 논쟁의 여지가 있는 철학적 가정이다.

같이 보기

외부 링크

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:ai-alignment·ai-safety·philosophy-of-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사