영어에서 번역됨

헌법적 AI는 Anthropic이 개발한 훈련 방법으로, 모델이 서면으로 작성된 원칙 집합에 따라 자신의 출력을 비판하고 수정하여 유해 행동에 대한 인간 라벨링 예시에 대한 의존도를 줄인다.

Constitutional AI(CAI)는 대규모 언어 모델을 유용하고 무해하게 훈련시키는 방법으로, 모델이 헌법이라고 불리는 문서화된 원칙 집합에 따라 자신의 출력을 비판하고 수정하는 방식이다. 이는 모든 바람직하지 않은 행동 예시에 대해 주로 인간의 피드백에 의존하는 대신에 이루어진다. 이 방법은 Anthropic이 2022년 12월 논문 "Constitutional AI: Harmlessness from AI Feedback"에서 소개했으며, Claude (AI model family) 모델 제품군의 핵심 훈련 방법이 되었다.

방법

이 기술은 두 단계로 진행된다. 지도 학습 단계에서는 모델이 프롬프트에 대한 응답을 생성하고, 헌법의 원칙에 따라 자신의 응답을 비판한 후, 이를 더 잘 충족하도록 응답을 다시 작성한다. 이러한 자기 비판 및 수정 루프는 지도 미세 조정에 사용되는 데이터 세트를 생성한다. 강화 학습 단계에서는 모델이 자신의 응답 쌍을 비교하고 어느 것이 헌법을 더 잘 따르는지 판단하여, 보상 모델을 훈련시키는 선호도 데이터 세트를 생성한다. 이 과정을 Anthropic은 AI 피드백 기반 강화 학습(RLAIF)이라고 명명했다. 그런 다음 이 보상 모델은 강화 학습을 통해 모델을 미세 조정하는 데 사용되며, 이 구조는 RLHF와 유사하지만 인간이 제공한 선호도 라벨의 상당 부분을 AI가 생성한 라벨로 대체한다.

동기

Anthropic 연구자들은 공동 창업자 Jared Kaplan을 포함하여 순수 RLHF에는 두 가지 약점이 있다고 주장했다. 첫째, 유해한 출력을 검토하는 데 많은 인간 노동력이 필요하며, 이는 느리고 라벨러를 불쾌한 콘텐츠에 노출시킬 수 있다. 둘째, 명시적이고 문서화된 표준이 아닌 암묵적이고 문서화되지 않은 판단만을 인코딩한다. 반면에 헌법은 개별 라벨러의 선호도와 독립적으로 검사, 논의, 수정될 수 있으며, 동일한 문서를 훈련 실행 전반에 걸쳐 재사용할 수 있다. Anthropic의 최고 경영자인 Dario Amodei는 이 접근 방식을 유능한 모델을 안전하게 확장하려면 점점 더 많은 인간 검토에 의존하지 않는 방법이 필요하다는 더 넓은 확신의 일부로 설명했다.

헌법

Anthropic의 원래 헌법에 있는 원칙은 유엔 세계 인권 선언, 다른 기술 회사의 신뢰 및 안전 규범, 그리고 모델이 좁은 서구적 기본값 밖의 관점에 대해 비회피적이고 주의를 기울이도록 하는 지침 등 여러 출처에서 가져왔다. Anthropic은 Claude의 헌법의 연속적인 개정판을 공개했으며, 이를 고정된 사양이 아닌 진화하는 문서로 설명한다.

정렬 및 안전과의 관계

Constitutional AI는 연구자들이 모델의 행동과 설계자의 의도 사이의 AI alignment을 추구하기 위해 사용하는 여러 기술 중 하나이며, 일반 RLHF 및 Direct Preference Optimization과 함께 사용된다. 지지자들은 AI 생성 피드백이 인간 피드백보다 훨씬 빠르게 생성될 수 있으므로 확장성을 개선하고, 헌법 자체를 외부인이 읽고 비판할 수 있으므로 투명성을 개선한다고 주장한다. 또한 명시적인 서면 원칙에 선호도를 근거로 두면 모델이 근본적인 목표의 의도를 위반하면서 보상 신호를 충족시키기가 더 어려워진다는 논리로 Reward hacking에 대한 부분적인 답변으로 제시된다.

비판

비판자들은 몇 가지 이의를 제기했다. 응답을 비판하고 수정하는 데 사용되는 모델은 훈련되는 모델과 동일한 광범위한 능력을 활용하므로, 일부 연구자들은 AI 피드백이 비교 가능한 능력을 가진 인간 감독자가 놓칠 수 있는 실패를 포착할 수 있는지 의문을 제기한다. 특히 모델이 판단되는 작업에서 인간 성능에 근접하거나 초과하는 경우에 그렇다. 다른 이들은 포함할 원칙의 선택과 원칙 간의 충돌 해결 방법이 여전히 단일 회사의 결정에 달려 있으므로, 이 방법 자체로는 AI 시스템이 반영해야 할 가치에 대한 논쟁을 해결하지 못한다고 지적한다. Constitutional AI는 또한 Red teaming (AI) 및 기타 guardrail 메커니즘의 필요성을 제거하지 않는다. 서면 원칙은 Jailbreak (AI)와 같은 적대적 프롬프트에 의해 여전히 우회될 수 있기 때문이다.

유산

Constitutional AI 뒤에 있는 자기 비판 패턴은 모델을 사용하여 다른 모델을 감독하거나 평가하는 후속 연구에 영향을 미쳤으며, 때로는 LLM-as-judge 평가라고도 불린다. 이는 또한 프런티어 연구소가 상세한 정렬 방법론을 영업 비밀로 유지하는 대신 공개한 가장 널리 인용된 사례 중 하나로 남아 있다.

분류:ai-safety·alignment·anthropic
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사