Silverman v. OpenAI는 2023년 7월 미국 캘리포니아 북부 지방법원에 제기된 연방 소송이었다. 원고인 작가 사라 실버먼, 리처드 카드레이, 크리스토퍼 골든은 대규모 언어 모델인 ChatGPT의 개발사 OpenAI가 허가 없이 자신들의 저서를 훈련 데이터로 사용하여 저작권을 침해했다고 주장했다. 이 사건은 생성형 인공지능 시스템을 저작권이 있는 텍스트로 훈련시키는 관행에 대한 최초의 고위험 법적 도전 중 하나가 되었으며, 공정 사용, 훈련 데이터 세트의 투명성, 보호된 저작물을 연상시키는 출력물에 대한 AI 기업의 책임에 대한 의문을 제기했다.
이 소송은 2023년 7월 7일에 제기되었으며, 이후 유사한 소송과 병합되었다. 원고들은 법정 손해배상, 금지 명령, 그리고 OpenAI의 저작물 사용이 저작권 침해에 해당한다는 선언을 구했다. 또한 디지털 밀레니엄 저작권법(DMCA) 위반과 부당 이득을 주장했다. 이 사건은 허가 없이 저작권 있는 자료를 제한적으로 사용하는 것을 허용하는 '공정 사용' 원칙이 기계 학습 목적의 대규모 저서 수집에까지 확장되는지 여부를 시험했기 때문에 광범위한 주목을 받았다.
배경 및 법적 맥락
생성형 AI 시스템, 특히 ChatGPT와 같은 대규모 언어 모델의 부상은 수백만 권의 저서, 기사, 웹 페이지를 포함하는 훈련 데이터 세트에 의존한다. OpenAI의 훈련 과정은 공개적으로 이용 가능한 텍스트(저작권 있는 저작물 포함)를 스크래핑하여 모델이 인간과 유사한 텍스트를 예측하고 생성하도록 가르치는 것을 포함했다. 원고들은 이러한 사용이 변형적이지 않고 오히려 저자로부터 라이선스 수익과 창작물에 대한 통제권을 박탈하는 무단 복제의 한 형태라고 주장했다.
이 사건은 AI 기업을 상대로 한 더 광범위한 소송 물결의 일부였다. 존 그리샴, 조지 R.R. 마틴, 조디 피콜트를 포함한 다른 작가들도 OpenAI 및 다른 개발자들을 상대로 유사한 소송을 제기했다. Silverman v. OpenAI의 결과는 법원이 AI 훈련 맥락에서 공정 사용을 어떻게 해석할지에 대한 선도적 사례로 여겨졌다.
원고의 주장
실버먼, 카드레이, 골든은 OpenAI가 훈련 데이터 세트를 만들기 위해 자신들의 저서를 전체 복사했으며, 이를 ChatGPT 훈련에 사용했다고 주장했다. 그들은 이러한 복사가 상업적이고 비변형적이며 저작물 시장에 해를 끼치기 때문에 공정 사용으로 보호되지 않는다고 주장했다. 또한 ChatGPT가 저서의 요약이나 발췌문을 생성할 수 있어 모델이 텍스트의 상당 부분을 암기했음을 입증한다고 주장했다.
원고들은 또한 OpenAI가 디지털화 과정에서 제목 페이지나 저작권 고지와 같은 저작권 관리 정보를 제거하여 DMCA를 위반했다고 주장했다. 그들은 직접 및 대리 침해에 대한 손해배상과 부당 이득에 대한 손해배상을 구했다.
OpenAI의 방어
OpenAI는 소송 기각을 신청하며 훈련에서 저작권 있는 저작물을 사용하는 것이 공정 사용이라고 주장했다. 회사는 훈련 데이터가 표현적 콘텐츠를 재현하는 것이 아니라 통계적 패턴을 만드는 데 사용되며, 결과 모델이 원본 저작물과 경쟁하지 않는다고 주장했다. OpenAI는 또한 원고들이 미국 저작권청에 저작권을 등록하지 않아 침해 소송 제기의 전제 조건을 충족하지 못했으므로 소송 자격이 없다고 주장했다.
기각 신청에서 OpenAI는 원고들이 ChatGPT가 저서의 침해적 복사본을 생성했다고 주장하지 않고 훈련 과정에서의 복사만 주장했다는 점을 강조했다. 회사는 이러한 중간 복사는 변형적이며 검색 엔진과 텍스트 마이닝을 포함한 이전 사례에서 지지되었다고 주장했다.
법원 판결
2024년 2월 12일, 캘리포니아 북부 지방법원의 아라셀리 마르티네스-올긴 판사는 OpenAI의 기각 신청을 일부 인용하고 일부 기각했다. 법원은 원고들이 ChatGPT 출력물이 자신들의 저작물을 침해한다는 점을 그럴듯하게 주장하지 못했다고 보아 직접 저작권 침해 주장을 기각했다. 법원은 원고들이 모델이 저서의 복제물이나 파생 저작물을 생성한다는 것을 입증하지 못했으며, 단지 요약이나 발췌문을 생성할 수 있다는 것만으로는 충분하지 않다고 판단했다.
그러나 법원은 캘리포니아 법에 따른 부정 경쟁 주장과 과실에 의한 경제적 이익에 대한 간섭 주장은 진행을 허용했다. 또한 법원은 원고들에게 저작권 주장의 결함을 보완하기 위해 소장을 수정할 기회를 부여했다. DMCA 주장은 원고들이 OpenAI가 저작권 관리 정보를 제거했다는 점을 충분히 주장하지 못했다고 보아 기각되었다.
이 판결은 혼합된 결과로 여겨졌다. 직접 침해 주장은 기각되었지만, 사건은 다른 근거로 계속되었고 원고들은 재소장할 기회를 얻었다. 이 결정은 훈련 과정에서의 복사가 모델 출력물에서의 복사보다 침해를 입증하기 어렵다는 점을 강조했다.
이후 전개
기각 이후, 원고들은 2024년 3월 수정 소장을 제기하며 ChatGPT가 저작권 있는 텍스트를 재현할 수 있는 능력에 대한 더 구체적인 주장을 추가했다. 또한 훈련에 사용된 저작물의 작가들로 구성된 집단 소송 인증을 요청했다. OpenAI는 다시 기각을 신청했고, 법원은 2024년 10월 청문회를 열었다. 2025년 초 현재, 사건은 본안에 대한 최종 판결 없이 계류 중이었다.
이 사건은 더 큰 법적 환경의 일부였다. 2024년 미국 저작권청은 AI의 저작권 영향에 대한 연구를 시작했고, 의회는 이 문제에 대한 청문회를 열었다. 다른 법원들도 2023년 12월에 제기된 뉴욕 타임즈와 OpenAI 간의 사건을 포함하여 유사한 문제를 다루고 있었다.
AI 산업에 미치는 영향
Silverman v. OpenAI는 인공지능 산업에 중요한 영향을 미쳤다. 이 사건은 AI 기업들이 데이터 수집 관행을 재고하도록 촉구했다. OpenAI를 포함한 일부 기업은 저작권 보유자를 위한 옵트아웃 메커니즘과 출판사와의 라이선스 계약을 제공하기 시작했다. 이 사건은 또한 훈련 데이터 세트의 투명성 필요성과 법정 라이선스 제도의 가능성에 대한 논의에 영향을 미쳤다.
이 소송은 혁신과 지적 재산권 사이의 긴장을 부각시켰다. AI 개발자들은 유용한 모델을 만드는 데 텍스트에 대한 광범위한 접근이 필수적이라고 주장한 반면, 작가와 출판사는 보상과 통제를 받을 자격이 있다고 주장했다. 이 사건과 유사한 사건들의 결과는 기계 학습의 미래와 생성형 AI 시스템의 상업적 생존 가능성을 형성할 수 있다.
법적 및 윤리적 고려 사항
이 사건은 여러 법적 및 윤리적 질문을 제기했다. 핵심 문제 중 하나는 비판, 논평, 연구와 같은 목적의 제한적 복사에 전통적으로 적용되어 온 '공정 사용' 원칙이 AI 훈련을 위한 저작권 있는 저작물의 전체 수집에까지 확장되어야 하는지 여부였다. 법원은 이전에 Authors Guild v. Google과 같은 사건에서 텍스트 마이닝을 공정 사용으로 지지했지만, 이러한 사건은 표현적 콘텐츠를 생성할 수 있는 생성 모델이 아닌 검색 색인을 다루었다.
또 다른 문제는 신경망이 파생 저작물을 만드는 역할이었다. 원고들은 ChatGPT가 작가의 스타일로 텍스트를 생성하거나 저서의 본질을 포착하는 요약을 생성하는 능력이 파생 저작물을 구성할 수 있다고 주장했다. OpenAI는 모델의 출력물이 원본 저작물과 실질적으로 유사하지 않으며 모델이 텍스트의 복사본을 저장하지 않는다고 반박했다.
윤리적으로, 이 사건은 창작자의 저작물을 사용할 때 동의와 보상의 필요성을 강조했다. 또한 의미 있는 감독 없이 방대한 양의 데이터에 접근할 수 있는 AI 기업에 대한 권력 집중에 대한 우려를 제기했다. 이 사건은 기술 개발자와 콘텐츠 창작자 간의 사회적 계약에 대한 더 넓은 논쟁에 기여했다.
결론
Silverman v. OpenAI는 진화하는 AI 법 분야에서 획기적인 사건으로 남아 있다. 그 판결은 법원이 AI 기업에 대한 저작권 주장을 어떻게 다룰 수 있는지에 대한 초기 지침을 제공했지만, 많은 질문은 여전히 해결되지 않았다. 이 사건은 항소될 가능성이 높으며, 최종 결과는 회사와 더 넓은 딥 러닝 커뮤니티에 지대한 영향을 미칠 수 있다. 2025년 초 현재, 소송은 진행 중이었고 AI와 저작권에 대한 법적 환경은 계속 발전하고 있었다.