Authors Guild v. OpenAI (2023)는 2023년 9월 20일 뉴욕 남부지방법원에 제기된 집단소송입니다. 원고인 Authors Guild와 John Grisham, Jodi Picoult, George R.R. Martin을 포함한 저명한 작가 그룹은 OpenAI가 허가 없이 그들의 저서를 사용하여 대규모 언어 모델을 훈련시킴으로써 저작권을 침해했다고 주장합니다. 이 소송은 법정 손해배상, 금지 명령, 이익 환수를 요구하며, Generative AI와 저작권법의 교차점에 있는 획기적인 사건으로 자리매김하고 있습니다.
고소장은 Transformer (architecture) 아키텍처를 기반으로 구축된 GPT-3 및 GPT-4와 같은 모델의 OpenAI 훈련에 초점을 맞추고 있습니다. 원고들은 OpenAI가 그들의 저서를 훈련 데이터 세트에 전체적으로 복사하여 모델이 원본 저서와 경쟁하는 파생 텍스트를 생성할 수 있게 했다고 주장합니다. 이 사건은 The New York Times와 다른 작가들이 제기한 유사한 소송을 포함하여 AI 기업을 상대로 한 광범위한 소송 물결의 일부이지만, 작가 커뮤니티의 집단적 대표성으로 주목받고 있습니다.
배경 및 법적 맥락
이 소송은 Artificial intelligence 및 Machine learning의 급속한 발전, 특히 방대한 텍스트 코퍼스로 훈련된 Deep learning 모델의 부상을 배경으로 등장했습니다. 2015년에 설립된 OpenAI는 GPT-3(2020년 출시) 및 GPT-4(2023년 3월 출시)를 포함한 가장 널리 사용되는 대규모 언어 모델 중 일부를 개발했습니다. 이러한 모델은 인터넷에서 수집된 수십억 개의 단어, 종종 명시적 허가 없이 저작권이 있는 책, 기사 및 기타 자료를 포함하여 훈련됩니다.
미국 저작권법은 저자에게 원본 창작물을 복제, 배포 및 파생 저작물을 작성할 수 있는 독점적 권리를 부여합니다. 원고들은 저작권이 있는 책을 AI 모델 훈련에 사용하는 것이 모델이 텍스트를 직접 출력하지 않더라도 무단 복제에 해당한다고 주장합니다. 또한 모델이 요약, 의역 또는 문체적으로 유사한 콘텐츠를 생성할 수 있는 능력이 파생 저작물 권리를 위반한다고 주장합니다.
OpenAI는 비평, 논평, 뉴스 보도, 교육 또는 연구와 같은 목적을 위한 저작권 자료의 제한적 사용을 허용하는 공정 사용 원칙을 근거로 자사 관행을 방어해 왔습니다. 회사는 또한 훈련 데이터가 변형적이며, 모델이 원본 작품을 재생산하지 않고 통계적 패턴을 학습니다고 주장합니다. 그러나 원고들은 수천 권의 책을 포한하는 복사 규모가 합리적 공정 사용 범위를 훨씬 초과한다고 주장합니다.
관련 당사자
주요 원고에는 여러 베스트셀러 작가가 포한됩니다: "The Firm"(1991년)과 같인 법정 스릴러로 알려진 John Grisham, "My Sister's Keeper"(2004년)의 작가 Jodi Picoult, "A Song of Ice and Fire" 시리즈의 창작자 George R.R. Martin. 기타 지명된 원고에는 David Baldacci, Sylvia Day, Jonathan Franzen이 포한됩니다. 1912년에 설립된 전문 작가 조직인 Authors Guild는 수천 명의 작가를 대표하며 디지털 시대에 작가 권리를 옹호하는 데 활발히 활동해 왔습니다.
피고는 캘리포니아 주 샌프란시스코에 본사를 둔 OpenAI입니다. OpenAI의 지도부에는 CEO Sam Altman과 CTO Mira Murati가 포한되지만, 소송에서 개별 임원을 지명하지는 않습니다. 회사는 Microsoft 및 기타 기술 대기업으로부터 상당한 투자를 받았으며, 모델은 Azure 및 ChatGPT와 같인 플랫폼을 통해 배포됩니다.
주요 주장 및 혐의
고소장은 OpenAI의 훈련 과정이 원고들의 책을 전체적으로 복사했으며, 직접 흡입 또는 불법 복제본을 포한한 데이터 세트를 통했을 것으로 주장합니다. 구체적으로, 원고들은 일부 모델 훈련에 사용된 190,000권 이상의 책 컬렉션인 Books3 데이터 세트를 지목하며, 지명된 작가들의 작품이 포한되었습니다. 소송은 OpenAI가 데이터 세트에 저작권 자료가 포한되어 있음을 알았기 때분에 이러안 복사가 고의적이었다고 주장합니다.
복제 외에도, 원고들은 모델이 그들의 작품을 "요약, 의역 또는 기타 방식으로 파생"하는 출력을 생성하여 무단 파생 저작물을 만든다고 주장합니다. 그들은 ChatGPT가 상세한 줄거리 요약을 생성하거나 작가의 문체를 모방할 수 있는 예를 인용하며, 이는 원본 책의 시장을 감소시킨다고 주장합니다. 소송은 또한 OpenAI가 저작자 표시나 보상을 제공하지 않았으며, 특정 국제 협정에 따른 작가의 인격권을 위반했다고 주장하지만, 미국 법은 인격권을 명시적으로 인정하지 않습니다.
원고들은 고의적 침해에 대해 작품당 최대 150,000달러의 법정 손해배상을 구하며, 포한된 작품 수를 감안할 때 수십억 달러에 달할 수 있습니다. 또한 OpenAI가 향후 훈련에서 그들의 작품을 사용하는 것을 방지하기 위안 금지 명령과 침해 복사본 또는 그들로 훈련된 모델의 폐기를 요구합니다.
절차적 경과
이 사건은 뉴욕 남부지방법원의 Sidney H. Stein 판사에게 배정되었습니다. 2023년 11월, OpenAI는 원고들이 구체적인 침해 복사본이나 출력을 지명하지 않았기 때분에 청구를 기각해 달라며 기각 신청을 제출했습니다. 회사는 또한 AI 훈련의 변형적 성격을 인용하며 공정 사용 항변을 반복했습니다.
원고들은 2024년 1월 고소장을 수정하여 더 구체적인 주장과 추가 원고를 추가했습니다. 또한 허가 없이 훈련에 사용된 모든 작가를 대표하기 위해 집단 인증 신청을 제출했습니다. 2025년 초 현재, 법원은 기각 신청에 대안 판결을 내리지 않았으며, 증거 개시 절차가 진행 중입니다.
이 사건은 여러 주목할 만한 AI 저작권 소송 중 하나입니다. 2023년 12월, The New York Times는 OpenAI와 Microsoft를 상대로 유사한 침해를 주장하며 별도의 소송을 제기했습니다. Sarah Silverman과 Christopher Golden을 포함한 다른 작가들도 다른 지역에서 집단 소송을 제기했습니다. 이러한 사건들의 결과는 저작권법이 AI 훈련에 어떻게 적용되는지에 대안 선례를 설정할 수 있습니다.
OpenAI의 주장
OpenAI의 방어는 주로 공정 사용에 의존합니다. 회사는 저작권이 있는 텍스트로 모델을 훈련하는 것이 인간이 책을 읽고 배우는 것과 유사하며, 이는 침해에 해당하지 않는다고 주장합니다. 그들은 모델이 원본 작품의 사본을 저장하는 것이 아니라 추상적 패턴과 관계를 학습하므로 사용이 변형적이라고 주장합니다.
OpenAI는 또한 AI 기술의 공공 이익을 강조하며, 훈련 데이터를 제한하면 혁신을 억압하고 의학, 교육, 과학 분야의 유익한 응용 프로그램 개발을 해칠 것이라고 주장합니다. 회사는 작가를 위한 옵트아웃 메커니즘을 구현했지만, 비평가들은 이것이 충분하지 않으며 창작자에게 부담을 지운다고 주장합니다.
기각 신청에서 OpenAI는 원고들이 구체적 피해를 주장하지 않았기 때분에 소송 적격성이 없다고 주장했습니다. 회사는 모델이 원고들의 작품을 경쟁 방식으로 재생산하지 않으며, 출력이 변형적이라고 주장했습니다. 또한 Books3 데이터 세트가 공개적으로 이용 가능했으며 OpenAI가 요청 시 특정 저작권 작품을 제거하기 위한 조치를 취했다고 언급했습니다.
광범위한 영향
이 사건은 Artificial intelligence 산업에 중대한 영향을 미칩니다. OpenAI에 불리한 판결은 AI 기업이 모든 저작권 있는 훈련 데이터에 대한 라이선스를 획득해야 하며, 이는 비용이 많이 들고 개발 속도를 늦출 수 있습니다. 또한 음악이나 스톡 사진과 유사한 라이선스 시장의 창출로 이어져 작가가 자신의 작품 사용에 대해 보상을 받을 수 있습니다.
반대로, OpenAI에 유리한 판결은 AI 훈련이 공정 사용임을 확립하여 기업이 허가 없이 데이터를 계속 수집할 수 있는 청신호를 제공할 것입니다. 이는 콘텐츠 창작자와의 긴장을 증가시키고 입법 조치를 촉발할 가능성이 있습니다. 유럽 연합을 포함한 여러 국가는 이미 훈련 데이터의 투명성과 권리 보유자에 대한 보상을 요구하는 규제를 고려하고 있습니다.
이 사건은 또한 창의성과 저작권의 본질에 대한 질문을 제기합니다. AI 모델이 인간 작가를 모방하는 텍스트를 생산할 수 있다면, 원본 작품의 가치는 무엇을 의미할까요? 일부 학자들은 AI 생성 콘텐츠가 정의상 파생적이라고 주장하는 반면, 다른 학자들은 보호해야 할 새로운 표현 형태로 봅니다.
관련 사건 및 발전
Authors Guild 소송 외에도 AI 기업을 상대로 한 여러 다른 사건이 제기되었습니다. 2023년 7월, 작가 Sarah Silverman, Richard Kadrey, Christopher Golden은 캘리포니아 북부지방법원에서 OpenAI와 Meta를 상대로 자신들의 책이 허가 없이 사용되었다고 주장하며 소송을 제기했습니다. 그 사건은 2023년 11월 부분적으로 기각되었지만, 원고들은 주장을 수정할 수 있었습니다.
2023년 12월에 제기된 The New York Times 소송은 상당한 법적 자원을 가진 주요 미디어 조직이 관련되어 있어 가장 중요한 사건 중 하나로 간주됩니다. The Times는 OpenAI와 Microsoft가 수백만 개의 기사를 모델 훈련에 사용했으며, 모델이 Times 콘텐츠를 그대로 재생산할 수 있다고 주장합니다. 이 사건은 Authors Guild 소송과 같은 법원에서 계류 중입니다.
Anthropic 및 Google DeepMind를 포함한 다른 기술 기업도 훈련 관행에 대해 조사를 받았습니다. 2024년, 미국 저작권청은 AI와 저작권에 대한 공개 협의를 시작하여 이해 관계자의 의견을 구했습니다. 청은 인간의 저작권이 없는 AI 생성 작품은 저작권이 없을 수 있다는 지침을 발표했지만, 훈련 데이터 문제는 여전히 해결되지 않았습니다.
잠재적 결과 및 일정
법률 전문가들은 문제의 복잡성과 항소 가능성으로 인해 이 사건이 해결되는 데 몇 년이 걸릴 것으로 예상합니다. 약식 판결 신청은 2025년에 제기될 수 있으며, 재판은 2026년 또는 그 이후에 열릴 수 있습니다. 대법원은 Google v. Oracle 사건(2021년)에서 코드 복사에 대안 판결을 내린 것처럼, 공정 사용 문제에 대안 최종적으로 판단해야 할 수 있습니다.
원고들이 승소하면 상당한 손해배상을 받을 수 있지만, 더 중요하게는 판결이 OpenAI가 훈련 관행을 변경하도록 강제할 수 있습니다. 회사는 이미 2023년 12월 Axel Springer와의 계약과 같인 일부 출판사와 콘텐츠 라이선스 계약을 체결했지만, 법원 명령이 더 구속력이 있을 것입니다.
OpenAI가 승소하면 현재 AI 훈련 방식을 입중하고 더 공격적인 데이터 수집을 장려할 것입니다. 이는 창작자들의 반발을 초래하고 새 입법을 촉발할 수 있습니다. 일부 평론가들은 강제 라이선스 제도와 같인 입법적 해결책이 양측에 확실성을 제공할 수 있기 때분에 소송보다 선호될 수 있다고 제안했습니다.
결론
Authors Guild v. OpenAI (2023)는 Generative AI와 지적 재산권 법 사이의 관계에 있서 중대한 전환점을 나타냅니다. 이 사건은 기존 저작권 체계가 방대한 텍스트 훈련이라는 새로운 관행을 수용할 수 있는지 시험합니다. 그 결과는 당사자들뿐만 아니라 AI 기술의 미래 발전과 전 세계 창작자의 권리에 영향을 미칠 것입니다. 소송이 진행됨에 따라 향후 수년간 산업 규범과 법적 기준을 형성할 가능성이 높습니다.