작가들의 OpenAI에 대한 집단 소송

영어에서 번역됨

OpenAI를 상대로 저자들이 제기한 집단 소송으로, 대규모 언어 모델 훈련 과정에서의 저작권 침해를 주장하며, 저작권 보호를 받는 저작물의 무단 사용에 대한 손해 배상과 금지 명령을 구하는 내용입니다.

저자들이 OpenAI를 상대로 제기한 집단 소송은 GPT-3 및 GPT-4와 같은 대규모 언어 모델을 개발한 OpenAI가 허가 없이 저자들의 책과 기타 저작물을 인공지능 시스템 훈련에 사용함으로써 저작권을 침해했다고 주장하는 통합된 법적 절차입니다. 뉴욕 남부 연방지방법원에 제기된 이 사건은 저작권이 있는 텍스트로 생성형 AI를 훈련시키는 것의 합법성에 대한 광범위한 논쟁의 초점이 되었습니다. 원고들은 법정 손해배상, 이익 환수, 추가 무단 사용 금지 명령을 구했으며, OpenAI는 자사의 훈련 관행이 공정 이용 원칙에 해당한다고 주장했습니다.

이 소송은 AI 기업들을 상대로 한 유사한 소송의 물결 속에서 나타났으며, 창작 산업과 Generative AI의 급속한 상업화 사이의 성장하는 긴장을 반영했습니다. 저자들의 주장은 Transformer (architecture) 아키텍처를 기반으로 하고 방대한 인터넷 말뭉치로 훈련된 OpenAI의 Large language model이 보호된 표현을 필연적으로 복제하고 파생했다는 전제에 중심을 두었습니다. 검색 엔진이나 이미지 썸네일을 다룬 초기 사건과 달리, 이 소송은 훈련 과정 자체를 겨냥하여 기계 학습을 위해 저작권 있는 자료를 수집하는 것이 침해를 구성하는지에 대한 새로운 질문을 제기했습니다.

배경 및 제기

최초 고소장은 2023년 9월 8일 Sarah Silverman, Richard Kadrey, Christopher Golden을 포함한 저자들에 의해 제기되었으며, 그들은 OpenAI의 훈련 데이터에 허가 없이 자신들의 책이 포함되었다고 주장했습니다. 원고들은 OpenAI의 OpenAI 모델이 자신들의 저작물에 대한 요약, 의역, 심지어 축어적 발췌문을 생성할 수 있다고 주장하며, 이는 훈련 과정이 표현적 요소를 복사하고 저장했음을 보여준다고 밝혔습니다. 이 사건은 Michael Chabon, Ta-Nehisi Coates, 코미디언 Sarah Silverman이 제기한 소송을 포함한 다른 저자 소송과 통합되어 In re OpenAI ChatGPT Litigation이라는 제목으로 진행되었습니다.

저자들은 이전에 유명한 지적 재산 분쟁을 다룬 로펌 Susman Godfrey가 대리했습니다. 고소장은 OpenAI가 훈련 데이터 세트를 구성하기 위해 책 저장소와 불법 텍스트 컬렉션을 포함한 인터넷의 상당 부분을 스크랩한 방법을 자세히 설명했습니다. 또한 OpenAI가 라이선스 없이 저작권 있는 자료를 사용하는 법적 위험을 인식했음을 시사하는 내부 문서와 공개 성명을 인용했습니다. 원고들은 OpenAI의 행위가 변형적이지 않고 기존 저작물의 상업적 착취라고 주장했으며, 모델이 시장에서 원본 책과 경쟁한다고 지적했습니다.

법적 주장 및 논거

핵심 법적 주장은 미국 저작권법, 특히 17 U.S.C. § 501에 따른 직접 저작권 침해였습니다. 원고들은 OpenAI가 복제, 파생 저작물 작성, 사본 배포에 대한 독점적 권리를 침해했다고 주장했습니다. 또한 간접 침해 및 부당 이득에 대한 주장도 제기하며, OpenAI가 자신들의 창작 노동을 무단 사용하여 이익을 얻었다고 주장했습니다. 고소장은 저작물당 최대 150,000달러의 법정 손해배상을 구했으며, 침해된 것으로 추정되는 저작물 수를 고려할 때 수십억 달러에 달할 수 있었습니다.

OpenAI의 방어는 주로 17 U.S.C. § 107에 규정된 공정 이용 예외에 의존했습니다. 회사는 모델 훈련이 원본 텍스트를 복제하지 않고 통계적 패턴과 언어 구조를 학습하기 때문에 변형적 사용이라고 주장했습니다. OpenAI는 훈련의 목적이 저자들의 저작물을 대체하는 것이 아니라 범용 도구를 만드는 것이며, 모델의 출력이 원본 자료와 거의 유사하지 않다고 주장했습니다. 또한 회사는 축어적 저작권 텍스트 생성을 방지하기 위한 필터를 구현했다고 언급했지만, 원고들은 이러한 조치의 효과에 대해 이의를 제기했습니다.

핵심 법적 질문은 훈련 중 저작권 있는 저작물의 중간 복사가 침해를 구성하는지 여부였습니다. 원고들은 Google이 검색 색인을 위해 책을 디지털화한 것이 공정 이용이라고 판결한 획기적인 사건인 Authors Guild v. Google 사건과 유사점을 제시했습니다. 그러나 저자들은 Google의 사용이 텍스트를 검색 가능하게 만드는 데 국한된 반면, OpenAI의 사용은 원본 저자의 스타일로 새 텍스트를 생성할 수 있는 경쟁 제품을 만드는 것과 관련이 있다고 주장했습니다. "검색"과 "생성"의 구분은 논쟁의 중심 포인트가 되었습니다.

증거 개시 및 기술적 증거

증거 개시 단계에서 원고들은 OpenAI의 훈련 데이터와 모델 가중치에 대한 접근을 요청하며, 이는 저작권 있는 저작물이 실제로 복사되었음을 증명하는 데 필요하다고 주장했습니다. OpenAI는 영업 비밀 보호와 그러한 데이터를 생성하는 데 필요한 막대한 계산 자원을 이유로 저항했습니다. 그러나 법원은 제한된 증거 개시를 명령하여 원고들이 훈련 말뭉치에 포함된 출처를 보여주는 메타데이터와 로그를 검사할 수 있게 했습니다. 이로 인해 OpenAI가 그림자 도서관 Bibliotik에서 가져온 불법 책 컬렉션인 Books3와 같은 데이터 세트를 사용했으며, 여기에는 수천 권의 저작권 있는 제목이 포함되어 있다는 사실이 드러났습니다.

기술적 증거는 Neural network의 아키텍처와 Deep learning의 본질에 초점을 맞췄습니다. 원고 측 전문가들은 Transformer (architecture) 아키텍처를 기반으로 한 대규모 언어 모델을 포함한 모델이 훈련 예제의 압축된 표현을 저장한다고 증언했습니다. 그들은 이러한 표현이 모델이 단순한 통계적 우연이 아니라 원본에서 직접 파생된 텍스트를 재생산할 수 있게 한다고 주장했습니다. OpenAI 측 전문가들은 모델이 확률적이며 특정 텍스트와의 유사성은 암기가 아니라 일반화 능력의 결과라고 반박했습니다. "암기" 대 "일반화"에 대한 논쟁은 이 사건에서 반복되는 주제가 되었습니다.

사법적 판결 및 신청

2024년 2월, Araceli Martínez-Olguín 판사는 OpenAI의 기각 신청을 기각하고 저작권 주장이 진행되도록 허용했습니다. 판사는 원고들이 OpenAI의 훈련 과정이 보호된 표현을 복사하는 것과 관련되어 있음을 그럴듯하게 주장했으며, 공정 이용 방어는 소장 단계에서 해결될 수 없다고 판결했습니다. 이 결정은 OpenAI가 소멸 시효에 의해 사건이 차단되었거나 원고들이 소송 자격이 없다는 주장을 거부했기 때문에 중요했습니다. 또한 판결은 출력이 축어적 사본이 아니더라도 원고들이 훈련 데이터와 모델 출력 사이의 연관성을 적절히 주장했다고 언급했습니다.

2024년 5월의 후속 판결은 주법 및 부당 이득과 관련된 일부 주장을 기각하여 사건 범위를 좁혔지만 핵심 저작권 주장은 유지했습니다. 법원은 또한 원고들이 중재 조항에 동의하지 않았다는 이유로 OpenAI의 중재 강제 신청을 기각했습니다. 이러한 판결은 재판 가능성을 열어 두었지만, 양측은 합의 의사를 표명했습니다. 이 사건은 AnthropicGoogle DeepMind에 대한 사건을 포함한 다른 AI 저작권 사건을 담당하는 동일한 판사에게 배정되어, 법원이 공통 법적 문제를 조정된 방식으로 다룰 수 있음을 시사했습니다.

산업 및 정책 영향

이 소송은 Artificial intelligence 산업에 지대한 영향을 미쳤습니다. 이는 AnthropicGoogle DeepMind를 포함한 다른 AI 기업들이 훈련 관행을 검토하고 출판사 및 저자와 라이선스 계약을 협상하도록 촉구했습니다. 2023년 말, OpenAI는 Axel Springer 및 Associated Press를 포함한 여러 미디어 회사와 뉴스 콘텐츠 라이선스 파트너십을 발표했습니다. 그러나 이러한 계약은 훈련에 사용된 책과 기사의 극히 일부만을 다루었으며, 많은 저자들은 보상을 받지 못했습니다.

이 사건은 또한 입법 노력에 영향을 미쳤습니다. 미국 의회에서는 AI 기업들이 훈련 데이터 출처를 공개하도록 요구하는 AI 기반 모델 투명성 법안과 같은 법안이 도입되었습니다. 2024년에 확정된 유럽 연합의 AI 법은 범용 AI 모델 개발자들이 훈련 데이터를 문서화하고 저작권법을 준수하도록 요구하는 조항을 포함했습니다. 저자들의 집단 소송은 기존 저작권법이 AI 훈련을 효과적으로 규제할 수 있는지, 아니면 새로운 법률이 필요한지에 대한 시험 사례로 작용했습니다.

창작 커뮤니티의 반응

이 소송은 저자들과 다른 창작자들을 결집시켰으며, 그들은 이를 생계 수단의 방어로 보았습니다. Authors Guild와 같은 조직은 원고를 지지하는 의견서를 제출하며 AI 모델이 인간의 글쓰기 가치를 떨어뜨리고 창작 작업에 대한 경제적 인센티브를 약화시킬 위험이 있다고 주장했습니다. 그러나 일부 저자들은 AI를 영감과 협업을 위한 도구로 지지했으며, 일부는 자신의 저작물을 AI 기업에 라이선스하기도 했습니다. 이러한 분열은 창작 분야에서 자동화의 역할에 대한 광범위한 사회적 논쟁을 반영했습니다.

소송에 참여한 저명한 저자로는 Jonathan Franzen, Jodi Picoult, George R.R. Martin이 있었지만, 일부는 나중에 철회하거나 유보적인 입장을 표명했습니다. 이 사건은 또한 저작권 있는 텍스트에 대한 훈련이 인간의 학습과 유사한지에 대한 학계의 논쟁을 불러일으켰습니다. Melanie MitchellBrendan Lake와 같은 학자들은 기계가 인간의 의미로 "읽지" 않는다고 주장했지만, 법체계는 데이터를 복사하고 변형하는 기계적 과정이 침해를 구성하는지 여부를 결정해야 했습니다.

합의 및 여파

2025년 현재, 이 사건은 해결되지 않은 상태로 남아 있으며, 양측은 합의 협상에 참여하고 있습니다. 보도에 따르면 OpenAI는 저자 집단에 라이선스 비용을 지불하겠다고 제안했지만, 원고들은 더 높은 금액과 지속적인 로열티를 요구했습니다. 법원은 2025년 말에 상태 회의를 예정했으며, 관찰자들은 소송 비용이 높고 불리한 판결 가능성이 있기 때문에 합의가 이루어질 가능성이 높다고 추측했습니다. 합의는 AI 기업이 창작자에게 보상하는 방법에 대한 선례를 확립하겠지만, 반드시 다른 피고를 구속하지는 않을 것입니다.

이 사건은 또한 관련 소송을 촉발했습니다. 2024년, 논픽션 저자 그룹이 OpenAI를 상대로 별도의 집단 소송을 제기하여 회사가 허가 없이 자신들의 저작물을 사용했다고 주장했습니다. 뉴욕 타임스는 같은 법원에 계류 중인 OpenAI와 Microsoft를 상대로 자체 소송을 제기했습니다. 이러한 사건들은 저자들의 집단 소송과 함께 AI 개발의 미래를 형성할 복잡한 법적 환경을 만들었습니다. 저자 사건의 결과는 미국뿐만 아니라 유사한 문제를 다루는 전 세계 관할권에도 영향을 미칠 것으로 널리 예상되었습니다.

광범위한 맥락 및 향후 전망

OpenAI를 상대로 한 저자들의 집단 소송은 AI 기업들을 훈련 데이터에 대해 책임을 묻는 더 큰 운동의 일부였습니다. 이는 기술 혁신과 지적 재산권 사이의 긴장을 부각시켰으며, AI 시스템이 수많은 작가, 예술가, 언론인의 무보수 노동 위에 구축되었다는 사실에 대한 공개적 성찰을 강요했습니다. 또한 이 사건은 원고들의 증거 개시 요청이 훈련 데이터 수집의 불투명한 성격을 드러냈기 때문에 AI 개발의 투명성 필요성을 강조했습니다.

앞으로 이 사건에서 확립된 법적 원칙은 지속적인 영향을 미칠 수 있습니다. 법원이 허가 없이 저작권 있는 저작물을 훈련에 사용하는 것이 침해라고 판결한다면, AI 기업들은 데이터 획득 전략을 재편해야 하며, 공개 도메인 저작물이나 라이선스 콘텐츠에 의존해야 할 것입니다. 법원이 공정 이용을 지지한다면, AI 개발자에게 기존 텍스트를 광범위하게 사용할 수 있는 여지를 주겠지만, 강제 라이선스 제도를 만들기 위한 입법 조치를 촉발할 수도 있습니다. 어느 쪽이든, 이 사건은 Machine learningGenerative AI의 상업화 역사에서 중추적인 순간을 나타냈습니다.

저자들의 집단 소송은 또한 저작권 자체의 본질에 대한 질문을 제기했습니다. AI 모델이 인간의 글쓰기에 필적하는 텍스트를 생성할 수 있게 되면서, 원본 창작과 파생 저작물 사이의 경계가 흐려집니다. 이 사건은 수백만 권의 책을 "읽은" 기계가 같은 책의 영향을 받은 인간 저자와 근본적으로 다른지 여부를 법원이 고려하도록 강요했습니다. 법체계가 아직 결정적인 답을 제공하지는 않았지만, 이 사건은 그 질문이 앞으로 수년간 논쟁될 것임을 보장했습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:copyright-law·artificial-intelligence·class-action·openai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사