Kadrey 대 Meta Platforms

영어에서 번역됨

Kadrey v. Meta Platforms는 저자들이 Meta를 상대로 제기한 저작권 침해 소송으로, Meta가 자사의 LLaMA 대규모 언어 모델을 훈련시키는 데 불법 복제된 도서를 사용한 것에 대해 무단 복제 및 배포를 주장하는 사건이다.

Kadrey v. Meta Platforms는 2023년 미국 캘리포니아 북부지방법원에 제기된 민사 소송이다. 원고인 리처드 캐드레이(Richard Kadrey), 세라 실버만(Sarah Silverman), 크리스토퍼 골든(Christopher Golden)을 포함한 작가 그룹은 메타 플랫폼(Meta Platforms, Inc.)이 자사의 대규모 언어 모델 제품군인 LLaMA(Large Language Model Meta AI)을 훈련시키기 위해 저서의 불법 복제본을 사용하여 저작권을 침해했다고 주장한다. 이 사건은 생성형 인공지능 시스템 개발자를 상대로 한 광범위한 소송 물결의 일부로, 명시적 허가 없이 저작권 있는 텍스트를 모델 훈련에 사용하는 것의 합법성에 대한 의문을 제기한다.

이 소송은 메타가 195,000권 이상의 책을 포함하고 있으며, 그중 다수가 섀도우 라이브러리인 비블리오틱(Bibliotik)에서 출처를 둔 "북스3(Books3)"라는 데이터셋을 사용한 것에 초점을 맞춘다. 원고들은 메타가 LLaMA 1 및 LLaMA 2를 포함한 LLaMA 모델을 훈련시키기 위해 이 데이터셋을 다운로드하고 사용했으며, 저자들의 허가를 받거나 보상하지 않았다고 주장한다. 이 사건은 특히 공정 이용(fair use) 원칙과 관련하여 기계 학습에 저작권법을 적용하는 데 있어 핵심적인 시험대가 되고 있다.

배경 및 당사자

주요 원고인 리처드 캐드레이는 샌드맨 슬림(Sandman Slim) 어반 판타지 시리즈로 알려진 미국 작가이다. 코미디언이자 작가인 세라 실버만과 공포 및 판타지 작가인 크리스토퍼 골든이 소송에 합류했다. 소장은 2023년 7월 7일에 제출되었으며, 이후 작가 폴 트렘블레이(Paul Tremblay)가 제기한 사건을 포함한 유사한 소송과 병합되었다. 피고는 메타 플랫폼과 LLaMA 모델을 개발한 자회사 메타 AI(Meta AI)이다.

원고들은 여러 AI 기업을 상대로 소송을 제기한 조셉 사베리 법률 사무소(Joseph Saveri Law Firm)가 대리한다. 메타는 깁슨 던 앤 크러처(Gibson, Dunn & Crutcher)의 변호사들이 대리한다. 이 사건은 다른 AI 저작권 분쟁도 담당하는 재클린 스콧 콜리(Jacqueline Scott Corley) 판사에게 배정되었다.

저작권 침해 주장

핵심 주장은 메타가 훈련 과정에서 허가 없이 저작권 있는 책을 복제하고 배포했다는 것이다. 원고들은 LLaMA 모델이 프롬프트를 받으면 자신들의 책에 있는 구절과 매우 유사한 텍스트를 생성할 수 있으며, 이는 모델이 저작권 있는 자료를 암기하고 재생산할 수 있음을 보여준다고 주장한다. 또한 AI 중심 플랫폼인 디 아이(The Eye)의 사용자가 만든 북스3 데이터셋이 불법 복제된 책을 포함하고 있다는 사실이 널리 알려져 있었기 때문에 메타의 사용은 고의적 침해라고 주장한다.

소장은 모델이 캐드레이의 소설 "샌드맨 슬림"과 실버만의 회고록 "더 베드웨터(The Bedwetter)"의 발췌문과 일치하는 텍스트를 생성한 구체적인 예를 인용한다. 원고들은 이러한 복제가 직접 및 대위 침해를 구성하며, 메타가 침해 데이터셋의 생성을 용이하게 했기 때문에 기여 침해에도 해당한다고 주장한다.

메타의 방어 및 공정 이용 주장

메타의 주요 방어는 AI 모델을 저작권 있는 텍스트로 훈련시키는 것이 미국 저작권법 제107조에 따른 공정 이용에 해당한다는 것이다. 회사는 모델이 책 전체를 복제하는 것이 아니라 통계적 패턴과 언어 구조를 학습하기 때문에 사용이 전환적(transformative)이라고 주장한다. 또한 훈련 과정은 인간이 책을 읽고 배우는 것과 유사하며, 모델이 시장에서 원저작물과 경쟁하지 않는다고 주장한다.

메타는 원고들이 모델이 저작권 있는 저작물의 상당 부분을 출력한다는 것을 입증하지 못했다며 소송 각하를 신청했다. 회사는 또한 LLaMA 모델이 오픈소스이고 훈련 데이터가 공개적으로 배포되지 않는다는 점을 지적하며, 이는 시장 피해를 제한한다고 주장한다.

절차적 경과

2023년 7월 최초 제출 이후, 법원은 여러 관련 사건을 대표 사건 번호 3:23-cv-03417로 병합했다. 2023년 11월, 콜리 판사는 직접 침해 주장에 대한 메타의 각하 신청을 기각했지만, 대위 및 기여 침해에 관한 원고들의 소장 수정을 허용했다. 원고들은 2023년 12월에 더 구체적인 주장을 추가한 수정 소장을 제출했다.

2024년 2월, 메타는 수정 소장에 대한 새로운 각하 신청을 제기했으며, 2024년 5월에 부분적으로 인용되었다. 법원은 기여 침해 주장을 기각했지만 직접 침해 및 대위 책임 주장은 진행을 허용했다. 양측은 메타의 내부 통신 및 훈련 데이터 문서를 요구하며 증거 개시(discovery)가 진행 중이다.

AI 저작권 소송의 광범위한 맥락

이 사건은 AI 개발자를 상대로 한 여러 주목할 만한 소송 중 하나이다. 작가들이 오픈AI(OpenAI)와 앤트로픽(Anthropic)을 상대로 유사한 소송을 제기했으며, 코미디언 세라 실버만이 주도한 집단 소송(일부는 나중에 기각됨)과 작가들이 구글(Google)의 제미니(Gemini) 모델을 상대로 제기한 소송도 포함된다. 이러한 사건들의 결과는 생성형 AI의 법적 환경을 형성할 것으로 예상되며, 기업들이 훈련 데이터를 수집하는 방식과 저작권 있는 저작물에 대한 라이선스를 취득해야 하는지에 영향을 미칠 수 있다.

미국 저작권청(US Copyright Office)도 이 문제를 연구 중이며, 2023년에는 AI와 저작권의 교차점에 대한 공개 의견을 요청하는 조사 통지(notice of inquiry)를 발행했다. 사무청은 아직 최종 지침을 발표하지 않았지만, 보고서에서 저자를 보호하면서 기술 혁신을 허용하는 균형 잡힌 접근 방식의 필요성을 강조했다.

주요 법적 쟁점

이 사건은 여러 미해결 법적 질문을 제기한다. 첫째, 훈련 중 저작권 있는 저작물의 복제가 일시적이고 직접 배포되지 않더라도 법적 의미의 "복제"를 구성하는지 여부. 둘째, AI 모델의 전환적 성격이 모델이 새 텍스트를 생성할 수 있지만 구절을 암기하고 재생산할 수도 있다는 점을 고려할 때 공정 이용에 유리하게 작용하는지 여부. 셋째, AI 모델이 원저작물을 대체할 수 있는 텍스트를 생성할 수 있다면 저자에 대한 시장 피해가 중대한지 여부.

법원은 역사적으로 공정 이용에 대한 4요소 테스트를 적용해 왔으며, 사용의 목적과 성격, 저작권 있는 저작물의 성격, 사용된 양, 시장에 미치는 영향을 고려한다. 관련 사건인 Authors Guild v. Google (2015)에서 제2순회 항소법원은 검색을 위한 구글의 도서 디지털화가 공정 이용이라고 판결했지만, 해당 사건은 스니펫의 제한적 표시를 다루었다. 캐드레이 사건은 더 광범위한 복제를 포함하므로 다른 결과를 초래할 수 있다.

잠재적 결과 및 영향

원고가 승소할 경우, 메타는 저작물당 최대 150,000달러의 법정 손해배상을 지급해야 할 수 있으며, 데이터셋의 책 수를 고려하면 수십억 달러에 달할 수 있다. 회사는 LLaMA 모델을 폐기하거나 라이선스 데이터로 재훈련하라는 명령을 받을 수도 있다. 이러한 판결은 AI 개발에 위축 효과를 가져와 기업들이 모든 훈련 데이터에 대한 라이선스를 취득하도록 강요할 수 있으며, 이는 비용이 많이 들고 시간이 많이 소요될 것이다.

반대로, 메타가 공정 이용으로 승소하면 AI 훈련이 저작권 있는 텍스트에 허용된다는 광범위한 선례를 확립하여 대규모 언어 모델 개발을 가속화할 수 있다. 이는 다른 진행 중인 사건에도 영향을 미치고 더 많은 기업이 보상 없이 스크랩된 데이터를 사용하도록 장려할 수 있다.

현재 상태 및 향후 절차

2024년 말 현재, 이 사건은 증거 개시 단계에 있다. 양측은 문서를 교환하고 증언을 채택하고 있다. 재판 날짜는 정해지지 않았지만, 법률 분석가들은 2025년에 약식 판결 신청으로 진행될 것으로 예상한다. 법원은 집단 소송 인증을 결정할 수도 있으며, 이는 원고 그룹을 북스3 데이터셋에 포함된 모든 저작자로 확대할 것이다.

이 사건은 원고를 지지하는 작가 길드(Authors Guild)와 유사한 사건에서 공정 이용을 주장하는 브리핑을 제출한 전자 프론티어 재단(Electronic Frontier Foundation)을 포함한 여러 조직의 의견서(amicus briefs)를 끌어모았다. 결과는 지방 법원의 결정과 관계없이 항소될 가능성이 높으며, 궁극적으로 대법원에 도달할 수 있다.

AI 산업에 대한 중요성

캐드레이 사건은 AI 산업의 바로미터이다. 이는 허용 가능한 훈련 데이터의 한계와 LLaMA와 같은 모델의 오픈소스 특성이 법적 분석을 바꾸는지 여부를 시험한다. 이 사건은 또한 혁신과 지적 재산권 사이의 긴장을 부각시키며, 이는 Artificial intelligenceGenerative AI의 미래에 중심적인 논쟁이다.

OpenAIAnthropic과 같은 기업들은 유사한 소송에 직면해 있기 때문에 이 절차를 면밀히 주시하고 있다. 결과는 이들이 출판사 및 작가와 라이선스 계약을 협상하는 방식과 저작권 있는 자료를 피하는 대체 훈련 방법에 투자할지 여부에 영향을 미칠 수 있다. 이 사건은 또한 많은 학술 데이터셋이 저작권 있는 텍스트를 포함하고 있기 때문에 Machine learning 연구에도 영향을 미친다.

한편, 메타는 추가 저작권 있는 저작물을 포함할 수 있는 더 큰 데이터셋으로 훈련된 LLaMA 3를 포함한 새로운 버전의 LLaMA를 계속 출시하고 있다. 회사는 지적 재산권을 존중하겠다고 밝혔지만, 영업 비밀을 이유로 훈련 데이터의 전체 내용을 공개하지 않았다.

결론

Kadrey v. Meta Platforms는 AI 훈련의 법적 경계를 정의하는 데 도움이 될 획기적인 사건이다. 이 결정은 저자, 기술 기업 및 대중에게 광범위한 영향을 미칠 것이다. 사건이 아직 진행 중이지만, 그 결과는 Large language model 및 기타 Neural network 시스템에 저작권법을 적용하는 방식에 영향을 미치는 선례를 설정할 가능성이 높다. 법원의 판결은 창작 저작물 보호와 기술 발전 촉진 사이의 균형에 관한 근본적인 질문을 다루기 때문에 법률 학자, 정책 입안자 및 업계 이해 관계자들이 면밀히 검토할 것이다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:copyright-law·artificial-intelligence·litigation·meta-platforms
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사