NYT v. OpenAI (2023)는 2023년 12월 27일 뉴욕 남부 연방 지방 법원에 뉴욕 타임스 컴퍼니가 OpenAI와 주요 투자자인 마이크로소프트를 상대로 제기한 획기적인 저작권 침해 소송입니다. 소장은 OpenAI와 마이크로소프트가 허가 없이 수백만 개의 저작권 보호를 받는 뉴스 기사를 사용하여 GPT-4 및 ChatGPT를 포함한 대규모 언어 모델을 훈련시켰고, 이 모델들이 이제 신문사의 자체 제품과 직접 경쟁하는 방식으로 타임스 콘텐츠를 재생산하고 "기억"한다고 주장합니다. 이 소송은 침해된 저작물당 최대 15만 달러의 법정 손해 배상, 타임스 콘텐츠의 추가 사용에 대한 금지 명령, 그리고 그러한 자료를 포함한 모든 훈련 데이터 세트의 파괴를 요구합니다.
이 사건은 생성형 AI 산업과 콘텐츠 창작자 간의 광범위한 갈등을 예고하는 시금석으로 널리 여겨집니다. 이는 "공정 사용" 원칙이 모델 훈련을 위한 저작권 텍스트의 대량 수집에 적용되는지 여부를 시험하기 때문입니다. 그 결과는 AI 개발의 경제학을 재편하여 기업들이 라이선스 계약을 협상하거나 훈련 파이프라인을 재설계하도록 강요할 수 있습니다. 2025년 초 현재, 이 사건은 양측이 기각 신청과 반소를 제기한 상태로 재판 전 소송 단계에 남아 있습니다.
배경: 생성형 AI와 데이터 수집의 부상
이 소송은 딥러닝의 급속한 발전과 트랜스포머 기반 모델의 상업적 배포라는 배경 속에서 등장했습니다. 2015년에 설립된 OpenAI는 2020년에 GPT-3를 출시하고 2022년 11월에 ChatGPT를 출시하여 역사상 가장 빠르게 성장하는 소비자 애플리케이션 중 하나가 되었습니다. 이러한 모델은 뉴스 기사, 서적, 학술 논문을 포함하여 공개 인터넷에서 수집된 방대한 텍스트 말뭉치로 훈련됩니다. 타임스는 주로 유료화된 자사 콘텐츠가 허가 없이 이러한 데이터 세트에 등장했으며, 종종 훈련 자료의 상당 부분을 차지할 만큼 많은 양이 포함되었다고 주장합니다.
OpenAI에 130억 달러 이상을 투자하고 Bing Chat 및 Office 365와 같은 제품에 자사 모델을 통합한 마이크로소프트는 주장된 침해 시스템을 배포하고 이익을 얻은 역할로 공동 피고로 지명되었습니다. 소장은 ChatGPT가 타임스 기사에서 거의 그대로 인용한 예를 구체적으로 언급하는데, 여기에는 2019년 택시 산업 조사와 2020년 모기지 금리에 관한 기사가 포함되어 모델이 요청 시 저작권 텍스트를 재생산할 수 있음을 보여줍니다.
법적 주장과 요구 사항
타임스는 직접 저작권 침해, 기여 침해, 대리 침해를 포함한 여러 소송 원인을 주장합니다. OpenAI와 마이크로소프트가 훈련 및 추론 중에 자사 저작물을 복사, 저장, 배포했으며 모델의 출력이 무단 파생 저작물을 구성한다고 주장합니다. 소장은 피고들이 "다른 사람의 작업을 등에 업고 사업을 구축했다"고 강조하며 타임스가 AI 회사들이 무료로 전용한 저널리즘에 수십억 달러를 지출했다고 밝힙니다.
금전적 손해 배상 외에도 타임스는 OpenAI와 마이크로소프트가 훈련 데이터 세트에서 타임스 콘텐츠의 모든 사본을 삭제하고 향후 사용을 방지하도록 요구하는 영구 금지 명령을 요청합니다. 이 요구는 규모 면에서 전례가 없으며, 회사들이 수억 달러의 비용이 들고 모델 품질을 저하시킬 수 있는 처음부터 모델을 재훈련하도록 사실상 강요할 것입니다. 타임스는 또한 피고들에게 훈련 데이터 출처를 공개하고 향후 침해를 방지하기 위한 기술적 조치를 구현하도록 명령하는 것을 요구합니다.
OpenAI의 방어: 공정 사용과 공익
OpenAI는 2024년 2월에 답변을 제출하여 저작권 자료 사용이 비평, 논평, 뉴스 보도, 교육, 연구와 같은 목적을 위한 제한적 복제를 허용하는 공정 사용 예외에 해당한다고 주장했습니다. 회사는 AI 모델 훈련이 원본 저작물을 대체하지 않는 변형적 사용이며, 모델이 특정 텍스트를 암기하기보다는 패턴과 사실을 학습한다고 주장합니다. OpenAI는 또한 웹사이트 소유자가 자사 웹 크롤러를 차단할 수 있는 "옵트아웃" 메커니즘과 AP 및 Axel Springer와 같은 다른 출판사와의 진행 중인 파트너십을 지적하며 지적 재산을 존중하려는 선의의 노력의 증거로 삼습니다.
마이크로소프트는 이러한 주장을 반영하여 모델이 기존 기사를 재생산하는 도구가 아니라 새로운 콘텐츠를 생성하는 도구라고 강조했습니다. 피고들은 또한 타임스 자체가 다양한 목적으로 AI 도구를 사용했으며 신문사의 소송은 경쟁을 억압하려는 시도라고 지적합니다. 법률 학자들은 이러한 방어의 강도에 대해 의견이 분분하며, 일부는 복사의 규모와 사용의 상업적 성격이 공정 사용에 불리하게 작용한다고 주장하고, 다른 일부는 기계 학습의 변형적 성격을 설득력 있는 정당화로 지적합니다.
업계 반응과 병행 소송
타임스 소송은 AI 회사들을 상대로 한 일련의 소송의 일부입니다. 2023년에는 Sarah Silverman, Christopher Golden, Richard Kadrey를 포함한 작가들이 OpenAI와 메타를 상대로 집단 소송을 제기했으며, 코미디언 Sarah Silverman의 사건은 나중에 다른 사건들과 통합되었습니다. Getty Images는 이미지 생성기 훈련에 자사 사진을 사용한 것에 대해 영국과 미국에서 Stability AI를 고소했습니다. 2024년에는 작가 길드가 OpenAI를 상대로 집단 소송을 제기했고, Chicago Tribune과 New York Daily News를 포함한 여러 신문사가 OpenAI와 마이크로소프트를 상대로 별도의 소송에 합류했습니다.
이러한 사건들은 업계에서 다양한 반응을 촉발했습니다. Anthropic 및 Google DeepMind와 같은 일부 회사는 출판사로부터 콘텐츠를 라이선스하기 시작했으며, 다른 회사는 음악 스트리밍에 사용되는 것과 유사한 법정 라이선스 제도를 주장했습니다. 미국 저작권청은 2023년 AI와 저작권에 관한 공개 조사를 시작했고, 유럽 연합은 2024년 훈련 데이터에 대한 투명성 요구 사항을 포함하는 AI 법을 통과시켰습니다. 타임스 사건의 결과는 이러한 모든 노력에 영향을 미칠 수 있는 선례를 설정할 수 있습니다.
주요 법적 쟁점과 선례
핵심 법적 질문은 저작권 텍스트로 AI 모델을 훈련하는 것이 공정 사용을 구성하는지 여부입니다. 법원은 역사적으로 네 가지 요소 테스트를 적용해 왔습니다: 사용의 목적과 성격, 저작권 저작물의 성격, 사용된 부분의 양과 실질성, 잠재적 시장에 미치는 영향. 2015년 Authors Guild v. Google 사건에서 제2순회 항소 법원은 검색을 위한 Google의 책 디지털화가 공정 사용이라고 판결했지만, 그 사건은 제한된 발췌문과 비상업적 목적을 포함했습니다. 타임스는 자사 기사가 고도로 창의적이고 표현적이며, 피고들이 전체 저작물을 복사했고, ChatGPT가 요약과 발췌문을 생성할 수 있는 능력이 타임스의 라이선스 수익과 구독 사업에 직접적인 해를 끼친다고 주장합니다.
또 다른 핵심 쟁점은 "암기" 문제입니다. OpenAI는 대규모 언어 모델이 특히 특정 방식으로 프롬프트될 때 훈련 데이터를 그대로 재생산할 수 있음을 인정했습니다. 타임스의 소장에는 이러한 출력의 예가 포함되어 있으며, 회사는 이것이 변형적이기보다는 일괄 복사의 한 형태라고 주장합니다. 피고들은 이러한 사례가 드물고 모델이 암기보다는 일반화하도록 설계되었다고 반박합니다. 전문 증인들은 모델 훈련의 기술적 세부 사항과 재생산 가능성에 대해 양측에서 증언할 것으로 예상됩니다.
절차적 역사와 현재 상태
소장이 제출된 후 법원은 사건을 Sidney H. Stein 판사에게 배정했습니다. 2024년 초, OpenAI와 마이크로소프트는 타임스가 특정 침해 출력을 식별하지 않았기 때문에 직접 침해를 적절히 주장하지 않았다고 주장하며 기각 신청을 제기했습니다. 타임스는 2024년 3월에 소장을 수정하여 더 많은 예를 추가하고 주장을 명확히 했습니다. 2024년 7월, Stein 판사는 기각 신청을 기각하여 사건이 증거 개시 절차로 진행되도록 허용했습니다. 이 판결은 피고들의 사건이 너무 추측적이라는 주장을 기각했기 때문에 타임스에게 중요한 승리로 간주되었습니다.
증거 개시 절차는 논쟁이 될 것으로 예상되며, 타임스는 OpenAI의 훈련 데이터와 데이터 소싱에 관한 내부 통신에 대한 접근을 요구하고 있습니다. OpenAI는 영업 비밀과 방대한 데이터 세트 생산의 부담을 이유로 일부 요청에 저항했습니다. 법원은 또한 양측에 잠재적 합의에 대해 논의하도록 명령했지만, 2025년 초 현재 합의에 도달하지 못했습니다. 재판 날짜는 설정되지 않았지만, 법률 관찰자들은 2025년 말 또는 2026년에 시작될 수 있다고 추정합니다.
AI 개발에 대한 광범위한 영향
이 사건은 양 당사자 너머의 영향을 미칩니다. 타임스가 승소하면 AI 회사들은 모든 저작권 훈련 데이터에 대한 라이선스를 획득해야 할 수 있으며, 이는 비용을 증가시키고 혁신을 둔화시킬 수 있습니다. 일부 스타트업은 공개 도메인 또는 합성 데이터만 사용하도록 전환할 수 있으며, 대기업은 독점 데이터 세트나 출판사와의 파트너십에 투자할 수 있습니다. 이 사건은 또한 스크랩된 데이터에 크게 의존하고 라이선스 요구 사항을 준수할 자원이 없을 수 있는 오픈 소스 모델의 개발에 영향을 미칠 수 있습니다.
반대로 OpenAI가 승소하면 허가 없이 저작권 자료를 훈련에 사용하는 관행을 합법화하여 더 공격적인 스크래핑과 창작자에 대한 보상 감소로 이어질 수 있습니다. 이 결과는 AI 생성 콘텐츠로의 추세를 가속화하여 전통적인 미디어 회사에 더 큰 압력을 가할 수 있습니다. 따라서 이 사건은 기계 학습 시대에 지적 재산의 경계를 정의하는 데 도움이 될 것이므로 기술자, 변호사, 언론인 모두가 면밀히 주시하고 있습니다.
결론
NYT v. OpenAI (2023)는 생성형 AI 시대의 정의적인 법적 전투입니다. 이는 기계가 대규모로 텍스트를 생성할 수 있는 세계에서 저자성, 소유권, 인간 창의성의 가치에 대한 근본적인 질문을 제기합니다. 사건의 해결은 사법적 판결이나 합의를 통해 AI 연구, 미디어 경제, 저작권법의 미래를 수십 년 동안 형성할 것입니다. 소송이 진행됨에 따라 신경망과 기계 학습의 급속한 발전은 단지 기술적 이야기일 뿐만 아니라 기술 발전의 혜택을 누리는 사람과 비용을 부담하는 사람에 관한 깊이 인간적인 이야기임을 상기시켜 줍니다.