NYT 대 OpenAI 소송

영어에서 번역됨

NYT 대 OpenAI 소송은 2023년 12월 The New York Times가 OpenAI와 Microsoft를 상대로 제기한 저작권 침해 사건으로, 자사 기사가 대규모 언어 모델 훈련에 무단 사용되었다고 주장합니다. 이 사건은 공정 사용과 생성형 AI에 관한 핵심 법적 쟁점을 제기합니다.

뉴욕타임스 컴퍼니는 2023년 12월 27일 뉴욕 남부 연방지방법원에 OpenAI와 마이크로소프트를 상대로 소송을 제기했다. 소장은 피고들이 수백만 건의 저작권 보호를 받는 뉴스 기사를 허가 없이 사용하여 대규모 언어 모델을 훈련시켰고, 그 결과물인 시스템이 신문사의 자체 콘텐츠와 경쟁한다고 주장한다. 이 사건은 생성형 AI와 저작권법의 교차점을 둘러싼 가장 주목받는 법적 공방 중 하나로, 인공지능 산업 전체에 영향을 미칠 수 있다.

소송은 직접 및 간접 저작권 침해 주장과 디지털 밀레니엄 저작권법 위반을 중심으로 한다. 타임스는 법정 손해배상, 금지 명령, 그리고 자사 저작물이 포함된 모델과 훈련 데이터셋의 폐기를 요구한다. OpenAI와 마이크로소프트는 기사 사용이 미국 저작권법상 공정 이용에 해당한다며 기각 신청으로 대응했으며, 이 항변은 2025년 초 현재 법원에서 완전히 해결되지 않은 상태다.

배경 및 당사자

1851년에 설립된 뉴욕타임스는 미국에서 가장 크고 영향력 있는 신문 중 하나로, 2023년 기준 디지털 구독 기반이 1,000만 명을 넘는다. 그 비즈니스 모델은 독점 보도와 유료 콘텐츠에 크게 의존한다. 2015년에 설립된 OpenAI는 GPT-3와 GPT-4를 포함한 GPT 시리즈 모델을 개발한 선도적인 AI 연구 기관으로, ChatGPT와 같은 제품을 구동한다. 마이크로소프트는 130억 달러 규모로 보고된 투자를 통해 OpenAI의 주요 투자자이며, Azure를 통해 클라우드 인프라를 제공하고 OpenAI의 모델을 자사 빙 검색 엔진과 오피스 생산성 제품군에 통합한다.

소장은 ChatGPT와 빙 채팅이 타임스 기사를 허가나 출처 표시 없이, 종종 유료화된 콘텐츠 뒤에서 거의 그대로 재생산한 100개 이상의 구체적인 사례를 제시한다. 타임스는 이로 인해 사용자가 구독 없이 AI 시스템에서 동일한 정보를 얻을 수 있게 되어 자사 저널리즘의 수익화 능력이 훼손된다고 주장한다.

법적 주장 및 혐의

주요 주장은 저작권 침해로, 피고들이 모델 훈련 과정에서 타임스 기사를 복제, 재생산, 배포했다는 것이다. 소장은 훈련 과정이 인터넷에서 수집된 방대한 텍스트 코퍼스를 흡수하는 것을 포함하며, 여기에는 수백만 건의 타임스 기사가 포함되었다고 상세히 설명한다. 타임스는 또한 모델이 자사 기사와 실질적으로 유사한 출력물을 생성할 수 있으며, 때로는 정확한 문장이나 단락을 포함한다고 주장한다.

소송은 또한 간접 침해를 주장하며, OpenAI와 마이크로소프트가 저작권 콘텐츠를 재생산하도록 모델을 유도한 사용자의 침해 행위로부터 직접 이익을 얻었다고 주장한다. 추가로 타임스는 디지털 밀레니엄 저작권법에 따른 주장을 제기하며, 피고들이 훈련 과정에서 필자 이름과 저작권 고지와 같은 저작권 관리 정보를 제거하거나 변경했다고 주장한다.

피고 측 항변

OpenAI와 마이크로소프트는 2024년 2월 기각 신청을 제기하며, 소송이 추측성 주장에 기반하며 저작권 있는 저작물을 훈련에 사용하는 것은 변형적 공정 이용이라고 주장했다. 그들은 모델이 원본 기사의 시장을 대체하는 것이 아니라 정보 종합을 위한 새로운 도구 역할을 한다고 주장한다. 피고들은 또한 타임스 기사가 온라인에서 공개적으로 접근 가능했으며, 훈련 과정이 직접 복제보다는 통계적 패턴을 포함한다는 점을 지적한다.

OpenAI는 제출 서류에서 출처 표시를 제공하고 훈련에서 제외할 수 있도록 발행자에게 선택권을 준 노력을 강조했지만, 타임스는 이러한 조치가 침해가 발생한 후에야 이루어졌으며 불충분하다고 주장한다. 피고들은 또한 타임스 자체가 다양한 목적으로 AI 도구를 사용한다는 점을 언급하며, 이는 기술에 대한 어느 정도의 수용을 시사한다고 주장한다.

산업 맥락 및 관련 사건

이 소송은 AI 기업을 둘러싼 더 광범위한 저작권 분쟁의 일부다. 2023년에는 사라 실버먼과 조지 R.R. 마틴을 포함한 작가들이 OpenAI와 다른 기업을 상대로 집단 소송을 제기했으며, 시각 예술가들은 스태빌리티 AI와 미드저니를 상대로 소송을 제기했다. 게티 이미지는 영국과 미국에서 스태빌리티 AI를 상대로 별도의 소송을 제기했다. 이러한 사건들은 저작권 있는 데이터에 대한 훈련이 공정 이용을 구성하는지, 그리고 AI 생성 출력물이 기존 저작물을 침해할 수 있는지에 대한 공통된 질문을 공유한다.

NYT 사건의 결과는 기계 학습 맥락에서 법원이 공정 이용을 어떻게 해석할지에 대한 선례를 설정할 수 있다. 법학자들은 Authors Guild v. Google과 같은 사건에서 확립된 변형적 이용 원칙이 항변의 핵심이 될 수 있다고 지적한다. 그러나 OpenAI 제품의 상업적 성격과 타임스에 대한 잠재적 시장 피해는 이 사건을 이전 선례와 구별한다.

훈련 데이터의 기술적 측면

대규모 언어 모델의 훈련은 책, 웹사이트, 뉴스 기사를 포함한 다양한 출처의 수십억 단어를 입력하는 것을 포함한다. 2020년에 출시된 OpenAI의 GPT-3는 페타바이트 규모의 웹 페이지를 포함하는 Common Crawl이라는 데이터셋으로 훈련되었다. 타임스는 자사 기사가 이 데이터셋과 이후 데이터셋에 무단으로 포함되었다고 주장한다. 기술적 과정은 트랜스포머멀티 헤드 어텐션과 같은 기법을 사용하여 텍스트를 수치 표현으로 변환하는 것을 포함하며, 이를 통해 모델이 패턴을 학습하고 일관된 응답을 생성할 수 있다.

OpenAI는 훈련 데이터에 공개적으로 접근 가능한 웹 콘텐츠가 포함되어 있음을 인정했지만 데이터셋의 전체 구성을 공개하지는 않았다. 회사는 저작권 있는 텍스트의 축어적 재생산 가능성을 줄이기 위한 필터를 구현했지만, 타임스의 소장은 이러한 필터가 실패한 사례를 제공한다. 이 사건은 더 투명한 데이터 소싱의 필요성과 AI 기업과 콘텐츠 제작자 간의 라이선스 계약 가능성에 대한 논의를 촉발했다.

절차적 경과 및 현황

최초 제기 후, 법원은 이 사건을 OpenAI를 상대로 한 다른 관련 저작권 소송과 재판 전 목적으로 병합했지만, 타임스 사건은 별개로 유지된다. 2024년 3월, 판사는 피고들의 기각 신청을 부분적으로 기각하며 핵심 저작권 주장은 진행을 허용하고 일부 2차 주장은 기각했다. 2025년 초 현재, 당사자들은 증거 개시 절차에 참여 중이며, 타임스는 OpenAI의 훈련 데이터와 내부 통신에 대한 접근을 요구하고 있다.

2024년 11월에는 OpenAI가 타임스를 상대로 반소를 제기하며, 신문사가 계약자를 고용하여 ChatGPT가 저작권 있는 자료를 재생산하도록 조작함으로써 플랫폼 이용 약관을 위반했다고 주장하는 중요한 발전이 있었다. 타임스는 이러한 주장을 핵심 문제에서 주의를 돌리기 위한 것이라며 부인했다. 이 사건은 2025년 후반 재판이 예정되어 있지만, 양측의 높은 이해관계를 고려할 때 합의 가능성도 남아 있다.

저널리즘과 AI에 대한 영향

이 소송은 디지털 경제에 적응하는 데 어려움을 겪어 온 뉴스 산업에 중요한 영향을 미친다. 많은 발행자가 OpenAI와 악셀 슈프링어, AP 통신, 뉴스 코프 간의 계약과 같은 AI 기업과의 라이선스 계약을 체결했다. 그러나 타임스는 라이선스만으로는 무단 사용의 근본적 피해를 해결하지 못한다고 주장하며 소송을 선택했다. 이 사건은 AI 기업이 제품의 기반이 되는 데이터에 대해 비용을 지불해야 하는지 여부를 결정할 수 있으며, 저널리즘과 AI 개발의 경제학을 재편할 잠재력이 있다.

AI 산업의 경우, 불리한 판결은 기업이 훈련 관행을 개편하도록 강요하여 데이터셋 규모를 제한하고 비용을 증가시킬 수 있다. 반대로 OpenAI에 유리한 판결은 광범위한 공정 이용 보호를 확립하여 추가 혁신을 장려하지만 콘텐츠 제작자 사이에서 우려를 제기할 수 있다. 이 사건은 AI의 법적 및 윤리적 차원을 연구하는 MIT CSAIL스탠포드 AI 랩과 같은 기관의 연구자들이 면밀히 주시하고 있다.

대중 및 학계 반응

소송에 대한 여론은 분분하다. 언론인과 미디어 옹호자들은 일반적으로 타임스를 지지하며, 이를 지적 재산의 수호이자 양질의 저널리즘 지속 가능성으로 본다. 기술 애호가와 일부 AI 연구자들은 제한적인 저작권 판결이 진보를 저해할 수 있다고 주장하며, 기존 저작물을 사용하여 새로운 지식을 창조해 온 오랜 역사를 지적한다. 법률 전문가들은 관련 질문의 참신성과 중요성을 고려할 때 이 사건이 궁극적으로 대법원에 도달할 수 있다고 지적한다.

학자들은 또한 AI 맥락에서 공정 이용 개념을 논의하며, 혁신과 창작자 권리의 균형을 맞추는 새로운 프레임워크를 제안하고 있다. 이 사건은 신경망이 훈련 데이터를 암기하는 방식과 재생산이 발생하는 조건에 대한 분석을 포함한 학술 회의와 논문을 촉발했다. 이러한 연구는 사법적 결정과 향후 입법에 정보를 제공할 수 있다.

잠재적 결과 및 향후 방향

여러 잠재적 결과가 가능하다. 법원이 저작권 있는 저작물에 대한 훈련이 공정 이용이라고 판결할 수 있으며, 이는 더 많은 라이선스 협상으로 이어질 수 있지만 의무적 지불은 아닐 것이다. 대안적으로 법원이 침해를 인정하여 OpenAI가 손해배상을 지불하고 모델을 폐기해야 할 수 있으며, 이는 전례가 없고 파괴적일 것이다. 중간 지점은 훈련을 허용하지만 축어적 재생산에 대한 더 강력한 보호 장치를 요구하거나 라이선스 체제를 의무화하는 판결일 수 있다.

법정 밖에서도 이 사건은 훈련 데이터 출처 공개를 요구하는 AI 기반 모델 투명성 법안과 같은 입법 제안을 촉발했다. 2024년에 통과된 유럽 연합의 AI 법은 훈련 데이터에 대한 저작권 준수 조항을 포함한다. 이러한 규제 노력은 사건별 소송의 필요성을 줄이는 프레임워크를 제공할 수 있다. 따라서 NYT 대 OpenAI 소송은 AI의 이점과 창작자 권리의 균형을 사회가 어떻게 맞출지에 대해 향후 수년간 영향을 미칠 기념비적인 사건으로 자리 잡고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:copyright-infringement·generative-ai·legal-case·journalism
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사