Authors Guild v. OpenAI 소송은 2023년 9월에 제기된 인공지능과 생성형 AI 분야에서 중요한 법적 도전입니다. 이 소장은 Authors Guild가 John Grisham, George R.R. Martin 등 저명한 소설가들을 대표하여 제출한 것으로, OpenAI의 대규모 언어 모델이 저작권자의 허가 없이 저작물을 학습에 사용하여 미국 저작권법상 저작자의 권리를 침해했다고 주장합니다. 이 사건은 기계 학습과 지적 재산권의 교차점을 둘러싼 진행 중인 법적 논쟁의 중심에 서 있으며, AI 시스템의 학습 데이터 수집은 종종 책, 기사 및 기타 보호 대상 저작물을 포함한 방대한 텍스트 코퍼스를 복제하거나 인용하는 것을 수반하기 때문입니다.
분쟁의 핵심에는 Transformer (architecture) 기반 모델을 방대한 데이터 세트로 학습시키는 관행이 있습니다. 소장은 저작자의 저작물을 모델 학습과 해당 저작물을 밀접하게 모방하거나 재현할 수 있는 출력 생성에 무단 사용하는 것이 창작 노동의 직접적인 몰수에 해당한다고 주장합니다. 원고들은 손해 배상 및 회사에 대한 금지 명령을 포함한 다양한 구제책을 요구하며, 이는 AI 기술의 혁신과 원저작자에게 부여된 보호 사이의 증가하는 긴장을 강조합니다.
배경: 대규모 언어 모델의 부상
문제가 되는 시스템의 기술적 기반에는 신경망 아키텍처인 Transformer (architecture)가 포함됩니다. 2017년 논문 'Attention Is All You Need'에서 Google DeepMind와 Jakob Uszkoreit, Lukasz Kaiser 및 동료들이 처음 제안한 연구에서 소개된 트랜스포머는 Multi-Head Attention 및 Positional Encoding과 같은 메커니즘을 활용하여 순차 데이터를 처리함으로써 자연어 이해와 생성의 돌파구를 가능하게 했습니다. OpenAI의 GPT 시리즈 모델(GPT-3, GPT-4 포함)은 이러한 트랜스포머를 기반으로 하며 웹 텍스트, 책, 학술 논문 등을 포함한 방대한 코퍼스로 학습되어 인간과 유사한 텍스트를 생성합니다.
학습 데이터의 규모는 모델의 성능에 핵심적입니다. 대규모 언어 모델은 Adam (Optimizer)와 같은 알고리즘과 다음 단어 예측 작업의 오류를 최소화하기 위해 수십억 개의 매개변수를 조정하는 변형을 사용하여 학습됩니다. Data Augmentation 및 Batch Normalization과 같은 더 넓은 기계 학습 분야의 기술(트랜스포머에서는 덜 자주 사용되지만)은 미니 모델 학습 파이프라인에 기여합니다. 그런 다음 모델은 사용자 기대에 맞춰 정렬을 개선하기 위해 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 또는 인간 피드백을 사용하여 미세 조정되기도 합니다.
원고와 그들의 주장
Authors Guild가 집단 소송으로 제기한 이 소장에는 다양한 장르의 작가들로 구성된 연합이 포함됩니다. 알려진 원고로는 john-grisham, george-r-r-martin, dave-eggers, jodi-picoult, jonathan-franzen, pat-tigret 등이 있습니다. 그들은 OpenAI의 학습 과정(종종 데이터 세트를 통해 자신의 책 텍스트를 스크래핑하거나 수집하는 과정)이 직접적인 저작권 침해에 해당한다고 주장했습니다. 작가들은 자신의 창작물이 생계 수단이며, 라이선스 없이 저작권 있는 자료를 사용하는 것이 독점적 권리를 침해한다고 강조했습니다.
구체적인 주장에는 AI 생성 콘텐츠가 인간이 쓴 저작물을 대체할 수 있다는 점과 모델이 원본과 불공정하게 경쟁할 수 있는 파생 출력을 생성할 수 있다는 점에서 원고의 저작물 시장에 대한 위협이 포함됩니다. 이 소송은 저작권 있는 저작물을 모호하게 하거나 변형하는 합법적인 AI 사용과 사전 학습 중 발생한 allegedly 무단 복제를 구분합니다.
법적 맥락 및 이전 사례
미국 저작권법은 공정 사용에 대한 일부 여지를 허용합니다. AI 관련 소송에서는 뉴욕타임스가 OpenAI와 Microsoft를 상대로 제기한 소송에서 볼 수 있듯이 공정 사용 항변이 사용되어 왔습니다. 그러나 Authors Guild의 소장은 학습 데이터가 이렇게 방대한 규모로 사용되고 모델이 텍스트를 그대로 암기하고 재현할 수 있을 때 공정 사용 항변은 성립할 수 없다고 반박합니다.
이것은 Authors Guild가 저작권 분쟁의 중심에 선 첫 번째 사례가 아닙니다. 길드는 이전에 Google Books 및 Datasail 스캔에 관여하여 색인 및 검색 사용을 위한 책의 디지털 사본 라이선스 권리를 지지했습니다. 그러나 길드는 상업적 AI 사용은 출력의 논평적 성격과 작가에 대한 잠재적 경제적 피해로 인해 실질적으로 다르다고 주장합니다.
법적 프레임워크 및 제기된 청구
소장은 직접 저작권 침해, 대위 침해, 저작권 관리 정보 제거에 따른 디지털 밀레니엄 저작권법(DMCA) 위반을 포함한 8개 조항을 주장합니다. 텍스트의 핵심은 AI 모델 학습 과정에서 문학 작품의 불법 복제입니다. 원고들은 OpenAI가 저작권 있는 저작물의 나머지 부분에서 얻은 모든 이익에 대한 공평한 신탁 설립을 요구합니다.
이 사건은 뉴욕 남부 지방 법원에서 진행 중입니다. OpenAI는 처음에 기각을 신청했지만, 소송은 저명한 학계 및 업계 논평가들이 신경망의 비지도 학습에 저작권 있는 텍스트 데이터를 사용할 때의 책임 모호성을 강조하면서 접근하고 있습니다.
AI 산업 및 더 넓은 영향
이 소송은 2023년 AI 기업을 상대로 제기된 여러 집단 소송 중 하나입니다. 이는 2023년 8월 Karin Ale와 Feng Ming이 제안된 작가 집단을 대신하여 제기한 소송 직후에 나온 것으로, AI와 저작권의 교차점에서의 일련의 소송으로 간주되어야 합니다. 특히 Anthropic, Google DeepMind, Amazon Web Services와 같은 다른 업체들도 모델 학습에 방대한 데이터에 의존합니다. 그러나 이 분쟁은 향후 AI 개발 관행을 형성할 수 있는 법적 노출에 대한 우려를 제기했습니다 - 기업이 라이선스를 구해야 하는지 또는 저작권 소송을 피하기 위해 학습 전략을 수정해야 하는지 여부입니다.
기술 경영진과 개발자들은 Gradient Clipping 및 Learning Rate Scheduling과 같은 기존 프레임워크가 모델을 미세 조정하지만 데이터 수집이 필수적이라고 말합니다. 책 학습은 한 가지 방법이지만 원시 텍스트에 대한 재산권에 대한 합의는 없습니다. 이 사건은 다음과 같은 질문을 제기합니다: 모델의 메모리가 의미론 이상을 기억할 만큼 충분히 클 때 공정 사용이란 무엇인가? 추론 시 Beam Search 또는 Top-P (Nucleus) Sampling Temperature Scaling이 저작권 있는 장을 거의 그대로 재생하는 샘플 시퀀스인 침해 혼합물을 생성할 수 있는가?
관련 사례 및 향후 절차
Authors Guild 사건은 단독으로 서지 않습니다. 2024년 현재, 코미디언과 사진작가들이 생성형 AI 플랫폼을 상대로 한 집단 소송이 계류 중입니다. OpenAI와 다른 업체들은 공정 사용 주장을 하고 있지만, Authors Guild 소송의 결과는 스타트업 생태계에 선례를 남길 것이며, 스타트업은 공개 액세스 또는 적절히 라이선스된 컬렉션과 같은 대체 데이터 소스가 필요할 수 있습니다.
OpenAI는 부분적으로 주요 뉴스 기관의 저작권 있는 콘텐츠 라이선스를 시작하고 출판사와 회동하는 것으로 알려졌습니다. 그러나 마찰은 남아 있습니다. Authors Guild 소송은 집단적 성격으로 유명합니다 - 이는 문제를 전체 직업에 영향을 미치는 체계적인 것으로 규정하며, 어떤 판결이든 콘텐츠 창작자와 AI 개발자 간의 계약을 구속하고 형성할 것입니다.
작가와 AI 윤리에 미치는 영향
일반적인 우려 중 하나는 AI 패러다임의 경제적 불균형입니다. 비평가들은 학습 데이터가 모든 분야의 인간 저작물을 광범위하게 포함하지만 오직 기술 대기업만 이익을 얻는다는 점에서 이는 불균형한 비즈니스 모델을 나타낸다고 주장합니다. 소설가들은 종종 얇은 마진으로 개별적으로 글을 쓰며, 그들의 출력을 보상 없이 사용하는 것은 불균형을 만듭니다. 이는 동의, 귀속, 논쟁의 여지가 있는 데이터 큐레이션에 관한 더 넓은 윤리적 AI 논쟁과 다시 공명합니다.
그러나 일부 분석가들은 AI21 Labs 및 Inflection AI의 개발이 변화의 균형을 맞출 수 있는 모델이라고 지적합니다. Reinforcement Learning from AI Feedback (RLAIF)를 사용한 모델 개선은 저작권 문제를 포함하여 정밀도와 오류 감소를 지향합니다. 그러나 소장이 강조하듯이, 이는 사전 학습 단계에서의 궁극적인 복제 자체를 부정하지 않습니다.
학습 인프라 살펴보기
사건에서 학습 자체는 분리 가능한 대규모 인프라를 수반합니다. 거대한 Deep learning 코퍼스를 처리하려면 컴퓨팅 리소스가 핵심입니다. NVIDIA(하드웨어 공급업체) 또는 실제 GPU 사용과 같은 회사들이 있으며, AWS Trainium 클라우드 또는 Google Cloud와 같은 옵션이 있습니다. 책을 밀리초 단위로 모델 가중치로 가져오는 규모는 그러한 비즈니스가 AI 도메인에서 이익을 얻는 방식입니다.
이 소송에서 제시된 문제는 클라우드 컴퓨팅 산업에 영향을 미칠 수 있으며, 소송이 Amazon Web Services 및 Google Cloud의 멀티모달 모델 애플리케이션 투자를 저해할 수 있습니다. Groq와 같은 빠른 추론을 생각하는 플랫폼과 같은 추론 엔진이 역할을 할 수 있지만, 저작권 모델링에서 추론 노드 평가가 초점이 됩니다.
전망
사건의 절차적 단계를 고려할 때 최종 결정은 내려지지 않았습니다. 이 기사 시점에서 법원은 기각 신청에 대해 판결하지 않았습니다. 많은 법률 관찰자들은 이 결정이 당사자뿐만 아니라 향후 라이선스 및 데이터 출처를 다룰 수 있는 잠재적 입법 조치를 포함한 더 넓은 AI 저작권 환경을 모니터링하는 데 영향을 미칠 것이라고 추적합니다.
Authors Guild v. OpenAI 소송은 이전 논문의 생성 모델이 스타일을 가져오거나 회사 발전에 기여한 정확한 문화가 이제 우리 문화, 영화, 예술 작품이 창작되는 법과 겹치는 영역의 긴장을 강조합니다. 법원은 기술 혁신의 정의를 설득하고 2020년대 대규모 모델 개발의 궤적을 변경할 수 있습니다. 그러나 결과가 어떻든, 이는 인공지능이 더 이상 자율적이지 않으며, 법의 복잡성과 그것이 학습하는 창의성의 인구 통계에 얽혀 있다는 증거입니다.