Authors Guild v. OpenAIは、2023年9月20日にニューヨーク南部地区連邦地方裁判所に提起された集団訴訟である。この訴訟は、Authors Guildと著名なフィクション・ノンフィクション作家のグループによって提起され、ChatGPTの背後にある大規模言語モデルの開発者であるOpenAIが、その生成AIシステムを訓練するために著者の書籍を無断で使用し、著作権を侵害したと主張している。この事件は、AI企業のデータ慣行に対する数多くの注目度の高い法的挑戦の一つであり、フェアユース、著作者性、そして機械学習時代における創造的労働の経済学に関する根本的な問題を提起している。
原告には、米国最大の作家専門組織であるAuthors Guildに加え、ジョン・グリシャム、ジョージ・R・R・マーティン、ジョディ・ピコー、デイビッド・バルダッチなどの個人作家が含まれる。彼らの訴状は、OpenAIがそのモデルの訓練データセットに彼らの作品を丸ごとコピーし、そのモデルが作品を模倣または要約したテキストを生成し、市場でオリジナルと競合していると主張している。この訴訟は、法定損害賠償、差止命令、および同意なしに著作権素材を使用することは1976年著作権法に違反するという宣言を求めている。
背景:大規模言語モデルの台頭
2015年に非営利研究組織として設立されたOpenAIは、2019年に巨額の計算リソースの資金調達を確保するために利益上限付きの構造に移行した。その主力製品であるChatGPTは、2022年11月に一般公開され、2ヶ月以内に月間1億人以上のユーザーを達成し、歴史上最も急速に成長した消費者向けアプリケーションの一つとなった。その基盤技術は、Googleの研究者による2017年の論文で紹介されたトランスフォーマーアーキテクチャに基づいており、膨大なテキストデータの効率的な訓練を可能にした。
大規模言語モデルの訓練には、書籍、記事、ウェブサイト、その他の書面資料など、多様なソースから数十億語をモデルに供給することが含まれる。OpenAIはその訓練データセットの完全な内容を公表していないが、同社はGPT-2やGPT-3などの初期モデルにおいて、書籍を含むインターネット上の公開テキストを使用したことを認めている。その規模は膨大であり、2020年にリリースされたGPT-3は、数千億のトークン(単語または単語の一部にほぼ相当するテキストの単位)で訓練された。
原告は、書籍は高品質で長文の散文を含み、モデルが文法、推論、物語構造を学習するのに役立つため、訓練データとして独自の価値があると主張する。しかし、許可なく著作権のある書籍を使用することは、変容的フェアユースではなく、著者の労働の商業的搾取であると彼らは主張する。この事件は、機械学習技術と著作権法の交差点に位置しており、この分野は深層学習やニューラルネットワークなどの技術を通じて急速に進歩してきた。
法的主張と議論
訴状は、直接著作権侵害、間接侵害、不当利得を含む複数の訴訟原因を主張している。原告は、OpenAIの訓練プロセスが、訓練データセットの作成と、モデルがオリジナルに酷似したテキストを生成する能力の両方において、必然的に彼らの作品の無断複製を含むと主張する。また、OpenAIによる作品の使用が、読者がAI生成の要約や模倣を無料で入手できるようになったため、彼らの書籍の市場を減少させたとも主張する。
OpenAIの防御は、批評、コメント、ニュース報道、教育、研究などの目的での著作権素材の限定的使用を許可するフェアユースの原則に焦点を当てる可能性が高い。同社は他の文脈で、公開テキストでAIモデルを訓練することは、オリジナル作品の代替にはならない変容的使用であると主張してきた。しかし、原告は、OpenAIの使用は商業的で非変容的であり、彼らの作品の市場に有害であると反論し、2024年初頭に800億ドルを超えた同社の評価額を指摘している。
この事件は、2023年12月にThe New York TimesがOpenAIとMicrosoftに対して提起した関連訴訟も担当するシドニー・H・スタイン判事に割り当てられている。Authors Guildの訴訟は、サラ・シルバーマン、リチャード・カドレイ、クリストファー・ゴールデンが提起した訴訟を含む他の類似訴訟と統合されているが、統合は部分的かつ手続き的なものである。重要な初期判断として、2023年11月にスタイン判事はシルバーマン事件の一部の主張を当事者適格の欠如により却下したが、他の主張は進行を許可し、裁判所が実質的な著作権問題に取り組む用意があることを示した。
より広範な訴訟環境
Authors Guild v. OpenAIは、AI企業に対する訴訟の波の一部である。The New York Timesの訴訟に加えて、OpenAIとそのパートナーであるMicrosoftが数百万の著作権記事をモデルの訓練に使用したと主張する訴訟があり、他の著者はClaudeモデルの製造元であるAnthropicやGoogle DeepMindに対して訴訟を提起している。これらの事件は、その結果がAI企業が訓練データを取得・使用する方法の先例を設定する可能性があるため、テクノロジー業界、出版部門、法律学者によって注視されている。
注目すべき進展として、2024年7月に米国著作権局が著作権とAIに関する報告書を発表し、AI訓練における著作権作品の使用に対処するための新法を議会が検討することを推奨した。報告書はフェアユースについて決定的な立場を取らなかったが、明確化の必要性を強調し、既存法が著者を十分に保護していない可能性を示唆した。この規制上の不確実性により、一部のAI企業は、OpenAIがAxel SpringerやAssociated Pressなどのニュース組織と締結した契約など、コンテンツプロバイダーとのライセンス契約を結ぶようになったが、そのような契約は大多数の著者をカバーしていない。
Authors Guildはまた、音楽出版社やソングライターが使用するものと同様の集団ライセンスメカニズムの提唱にも積極的である。2024年、同ギルドは、AI企業が著作権作品の使用に対してサブスクリプション料金を支払い、収益を使用状況に基づいて著者に分配するという枠組みを提案した。この提案は政策界でいくつかの支持を得ているが、2025年初頭の時点で主要なAI企業には採用されていない。
主要な手続き上のマイルストーン
最初の提出後、この事件はいくつかの手続き段階を経て進行した。2023年10月、OpenAIは却下申し立てを提出し、訓練プロセスが公衆に配布されない中間コピーを含むため、原告が直接侵害を適切に主張していないと主張した。同社はまた、原告が米国著作権局に全作品を登録していないため、当事者適格を欠いていると主張した。これは侵害訴訟を提起するための前提条件である。
スタイン判事は2024年2月にこの申し立てについて部分的に判断し、ほとんどの主張の進行を許可したが、技術的な理由で一部を却下した。彼は、原告がOpenAIの訓練プロセスがコピーを含むことをもっともらしく主張したと判断し、フェアユースの防御は却下申し立てよりも略式判決または裁判に適しているとした。この判断は、核心的な主張を存続させたため、著者側の勝利と見なされた。
2024年6月、当事者は証拠開示に従事し、原告はOpenAIの訓練データセットに関する詳細な情報を要求し、同社は営業秘密を理由に抵抗した。治安判事はOpenAIに特定の文書の提出を命じたが、証拠開示の範囲は依然として争われている。この事件は2025年3月に審理前会議が予定されており、裁判日は2025年後半または2026年の可能性があるが、複雑な訴訟ではそのようなスケジュールはしばしば延長される。
著者とAI開発への影響
Authors Guild v. OpenAIの結果は、文学界とAI業界の両方に深遠な影響を与える可能性がある。原告が勝訴した場合、OpenAIおよび他のAI企業は、訓練に使用されるすべての著作権作品に対してライセンスを取得することが要求される可能性があり、そのプロセスは物流的に困難で経済的に負担となる可能性がある。これは、特に数千の権利者と交渉するリソースを欠く小規模企業や研究機関にとって、大規模言語モデルの開発を遅らせる可能性がある。
逆に、OpenAIに有利な判決は、AI訓練に適用されるフェアユース原則を確認し、企業が補償なしで著作権テキストを継続して使用することを許可する可能性がある。そのような決定は、より積極的なデータ収集を促進し、訴訟と和解を賄えるのは最大手のみであるため、AI業界のさらなる統合につながる可能性がある。
著者にとって、この事件はお金以上のものである。機械が人間の創造性を模倣したテキストを生成できる時代における著作者性の本質についての疑問を提起する。一部の作家はAIをツールとして受け入れているが、他の作家はそれを生計に対する存在論的脅威と見なしている。Authors Guildはこの訴訟を職業の防衛として位置づけ、作家がAIシステムに貢献する価値に対して補償されるべきだと主張している。
この事件はまた、OpenAIのビジネス慣行と創造的コミュニティとの関係に関するより広範な議論と交差している。2023年、OpenAIは訓練における作品の使用に対して一部の著者に支払うプログラムを開始したが、その条件は不十分として広く批判された。同社はまた、訓練データに関する透明性の欠如について批判を受けており、これは訴訟の中心的な懸念である。
専門家の意見と学術的議論
法律学者は結果について意見が分かれている。カリフォルニア大学バークレー校のパメラ・サミュエルソン教授などの一部は、著作権作品でのAI訓練は、変容的目的でテキストをコピーする検索エンジンや他の技術との類似性を引き合いに出し、フェアユースと見なされるべきだと主張している。コーネル大学のジェームズ・グリメルマン教授などの他の学者は、AI訓練の規模と商業的性質が、特にモデルがオリジナルと競合する出力を生成できる場合、著者側に有利にバランスを傾ける可能性があると示唆している。
この事件はまた、訓練データの価値が substantial であると指摘する経済学者の注目も集めている。2023年の研究では、モデル性能の向上における多様でよく書かれたテキストの重要性を考慮すると、AI訓練のための単一の高品質書籍の市場価値は数千ドルになる可能性があると推定された。これにより、著者は利益の分け前を受け取らずに実質的にAI業界を補助していると主張する者もいる。
結論と展望
2025年初頭の時点で、Authors Guild v. OpenAIは証拠開示段階にあり、本案に関する最終判決は下されていない。この事件は解決に数年かかる可能性が高く、結果に関係なく第二巡回区控訴裁判所への控訴が予想される。最高裁判所は、2021年のGoogle v. Oracle判決(GoogleによるJavaコードの使用はフェアユースであると判断)など、新技術を含む他の著作権事件で行ったように、最終的に判断を下す可能性がある。
その間、この事件はすでに影響を与えている。他の著者や出版社が独自の訴訟を提起するきっかけとなり、自主的なライセンス枠組みの開発努力を加速させた。また、AIの倫理、クリエイターの権利、デジタル時代における知的財産の未来についてのより広範な公的議論にも貢献した。最終判決がどうであれ、Authors Guild v. OpenAIは人工知能と著作権法の歴史における画期的な事件として記憶される可能性が高い。