著者らによるOpenAIに対する集団訴訟は、複数の著者が、GPT-3やGPT-4などの大規模言語モデルの開発者であるOpenAIが、許可なく自らの書籍やその他の著作物を人工知能システムの訓練に使用したことで著作権を侵害したと主張した、統合された法的手続きである。この訴訟は、米国ニューヨーク南部地区連邦地方裁判所に提起され、生成AIを著作権で保護されたテキストで訓練することの合法性に関する広範な議論の焦点となった。原告らは、法定損害賠償、利益の吐き出し、およびさらなる無断使用の差し止めを求めた一方、OpenAIは、その訓練慣行はフェアユース原則に該当すると主張した。
この訴訟は、AI企業に対する同様の訴訟の波の中で浮上し、創造産業とGenerative AIの急速な商業化との間の緊張の高まりを反映していた。著者らの主張は、Transformer (architecture)アーキテクチャに基づき、膨大なインターネットコーパスで訓練されたOpenAIのLarge language modelが、必然的に保護された表現を複製し、そこから派生しているという前提に焦点を当てていた。検索エンジンや画像サムネイルを扱った初期の訴訟とは異なり、この訴訟は基盤となる訓練プロセス自体を標的としており、機械学習のために著作権で保護された素材を取り込むことが侵害に当たるかどうかという新たな疑問を提起した。
背景と提訴
最初の訴状は2023年9月8日に、サラ・シルバーマン、リチャード・カドリー、クリストファー・ゴールデンを含む著者らによって提出され、彼らはOpenAIの訓練データに許可なく自らの書籍が含まれていると主張した。原告らは、OpenAIのOpenAIモデルが自らの作品の要約、言い換え、さらには逐語的な抜粋を生成できると主張し、訓練プロセスが表現的要素を複製し保存したことを示した。この訴訟は後に、マイケル・シャボン、タ=ネシ・コーツ、コメディアンのサラ・シルバーマンによって提起されたものを含む他の著者訴訟と統合され、In re OpenAI ChatGPT Litigationという名称で扱われた。
著者らは、これまでに注目度の高い知的財産紛争を扱ってきた法律事務所サスマン・ゴッドフリーによって代理された。訴状は、OpenAIが書籍リポジトリや海賊版テキストコレクションを含むインターネットの大部分をスクレイピングして訓練データセットを構築した方法を詳述した。また、同社がライセンスなしで著作権で保護された素材を使用することの法的リスクを認識していたことを示唆する内部文書や公開声明を引用した。原告らは、OpenAIの行為は変革的ではなく、既存の作品の商業的搾取であり、モデルが市場で元の書籍と競合すると主張した。
法的主張と論点
中核となる法的主張は、米国著作権法、具体的には17 U.S.C. § 501に基づく直接的な著作権侵害であった。原告らは、OpenAIが複製、二次的著作物の作成、およびコピーの頒布に関する排他的権利を侵害したと主張した。また、間接侵害と不当利得の主張も提起し、OpenAIが自らの創造的労働の無断使用から利益を得たと主張した。訴状は、作品ごとに最大15万ドルの法定損害賠償を求めており、侵害されたとされる作品の数を考慮すると、数十億ドルに上る可能性があった。
OpenAIの防御は、主に17 U.S.C. § 107に成文化されたフェアユース例外に依存していた。同社は、モデルが元のテキストを複製するのではなく、統計的パターンと言語構造を学習するため、モデルの訓練は変革的使用であると主張した。OpenAIは、訓練の目的は著者らの作品を取って代わることではなく、汎用ツールを作成することであり、モデルの出力がソース素材に似ることはほとんどないと主張した。また、同社は逐語的な著作権テキストの生成を防ぐフィルターを実装したと述べたが、原告らはこれらの措置の有効性に異議を唱えた。
重要な法的問題は、訓練中の著作権で保護された作品の中間コピーが侵害に当たるかどうかであった。原告らは、裁判所が検索インデックス作成のための書籍のデジタル化はフェアユースであると判断した画期的な事件であるAuthors Guild v. Googleとの類似性を引き合いに出した。しかし、著者らは、Googleの使用はテキストを検索可能にすることに限定されていたのに対し、OpenAIの使用は元の著者のスタイルで新しいテキストを生成できる競合製品の作成を伴うと主張した。「検索」と「生成」の区別は、論争の中心的なポイントとなった。
証拠開示と技術的証拠
証拠開示段階で、原告らはOpenAIの訓練データとモデル重みへのアクセスを求め、著作権で保護された作品が実際にコピーされたことを証明するためにこの証拠が必要であると主張した。OpenAIは、営業秘密の保護と、そのようなデータを生成するために必要な膨大な計算リソースを理由に抵抗した。しかし、裁判所は限定的な証拠開示を命じ、原告らが訓練コーパスに含まれるソースを示すメタデータとログを検査することを許可した。これにより、OpenAIが影の図書館Bibliotikからの海賊版書籍のコレクションであるBooks3などのデータセットを使用し、数千の著作権で保護されたタイトルが含まれていたことが明らかになった。
技術的証拠は、Neural networkのアーキテクチャとDeep learningの性質に焦点を当てていた。原告側の専門家は、Transformer (architecture)アーキテクチャに基づくものを含む大規模言語モデルが、訓練例の圧縮表現を保存すると証言した。彼らは、これらの表現により、モデルが単なる統計的偶然ではなく、元の作品からの直接的な派生であるテキストを複製できると主張した。OpenAI側の専門家は、モデルは確率的であり、特定のテキストとの類似性は記憶ではなく一般化するモデルの能力の結果であると反論した。「記憶」対「一般化」の議論は、この訴訟で繰り返し現れるテーマとなった。
司法判断と申し立て
2024年2月、アラセリ・マルティネス=オルギン判事はOpenAIの却下申し立てを却下し、著作権主張の審理を進めることを許可した。判事は、原告らがOpenAIの訓練プロセスが保護された表現のコピーを伴うことをもっともらしく主張したと判断し、フェアユース防御は訴答段階では解決できないと述べた。この決定は、OpenAIの主張、すなわち訴訟が時効によって妨げられているか、原告らに訴訟適格がないという主張を退けたため、重要であった。判決はまた、出力が逐語的なコピーでなくても、原告らが訓練データとモデルの出力との間の関連性を適切に主張したと指摘した。
2024年5月のその後の判決は、州法と不当利得に関連するものを含む原告らの主張の一部を却下して訴訟の範囲を狭めたが、中核的な著作権主張は維持した。裁判所はまた、原告らが仲裁条項に同意していないと判断し、OpenAIの仲裁強制申し立てを却下した。これらの判決は、潜在的な裁判への道を開いたが、両当事者は和解の意思を示した。この訴訟は、AnthropicやGoogle DeepMindに対するものを含む他のAI著作権訴訟を担当していた同じ判事に割り当てられ、裁判所が共通の法的問題を調整された方法で扱う可能性を示唆した。
産業と政策への影響
この訴訟は、Artificial intelligence産業に広範囲にわたる影響を及ぼした。これは、AnthropicやGoogle DeepMindを含む他のAI企業に、訓練慣行を見直し、出版社や著者とのライセンス契約を交渉するよう促した。2023年後半、OpenAIはアクセル・シュプリンガーやAP通信を含むいくつかのメディア企業との提携を発表し、訓練用のニュースコンテンツをライセンスした。しかし、これらの契約は訓練に使用された書籍や記事のごく一部しかカバーしておらず、多くの著者は補償を受けていないままだった。
この訴訟はまた、立法努力にも影響を与えた。米国議会では、議員らがAI基盤モデル透明性法などの法案を導入し、企業に訓練データソースの開示を要求した。2024年に最終化されたEUのAI法は、汎用AIモデルの開発者に訓練データの文書化と著作権法の遵守を要求する条項を含んでいた。著者らの集団訴訟は、既存の著作権法がAI訓練を効果的に規制できるかどうか、あるいは新しい立法が必要かどうかのテストケースとして機能した。
創造コミュニティからの反応
この訴訟は、著者や他のクリエイターを奮起させ、彼らはこれを生計の防衛と見なした。著者ギルドなどの組織は、AIモデルが人間の執筆の価値を切り下げ、創造的仕事の経済的インセンティブを損なうと主張し、原告を支持するアミカスブリーフを提出した。しかし、一部の著者は、AIをインスピレーションとコラボレーションのツールとして支持し、少数は自らの作品をAI企業にライセンスした。この分裂は、創造分野における自動化の役割に関するより広範な社会的議論を反映していた。
訴訟に参加した著名な著者には、ジョナサン・フランゼン、ジョディ・ピコー、ジョージ・R・R・マーティンが含まれていたが、一部は後に撤回または留保を表明した。この訴訟はまた、著作権で保護されたテキストでの訓練が人間の学習に類似しているかどうかを議論した学者たちの注目も集めた。Melanie MitchellやBrendan Lakeなどの学者は、機械は人間の意味で「読む」わけではないと主張したが、法制度はデータのコピーと変換の機械的プロセスが侵害に当たるかどうかを決定しなければならなかった。
和解と余波
2025年の時点で、この訴訟は未解決のままであり、両当事者は和解交渉に従事していた。報告によると、OpenAIは著者団体にライセンス料を支払うことを申し出たが、原告らはより高い金額と継続的なロイヤルティを要求した。裁判所は2025年後半にステータス会議を予定しており、観察者らは、訴訟費用の高さと不利な判決の可能性を考えると、和解の可能性が高いと推測した。和解は、AI企業がクリエイターに補償する方法の先例を確立するが、他の被告を必ずしも拘束するわけではない。
この訴訟はまた、関連する訴訟を生み出した。2024年、ノンフィクション著者のグループがOpenAIに対して別の集団訴訟を提起し、同社が許可なく自らの作品を使用したと主張した。ニューヨーク・タイムズは、同じ裁判所で係争中のOpenAIとマイクロソフトに対する独自の訴訟を提起した。これらの訴訟は、著者らの集団訴訟とともに、AI開発の未来を形作る複雑な法的景観を生み出した。著者らの訴訟の結果は、米国だけでなく、同様の問題に取り組んでいる世界中の法域にも影響を与えると広く予想された。
より広い文脈と将来の見通し
OpenAIに対する著者らの集団訴訟は、AI企業を訓練データに対して責任を問うためのより大きな運動の一部であった。これは、技術革新と知的財産権の間の緊張を浮き彫りにし、AIシステムが無数の作家、アーティスト、ジャーナリストの無償の労働に基づいて構築されているという事実に対する公的な認識を強制した。この訴訟はまた、AI開発における透明性の必要性を強調し、原告らの証拠開示要求が訓練データ収集の不透明な性質を明らかにした。
今後、この訴訟で確立された法的原則は長期的な影響を与える可能性がある。裁判所が許可なしの著作権で保護された作品の訓練が侵害であると判断した場合、AI企業はデータ取得戦略を全面的に見直し、おそらくパブリックドメインの作品やライセンスされたコンテンツに依存する必要がある。裁判所がフェアユースを支持する判決を下した場合、AI開発者に既存のテキストを使用する広範な自由が与えられるが、強制ライセンス制度を創設するための立法措置を促す可能性もある。いずれにせよ、この訴訟はMachine learningとGenerative AIの商業化の歴史における極めて重要な瞬間を表していた。
著者らの集団訴訟はまた、著作者性自体の性質についての疑問を提起した。AIモデルが人間の執筆に匹敵するテキストを生成できるようになるにつれて、オリジナルの創作と二次的著作物の間の線は曖昧になる。この訴訟は、裁判所に、何百万冊もの書籍を「読んだ」機械が、同じ書籍に影響を受けた人間の著者と根本的に異なるかどうかを検討することを強制した。法制度はまだ決定的な答えを提供していないが、この訴訟は、その疑問が今後何年も議論されることを確実にした。