Authors Guild v. OpenAIは、2023年にニューヨーク南部地区連邦地方裁判所に提起された著作権侵害訴訟である。原告であるAuthors Guildに代表される作家グループは、OpenAIがGPT-3やGPT-4を含む大規模言語モデルの訓練に、許可なく著作権で保護された書籍を使用したと主張している。この訴訟は、生成AI企業の慣行に対する注目度の高い法的挑戦の一つであり、機械学習へのフェアユース原則の適用に関する疑問を提起している。
この訴訟は、2023年9月19日にAuthors Guildと、David Baldacci、John Grisham、George R.R. Martinを含む17人の個人作家によって開始された。原告は、OpenAIの訓練プロセスが彼らの作品をデータセットにコピーし、それがモデルの訓練に使用されたことで、直接および代位の著作権侵害を構成すると主張している。また、OpenAIがこれらの無許可のコピーから利益を得て、1976年著作権法に基づく排他的権利を侵害したと主張している。
最初の訴状と法的論点
最初の訴状は、法定損害賠償と差止命令を求め、OpenAIによる著作権テキストの使用は、モデルが作品の表現内容を複製し、そこから価値を引き出すため、変革的ではないと主張した。原告は、OpenAIのモデルが元の書籍のスタイルと内容を密接に模倣したテキストを生成でき、作家の作品の市場を損なうと強調した。
OpenAIは2024年初頭に却下申し立てを提出し、訓練における著作権素材の使用はフェアユース原則に基づき保護されると主張した。同社は、訓練プロセスは新しい非表現的な出力を生み出すため変革的であり、モデルは元の書籍の代替品として機能しないと論じた。また、OpenAIは、原告が訴状の基準で要求される具体的な侵害事例を主張していないと反論した。
修正訴状と新たな主張
2024年3月18日、原告は修正訴状を提出し、より多くの作家を追加し、主張を精緻化した。修正訴状には、モデルが原告の書籍の一節を密接に言い換えたり複製したりするテキストを生成する具体的な例が含まれ、原告はこれが直接侵害を示すと主張した。修正訴状はまた、不当利得と不正競争の主張を導入したが、これらは後の提出で取り下げられた。
修正訴状は、OpenAIに多額の投資を行い、Microsoft Azureを通じてクラウドインフラを提供していたMicrosoftを含む追加被告を指名した。原告は、Microsoftがモデルの訓練と展開から利益を得たため、侵害に対して共同責任があると主張した。Microsoftは独自の却下申し立てを提出し、訓練プロセスに直接関与していないと論じた。
却下申し立てに対する判決
2024年7月9日、Sidney H. Stein判事は却下申し立てに対する判決を下した。裁判所は、代位侵害と不当利得を含む原告のいくつかの主張を却下したが、中核となる直接侵害の主張は進行を許可した。裁判所は、原告がOpenAIが作品をコピーしたことを十分に主張しており、フェアユースの抗弁は却下申し立てではなく略式判決段階で扱うのが適切であると判断した。
判決はまた、法定損害賠償の問題にも触れ、原告は米国著作権局に登録された作品についてそれを求めることができると指摘した。裁判所はMicrosoftに対する主張を却下し、原告がMicrosoftが侵害行為を監督する権利と能力を持っていたことを十分に主張していないと判断した。これは代位責任の要件である。
フェアユースと変革的使用の議論
この訴訟の中心的な法的問題は、著作権テキストでLarge language modelを訓練することがフェアユースを構成するかどうかである。著作権法第107条に成文化されたフェアユース原則は、使用の目的と性質、著作権作品の性質、使用された部分の量と実質性、作品の潜在的な市場への影響という4つの要素を考慮する。
OpenAIは、モデルが元の作品を複製するのではなく、そこから統計的パターンを学習するため、使用は変革的であると主張する。同社は、モデルが既存の作品のリポジトリとしてではなく、新しいテキストを生成するように設計されているという事実を指摘する。原告は、モデルが元の作品のスタイルと内容を模倣するように訓練されているため、コピーは変革的ではなく、OpenAIの事業の商業的性質がフェアユースに反すると反論する。
証拠開示と証拠
2024年7月の判決後、訴訟は証拠開示段階に入った。原告は、OpenAIの訓練データと著作権素材の使用に関する内部通信へのアクセスを求めた。OpenAIは、営業秘密の保護と膨大なデータの生産負担を理由に、これらの要求の一部に抵抗している。
2024年10月、裁判所はOpenAIに訓練データセットで使用された書籍のリストを提出するよう命じたが、特定の専有情報の編集を許可した。原告はまた、CEOのSam Altmanを含むOpenAIの主要幹部の証言を求めているが、裁判所はまだこれらの要求について判断を下していない。
関連訴訟と業界への影響
Authors Guild訴訟は、AI企業に対するより広範な訴訟の波の一部である。Sarah Silvermanが主導する集団訴訟や、The New York Timesなどの報道機関による訴訟など、他の作家による同様の訴訟が提起されている。これらの訴訟はArtificial intelligence業界で注目されており、その結果はAIモデルの訓練と展開方法に前例を設定する可能性がある。
この訴訟はまた、政策立案者の注目も集めている。2024年、米国著作権局はAIと著作権に関する報告書を発表し、訓練データに対するフェアユースの範囲を明確にするよう議会に勧告した。報告書は、現在の法律は曖昧であり、クリエイターとAI開発者の両方に確実性を提供するために立法措置が必要かもしれないと指摘した。
現在の状況と次のステップ
2024年後半の時点で、訴訟は証拠開示段階にあり、両当事者は潜在的な略式判決申し立てに備えている。裁判所は、証拠開示の進捗と残りの申し立てを議論するために2025年1月にステータス会議を予定している。裁判日は設定されていないが、完全な裁判の複雑さとコストを考慮して、訴訟は略式判決または和解によって解決されるだろうと法律専門家は予想している。
Authors Guild v. OpenAIの結果は、Generative AI業界に重大な影響を与える可能性がある。裁判所が著作権作品での訓練がフェアユースではないと判断した場合、AI企業は訓練データのライセンスを取得する必要があるかもしれず、コストが増加し、革新が遅くなる可能性がある。逆に、OpenAIに有利な判決は、AI開発における大規模なウェブスクレイピングの継続的な使用に法的基盤を提供する可能性がある。
より広い文脈と学術的コメント
法律学者はこの訴訟について多様な見解を示している。一部は、フェアユース原則は新しい技術に対応するために柔軟に解釈されるべきであり、著作権法がコピー機やVCRなどの革新に適応してきた歴史を引用している。他方は、AI訓練におけるコピーの規模は前例がなく、特に競合コンテンツを生成できるモデルの訓練に作品が使用される作家にとって、経済的損害は現実的であると主張する。
この訴訟はまた、AI時代における創造性と著作者の性質についての議論を引き起こしている。一部のコメンテーターは、この訴訟が、機械が人間の執筆と区別できないテキストを生成できる世界における人間の著作者の役割についての広範な不安を反映していると示唆している。他方は、原告はAI自体に反対しているのではなく、作品の無償使用に反対していると指摘している。
潜在的な結果と前例
訴訟が本案に関する判決に進む場合、裁判所はAI訓練の具体的な事実に4要素のフェアユーステストを適用する必要がある。裁判所は、モデルの出力が十分に変革的であるか、使用された作品が主に事実的か創造的か、訓練プロセスが必要以上にコピーしているかを検討する可能性がある。市場損害の要素は中心的になる可能性が高く、原告はモデルが書籍の需要を減らすと主張し、OpenAIはモデルが元の作品と競合しないと主張するだろう。
原告に有利な判決は、AI企業が訓練データのライセンスを取得する要件につながり、著作権作品の新しい市場を生み出す可能性がある。OpenAIに有利な判決は、AI訓練がフェアユースであるという考えを強化するかもしれないが、クリエイターの懸念に対処するための立法措置を促す可能性もある。いずれにせよ、この訴訟は控訴される可能性が高く、最終的な解決は最高裁判所から来るかもしれない。
結論
Authors Guild v. OpenAIは、AIと著作権の法的景観を形成する画期的な訴訟である。修正訴状と判決は主張の範囲を明確にしたが、フェアユースの核心的な問題は未解決のままである。訴訟が進むにつれて、法律、技術、創造的コミュニティからの注目を集め続け、その結果はMachine learningの発展と知的財産の保護に永続的な影響を与えるだろう。