Copyleaksは、人工知能を活用して様々な形式の類似・同一コンテンツを識別する盗用検出プラットフォームである。2015年にソフトウェア開発者のAlon YaminとYehonatan Bittonによって設立された同社は、テキスト分析、機械学習、および関連技術を専門としている。その製品群は、企業、教育機関、個人が潜在的な盗用やAI生成コンテンツを検出するために使用され、責任あるAI採用に関する透明性の提供を目指している。2022年、Copyleaksは盗用防止機能を拡張するために775万ドルを調達した。
このプラットフォームは、人間が書いたテキストと大規模言語モデルが生成したコンテンツを区別するという、生成AIツールの普及に伴い深刻化している課題に対処している。データベース比較と、意味論的な意味や文体を理解するAIモデルを組み合わせることで、Copyleaksはコンテンツ検証に対する包括的なアプローチを提供する。
サービス
Copyleaksは、学術機関、企業、個人向けに設計された一連のツールを提供している。中核となるサービスは、テキストを膨大な既存コンテンツのデータベースと比較し、AIモデルを使用して意味論的な意味と文体を評価することでテキストを分析する。この二重のアプローチにより、プラットフォームは逐語的なコピーと、言い換えや書き換えられたテキストなどのより微妙な形態の盗用の両方を検出できる。
AI検出ツールは、大規模言語モデルによって生成されたテキストを特定するために特別に設計されており、AI生成を隠すために言い換えられたテキストも含まれる。この機能は、書かれた作品の信頼性を検証する必要がある教育者や出版者にとって重要である。このツールはChrome拡張機能としても利用可能で、ユーザーはオンラインコンテンツをリアルタイムでチェックできる。
テキスト検出に加えて、CopyleaksはAI生成および盗用されたソースコードを検出するためのCodeleaksと呼ばれる専門ツールを提供している。Codeleaksはまた、コードに関連する元のソフトウェアライセンスも特定し、知的財産のコンプライアンスに関心のある開発者や組織に貴重な文脈を提供する。
評価
Copyleaksを含むAI検出ツールの精度と信頼性は、学術研究の対象となっている。2023年6月、International Journal for Educational Integrityに掲載された研究では、AI検出ツールはしばしば不正確で信頼性が低いことが判明した。しかし、同じジャーナルでの5つのAIコンテンツ検出ツールの別の分析では、Copyleaksが最も高い感度、すなわちAI生成コンテンツを正しく識別した割合が、GPT-4によって生成されたコンテンツに対して93%であることが判明した。ただし、このツールは人間によって修正されたテキストには苦労した。
2023年11月、アデレード大学の研究チームによる分析では、Copyleaksはテストされたツールの中でより信頼性の高いものの一つであると判明したが、完全に信頼できるものはなかった。あるテストでは、研究者らは14歳の学生の文体で映画批評を書き、CopyleaksはAI生成コンテンツの確率が85.2%であると判定した。テキストが人間によって変更された後、ツールは73.1%の確率を返した。研究者らは「本当の教訓は、学生がどんなAI検出ツールも、その洗練度に関係なく突破できると想定すべきだということだ」と結論付けた。
技術とアプローチ
Copyleaksは、人工知能と深層学習技術を活用して、テキストを大規模に分析する。プラットフォームのAIモデルは、文構造の均一性や自然な変化の欠如など、機械生成コンテンツに特徴的なパターンを認識するように訓練されている。このアプローチは、主にデータベースに対する文字列マッチングに依存する従来の盗用検出とは異なる。
同社の意味論的理解への焦点により、言い換えや書き換えが行われた場合でもAI生成テキストを検出できる。これは、非常に一貫性があり人間らしいテキストを生成できるトランスフォーマーベースのモデルの急速な進歩を考えると特に重要である。モデルを継続的に更新することで、Copyleaksは進化するAI機能に先んじることを目指している。
応用と影響
Copyleaksは、学術的誠実性を維持しようとする教育機関から知的財産を保護する企業まで、多様なユーザーにサービスを提供している。学術界では、このツールは教員が独自性のないまたはAI生成の提出物を特定するのに役立ち、企業の世界では、コンテンツの独自性とコンプライアンスの取り組みを支援する。プラットフォームのAI生成ソースコードを検出する能力は、ソフトウェア開発チームにとっても価値がある。
同社の取り組みは、AIの倫理的使用とコンテンツ作成における透明性の必要性に関する広範な議論に貢献している。AIが日常のワークフローにより統合されるにつれて、Copyleaksのようなツールはデジタルコミュニケーションにおける信頼と説明責任の確立に役割を果たしている。