RedPajamaは、Generative AIインフラの推進に注力する企業であるTogether AIによって立ち上げられたオープンソースイニシアチブです。このプロジェクトの主な目的は、Large language modelのトレーニング用に、完全に透明で再現可能なデータセットとモデルチェックポイントを提供することです。これは、主要なAI研究機関がしばしば非公開とする独自のトレーニングデータに代わるオープンな選択肢への高まるニーズに応えて作成されました。データとモデルの両方を公開することで、RedPajamaは研究者や開発者が、クローズドソースのリソースによる障壁なしに、最先端の言語モデルトレーニングプロセスを研究、複製、および構築することを可能にします。
このプロジェクトは2023年4月に、LLaMAモデルのトレーニングに使用されたデータの構成を模倣するように設計された1.2兆トークンのコレクションであるRedPajamaデータセットのリリースで始まりました。この初期リリースは、Together AIと、Stanford AI LabやBAIR (Berkeley AI Research)グループを含む複数の学術パートナーとの協力によるものでした。データセットは、Common Crawl、Wikipedia、GitHub、書籍などの公開ソースから収集され、寛容なライセンスの下で利用可能になりました。データセットに続いて、Together AIはRedPajama-INCITEモデルファミリーをリリースしました。これらはこのデータでトレーニングされたNeural networkであり、同規模の他のオープンモデルと比較して競争力のあるパフォーマンスを示しました。
データセットの構成と構築
RedPajamaデータセットは、元のLLaMAモデルに使用されたデータ混合を再現するために構築されました。これは研究論文で詳細に説明されていましたが、公開されていませんでした。データセットは7つの異なるコンポーネントで構成されています: Common Crawl(大規模なウェブスクレイプ)、C4(別のウェブコーパス)、Wikipedia、GitHubコード、ArXiv論文、StackExchange、および書籍です。各コンポーネントは品質と一貫性を確保するために処理され、低品質または反復的なコンテンツを除去するための重複排除とフィルタリングが適用されました。最終的なデータセットは合計1.2兆トークンとなり、リリース時点で言語モデルトレーニング用に公開されている最大のコーパスの1つとなりました。
データセットの重要な特徴は、透明性への焦点です。多くの独自データセットとは異なり、RedPajamaはソースと前処理ステップに関する詳細なメタデータを提供し、研究者がモデルが正確に何でトレーニングされたかを理解できるようにします。この透明性は、バイアスの監査、データ品質の検証、再現可能な研究の実現に不可欠です。データセットは、一般的なMachine learningフレームワークと互換性のある形式で配布され、既存のトレーニングパイプラインへの簡単な統合を容易にします。
RedPajama-INCITEモデル
2023年5月、Together AIはRedPajamaデータセットでトレーニングされたRedPajama-INCITEモデルファミリーをリリースしました。これらのモデルは、3Bおよび7Bパラメータを含むいくつかのサイズで利用可能であり、ベース、命令チューニング、チャットチューニングのバリアントがありました。命令チューニングモデルは、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)や人間のフィードバックなどの技術を使用してファインチューニングされ、会話型およびタスク指向のアプリケーションに適していました。モデルは効率的でアクセスしやすいように設計され、コンシューマーグレードのハードウェアで動作し、エッジデバイスへの展開のための量子化をサポートしました。
INCITEモデルは、AI21 LabsやAnthropicなどの他のオープンモデルとベンチマークされ、質問応答や推論などの標準的なNLPタスクで競争力のあるパフォーマンスを示しました。ただし、OpenAIやGoogle DeepMindなどの最大の独自モデルを超えるように設計されたのではなく、オープンソースコミュニティに堅実で再現可能なベースラインを提供することを目的としていました。リリースには、ハイパーパラメータや計算要件を含む完全なトレーニング詳細が含まれており、他の人がトレーニングプロセスを複製できるようにしました。
拡張とバリアント
初期リリースに続いて、RedPajamaプロジェクトは追加のデータセットとモデルバリアントを含むように拡張されました。2023年7月、Together AIはRedPajama-V2をリリースしました。これは改善されたフィルタリングとより大きなコーパスを備えた更新されたデータセットで、Common Crawlだけで30兆トークンを超えました。このバージョンでは、分類器を使用して低品質または重複したコンテンツを識別および除去する、より洗練されたデータクリーニングパイプラインが導入されました。V2データセットは、さらに大きなモデルのトレーニングをサポートし、研究コミュニティにより包括的なリソースを提供するように設計されました。
さらに、プロジェクトはRedPajama-INCITE-BaseやRedPajama-INCITE-Chatなどの特定のユースケースに最適化された専門モデルを導入しました。チャットバリアントは会話データでファインチューニングされ、マルチターン対話タスクで改善されたパフォーマンスを示しました。Together AIはまた、データ処理用のツールとスクリプトをリリースし、ユーザーが言語やドメインによるフィルタリングなど、独自のニーズに合わせてデータセットをカスタマイズできるようにしました。
技術的革新と貢献
RedPajamaプロジェクトは、オープンソースAIの分野にいくつかの技術的革新をもたらしました。注目すべき貢献の1つは、データセットの大規模な規模を処理できる効率的なデータ処理パイプラインの開発でした。チームは分散コンピューティングと最適化されたData Augmentation技術を使用して、データがタイムリーに処理されることを確保しました。また、トークン化や重複排除を含む前処理ステップに関する詳細なドキュメントを公開し、同様のデータセットを構築している他の研究者にとって貴重なものとなりました。
もう1つの貢献は、オープンデータセットでのモデルトレーニング技術の探求でした。INCITEモデルは標準のTransformer (architecture)アーキテクチャとMulti-Head AttentionおよびPositional Encodingを使用しましたが、トレーニングプロセスにはGradient ClippingやLearning Rate Scheduling最適化などの現代的なプラクティスが組み込まれていました。プロジェクトはまた、ファインチューニングと推論用のコードをリリースし、開発者がモデルを特定のアプリケーションに適応させやすくしました。
コミュニティとエコシステムへの影響
RedPajamaはオープンソースAIエコシステムに大きな影響を与えました。独自データセットに代わる透明で再現可能な選択肢を提供することで、研究者や小規模組織への参入障壁を低くしました。MIT CSAILやCarnegie Mellon Universityを含む多くの学術機関が、独自の研究プロジェクトでRedPajamaデータを使用しています。プロジェクトはまた、フィードバックやコード貢献を通じてデータセットとモデルの改善に貢献したコミュニティを育成しました。
RedPajamaのリリースは他のオープンソースイニシアチブにも影響を与えました。例えば、データ品質と処理技術のベンチマークとして使用され、そのアプローチは透明なトレーニングリソースを作成しようとする他のプロジェクトに採用されました。プロジェクトの透明性への強調は、Artificial intelligenceシステムにおける説明責任と公平性を確保するためのオープンデータの重要性について、AIコミュニティでより広範な議論を引き起こしました。
課題と制限
その成功にもかかわらず、RedPajamaプロジェクトはいくつかの課題に直面しています。1つの主要な制限は、インターネットからスクレイプされ、有害または偏ったコンテンツを含む可能性のあるソースデータに固有のバイアスです。フィルタリングと重複排除はいくつかの問題を軽減するのに役立ちますが、完全に排除することはできません。プロジェクトはこれらの制限を認識しており、モデルを展開する際に追加の安全対策を適用するようユーザーに奨励しています。
もう1つの課題は、このような大規模なデータセットで大規模なモデルをトレーニングすることに関連する計算コストです。INCITEモデルは比較的小さいですが、より大きなモデルにスケールアップするにはかなりの計算リソースが必要であり、すべての研究者がアクセスできるわけではありません。プロジェクトは、事前トレーニング済みチェックポイントと効率的なファインチューニング用のツールを提供することでこれに対処しましたが、ゼロからトレーニングしようとする人々にとっては障壁が残っています。
今後の方向性
2024年現在、RedPajamaプロジェクトは進化を続けています。Together AIは、コミュニティからのフィードバックとMachine learning研究の進歩を組み込んだ、更新されたデータセットとモデルをリリースする計画を示しています。将来のイテレーションには、より多様なデータソース、改善されたフィルタリング技術、マルチモーダルデータのサポートが含まれる可能性があります。プロジェクトはまた、すべてのリソースがオープンでアクセス可能なままであることを確保し、透明性へのコミットメントを維持することを目指しています。
RedPajamaのより広い目標は、高品質なトレーニングデータとモデルへのアクセスを民主化し、より広範な参加者がLarge language modelの開発に貢献できるようにすることです。これにより、イノベーションを促進し、AIの利益が社会全体でより公平に共有されることを期待しています。プロジェクトの継続的な成功は、コミュニティの継続的な関与と、持続可能な資金調達およびガバナンスモデルの開発に依存します。
結論
RedPajamaはオープンソースAI運動における画期的な取り組みを代表し、言語モデルのトレーニングのための包括的で透明なリソースを提供します。そのデータセットとモデルは広く採用され、オープンAI研究の方向性に影響を与えました。課題は残っていますが、プロジェクトの開放性と再現性へのコミットメントは分野に新しい基準を設定し、その影響は今後何年にもわたって感じられる可能性があります。