RedPajama는 Generative AI 인프라 개발에 주력하는 기업인 Together AI가 시작한 오픈소스 이니셔티브입니다. 이 프로젝트의 주요 목표는 Large language model 훈련을 위한 완전히 투명하고 재현 가능한 데이터셋과 모델 체크포인트를 제공하는 것입니다. 이는 주요 AI 연구 기관들이 공개하지 않는 독점 훈련 데이터에 대한 공개 대안의 필요성이 커짐에 따라 만들어졌습니다. RedPajama는 데이터와 모델을 모두 공개함으로써 연구자와 개발자가 폐쇄형 소스 자원의 장벽 없이 최첨단 언어 모델 훈련 과정을 연구, 복제, 확장할 수 있게 합니다.
이 프로젝트는 2023년 4월 LLaMA 모델 훈련 데이터의 구성을 모방하도록 설계된 1.2조 토큰 컬렉션인 RedPajama 데이터셋을 공개하면서 시작되었습니다. 이 초기 공개는 Together AI와 Stanford AI Lab 및 BAIR (Berkeley AI Research) 그룹을 포함한 여러 학술 파트너 간의 협력 노력이었습니다. 데이터셋은 Common Crawl, Wikipedia, GitHub, 서적과 같은 공개 소스에서 수집되었으며, 허용적 라이선스 하에 제공되었습니다. 데이터셋 이후 Together AI는 이 데이터로 훈련된 Neural network인 RedPajama-INCITE 모델 제품군을 공개하여 유사한 크기의 다른 공개 모델과 경쟁력 있는 성능을 입증했습니다.
데이터셋 구성 및 구축
RedPajama 데이터셋은 원래 LLaMA 모델에 사용된 데이터 혼합을 복제하도록 구축되었으며, 이는 연구 논문에 상세히 기술되었지만 공개적으로 배포되지는 않았습니다. 데이터셋은 Common Crawl(대규모 웹 스크레이프), C4(또 다른 웹 코퍼스), Wikipedia, GitHub 코드, ArXiv 논문, StackExchange, 서적의 일곱 가지 별도 구성 요소로 이루어져 있습니다. 각 구성 요소는 품질과 일관성을 보장하기 위해 처리되었으며, 저품질 또는 반복 콘텐츠를 제거하기 위해 중복 제거와 필터링이 적용되었습니다. 최종 데이터셋은 총 1.2조 토큰으로, 공개 시점에 언어 모델 훈련을 위한 가장 큰 공개 코퍼스 중 하나였습니다.
데이터셋의 핵심 특징은 투명성에 대한 초점입니다. 많은 독점 데이터셋과 달리 RedPajama는 소스와 전처리 단계에 대한 상세한 메타데이터를 제공하여 연구자들이 모델이 정확히 무엇으로 훈련되었는지 이해할 수 있게 합니다. 이러한 투명성은 편향 감사, 데이터 품질 검증, 재현 가능한 연구를 가능하게 하는 데 중요합니다. 데이터셋은 일반적인 Machine learning 프레임워크와 호환되는 형식으로 배포되어 기존 훈련 파이프라인에 쉽게 통합할 수 있습니다.
RedPajama-INCITE 모델
2023년 5월, Together AI는 RedPajama 데이터셋으로 훈련된 RedPajama-INCITE 모델 제품군을 공개했습니다. 이 모델들은 3B 및 7B 파라미터를 포함한 여러 크기로 제공되었으며, 기본, 지시 튜닝, 채팅 튜닝 변형으로 제공되었습니다. 지시 튜닝 모델은 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 및 인간 피드백과 같은 기술을 사용하여 미세 조정되어 대화 및 작업 지향 애플리케이션에 적합했습니다. 모델들은 효율적이고 접근 가능하도록 설계되어 소비자급 하드웨어에서 실행되고 엣지 장치 배포를 위한 양자화를 지원했습니다.
INCITE 모델은 AI21 Labs 및 Anthropic의 모델과 같은 다른 공개 모델과 벤치마킹되었으며, 질문 응답 및 추론과 같은 표준 NLP 작업에서 경쟁력 있는 성능을 보여주었습니다. 그러나 OpenAI 또는 Google DeepMind의 가장 큰 독점 모델을 능가하도록 설계되지는 않았으며, 오픈소스 커뮤니티를 위한 견고하고 재현 가능한 기준선을 제공하는 데 중점을 두었습니다. 공개에는 하이퍼파라미터와 컴퓨팅 요구 사항을 포함한 전체 훈련 세부 사항이 포함되어 다른 사람들이 훈련 과정을 복제할 수 있게 했습니다.
확장 및 변형
초기 공개 이후 RedPajama 프로젝트는 추가 데이터셋과 모델 변형을 포함하도록 확장되었습니다. 2023년 7월, Together AI는 개선된 필터링과 더 큰 코퍼스를 갖춘 업데이트된 데이터셋인 RedPajama-V2를 공개했으며, Common Crawl만으로 총 30조 이상의 토큰을 포함했습니다. 이 버전은 분류기를 사용하여 저품질 또는 중복 콘텐츠를 식별하고 제거하는 더 정교한 데이터 정리 파이프라인을 도입했습니다. V2 데이터셋은 더 큰 모델 훈련을 지원하고 연구 커뮤니티에 더 포괄적인 자원을 제공하도록 설계되었습니다.
또한 프로젝트는 특정 사용 사례에 최적화된 RedPajama-INCITE-Base 및 RedPajama-INCITE-Chat과 같은 특수 모델을 도입했습니다. 채팅 변형은 대화 데이터로 미세 조정되어 다중 턴 대화 작업에서 개선된 성능을 보여주었습니다. Together AI는 또한 데이터 처리 도구와 스크립트를 공개하여 사용자가 언어나 도메인별 필터링과 같은 자신의 필요에 맞게 데이터셋을 사용자 정의할 수 있게 했습니다.
기술 혁신 및 기여
RedPajama 프로젝트는 오픈소스 AI 분야에 여러 기술 혁신을 기여했습니다. 주목할 만한 기여 중 하나는 데이터셋의 대규모를 처리할 수 있는 효율적인 데이터 처리 파이프라인의 개발이었습니다. 팀은 분산 컴퓨팅과 최적화된 Data Augmentation 기술을 사용하여 데이터가 적시에 처리되도록 보장했습니다. 또한 토큰화 및 중복 제거를 포함한 전처리 단계에 대한 상세한 문서를 게시하여 유사한 데이터셋을 구축하는 다른 연구자들에게 가치 있는 자료가 되었습니다.
또 다른 기여는 공개 데이터셋에서 모델 훈련 기술의 탐구였습니다. INCITE 모델은 표준 Transformer (architecture) 아키텍처와 Multi-Head Attention 및 Positional Encoding을 사용했지만, 훈련 과정은 Gradient Clipping 및 Learning Rate Scheduling 최적화와 같은 현대적 관행을 통합했습니다. 프로젝트는 또한 미세 조정 및 추론을 위한 코드를 공개하여 개발자가 모델을 특정 애플리케이션에 쉽게 적응시킬 수 있게 했습니다.
커뮤니티 및 생태계 영향
RedPajama는 오픈소스 AI 생태계에 상당한 영향을 미쳤습니다. 독점 데이터셋에 대한 투명하고 재현 가능한 대안을 제공함으로써 연구자와 소규모 조직의 진입 장벽을 낮췄습니다. MIT CSAIL 및 Carnegie Mellon University를 포함한 많은 학술 기관이 자체 연구 프로젝트에서 RedPajama 데이터를 사용했습니다. 프로젝트는 또한 피드백과 코드 기여를 통해 데이터셋과 모델을 개선하는 데 도움을 준 기여자 커뮤니티를 육성했습니다.
RedPajama의 공개는 다른 오픈소스 이니셔티브에도 영향을 미쳤습니다. 예를 들어, 데이터 품질 및 처리 기술의 벤치마크로 사용되었으며, 그 접근 방식은 투명한 훈련 자원을 만들고자 하는 다른 프로젝트에 채택되었습니다. 프로젝트의 투명성 강조는 Artificial intelligence 시스템의 책임성과 공정성을 보장하기 위한 공개 데이터의 중요성에 대한 AI 커뮤니티의 더 넓은 논의를 촉발했습니다.
과제 및 한계
성공에도 불구하고 RedPajama 프로젝트는 여러 과제에 직면했습니다. 주요 한계 중 하나는 인터넷에서 스크레이프된 소스 데이터에 내재된 편향으로, 유해하거나 편향된 콘텐츠를 포함할 수 있습니다. 필터링과 중복 제거가 일부 문제를 완화하는 데 도움이 되지만 완전히 제거할 수는 없습니다. 프로젝트는 이러한 한계를 인정하고 사용자가 모델을 배포할 때 추가 안전 조치를 적용할 것을 권장합니다.
또 다른 과제는 이렇게 방대한 데이터셋에서 대규모 모델을 훈련하는 데 따르는 컴퓨팅 비용입니다. INCITE 모델은 상대적으로 작지만 더 큰 모델로 확장하려면 상당한 컴퓨팅 자원이 필요하며, 이는 모든 연구자에게 접근 가능하지 않을 수 있습니다. 프로젝트는 사전 훈련된 체크포인트와 효율적인 미세 조정 도구를 제공하여 이 문제를 해결했지만, 처음부터 훈련하려는 사람들에게는 장벽이 남아 있습니다.
향후 방향
2024년 현재 RedPajama 프로젝트는 계속 진화하고 있습니다. Together AI는 커뮤니티 피드백과 Machine learning 연구의 발전을 통합한 업데이트된 데이터셋과 모델을 공개할 계획을 밝혔습니다. 향후 반복에는 더 다양한 데이터 소스, 개선된 필터링 기술, 멀티모달 데이터 지원이 포함될 수 있습니다. 프로젝트는 또한 모든 자원이 공개되고 접근 가능하도록 보장하는 투명성에 대한 약속을 유지하는 것을 목표로 합니다.
RedPajama의 더 넓은 목표는 고품질 훈련 데이터와 모델에 대한 접근을 민주화하여 더 넓은 범위의 참가자가 Large language model 개발에 기여할 수 있게 하는 것입니다. 이를 통해 혁신을 촉진하고 AI의 혜택이 사회 전반에 더 공평하게 공유되도록 하는 것을 희망합니다. 프로젝트의 지속적인 성공은 커뮤니티 참여와 지속 가능한 자금 및 거버넌스 모델 개발에 달려 있습니다.
결론
RedPajama는 언어 모델 훈련을 위한 포괄적이고 투명한 자원을 제공하는 오픈소스 AI 운동의 획기적인 노력을 대표합니다. 그 데이터셋과 모델은 널리 채택되었으며 공개 AI 연구의 방향에 영향을 미쳤습니다. 과제가 남아 있지만, 개방성과 재현성에 대한 프로젝트의 약속은 분야에 새로운 기준을 설정했으며, 그 영향은 앞으로 수년간 느껴질 가능성이 높습니다.