Meta는 2024년 4월 18일, 지속적인 Llama 시리즈의 일환으로 대규모 언어 모델(LLM) 제품군인 Llama 3를 출시했습니다. 이번 출시에는 80억 개와 700억 개의 매개변수로 구성된 두 가지 모델 크기가 포함되었으며, 두 모델 모두 공개 소스의 약 15조 개 토큰 텍스트로 사전 학습되었습니다. 지시 조정 변형은 공개 지시 데이터 세트와 1,000만 개 이상의 인간 주석 예제로 미세 조정되었습니다. Meta는 Llama 3를 오픈 가중치 AI의 중요한 진전으로 자리매김했으며, 70B 모델은 출시 당시 표준 벤치마크에서 여러 상업적 경쟁 모델을 능가했습니다.
Llama 시리즈는 2023년 2월 Llama 1로 시작되어 처음에는 비상업적 라이선스로 연구자에게만 공개되었습니다. 2023년 3월 BitTorrent를 통한 무단 유출 이후, Meta는 2023년 7월 Llama 2로 전략을 전환하여 맞춤형 라이선스로 더 넓은 상업적 사용을 위한 가중치를 제공했습니다. Llama 3는 접근성과 성능을 강조하며 이러한 궤도를 이어갔습니다. 이번 출시는 Llama를 기반으로 구축된 어시스턴트인 Meta AI와 함께 이루어졌으며, 전용 웹사이트를 통해 제공되고 Facebook과 WhatsApp에 통합되었습니다.
모델 아키텍처 및 학습
Llama 3 모델은 이전 버전보다 개선된 표준 트랜스포머 아키텍처를 사용합니다. 8B 및 70B 모델은 15조 개 토큰으로 학습되었으며, 이는 8B 크기(2000억 개 토큰)에 대한 Chinchilla 최적량보다 75배 큰 데이터 세트입니다. 최적 데이터 지점을 초과했음에도 불구하고 성능은 로그-선형적으로 계속 확장되어 기존 스케일링 법칙에 도전했습니다. Meta는 70B 모델이 학습 종료 시점에도 여전히 개선되고 있었지만, GPU 자원을 다른 곳에 할당하기 위해 학습을 중단하기로 결정했다고 보고했습니다.
학습 데이터는 품질과 다양성에 중점을 두고 공개 소스에서 선별되었습니다. 지시 미세 조정은 공개 데이터 세트와 인간 주석 예제의 조합을 사용하여 모델의 복잡한 지시를 따르는 능력을 향상시켰습니다. Meta는 또한 향후 버전을 다국어, 다중 모달로 만들고 코딩 및 추론 능력을 개선하며 컨텍스트 창을 늘릴 계획을 발표했습니다.
성능 및 벤치마크
2024년 4월, Meta의 내부 테스트에 따르면 Llama 3 70B는 추론, 코딩, 일반 지식 작업을 포함한 대부분의 벤치마크에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 능가했습니다. Mark Zuckerberg는 8B 모델이 가장 큰 Llama 2 모델(70B)과 거의 동등한 성능을 보여 상당한 효율성 향상을 입증했다고 보고했습니다. 이러한 결과는 Llama 3를 OpenAI, Anthropic, Google DeepMind와 같은 회사의 독점 모델에 대한 경쟁력 있는 대안으로 자리매김했습니다.
모델은 표준 NLP 벤치마크로 평가되었으며, 70B 변형은 당시 오픈 가중치 모델 중 최첨단 결과를 달성했습니다. 관찰된 스케일링 동작 - Chinchilla 최적 데이터를 초과한 지점에서도 지속적인 개선 - 은 더 큰 데이터 세트가 추가 이득을 가져올 수 있음을 시사하며, 이후 Machine learning 및 Deep learning 연구에 영향을 미쳤습니다.
출시 및 생태계
Llama 3는 상업적 사용을 허용하는 맞춤형 라이선스로 출시되었지만, 특정 애플리케이션을 제한하는 허용 가능한 사용 정책이 포함되어 오픈 소스로 간주되는지에 대한 논쟁을 불러일으켰습니다. 가중치는 다운로드 가능하게 제공되었으며, 모델은 Amazon Web Services, Microsoft Azure, Google Cloud, Oracle Cloud Infrastructure를 포함한 다양한 플랫폼에 통합되었습니다. Groq 및 SambaNova와 같은 특수 하드웨어 제공업체는 Llama 3의 추론을 최적화하여 더 빠른 배포를 가능하게 했습니다.
이번 출시는 Llama 2 주변에서 형성된 생태계와 유사한 미세 조정 변형 및 도구의 물결을 촉발했습니다. 개발자들은 Reinforcement Learning from AI Feedback (RLAIF) 및 Curriculum Learning과 같은 기술을 사용하여 특정 도메인에 모델을 적응시켰습니다. 오픈 가중치 접근 방식은 경쟁사의 폐쇄형 모델과 대조되어 Generative AI 애플리케이션의 혁신을 촉진했습니다.
후속 개발
Llama 3.1은 2024년 7월 23일에 출시되어 405B 매개변수 모델을 도입하고 컨텍스트 창을 확장했습니다. 이 버전은 AI 환경에서 Llama의 입지를 더욱 공고히 했습니다. 시리즈는 2025년 4월 Llama 4로 계속되었으며, 2026년 4월 Meta Superintelligence Labs는 Muse Spark를 대체 모델로 출시했습니다. Llama의 진화는 더 넓은 분야에 영향을 미쳤으며, 연구자들은 Transformer (architecture) 아키텍처 및 Loss Functions에 대한 작업에서 볼 수 있듯이 스케일링 법칙과 학습 효율성을 연구했습니다.
이번 출시는 또한 대규모 컴퓨팅의 역할을 강조했으며, Meta는 AMD, Intel, TSMC와 같은 칩 제조업체와의 파트너십을 활용하여 모델을 효율적으로 학습했습니다. Llama 3의 성공은 Artificial intelligence의 미래와 오픈 및 독점 개발 간의 균형에 대한 논의에 기여했습니다.