Llama 3는 Meta AI가 개발하고 2024년 4월 18일에 출시한 대규모 언어 모델 제품군입니다. 이는 2023년 2월에 시작된 Llama 시리즈의 일부로, 오픈 가중치 모델 성능의 중요한 발전을 나타냅니다. 초기 출시에는 80억(8B) 및 700억(70B) 매개변수의 두 가지 모델 크기가 포함되었으며, 기본 모델과 명령어 튜닝 버전이 모두 제공되었습니다. Llama 3 모델은 공개적으로 이용 가능한 소스에서 약 15조 개의 토큰으로 구성된 텍스트로 사전 학습되었으며, 명령어 튜닝 변형은 공개 명령어 데이터 세트와 1,000만 개 이상의 인간 주석 예제로 추가 미세 조정되었습니다.
Llama 3는 이전 모델의 아키텍처 원칙을 기반으로 하지만 학습 데이터 규모와 성능에서 주목할 만한 개선을 도입했습니다. Meta AI의 2024년 4월 테스트에 따르면 70B 모델은 대부분의 벤치마크에서 Gemini Pro 1.5 및 Claude 3 Sonnet과 같은 경쟁 모델을 능가했습니다. 이번 출시는 또한 Llama를 기반으로 구축된 AI 어시스턴트인 Meta AI의 출시를 의미하며, 전용 웹사이트를 통해 제공되고 Facebook 및 WhatsApp에 통합되었습니다.
배경
Llama 3의 개발은 특히 2022년 말 ChatGPT 출시 이후 생성형 AI의 급속한 발전을 배경으로 이루어졌습니다. ChatGPT의 성공은 대규모 언어 모델에 대한 관심을 강화했으며, 기업들이 이러한 시스템을 확장하고 개선하는 데 막대한 투자를 하도록 촉구했습니다. Meta의 최고 AI 과학자 Yann LeCun은 이전에 대규모 언어 모델이 글쓰기 지원에 가장 적합하다고 밝혔으며, 이러한 관점이 Llama 모델 설계에 영향을 미쳤습니다.
Llama 3는 또한 모델 배포에 대한 Meta의 접근 방식 변화를 반영합니다. 원래 Llama는 비상업적 라이선스 하에 학술 연구자에게만 제한되었지만, Llama 3를 포함한 후속 버전은 일부 상업적 사용을 허용하는 라이선스 하에 더 넓은 사용자층이 접근할 수 있게 되었습니다. 이러한 개방성은 혁신을 촉진했지만 AI 커뮤니티에서 "오픈 소스"의 정의에 대한 논쟁도 불러일으켰습니다.
아키텍처 및 학습
Llama 3 모델은 이전 Llama 버전과 유사한 표준 Transformer (architecture) 아키텍처를 사용하지만 학습 방법론에서 개선 사항이 있습니다. 모델은 Llama 2에 사용된 1.4조 개의 토큰에서 크게 증가한 15조 개의 토큰 데이터 세트로 학습되었습니다. 이러한 규모 덕분에 모델은 광범위한 작업에서 더 나은 성능을 달성할 수 있었습니다.
Llama 3 학습에서 얻은 주요 발견은 확장 법칙과 관련이 있습니다. 모델은 학습 데이터가 "Chinchilla-최적" 양을 초과하더라도 성능이 로그-선형적으로 계속 개선된다는 것을 경험적으로 입증했습니다. 예를 들어, 8B 모델의 Chinchilla-최적 데이터 세트는 2,000억 개의 토큰이지만, 성능은 사용된 15조 개의 토큰(75배 더 큼)까지 계속 확장되었습니다. 이러한 관찰은 향후 모델 학습 전략에 시사점을 제공합니다.
Dwarkesh Patel과의 인터뷰에서 Meta CEO Mark Zuckerberg는 Llama 3의 8B 버전이 가장 큰 Llama 2 모델과 거의 동등한 성능을 보였다고 언급했습니다. 그는 또한 70B 모델이 15조 개의 토큰 학습이 끝날 때 여전히 학습 중이었지만 GPU 리소스를 다른 곳에 할당하기 위해 학습을 중단하기로 결정했다고 언급했습니다.
성능 및 벤치마크
Llama 3 모델은 출시 당시 많은 자연어 처리 벤치마크에서 최첨단 결과를 달성했습니다. 특히 70B 모델은 추론, 코딩, 일반 지식과 같은 작업에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 포함한 여러 독점 모델을 능가했습니다. 8B 모델은 크기가 더 작음에도 불구하고 경쟁력 있는 성능을 제공하여 덜 강력한 하드웨어에 배포하기에 적합했습니다.
Meta AI의 평가에 따르면 Llama 3 70B는 수학적 추론 및 코드 생성 영역에서 탁월했으며, 8B 모델은 효율성과 성능의 강력한 균형을 제공했습니다. 이러한 결과는 Llama 3를 폐쇄 소스 시스템의 지배력에 도전하는 선도적인 오픈 가중치 모델로 자리매김했습니다.
가용성 및 생태계
Llama 3는 특정 애플리케이션을 제한하는 허용 가능한 사용 정책과 함께 상업적 사용을 허용하는 라이선스로 출시되었습니다. 모델은 Meta 웹사이트와 Amazon Web Services, Azure, Google Cloud를 포함한 다양한 클라우드 플랫폼에서 다운로드할 수 있습니다. 이러한 접근성은 연구 및 산업 분야에서 광범위한 채택을 촉진했습니다.
Llama 3의 출시는 또한 모델의 기능을 활용하는 어시스턴트인 Meta AI의 출시와 일치했습니다. Meta AI는 Facebook, WhatsApp 및 전용 웹사이트에 통합되어 사용자에게 대화형 AI 서비스를 제공합니다. Llama 3 주변의 생태계에는 미세 조정, 양자화 및 배포를 위한 도구가 포함되어 개발자가 특정 사용 사례에 맞게 모델을 사용자 지정할 수 있습니다.
유산 및 미래
Llama 3는 오픈 가중치 대규모 언어 모델의 진화에서 중요한 이정표를 세웠으며, 이러한 모델이 독점 경쟁 제품과 경쟁할 수 있음을 입증했습니다. 그 성공은 2024년 7월 23일에 출시된 Llama 3.1을 포함한 후속 개발에 영향을 미쳤으며, 여기서 추가 개선이 도입되었습니다. Llama 시리즈는 2025년 4월 Llama 4로 계속되었으며, 2026년 4월 Meta Superintelligence Labs는 Llama를 대체하는 Muse Spark를 출시했습니다.
Llama 3의 영향은 기술적 성과를 넘어 AI 안전, 접근성 및 고급 AI 기술의 민주화에 대한 논의에 기여했습니다. 오픈 가중치 특성 덕분에 전 세계 연구자와 개발자가 모델을 실험하고 구축할 수 있어 혁신의 활기찬 생태계를 조성했습니다.