Llama 2는 2023년 7월 Meta AI가 개발하고 출시한 대규모 언어 모델(LLM) 제품군이다. 이는 원래 Llama 모델의 후속작으로, 전작보다 더 접근하기 쉽고 상업적으로 사용 가능하도록 설계되었다. Llama 2는 70억, 130억, 700억 개의 매개변수를 가진 모델을 포함하며, 각각 기본 버전과 채팅 애플리케이션용으로 미세 조정된 버전으로 제공된다. 모델은 가중치와 함께 공개되어 광범위한 사용을 허용하지만, 특정 애플리케이션을 제한하는 라이선스 하에 배포되어 오픈 소스로 간주될 수 있는지에 대한 논쟁을 불러일으켰다.
Llama 2의 아키텍처는 대체로 원래 Llama를 따르지만, 훈련 데이터는 40% 증가했다. 이러한 확장은 다양한 자연어 처리 작업에서 성능과 일반화를 개선하는 것을 목표로 했다. Llama 2의 출시는 OpenAI 및 Google DeepMind와 같은 다른 LLM 제공업체와 경쟁하기 위한 Meta의 전략에서 중요한 단계로, 강력하면서도 접근 가능한 대안을 제공했다.
배경
Llama 2의 개발은 대규모 언어 모델의 급속한 발전, 특히 GPT-3 출시와 이후 ChatGPT의 인기에 힘입어 이루어졌다. 이러한 모델들은 신경망을 확장하면 능력이 크게 향상될 수 있음을 보여주며, 이 분야에 대한 뜨거운 관심을 촉발했다. Meta의 최고 AI 과학자 Yann LeCun은 LLM이 특히 글쓰기 지원에 효과적이라고 언급하며, Llama를 창의적이고 전문적인 글쓰기 작업을 위한 도구로 자리매김했다.
원래 Llama는 2023년 2월에 출시되었으며, 처음에는 비상업적 라이선스 하에 연구자에게만 제공되었다. 그러나 2023년 3월에 가중치가 온라인에 유출되어 광범위한 비공식 배포가 이루어졌다. 이 유출은 논란을 불러일으켰지만, 접근 가능한 LLM에 대한 수요를 부각시켰고, Meta가 더 허용적인 라이선스로 Llama 2를 출시하는 결정에 영향을 미쳤다.
버전
초기 출시
때때로 Llama 1이라고도 불리는 첫 번째 Llama 버전은 2023년 2월 24일에 발표되었다. 이는 공개적으로 이용 가능한 데이터로 훈련되었으며, 10억에서 650억 개의 매개변수 크기로 제공되었다. 130억 매개변수 모델은 많은 벤치마크에서 훨씬 더 큰 GPT-3를 능가했으며, 650억 매개변수 모델은 PaLM 및 Chinchilla와 같은 최첨단 모델과 경쟁력이 있었다. 가중치에 대한 접근은 학술 연구자와 산업 연구소로 제한되었지만, 추론 코드는 오픈 소스 GPLv3 라이선스 하에 공개되었다.
#### 유출
2023년 3월 3일, Llama의 가중치를 포함한 토렌트가 4chan에 업로드되었고, 링크는 온라인 AI 커뮤니티를 통해 빠르게 퍼졌다. Meta는 HuggingFace와 GitHub에 삭제 요청을 제기했지만, 유출은 이미 광범위한 사용을 촉진했다. 평론가들은 이 상황을 Stable Diffusion의 출시와 비교하며, 오용에 대한 우려에도 불구하고 공개 접근이 혁신과 도구 개발을 촉진할 수 있다고 제안했다.
Llama 2
Llama 2는 2023년 7월 18일에 Microsoft와 협력하여 발표되었다. 이는 70억, 130억, 700억 개의 매개변수 크기로 출시되었다. 아키텍처는 Llama 1과 유사하게 유지되었지만, 훈련 데이터는 40% 증가했다. 전작과 달리 Llama 2의 가중치는 허용 가능한 사용 정책에 따라 상업적 사용이 가능하게 되었다. 이 정책은 특정 애플리케이션을 금지하며, 이로 인해 Open Source Initiative는 Meta가 Llama를 오픈 소스로 규정한 것에 대해 이의를 제기했다.
Llama 2는 코드 생성에 특화된 미세 조정 버전인 Code Llama의 기반이 되기도 했다. Code Llama는 2023년 8월과 2024년 1월에 출시되었으며, 70억에서 700억 개의 매개변수 크기로 추가 코드 특화 데이터셋으로 훈련되었다.
Llama 3
2024년 4월 18일, Meta는 80억 및 700억 개의 매개변수 크기로 Llama 3를 출시했다. 이 모델들은 약 15조 개의 토큰으로 구성된 공개 텍스트로 사전 훈련되었으며, 1천만 개 이상의 인간 주석 예제로 지시 미세 조정되었다. Llama 3 70B는 많은 벤치마크에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 능가했다. 이 모델들은 Chinchilla 최적량을 훨씬 초과하는 데이터로 훈련해도 성능이 계속 향상된다는 것을 보여주었으며, 80억 모델은 15조 토큰까지 로그-선형 확장을 나타냈다.
Meta는 또한 Llama 3를 다국어 및 다중 모달로 만들고, 컨텍스트 창을 늘릴 계획을 발표했다. 최신 버전인 Llama 4는 2025년 4월에 출시되었으며, 2026년 4월에는 Meta Superintelligence Labs가 Muse Spark를 Llama의 대체품으로 도입했다.
영향과 평가
Llama 2 및 후속 버전의 출시는 AI 환경에 상당한 영향을 미쳤다. Meta는 공개 가중치를 제공함으로써 연구자와 개발자가 특정 애플리케이션에 맞게 모델을 미세 조정할 수 있게 하여, 도구와 파생 모델의 활기찬 생태계를 조성했다. 그러나 라이선스 조건은 오픈 소스의 정의에 대한 논쟁을 촉발했으며, 비평가들은 허용 가능한 사용 정책이 자유를 제한한다고 주장했다.
Llama 모델은 학계와 산업계에서 널리 채택되었으며, 챗봇에서 코드 생성에 이르는 다양한 애플리케이션에 사용된다. 특히 크기 대비 성능은 제한된 계산 자원을 가진 조직에게 매력적이었다. 2025년 현재 Llama는 가장 주목할 만한 공개 가중치 LLM 제품군 중 하나로 남아 있으며, 후속 모델의 개발에 영향을 미치고 AI 접근성과 거버넌스에 대한 논의를 형성하고 있다.