LLaMA(Large Language Model Meta AI, 역두문자어로 사용됨)는 2023년 2월부터 Meta AI가 출시한 대규모 언어 모델(LLM) 계열이다. 모델은 10억 개에서 2조 개의 매개변수에 이르는 다양한 크기로 제공된다. 처음에는 기반 모델로 출시되었으며, Llama 2부터 Meta AI는 기반 모델과 함께 지시 미세 조정 버전도 출시했다. 최신 버전은 2025년 4월에 출시된 Llama 4이다. 2026년 4월, Meta Superintelligence Labs는 Llama를 대체하는 Muse Spark를 출시했다.
배경
GPT-3과 같은 대규모 언어 모델이 출시된 후, 연구의 초점은 모델 확장에 맞춰졌으며, 일부 사례에서는 emergent 능력의 큰 증가가 나타났다. ChatGPT의 출시와 예상치 못한 성공은 대규모 언어 모델에 대한 관심을 증가시켰다. ChatGPT에 대한 다른 대응과 비교하여, Meta의 최고 AI 과학자 Yann LeCun은 대규모 언어 모델이 글쓰기 지원에 가장 적합하다고 밝혔다.
버전
초기 출시
Llama의 첫 번째 버전(LLaMA로 표기되며 때로는 Llama 1로 불림)은 2023년 2월 24일에 블로그 게시물과 모델의 훈련, 아키텍처, 성능을 설명하는 논문을 통해 발표되었다. 모델을 실행하는 데 사용되는 추론 코드는 오픈 소스 GPLv3 라이선스로 공개적으로 배포되었다. 모델 가중치에 대한 접근은 신청 절차로 관리되었으며, 접근 권한은 "학술 연구자, 정부, 시민 사회, 학계 조직에 소속된 자, 그리고 전 세계 산업 연구소에 사례별로 부여"되었다.
Llama는 공개적으로 이용 가능한 정보만으로 훈련되었으며, 다양한 하드웨어에 더 접근하기 쉽도록 여러 모델 크기로 훈련되었다. 모델은 전적으로 기반 모델이었지만, 논문에는 지시 미세 조정 버전의 예시가 포함되어 있었다. Meta AI는 대부분의 NLP 벤치마크에서 13B 매개변수 모델의 성능이 훨씬 더 큰 GPT-3(175B 매개변수)를 능가했으며, 가장 큰 65B 모델은 PaLM 및 Chinchilla와 같은 최첨단 모델과 경쟁력이 있다고 보고했다.
#### 유출
2023년 3월 3일, Llama의 가중치를 포함한 토렌트가 업로드되었고, 토렌트 링크는 4chan 이미지보드에서 공유된 후 온라인 AI 커뮤니티로 퍼졌다. 같은 날, 공식 문서에 마그넷 링크를 추가하라는 요청이 주요 Llama 저장소에 풀 리퀘스트로 열렸다. 3월 4일, 모델을 포함한 HuggingFace 저장소에 대한 링크를 추가하는 풀 리퀘스트가 열렸다. 3월 6일, Meta는 모델의 "무단 배포"로 특징지으며 풀 리퀘스트에 연결된 HuggingFace 저장소를 제거하라는 삭제 요청을 제기했다. HuggingFace는 요청을 준수했다. 3월 20일, Meta는 미러에서 Llama를 다운로드하는 스크립트를 포함한 저장소에 대해 저작권 침해로 DMCA 삭제 요청을 제기했고, GitHub는 다음 날 준수했다.
유출에 대한 반응은 다양했다. 일부는 모델이 더 정교한 스팸과 같은 악의적인 목적으로 사용될 것이라고 추측했다. 일부는 모델의 접근성과 더 작은 버전의 모델을 비교적 저렴하게 실행할 수 있다는 사실을 환영하며, 이것이 추가 연구 개발의 번영을 촉진할 것이라고 제안했다. Simon Willison을 포함한 여러 논평가는 Llama를 Stable Diffusion과 비교했다. Stable Diffusion은 이전의 비슷한 수준의 모델과 달리 공개적으로 배포된 텍스트-이미지 모델로, 관련 도구, 기술, 소프트웨어의 빠른 확산을 이끌었다.
Llama 2
2023년 7월 18일, Microsoft와 협력하여 Meta는 Llama의 차세대인 Llama 2(LLaMa 2로 표기)를 발표했다. Meta는 Llama 2를 7, 13, 70억 개의 매개변수라는 세 가지 모델 크기로 훈련하고 출시했다. 모델 아키텍처는 Llama 1 모델과 크게 변하지 않았지만, 기반 모델을 훈련하는 데 40% 더 많은 데이터가 사용되었다.
Llama 2에는 기반 모델과 채팅용으로 미세 조정된 모델이 포함된다. 원래 버전의 Llama와의 또 다른 차이점으로, 모든 모델은 가중치와 함께 출시되며 많은 상업적 사용 사례에 사용될 수 있다. Llama의 라이선스가 일부 목적에 Llama 사용을 금지하는 허용 사용 정책을 적용하기 때문에, 이는 오픈 소스가 아니다. Llama를 설명하는 Meta의 오픈 소스 용어 사용은 Open Source Initiative(오픈 소스 정의를 유지하는 기관)와 다른 이들에 의해 논쟁되었다.
Code Llama는 코드 특정 데이터 세트로 미세 조정된 Llama 2이다. 7B, 13B, 34B 버전은 2023년 8월 24일에 출시되었고, 70B 버전은 2024년 1월 29일에 출시되었다. Llama 2의 기반 모델에서 시작하여, Meta AI는 추가로 500B 토큰의 코드 데이터 세트를 훈련한 후, 20B 토큰의 장문 컨텍스트 데이터를 추가로 훈련하여 Code Llama 기반 모델을 만들었다. 이 기반 모델은 지시 미세 조정을 만들기 위해 5B 토큰의 지시 따르기 데이터로 추가 훈련되었다. Python 코드용 기반 모델도 만들어졌으며, 장문 컨텍스트 데이터 전에 100B 토큰의 Python 전용 코드로 훈련되었다.
Llama 3
2024년 4월 18일, Meta는 두 가지 크기(8B 및 70B 매개변수)로 Llama 3를 출시했다. 모델은 "공개적으로 이용 가능한 출처"에서 수집된 약 15조 개의 토큰 텍스트로 사전 훈련되었으며, 지시 모델은 "공개적으로 이용 가능한 지시 데이터 세트와 1,000만 개 이상의 인간 주석 예시"로 미세 조정되었다. Meta AI의 테스트는 2024년 4월에 Llama 3 70B가 대부분의 벤치마크에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 능가한다는 것을 보여주었다. Meta는 또한 Llama 3를 다국어 및 다중 모달로 만들고, 코딩 및 추론 능력을 향상시키며, 컨텍스트 창을 늘릴 계획을 발표했다.
스케일링 법칙과 관련하여, Llama 3 모델은 모델이 "Chinchilla-최적" 양보다 더 많은 데이터로 훈련될 때 성능이 로그-선형적으로 계속 확장된다는 것을 경험적으로 보여주었다. 예를 들어, Llama 3 8B의 Chinchilla-최적 데이터 세트는 2,000억 개의 토큰이지만, 성능은 75배 더 큰 15조 개의 토큰 데이터 세트까지 로그-선형적으로 계속 확장되었다. Dwarkesh Patel과의 인터뷰에서 Mark Zuckerberg는 Llama 3의 8B 버전이 가장 큰 Llama 2와 거의 동등한 성능을 가졌다고 말했다. 이전 모델과 비교하여, Zuckerberg는 팀이 15T 토큰 훈련이 끝날 때에도 70B 모델이 여전히 학습 중이라는 사실에 놀랐다고 밝혔다. 훈련을 종료하기로 결정한 것은 GPU 성능을 다른 곳에 집중하기 위해서였다.
Llama 3.1은 2024년 7월 23일에 8B, 70B, 405B 매개변수 크기로 출시되었다. 405B 모델은 혼합 전문가 모델이 된 첫 번째 Llama였으며, 재배포 및 수정을 허용하지만 다른 대규모 언어 모델을 개선하는 데 사용하는 데 제한이 있는 라이선스로 출시되었다. Llama 3.2는 2024년 9월 25일에 엣지 장치용 1B 및 3B, 비전 작업용 11B 및 90B 크기로 출시되었다. Llama 3.3은 2024년 12월 6일에 효율성에 최적화된 70B 모델로 출시되었다.
Llama 4
Llama 4는 2025년 4월에 출시되었다. 초기 출시에는 Llama 4 Scout, Maverick, Behemoth가 포함되었다. Scout와 Maverick은 오픈 가중치 모델로 출시되었고, Behemoth는 미리보기로 출시되었다. Scout는 1,000만 토큰 컨텍스트 창을 가진 17B 매개변수 모델이고, Maverick은 100만 토큰 컨텍스트 창을 가진 400B 매개변수 혼합 전문가 모델이다. Behemoth는 출시 당시 아직 훈련 중이던 2조 매개변수 혼합 전문가 모델이다.
수용 및 영향
Llama의 초기 출시, 특히 유출은 AI 커뮤니티에 상당한 영향을 미쳤다. 더 작은 모델의 접근성은 소비자 하드웨어에서 연구 및 개발을 가능하게 했으며, 미세 조정 변형과 도구의 확산을 촉진했다. Llama 모델은 학술 연구 및 상업 응용 프로그램에서 널리 사용되었으며, 다른 조직의 후속 오픈 가중치 모델 출시에 영향을 미쳤다. Llama 3 및 Llama 4의 출시는 이러한 추세를 계속했으며, Meta는 Llama를 OpenAI, Anthropic, Google DeepMind의 독점 모델에 대한 선도적인 오픈 가중치 대안으로 자리매김했다.