Llama(스타일상 LLaMA로 표기되며, "Large Language Model Meta AI"가 역두문자어(backronym)로 사용됨)는 Meta AI가 개발한 대규모 언어 모델(LLM) 계열로, 2023년 2월에 처음 출시되었다. 모델은 10억 개에서 2조 개의 매개변수 범위로 제공된다. 초기 첫 버전은 비상업적 라이선스 하에 연구자에게만 제공되는 기반 모델이었지만, Llama 2부터 Meta는 기반 모델과 함께 지시 미세 조정 버전을 더 넓은 라이선스 조건으로 출시했다. 2023년 3월 BitTorrent를 통한 첫 모델 가중치의 무단 유출은 오픈소스 LLM 파생 모델과 도구의 확산을 크게 가속화했다.
Llama 모델은 다른 현대 LLM과 유사하게 Transformer (architecture) 아키텍처를 기반으로 한다. 여러 버전으로 출시되었으며, 각 버전은 규모, 학습 데이터, 성능에서 개선을 도입했다. 2025년 기준 최신 버전은 2025년 4월에 출시된 Llama 4이며, Meta는 Llama를 자사의 Meta AI 어시스턴트에도 통합했다.
배경
GPT-3과 같은 초기 대규모 언어 모델의 출시 이후, 주요 연구 초점은 모델 확장이었으며, 이는 일부 경우 창발적 능력에서 상당한 향상을 가져왔다. 2022년 말 ChatGPT의 출시와 예상치 못한 성공은 LLM에 대한 대중과 산업의 관심을 극적으로 증가시켰다. 이에 대해 Meta의 최고 AI 과학자 Yann LeCun은 대규모 언어 모델이 글쓰기 지원에 가장 적합하다고 언급하며, 다른 기술 기업들의 공격적인 배포와 비교하여 신중한 입장을 반영했다.
초기 출시
Llama의 첫 버전(때때로 Llama 1로 불림)은 2023년 2월 24일에 블로그 게시물과 학습, 아키텍처, 성능을 상세히 설명하는 논문을 통해 발표되었다. 추론 코드는 오픈소스 GPLv3 라이선스로 공개되었지만, 모델 가중치에 대한 접근은 신청 절차를 통해 제한되었으며, 학술 연구자, 정부, 시민 사회, 산업 연구소에 사례별로 접근이 허용되었다. 모델은 공개적으로 이용 가능한 데이터만으로 학습되었으며, 다양한 하드웨어 성능을 수용하기 위해 여러 모델 크기(7B, 13B, 33B, 65B 매개변수)로 제공되었다. 이는 기반 모델만 제공되었지만, 논문에는 지시 미세 조정의 예시가 포함되었다.
Meta는 13B 매개변수 모델이 대부분의 NLP 벤치마크에서 훨씬 더 큰 GPT-3(175B 매개변수)를 능가했으며, 가장 큰 65B 모델은 PaLM 및 Chinchilla와 같은 최첨단 모델과 경쟁력이 있다고 보고했다.
유출과 여파
2023년 3월 3일, Llama의 가중치를 포함한 토렌트가 업로드되었고, 링크는 4chan 이미지보드에 공유된 후 온라인 AI 커뮤니티를 통해 확산되었다. 같은 날, 공식 Llama 저장소의 풀 리퀘스트가 문서에 마그넷 링크를 추가할 것을 요청했다. 3월 4일, 또 다른 풀 리퀘스트가 모델을 호스팅하는 HuggingFace 저장소에 대한 링크를 추가했다. Meta는 3월 6일에 배포가 무단이라고 특성화하며 삭제 요청을 제기했고, HuggingFace는 이를 준수했다. 3월 20일, Meta는 미러에서 Llama를 다운로드하는 스크립트를 포함한 저장소에 대해 DMCA 삭제 요청을 제기했고, GitHub는 다음 날 이를 준수했다.
유출에 대한 반응은 엇갈렸다. 일부는 모델이 더 정교한 스팸과 같은 악의적인 목적으로 사용될 수 있다고 추측했다. 다른 이들은 접근성을 환영하며, 더 작은 버전이 비교적 저렴하게 실행될 수 있어 추가 연구를 촉진할 수 있다고 언급했다. Simon Willison과 같은 논평가들은 Llama를 공개적으로 배포된 텍스트-이미지 모델인 Stable Diffusion과 비교하며, 빠른 도구 개발을 촉진한 것과 유사한 효과가 LLM에도 있을 것이라고 제안했다.
Llama 2
2023년 7월 18일, Microsoft와 협력하여 Meta는 차세대 Llama 2를 발표했으며, 모델 크기는 7B, 13B, 70B 매개변수로 제공되었다. 아키텍처는 Llama 1에서 크게 변경되지 않았지만, 학습에는 40% 더 많은 데이터가 사용되었다. Llama 2는 기반 모델과 채팅 미세 조정 모델을 모두 포함했으며, 모든 가중치는 많은 상업적 용도로 공개되었다. 그러나 라이선스에는 허용 가능한 사용 정책이 포함되어 있어 Open Source Initiative에 의해 오픈소스로 간주되지 않으며, Meta의 용어 사용에 대해 논란이 있었다.
Code Llama는 코드 특화 데이터셋에 대한 Llama 2의 미세 조정 버전으로, 2023년 8월 24일에 7B, 13B, 34B 버전으로 출시되었고, 2024년 1월 29일에 70B 버전이 출시되었다. 기반 모델은 추가로 500B 토큰의 코드 데이터로 학습된 후 20B 토큰의 장문맥 데이터로 학습되었으며, 추가로 5B 토큰으로 지시 튜닝되었다. Python 특화 모델은 100B 토큰의 Python 코드로 학습되었다.
Llama 3
2024년 4월 18일, Meta는 Llama 3를 8B 및 70B 매개변수의 두 가지 크기로 출시했다. 모델은 공개적으로 이용 가능한 소스에서 약 15조 토큰으로 사전 학습되었으며, 지시 모델은 공개 지시 데이터셋과 1천만 개 이상의 인간 주석 예시로 미세 조정되었다. Meta의 테스트에 따르면 Llama 3 70B는 대부분의 벤치마크에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 능가했다. Meta는 Llama 3를 다국어, 멀티모달로 만들고, 코딩 및 추론 능력을 향상시키며, 컨텍스트 창을 늘릴 계획을 발표했다.
스케일링 법칙에 관해, Llama 3 모델은 Chinchilla 최적 학습 데이터 양을 넘어서도 성능이 로그-선형적으로 계속 확장됨을 경험적으로 보여주었다. 예를 들어, Llama 3 8B에 대한 Chinchilla 최적 데이터셋은 2000억 토큰이지만, 성능은 15조 토큰(75배 더 많음)까지 향상되었다. 인터뷰에서 Mark Zuckerberg는 8B 버전이 가장 큰 Llama 2와 거의 동등한 성능을 보였으며, 70B 모델은 GPU 자원을 다른 곳에 할당하기 위해 학습이 중단된 시점에도 여전히 학습 중이었다고 언급했다.
Llama 3.1은 2024년 7월 23일에 출시되었으며, 405B 매개변수 모델을 도입하고, 업데이트된 8B 및 70B 버전과 함께 128K 토큰의 더 긴 컨텍스트 창 및 향상된 다국어 지원을 제공했다.
Llama 4 및 이후
Llama 4는 2025년 4월에 출시되었으며, 최대 2조 개의 매개변수를 가진 mixture-of-experts 아키텍처를 특징으로 한다. 멀티모달 능력과 향상된 추론을 도입했다. 2026년 4월, Meta Superintelligence Labs는 Llama를 대체하는 Muse Spark를 출시하여 Meta의 AI 전략 변화를 알렸다.
영향과 생태계
Llama 1 가중치의 유출은 활기찬 오픈소스 생태계를 촉발했으며, 수많은 미세 조정 및 파생 모델이 등장했다. 이는 연구자와 취미 개발자가 API 비용 없이 LLM을 실험할 수 있게 했고, 양자화, 효율적 추론, 로컬 배포에서 혁신을 이끌었다. 7B 및 13B와 같은 더 작은 모델의 가용성은 소비자 하드웨어에서 LLM을 실행하는 것을 가능하게 하여 접근성을 민주화했다. 이는 OpenAI 및 Anthropic과 같은 다른 주요 연구소의 폐쇄적 접근 방식과 대조되었으며, 다른 조직의 후속 출시에 영향을 미쳤다. 라이선스에 대한 논란은 오픈소스 이상과 기업 통제 사이의 긴장을 부각시켰으며, 이는 AI 커뮤니티에서 계속되는 논쟁이다.