Meta Llama는 2023년 2월에 처음 출시된 Meta AI가 개발한 대규모 언어 모델(LLM) 제품군이다. "Llama"라는 이름은 "Large Language Model Meta AI"의 역두문자어 역할을 한다. 이 모델들은 연구 및 상업적 사용이 가능하도록 설계되었으며, 매개변수 크기는 10억 개에서 2조 개 이상으로 다양하다. 처음에 Llama는 기반 모델이었지만, Llama 2부터 Meta AI는 지시 미세 조정 버전도 출시했다. 최신 버전인 Llama 4는 2025년 4월에 출시되었으며, 2026년 4월에는 Meta Superintelligence Labs가 Llama를 대체하는 Muse Spark를 도입했다.
배경
Meta Llama의 개발은 대규모 언어 모델의 급속한 발전을 배경으로 이루어졌다. GPT-3와 같은 모델 출시 이후 연구는 확장에 초점을 맞추었으며, 이는 때때로 창발적 능력의 상당한 향상으로 이어졌다. ChatGPT의 출시와 예상치 못한 성공은 LLM에 대한 대중과 업계의 관심을 높였다. ChatGPT에 대응하여 Meta의 최고 AI 과학자 Yann LeCun은 대규모 언어 모델이 글쓰기 작업을 돕는 데 특히 유용하다고 언급하며, Meta의 신중하지만 적극적인 입장을 반영했다.
초기 출시 및 유출
첫 번째 버전의 Llama는 LLaMA로 표기되며 때로는 Llama 1이라고도 불리며, 2023년 2월 24일에 블로그 게시물과 훈련, 아키텍처 및 성능을 상세히 설명하는 논문을 통해 발표되었다. 추론 코드는 오픈소스 GPLv3 라이선스로 공개되었지만, 모델 가중치에 대한 접근은 학술 연구자와 관련 기관으로 제한되었으며, 사례별로 승인되었다. 이 모델은 공개적으로 이용 가능한 데이터로 훈련되었으며, 다양한 하드웨어 성능을 수용하기 위해 여러 크기로 제공되었다. Meta는 13B 매개변수 모델이 대부분의 NLP 벤치마크에서 훨씬 더 큰 GPT-3(175B 매개변수)를 능가했으며, 가장 큰 65B 모델은 PaLM 및 Chinchilla와 같은 최첨단 모델과 경쟁력이 있다고 보고했다.
2023년 3월 3일, Llama의 가중치가 포함된 토렌트가 4chan에 유출되어 AI 커뮤니티를 통해 확산되었다. Meta는 무단 배포 및 저작권 침해를 이유로 HuggingFace 저장소와 GitHub 스크립트에 대한 삭제 요청을 제기했다. 반응은 엇갈렸는데, 일부는 오용을 우려한 반면, 다른 이들은 빠른 혁신을 촉발한 Stable Diffusion의 공개 배포와 비교하며 접근성을 환영했다.
Llama 2
2023년 7월 18일, Meta는 Microsoft와 협력하여 7B, 13B 및 70B 매개변수 크기로 제공되는 Llama 2를 발표했다. 아키텍처는 Llama 1에서 크게 변경되지 않았지만, 훈련 데이터는 40% 증가했다. Llama 2에는 기반 모델과 채팅 미세 조정 모델이 모두 포함되었으며, 가중치는 허용 가능한 사용 정책을 부과하는 라이선스에 따라 상업적 사용을 위해 공개되어 오픈소스 자격 여부에 대한 논쟁을 불러일으켰다. Open Source Initiative는 라이선스 제한으로 인해 진정한 오픈소스가 될 수 없다고 주장했다.
코드 생성을 위한 Llama 2의 미세 조정 버전인 Code Llama는 2023년 8월 24일에 7B, 13B 및 34B 버전으로 출시되었으며, 70B 버전은 2024년 1월 29일에 출시되었다. 훈련에는 추가로 500B 토큰의 코드 데이터와 20B 토큰의 장문 컨텍스트 데이터가 포함되었으며, 지시 따르기 및 Python 특화 모델에 대한 추가 미세 조정이 이루어졌다.
Llama 3
2024년 4월 18일, Meta는 8B 및 70B 매개변수 크기의 Llama 3를 출시했다. 이 모델들은 공개적으로 이용 가능한 소스의 약 15조 토큰으로 사전 훈련되었으며, 지시 모델은 공개 지시 데이터 세트와 1,000만 개 이상의 인간 주석 예제로 미세 조정되었다. Meta의 벤치마크에 따르면 Llama 3 70B는 대부분의 테스트에서 Gemini Pro 1.5 및 Claude 3 Sonnet을 능가했다. Meta는 다국어 및 다중 모달 기능, 향상된 코딩 및 추론, 더 큰 컨텍스트 창에 대한 계획을 발표했다.
Llama 3는 성능이 Chinchilla 최적 훈련 데이터 양을 넘어서도 로그-선형적으로 계속 확장됨을 보여주었다. 예를 들어, 8B 모델의 Chinchilla 최적 데이터 세트는 2,000억 토큰이지만, 성능은 15조 토큰까지 향상되었다. Mark Zuckerberg는 8B 버전이 가장 큰 Llama 2와 거의 동등한 성능을 보였으며, 70B 모델은 GPU 리소스를 다른 곳에 할당하기 위해 중단된 훈련이 끝날 때까지 여전히 학습 중이었다고 언급했다.
Llama 3.1은 2024년 7월 23일에 추가 개선 사항과 확장된 컨텍스트 길이로 출시되었다.
Llama 4 및 후속 모델
Llama 4는 2025년 4월에 출시되어 향상된 기능으로 모델 제품군의 진화를 이어갔다. 2026년 4월, Meta Superintelligence Labs는 Llama를 대체하는 Muse Spark를 출시하여 새로운 세대의 모델로의 전환을 알렸다.
응용 및 생태계
Meta Llama 모델은 다양한 제품과 서비스에 통합되었다. Llama 3와 함께 Meta는 Llama 기반으로 구축된 AI 어시스턴트인 Meta AI를 출시했으며, 전용 웹사이트와 Facebook 및 WhatsApp과 같은 플랫폼에서 이용할 수 있다. 이 모델들은 또한 Amazon Web Services, Microsoft Azure 및 Google Cloud를 포함한 타사 개발자와 클라우드 제공업체에서 기업에 LLM 기능을 제공하는 데 사용된다. Llama의 오픈 가중치 특성은 생성형 AI 모델 주변 커뮤니티와 유사하게 미세 조정 변형 및 도구의 활기찬 생태계를 조성했다.
평가 및 영향
Llama 모델의 출시는 AI 환경에 상당한 영향을 미쳤다. Llama 1의 유출은 강력한 LLM에 대한 접근을 민주화하여 대기업 외부에서도 연구와 실험이 가능하게 했다. Llama 2 및 이후 버전은 OpenAI 및 Anthropic의 독점 모델에 대한 상업적으로 실행 가능한 대안을 제공했다. 그러나 라이선스 조건은 오픈소스의 정의에 대한 논쟁을 촉발했으며, 비평가들은 허용 가능한 사용 정책이 특정 응용 프로그램을 제한한다고 지적했다. 그럼에도 불구하고 Llama는 오픈 가중치 모델의 벤치마크가 되었으며, 인공지능 분야의 다른 오픈소스 노력의 발전에 영향을 미쳤다.
기술 아키텍처
Llama 모델은 Transformer 아키텍처를 기반으로 하며, 멀티 헤드 어텐션 및 위치 인코딩을 활용한다. 또한 레이어 정규화 및 잔차 연결과 같은 기술을 사용하여 훈련을 안정화한다. 모델은 SGD 변형인 Adam과 같은 옵티마이저로 훈련되며, 학습률 스케줄 및 그래디언트 클리핑을 사용한다. 추론의 경우 top-k 샘플링 및 top-p 샘플링이 온도 스케일링과 함께 일반적으로 사용된다. Llama 3에서 관찰된 스케일링 법칙은 최적 훈련 데이터 크기에 대한 연구에 정보를 제공하여 딥러닝 및 신경망에 대한 더 넓은 이해에 기여했다.
향후 방향
2026년 Muse Spark의 도입으로 Meta Superintelligence Labs는 잠재적으로 머신러닝 및 생성형 AI의 발전을 통합하여 AI 기능의 경계를 넓히는 것을 목표로 한다. Llama에서 Muse Spark로의 전환은 Llama 개발에서 얻은 교훈을 바탕으로 더 강력하고 효율적인 모델을 향한 전략적 변화를 시사한다. 분야가 발전함에 따라 Meta의 기여는 혁신과 안전 고려 사항의 균형을 유지하면서 오픈 가중치 AI 모델의 환경을 계속 형성하고 있다.