LLaMA 2는 2023년 7월 18일 메타 AI가 마이크로소프트와 협력하여 출시한 대규모 언어 모델(LLM) 제품군이다. 이는 2023년 2월의 초기 출시에 이은 LLaMA(Large Language Model Meta AI) 시리즈의 2세대를 대표한다. 모델은 70억, 130억, 700억 매개변수의 세 가지 크기로 제공되었으며, 기반 모델과 채팅 애플리케이션용으로 미세 조정된 버전을 모두 포함했다. 전작과의 주요 차이점은 라이선스였다. 모든 LLaMA 2 모델은 가중치와 함께 출시되어 많은 상업적 사용 사례를 허용했지만, 라이선스의 허용 가능한 사용 정책으로 인해 오픈 소스 이니셔티브가 정의한 오픈 소스로 간주되지는 않았다.
이번 출시는 메타의 AI 모델 배포 방식에 있어 중요한 전환점을 의미했다. 첫 번째 LLaMA 모델은 사례별로 학술 연구자에게만 제한되었지만, LLaMA 2는 상업적 기관을 포함한 더 넓은 사용자층이 접근할 수 있게 되었다. 이러한 움직임은 업계에서 더 개방적인 모델 출시로 향하는 광범위한 추세의 일부였지만, AI 맥락에서 오픈 소스의 정의에 대한 논쟁도 촉발했다. 모델 아키텍처는 LLaMA 1에서 크게 변경되지 않았지만, 훈련 데이터는 40% 증가하여 다양한 벤치마크에서 성능을 향상시켰다.
배경 및 맥락
LLaMA 2의 개발은 대규모 언어 모델의 급속한 발전을 배경으로 이루어졌다. GPT-3와 같은 모델의 성공과 ChatGPT의 예상치 못한 인기에 이어, 기술 기업들 간에 유능한 LLM을 생산하기 위한 치열한 경쟁이 벌어졌다. 메타의 최고 AI 과학자 얀 르쿤은 대규모 언어 모델이 글쓰기 작업을 돕는 데 가장 적합하다고 공개적으로 밝혔으며, 이는 AI 역량에 대한 더 넓은 담론 속에서 메타의 접근 방식을 자리매김했다.
2023년 2월 24일에 발표된 첫 번째 LLaMA 모델은 이미 더 작은 모델이 훨씬 더 큰 모델과 경쟁할 수 있음을 입증했다. 130억 매개변수 버전은 대부분의 NLP 벤치마크에서 GPT-3(1750억 매개변수)를 능가했으며, 650억 매개변수 모델은 PaLM 및 Chinchilla와 같은 최첨단 시스템과 경쟁력을 갖추었다. 이러한 효율성은 부분적으로 공개적으로 이용 가능한 데이터로 훈련하고 딥러닝 및 신경망 설계에서 고급 기술을 사용한 덕분이었다.
모델 아키텍처 및 훈련
LLaMA 2의 아키텍처는 대규모 언어 모델의 표준이 된 Transformer (architecture) 프레임워크를 기반으로 했다. 모델은 LLaMA 1의 설계와 일관되게 멀티 헤드 어텐션 메커니즘과 위치 인코딩을 사용하여 훈련되었다. 훈련 과정은 첫 번째 버전에 비해 데이터 세트를 40% 확장하여 모델이 더 광범위한 텍스트 말뭉치에서 학습할 수 있게 했다.
700억 매개변수 모델은 제품군에서 가장 큰 모델로 고성능 애플리케이션용으로 설계되었으며, 70억 및 130억 버전은 계산 리소스가 제한된 연구자와 개발자에게 더 접근 가능한 옵션을 제공했다. 모든 모델은 기반 모델과 지시 조정 버전으로 출시되었으며, 후자는 채팅 및 대화 작업에 맞게 미세 조정되었다. 이러한 이중 출시는 처음에는 기반 모델만 있었던 LLaMA 시리즈에서 처음 있는 일이었다.
라이선스 및 상업적 이용 가능성
LLaMA 2의 정의적 특징은 라이선스 모델이었다. 비상업적 라이선스로 학술 연구자에게 제한되었던 LLaMA 1과 달리, LLaMA 2는 허용 가능한 사용 정책을 조건으로 상업적 사용을 허용하는 라이선스로 출시되었다. 이 정책은 불법 활동이나 해를 끼치는 것과 같은 특정 애플리케이션을 금지했지만, 광범위한 합법적 사용을 허용했다.
메타가 LLaMA 2를 "오픈 소스"로 규정한 것은 오픈 소스 정의를 유지하는 오픈 소스 이니셔티브에 의해 이의가 제기되었다. 비평가들은 허용 가능한 사용 정책과 기타 제한 사항이 라이선스가 진정한 오픈 소스 기준을 충족하지 못한다고 주장했다. 이 논쟁은 AI 커뮤니티에서 모델 출시의 개방성이 무엇을 의미하는지에 대한 지속적인 긴장을 부각시켰다.
LLaMA 2의 상업적 이용 가능성은 기업과 스타트업에게 중요했으며, 독점 제공업체의 비싼 라이선스 비용 없이 제품에 모델을 통합할 수 있게 했다. 이는 OpenAI 및 Anthropic과 같은 회사의 폐쇄형 모델 지배에 대한 대응책으로 여겨졌다.
영향 및 반응
LLaMA 2의 출시는 AI 커뮤니티에서 상당한 관심을 받았다. 특히 700억 매개변수 모델의 성능은 당시 다른 주요 모델과 경쟁력이 있었으며, 허용적 라이선스는 연구와 상업적 배포 모두에서 매력적인 옵션이 되었다. 여러 크기의 제공은 사용자가 엣지 디바이스에서 대규모 서버에 이르기까지 하드웨어 역량에 맞는 모델을 선택할 수 있게 했다.
LLaMA 2 이후 메타는 시리즈를 계속 개발하여 2023년 8월 코드 특정 작업용 Code Llama를 출시했고, 2024년 4월에는 개선된 성능과 더 큰 훈련 데이터 세트를 갖춘 LLaMA 3를 출시했다. LLaMA 제품군은 메타의 AI 전략의 초석이 되었으며, LLaMA를 기반으로 한 어시스턴트인 Meta AI의 개발로 이어졌고, 2025년 4월에는 LLaMA 4가 최종 출시되었다. 2026년 4월, 메타 슈퍼인텔리전스 연구소는 LLaMA를 대체하는 Muse Spark를 도입하여 메타 AI 모델의 다음 진화를 알렸다.
기술적 세부 사항 및 변형
LLaMA 2 모델은 Adam 옵티마이저 및 학습률 스케줄을 포함한 현대 LLM 개발에서 일반적인 기술을 사용하여 훈련되었다. 훈련 과정은 또한 그래디언트 클리핑과 레이어 정규화를 사용하여 훈련을 안정화하고 수렴을 개선했다. 이러한 방법은 당시 머신러닝의 최첨단을 반영한 표준이었다.
LLaMA 2의 특수 변형인 Code Llama는 코드 특정 데이터 세트로 미세 조정되었다. 70억, 130억, 340억 버전은 2023년 8월 24일에 출시되었으며, 700억 버전은 2024년 1월 29일에 이어졌다. 훈련에는 추가로 5000억 토큰의 코드 데이터가 포함되었고, 이후 200억 토큰의 장문 맥락 데이터가 포함되어 일반 코드 생성을 위한 기반 모델을 만들었다. 50억 토큰의 지시 따르기 데이터로 추가 미세 조정을 통해 지시 버전이 생성되었으며, 별도의 Python 중심 모델은 1000억 토큰의 Python 코드로 훈련되었다.
이러한 기술적 발전은 LLaMA 2를 자연어 처리에서 소프트웨어 개발에 이르기까지 다양한 애플리케이션을 위한 다재다능한 플랫폼으로 자리매김했다. 이번 출시는 또한 아마존 웹 서비스 및 Azure와 같은 회사가 클라우드 플랫폼에서 LLaMA 2를 제공하여 더 넓은 사용자층이 접근할 수 있게 하면서 더 넓은 생태계의 혁신을 촉진했다.