메타 라마 2 출시

영어에서 번역됨

Llama 2는 2023년 7월 Meta AI가 출시한 대규모 언어 모델 제품군으로, 가중치를 상업적 용도로 공개하여 오픈소스 AI 생태계를 확장한 점에서 주목할 만하다.

Llama 2는 메타 AI가 마이크로소프트와 협력하여 2023년 7월 18일에 출시한 대규모 언어 모델(LLM) 계열이다. 이는 원래 Llama 모델의 후속작으로, 기반 모델과 명령어 튜닝된 채팅 버전을 모두 포함한다. 전작과 달리 Llama 2는 허용 가능한 사용 정책에 따라 상업적 용도로 널리 사용할 수 있는 가중치로 제공되었으며, 이는 오픈소스 AI 생태계에 큰 영향을 미쳤다.

Llama 2 모델은 더 넓은 Large language model 환경의 일부로, Transformer (architecture) 아키텍처와 Deep learning 기술의 발전을 기반으로 한다. 이 출시는 강력한 AI에 대한 접근성을 민주화하는 주요 단계로 여겨졌으며, OpenAIGoogle DeepMind와 같은 기업의 독점 모델에 대한 경쟁력 있는 대안을 제공했다.

배경

2020년대 초반 대규모 언어 모델의 급속한 발전은 Generative AI 도구의 성공과 얽혀 있으며, Llama의 등장을 위한 토대를 마련했다. GPT-3의 출시는 모델 크기를 확장하면 능력이 극적으로 향상될 수 있음을 보여주었다. 2022년 11월, OpenAI는 ChatGPT를 출시하여 광범위한 주목을 받았고 AI 연구와 투자의 급증을 촉발했다.

메타의 AI 연구 부서인 메타 AI는 Google DeepMind 및 다른 연구자들이 개발한 Transformer (architecture) 아키텍처와 같은 주목할 만한 기여를 통해 이 분야에서 활동해 왔다. 메타의 수석 AI 과학자인 얀 르쿤은 대규모 언어 모델에 대한 과대광고에 대해 공개적으로 회의적인 입장을 표명하며, 이러한 모델이 글쓰기 작업을 지원하는 데 가장 적합하다고 말했다. 이는 AI를 더 실용적이고 접근 가능하게 만드는 데 초점을 맞춘 메타의 방향을 반영한다.

초기 출시 및 유출

원래 Llama 계열(Llama 1, LLaMA로 표기)은 2023년 2월 24일 블로그 게시물과 기술 논문을 통해 발표되었다. 10억에서 650억 매개변수 크기로 제공되었으며 공개 데이터로 훈련되었다. 처음에는 모델 가중치가 비상업적 라이선스 하에 연구자에게만 사례별로 접근 가능했다.

그러나 가중치는 곧 온라인에 유출되었다. 2023년 3월, 가중치의 토렌트가 4chan에 공유되어 빠르게 퍼졌다. 메타는 모델을 호스팅하는 저장소에 대해 HuggingFace와 GitHub에 삭제 요청을 보냈지만, 유출로 인해 광범위한 개인 사용과 연구가 가능해졌다. 많은 사람들이 이 유출을 오픈 AI의 전환점으로 보았으며, Stable Diffusion이 혁신을 가속화한 것과 비교했다.

Llama 2 출시

2023년 7월 18일, 마이크로소프트와 협력하여 메타는 Llama 계열의 차세대 모델인 Llama 2를 발표했다. 회사는 70억, 130억, 700억 매개변수의 세 가지 크기를 출시했다. 메타는 또한 기반 모델과 미세 조정된 변형을 모두 출시했다. 특히 채팅 미세 조정 버전은 대화용으로 설계되었다.

모델은 원래 Llama보다 40% 더 많은 데이터로 훈련되었지만 아키텍처는 크게 변경되지 않았다. Llama 2 모델은 Residual Network (ResNet) 블록과 주의 메커니즘을 사용했으며, Layer Normalization 및 기타 혁신의 이점을 활용했다. 명령어 미세 조정은 RLAIF 스타일 기술을 사용하여 지도 미세 조정과 인간 피드백을 결합했다.

상업적 이용 가능성 및 라이선스

Llama 2 출시의 가장 주목할 만한 측면은 많은 상업적 응용 프로그램에 대해 가중치를 무료로 사용할 수 있도록 한 결정이었다. 메타는 상업 및 연구 목적 모두에 사용, 복제, 수정을 허용하는 맞춤형 라이선스로 모델을 출시했지만, 정책에 정의된 일부 사용 사례에 대한 제한이 있었다.

허용 가능한 사용 정책 및 기타 조건 때문에 많은 비평가들은 Llama 2가 오픈 소스 이니셔티브(OSI)의 기준에 따른 진정한 오픈소스가 아니라고 주장했다. 그럼에도 불구하고 상업적 사용이 가능한 강력한 언어 모델의 제공은 이정표가 되었으며, 소규모 조직과 개인이 유료 API에 의존하지 않고 기술을 기반으로 구축할 수 있게 했다.

마이크로소프트의 파트너십은 Microsoft Azure 인프라와의 통합으로 주목할 만했다. 모델은 Azure AI 모델 카탈로그에서 제공되었지만 직접 다운로드할 수도 있어 접근성이 높아졌다.

모델 아키텍처 및 훈련

Llama 2는 전작과 유사한 아키텍처를 사용했지만 확장 측면에서 조정이 있었다. 모델 크기는 700억 매개변수까지 확장되어 더 복잡한 패턴을 포착할 수 있었다. 훈련에는 웹 페이지, 책 및 기타 공개 데이터를 포함한 다양한 소스가 사용되었으며 품질 필터링에 중점을 두었다.

훈련 과정의 핵심 측면은 Learning Rate SchedulingModel Pruning과 같은 원리를 사용하여 교차 엔트로피 손실을 최적화하는 것이다. 메타는 또한 DropoutWeight Initialization과 같은 기술을 통합하여 성능을 개선했다.

7B, 13B 및 70B 모델이 제공되며, 70B 모델은 여러 GPU에서 실행되도록 설계되었다. Llama 2는 GPT-3Chinchilla와 같은 현대 모델과 비교 평가되었으며, 추론 및 코딩을 포함한 다양한 벤치마크 작업에서 경쟁력 있는 결과를 달성했다.

오픈소스 AI 생태계에 미친 영향

Llama 2의 상업적 접근성을 포함한 출시는 오픈소스 AI 생태계의 성장을 크게 가속화했다. 이는 독점 모델에 대한 대안을 제공하여 개발자, 연구자 및 스타트업 커뮤니티를 육성했다. AI21-LabsInflection AI와 같은 많은 기업이 자체 모델의 기반으로 Llama 2를 사용했다.

또한 이 출시는 Amazon Web Services, Google CloudOracle Cloud Infrastructure와 같은 클라우드 서비스와의 통합을 동반하여 배포를 용이하게 했다. 또한 하드웨어 공급업체인 AMD, IntelQualcomm은 Llama를 효율적으로 실행하도록 칩을 최적화했다.

파생 모델 및 미세 조정

Llama 2 모델은 다양한 응용 프로그램에 자주 미세 조정되었다. 주목할 만한 예로는 전문 코드 데이터 세트로 미세 조정된 Code Llama가 있다. 2023년 8월 24일에 처음에는 7B, 13B 및 34B 버전으로 출시되었고, 나중에 2024년 1월 29일에 70B 버전이 출시되었다. Code Llama는 기반 모델을 따라 5000억 토큰의 코드 데이터로 훈련되었다. Generative AI 커뮤니티는 창의적 글쓰기, 법률 지원 및 의료 조언을 위한 모델과 같은 많은 다른 미세 조정 모델을 생산했다.

모델 가중치의 접근성 덕분에 연구자들은 Model Pruning, Quantization 및 가중치와 같은 기술을 적용할 수 있었고, 소규모 AI 기업과 교육 기관이 기술을 연구하고 적응할 수 있게 되었다.

반응 및 비판

Llama 2에 대한 반응은 일반적으로 긍정적이었지만 우려도 있었다. 지지자들은 AI의 민주화와 혁신 촉진 가능성을 칭찬했으며, GPT-3.5와 같은 상업용 모델과 경쟁할 수 있다고 언급했다. 그러나 일부 비평가들은 라이선스 제한이 여전히 정의된 대로 완전히 "개방"되지 않아 자유의 범위를 제한한다고 지적했다.

허용 가능한 사용 정책은 감시, 스팸 및 악성 코드와 같은 영역의 응용 프로그램을 제한했다. 이는 오용을 방지하기 위한 노력으로 논의되었지만 유연성도 제한했다.

일부 연구자들은 Llama 2와 같은 대규모 모델 훈련의 환경 및 자원 문제도 지적했다. 훈련에는 상당한 컴퓨팅 성능이 필요하여 윤리적 및 실용적 문제가 제기되었다.

유산 및 미래

Llama 2는 오픈 AI의 새로운 표준을 설정했으며, 이후 2024년 4월 Llama 3의 출시로 이어졌다. 이 출시는 업계에 지속적인 영향을 미쳐 주요 상업 연구소가 모델 공유 방식을 재고하도록 했다. 또한 다른 제품의 기반으로서 오픈 AI 컬렉션의 성장을 장려했다.

Llama 2의 제한 사항이 있는 가중치 제공 방식은 다른 개발자들이 Meta AI와 같은 AI 어시스턴트를 구축하는 데 채택되었으며, 현재 Meta AI는 Llama 3을 기반으로 한다. 2025년 말 현재 Llama는 모델 계열이며, 새로운 모델의 등장에도 불구하고 Llama 2는 여전히 기초적인 이정표로 남아 있다.

요약

요약하면, 메타 Llama 2 발표는 생성 AI 발전에 있어 중요한 사건이었다. 강력한 성능과 허용적인 가중치를 결합함으로써, 메타의 결정은 오픈 AI 생태계를 형성하는 데 도움이 되었다. 이 사건은 상업적 AI에 대한 관심을 촉발한 중요한 전환점 중 하나로 자주 인용된다.

출시 당시 Llama 2는 다른 AI 모델의 더 제한적인 관행에서 벗어난 것을 의미했으며, 그 영향은 광범위했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-models·open-source-ai·meta-ai·artificial-intelligence
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사