메타 라마 3 출시

영어에서 번역됨

메타는 2024년 4월 18일, 8B 및 70B 매개변수 버전의 오픈 가중치 대규모 언어 모델 제품군인 Llama 3를 출시했으며, 이후 405B 모델로 확장되었다.

메타 라마 3는 2024년 4월 18일 메타 AI가 출시한 대규모 언어 모델 제품군입니다. 초기 출시에는 80억 개와 700억 개의 두 가지 모델 크기가 포함되었으며, 두 모델 모두 기본 및 명령어 튜닝 변형으로 제공되었습니다. 라마 3는 약 15조 개의 토큰으로 구성된 공개 텍스트 데이터에 대한 대규모 사전 학습과 당시 독점 모델과 경쟁할 만한 성능으로 주목을 받았습니다. 이후 버전인 라마 3.1은 2024년 7월 23일에 출시된 4050억 개의 매개변수 모델을 포함하도록 제품군을 확장했습니다. 라마 3 시리즈는 이전 라마 1 및 라마 2 출시를 기반으로 한 메타의 개방형 가중치 AI 개발 전략에서 중요한 단계를 나타냈습니다.

라마 3 모델은 상업적 사용을 허용하는 커뮤니티 라이선스에 따라 가중치가 공개되어 광범위하게 접근 가능하도록 설계되었으며, 이는 원래 라마의 더 제한적인 라이선스에서 벗어난 것입니다. 이 출시와 함께 페이스북과 왓츠앱에 통합된 어시스턴트인 메타 AI의 롤아웃도 이루어져 모델의 실제 적용을 보여주었습니다. 모델은 다양한 데이터 세트로 학습되었으며 추론, 코딩 및 일반 지식 벤치마크에서 강력한 성능을 보여 OpenAI, Anthropic, Google DeepMind의 모델에 대한 경쟁력 있는 대안으로 자리 잡았습니다.

배경 및 맥락

라마 3의 개발은 2022년 말 ChatGPT의 성공으로 촉발된 Large language model 연구의 급속한 발전을 배경으로 이루어졌습니다. OpenAI의 GPT-3 출시와 이후 ChatGPT의 인기에 따라 이 분야에서는 모델 확장 노력이 급증했으며, 일부는 추론 및 명령 수행에서 창발적 능력을 보여주었습니다. 메타의 초기 대응인 라마 1은 2023년 2월 연구 중심 모델로 출시되었으며, 가중치는 승인된 학술 연구자에게만 제공되었습니다. 2023년 3월 비트토렌트를 통해 유포된 모델의 유출은 개방형 접근에 대한 수요를 부각시켰고 AI 개발에서 개방형 모델의 역할에 대한 더 넓은 논의로 이어졌습니다.

2023년 7월 마이크로소프트와 협력하여 출시된 라마 2는 허용적 라이선스 하에 상업적 사용을 허용하면서 더 개방적인 접근으로 전환하는 계기가 되었습니다. 이는 규모와 능력 측면에서 개방형 가중치 모델의 경계를 넓히는 것을 목표로 한 라마 3의 토대를 마련했습니다. 라마 3의 출시는 또한 Generative AI가 주류 관심사가 되고 클라우드 제공업체와 하드웨어 기업의 대규모 투자가 이루어지던 시점에 이루어졌습니다.

모델 아키텍처 및 학습

라마 3 모델은 현대 대규모 언어 모델의 지배적인 설계인 Transformer (architecture) 아키텍처를 기반으로 합니다. 이 아키텍처는 이전 라마 버전에 비해 개선된 점을 포함하며, 더 큰 어휘 크기(128,256개 토큰)와 8,192개 토큰으로 증가된 컨텍스트 길이를 갖추고 있으며, 이후 업데이트에서 더 확장되었습니다. 모델은 Multi-Head AttentionPositional Encoding을 사용하는 표준 디코더 전용 설계를 사용하며, 다음 토큰 예측 목표로 학습되었습니다.

라마 3 학습의 핵심 특징은 데이터의 규모였습니다. 모델은 라마 2에 사용된 2조 개의 토큰보다 크게 증가한 약 15조 개의 공개 소스 텍스트 토큰으로 사전 학습되었습니다. 학습 데이터는 웹 페이지, 서적 및 과학 기사를 포함한 고품질 소스를 강조하고 다국어 및 코드 콘텐츠에 중점을 두어 선별되었습니다. 명령어 튜닝 버전은 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 및 지도 미세 조정과 같은 기술을 사용하여 공개 명령어 데이터 세트와 1,000만 개 이상의 인간 주석 예제로 추가 미세 조정되었습니다.

스케일링 법칙과 관련하여 라마 3 팀은 Chinchilla 최적 토큰 수를 훨씬 초과하여 학습해도 성능이 로그-선형적으로 계속 개선되는 것을 관찰했습니다. 8B 모델의 경우 Chinchilla 최적 데이터 세트 크기는 2,000억 개의 토큰으로 추정되었지만, 모델은 전체 15조 개의 토큰 학습에서 계속 이점을 얻었으며, 이는 더 큰 데이터 세트가 기존 권장 사항을 넘어 이득을 제공할 수 있음을 나타냅니다.

성능 및 벤치마크

2024년 4월 메타의 내부 평가에서 라마 3 70B 모델은 다양한 벤치마크에서 여러 주요 독점 모델을 능가했습니다. 구체적으로 Google DeepMind의 Gemini Pro 1.5와 Anthropic의 Claude 3 Sonnet을 추론, 코딩 및 일반 지식을 포함한 대부분의 표준 NLP 작업에서 능가했습니다. 더 작은 8B 모델은 메타 CEO 마크 저커버그에 따르면 가장 큰 라마 2 모델(70B)과 거의 동등한 성능을 보여 더 큰 학습 데이터 세트의 효율성 이점을 입증했습니다.

모델은 실제 응용에 중요한 코드 생성 및 수학적 추론에서 특히 강력한 성능을 보였습니다. 라마 3.1의 일부로 나중에 출시된 405B 모델은 이러한 결과를 더욱 개선하여 GPT-4 및 Claude 3.5 Sonnet과 같은 모델에 필적하는 많은 벤치마크에서 최첨단 성능을 달성했습니다.

출시 및 가용성

2024년 4월 18일의 초기 라마 3 출시에는 8B 및 70B 모델이 포함되었으며, 기본 및 명령어 튜닝 버전 모두 제공되었습니다. 모델은 메타 웹사이트와 Hugging Face와 같은 파트너 플랫폼을 통해 다운로드할 수 있게 되었습니다. 가중치는 상업적 사용을 허용하지만 군사적 사용이나 유해 콘텐츠 생성과 같은 특정 응용을 제한하는 허용 사용 정책을 포함하는 라마 3 커뮤니티 라이선스에 따라 공개되었습니다. 이 라이선스는 오픈 소스 이니셔티브에 의해 오픈 소스로 간주되지 않지만, 많은 독점 모델에 비해 허용적입니다.

메타는 또한 라마 3를 AI 어시스턴트인 메타 AI에 통합하여 페이스북, 왓츠앱 및 전용 웹사이트에서 사용할 수 있게 했습니다. 이 통합을 통해 사용자는 모델과 직접 상호 작용하여 채팅, 작성 및 코딩 작업에서의 기능을 보여줄 수 있었습니다. 출시와 함께 Amazon Web Services, Microsoft Azure, Google CloudOracle Cloud Infrastructure를 포함한 클라우드 제공업체와의 파트너십이 이루어져 관리형 서비스를 통해 모델에 접근할 수 있게 되었습니다.

생태계 및 하드웨어 지원

라마 3의 개방형 가중치 특성은 AI 생태계 전반에 걸친 빠른 채택을 촉진했습니다. 하드웨어 공급업체는 AMD, IntelNVIDIA를 포함한 라마 3 추론을 위해 플랫폼을 최적화했습니다. GroqSambaNova와 같은 전문 AI 칩 기업은 고속 추론 솔루션을 제공했으며, QualcommArm Holdings는 엣지 배포에 중점을 두었습니다. 클라우드 제공업체는 사전 구성된 환경을 제공했으며, AWS Trainium 및 기타 맞춤형 실리콘은 미세 조정 및 학습에 사용되었습니다.

모델은 또한 다양한 소프트웨어 프레임워크와 도구에 통합되어 개발자가 최소한의 노력으로 응용 프로그램을 구축할 수 있게 했습니다. 여러 모델 크기의 가용성 덕분에 엣지 장치에서 데이터 센터에 이르는 다양한 하드웨어에 배포할 수 있어 라마 3는 연구와 생산 모두에서 다재다능한 선택이 되었습니다.

영향 및 반응

라마 3의 출시는 AI 커뮤니티에서 상당한 관심을 받았으며, 많은 사람들이 모델의 성능과 가중치의 개방성을 칭찬했습니다. 이는 OpenAIAnthropic의 폐쇄적 접근에 대한 대안으로 여겨졌으며, 투명성과 통제를 선호하는 연구자와 개발자에게 대안을 제공했습니다. 벤치마크에서 모델의 강력한 성능은 개방형 가중치 모델의 기준을 높여 다른 조직이 자체 개발 노력을 가속화하도록 촉구했습니다.

그러나 출시는 또한 오픈 모델의 잠재적 오용, 특히 허위 정보, 스팸 및 기타 악의적 사용에 대한 우려에 대한 논의를 촉발했습니다. 메타가 허용 사용 정책을 포함한 결정은 이러한 위험을 완화하려는 시도였지만, 비평가들은 가중치가 공개되면 그러한 정책을 시행하기 어렵다고 주장했습니다. 이 논쟁은 라마 1 유출 이후의 이전 논의를 반영했습니다.

향후 개발

초기 출시 이후 메타는 라마 3 제품군을 계속 반복했습니다. 2024년 7월 23일에 출시된 라마 3.1은 405B 모델을 도입하고 컨텍스트 길이를 128,000개 토큰으로 확장하여 더 긴 형식의 추론과 문서 처리를 가능하게 했습니다. 405B 모델은 효율성을 개선하기 위해 데이터 정리 및 Model Pruning 기술의 조합으로 학습되었습니다. 메타는 또한 라마 3를 다국어 및 다중 모드로 만들고 이미지 및 비디오 이해를 지원하며 코딩 및 추론 능력을 개선할 계획을 발표했습니다.

2025년 4월 메타는 제품군의 차세대인 라마 4를 출시하여 모델 크기를 더 확장하고 혼합 전문가 아키텍처를 도입했습니다. 앞으로 메타 슈퍼인텔리전스 연구소는 2026년 4월 라마를 대체하는 Muse Spark를 출시하여 회사의 AI 전략 전환을 알렸습니다. 그럼에도 불구하고 라마 3는 개방형 대규모 언어 모델의 진화에서 중요한 이정표로 남아 있으며, 이후 이 분야의 연구와 개발에 영향을 미치고 있습니다.

결론

메타 라마 3는 대규모 학습과 경쟁력 있는 성능 및 광범위한 접근성을 결합한 개방형 가중치 대규모 언어 모델의 주요 발전을 나타냈습니다. 그 출시는 연구와 산업 모두에서 개방형 모델의 채택을 촉진했으며, 그 영향은 Artificial intelligence 기술의 지속적인 개발에서 계속 느껴지고 있습니다. 모델의 성공은 종종 독점 시스템이 지배하는 분야에서 개방형 접근의 실행 가능성을 강조했으며, 향후 출시에 대한 선례를 설정했습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·meta-ai·open-weight·ai-release
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사