LLaMA 1 출시

영어에서 번역됨

LLaMA 1은 2023년 2월에 출시된 Meta AI의 첫 번째 대규모 언어 모델 제품군으로, 처음에는 연구자에게만 제한되었으나 이후 BitTorrent를 통해 공개적으로 유출되어 오픈 가중치 AI 개발의 전환점이 되었습니다.

LLaMA 1(Large Language Model Meta AI)는 2023년 2월 24일에 발표된 메타(Meta)의 대규모 언어 모델 제품군 중 첫 번째 출시작이었다. 이 모델은 공개적으로 이용 가능한 데이터만으로 훈련된 기반 모델로 설계되었으며, 매개변수 크기는 70억 개에서 650억 개에 달했다. 이번 출시는 대규모 언어 모델 환경에 중요한 변화를 가져왔으며, 훨씬 더 큰 독점 시스템과 경쟁력 있는 성능을 보여주면서도 연구 목적으로 더 접근하기 쉬운 모델임을 입증했다.

LLaMA 1의 초기 배포는 비상업적 라이선스 하에 학술 연구자와 산업 연구소로 제한되었으며, 접근 권한은 사례별로 부여되었다. 그러나 발표 후 몇 주 만에 모델의 가중치가 온라인에 유출되어 광범위한 무단 배포로 이어졌고, AI 시스템에 대한 개방적 접근에 대한 논쟁을 촉발했다.

배경 및 맥락

LLaMA 1의 개발은 OpenAI의 GPT-3 출시와 이후 ChatGPT 출시에 이어 대규모 언어 모델에 대한 관심이 집중되던 시기에 이루어졌다. 이러한 시스템의 성공은 신경망 아키텍처의 확장 가능성을 부각시켰으며, 특히 트랜스포머 아키텍처는 자연어 처리에서 지배적인 접근 방식이 되었다.

메타의 최고 AI 과학자 얀 르쿤(Yann LeCun)은 대규모 언어 모델이 특히 글쓰기 작업을 돕는 데 유용하다고 강조하며, 더 광범위한 기능을 강조한 경쟁사와 차별화된 접근 방식을 취했다. 회사는 덜 강력한 하드웨어에서도 실행할 수 있는 더 효율적인 모델을 만들어, 제한된 컴퓨팅 자원을 가진 학술 기관이 고급 AI 연구에 더 쉽게 접근할 수 있도록 하는 것을 목표로 했다.

초기 출시 및 아키텍처

LLaMA의 첫 번째 버전은 블로그 게시물과 훈련 방법론, 아키텍처, 성능 특성을 설명하는 동반 연구 논문을 통해 발표되었다. 추론 코드는 오픈소스 GPLv3 라이선스로 공개되었지만, 모델 가중치는 신청 절차를 거쳐 접근이 제한되었다. 이러한 혼합 접근 방식은 연구 투명성과 잠재적 오용에 대한 우려 사이의 균형을 맞추기 위한 것이었다.

메타는 LLaMA 1을 여러 규모로 훈련시켰으며, 130억 개 매개변수 버전은 대부분의 NLP 벤치마크에서 GPT-3(1750억 개 매개변수)를 능가했다. 가장 큰 650억 개 매개변수 모델은 PaLM 및 Chinchilla와 같은 최첨단 시스템과 경쟁력 있는 결과를 달성했다. 훈련 데이터는 전적으로 공개 소스로 구성되었으며, 모델은 더 큰 모델보다 계산 효율성이 높도록 설계되었다.

유출과 그 여파

2023년 3월 3일, LLaMA의 가중치를 포함한 토렌트가 4chan 이미지보드에 업로드되어 공유되었고, 링크는 이후 온라인 AI 커뮤니티를 통해 확산되었다. 며칠 내에 공식 LLaMA 저장소에 마그넷 링크와 HuggingFace 저장소 참조를 추가하기 위한 풀 리퀘스트가 제출되었다. 메타는 3월 6일에 배포가 무단이라고 규정하며 삭제 요청을 제기했고, HuggingFace는 요청을 준수했다.

3월 20일, 메타는 미러에서 LLaMA를 다운로드하는 스크립트가 포함된 저장소에 대해 DMCA 삭제 요청을 제기했고, GitHub는 다음 날 요청을 준수했다. 이러한 노력에도 불구하고 모델은 다양한 미러 사이트와 토렌트 네트워크를 통해 널리 접근 가능한 상태로 남아 있었다.

유출에 대한 반응은 엇갈렸다. 일부 논평가들은 정교한 스팸 생성과 같은 잠재적 악의적 응용에 대한 우려를 표명했다. 다른 이들은 접근성 증가를 환영하며, 더 작은 버전의 모델이 비교적 저렴하게 실행될 수 있어 연구와 혁신을 가속화할 수 있다고 지적했다. 사이먼 윌리슨(Simon Willison)과 다른 논평가들은 공개적으로 배포된 텍스트-이미지 모델인 스테이블 디퓨전(Stable Diffusion)과 비교했는데, 이 모델 역시 도구와 기술의 급속한 확산을 촉발했다.

유산과 영향

LLaMA 1의 출시와 이후 유출은 AI 생태계에 지속적인 영향을 미쳤다. 이는 대규모 언어 모델이 대형 기술 기업 외부에서도 효과적으로 배포될 수 있음을 보여주었으며, 이러한 시스템이 대규모 컴퓨팅 인프라를 필요로 한다는 가정에 도전했다. 모델의 아키텍처와 훈련 접근 방식은 이후 오픈 가중치 모델에 영향을 미쳤고, 성장하는 오픈소스 AI 운동에 기여했다.

LLaMA 1의 경험은 메타의 후속 출시 접근 방식을 형성했다. 2023년 7월 18일 마이크로소프트와 협력하여 출시된 Llama 2는 기반 모델과 지시 조정 모델을 모두 포함했으며 더 광범위한 상업적 라이선스를 제공했다. Llama 3는 2024년 4월 18일에 이어졌으며, 15조 개 토큰으로 훈련된 모델과 개선된 성능을 제공했다. 이러한 계보는 2025년 4월 Llama 4로 이어졌고, 메타 슈퍼인텔리전스 연구소(Meta Superintelligence Labs)는 2026년 4월 Muse Spark를 대체 모델로 출시했다.

LLaMA 1의 유산은 경쟁력 있는 대규모 언어 모델이 비교적 적은 매개변수 수와 공개 데이터로 구축될 수 있음을 입증한 점, 그리고 강력한 AI 시스템이 출시된 후 접근을 통제하는 데 따르는 어려움을 부각시킨 점에 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-models·meta-ai·artificial-intelligence·open-source-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사