Meta Llama 4는 Meta AI가 개발한 대규모 언어 모델 제품군으로, 2025년 4월 Llama 3의 후속 모델로 출시되었다. 이 모델은 텍스트와 이미지를 처리하고 생성할 수 있는 네이티브 멀티모달 모델이라는 점과, 1,000만 토큰의 확장된 컨텍스트 창을 갖추어 매우 긴 문서나 멀티모달 입력을 단일 패스로 처리할 수 있다는 점에서 주목할 만하다. 이번 출시는 메타의 오픈 가중치 배포 전략을 이어간 것으로, 연구 및 상업적 용도로 모델을 제공하는 라이선스 하에 많은 애플리케이션을 허용하지만, 오픈 소스 이니셔티브의 정의에 따른 완전한 오픈 소스는 아니다.
Llama 시리즈는 2023년 2월 Llama 1의 초기 출시로 시작되었으며, 당시에는 비상업적 라이선스로 연구자에게만 제공되었지만 곧 비트토렌트를 통해 가중치가 공개적으로 유출되었다. 2023년 7월 Llama 2부터 시작된 후속 버전은 상업적 사용을 허용하는 보다 관대한 라이선스로 출시되었다. 2024년 4월에 출시된 Llama 3는 최대 700억 개의 파라미터를 가진 모델을 도입했으며 15조 개의 토큰으로 학습되었다. Llama 4는 이러한 기반 위에 네이티브 멀티모달리티와 획기적으로 확장된 컨텍스트 창을 추가하여, OpenAI, Anthropic, Google DeepMind의 모델에 대응하는 경쟁력 있는 응답으로 자리매김했다.
배경
Llama 4의 개발은 Large language model 역량의 급속한 발전이라는 맥락에서 이루어졌다. 2022년 11월 ChatGPT의 출시는 생성형 AI에 대한 관심과 투자의 급증을 촉발했으며, 기술 기업들 간에 더 강력하고 효율적인 모델을 생산하기 위한 경쟁으로 이어졌다. 메타의 최고 AI 과학자인 얀 르쿤은 이전에 대규모 언어 모델의 궁극적인 잠재력에 대해 회의적인 입장을 표명하며, 이러한 모델이 일반 지능을 달성하기보다는 글쓰기 지원에 가장 적합하다고 제안한 바 있다. 그럼에도 메타는 오픈 가중치 대안을 제공함으로써 독점 모델과 경쟁하기 위해 Llama 시리즈에 계속 대규모 투자를 진행했다.
2025년까지의 환경에는 OpenAI의 GPT-4, Anthropic의 Claude, Google DeepMind의 Gemini와 같은 모델이 포함되었으며, 이들 모두 Transformer (architecture) 아키텍처로 가능한 것의 경계를 확장하고 있었다. 메타는 Llama 4를 통해 오픈 액세스와 네이티브 멀티모달리티, 극도로 긴 컨텍스트 창과 같은 기술적 혁신으로 차별화하고자 했으며, 이를 통해 문서 분석, 코드 생성, 멀티모달 추론 분야의 새로운 애플리케이션이 가능해질 수 있었다.
아키텍처 및 기능
Llama 4는 네이티브 멀티모달 모델로 설계되었으며, 이는 비전 기능을 사후에 추가하는 방식이 아니라 처음부터 텍스트와 이미지 데이터 모두로 학습되었음을 의미한다. 이러한 접근 방식은 모델이 여러 양식에 걸쳐 콘텐츠를 이해하고 생성할 수 있게 하여, 이미지 캡셔닝, 시각적 질문 응답, 텍스트-이미지 혼합 생성과 같은 작업을 가능하게 한다. 모델의 아키텍처는 Transformer (architecture) 프레임워크를 기반으로 하며, 멀티모달 입력과 출력을 지원하도록 수정되었다.
Llama 4의 가장 중요한 특징 중 하나는 1,000만 토큰의 컨텍스트 창이다. 이는 일반적으로 128,000토큰 이하의 컨텍스트 창을 지원했던 이전 모델들에 비해 상당한 증가이다. 더 큰 컨텍스트 창은 모델이 전체 책, 긴 코드베이스, 또는 방대한 멀티모달 문서를 단일 패스로 처리할 수 있게 하여 일관성을 개선하고 청킹이나 요약의 필요성을 줄인다. 이러한 기능은 긴 시퀀스를 효율적으로 처리할 수 있게 하는 Positional Encoding 및 Multi-Head Attention의 발전으로 가능해졌다.
Llama 4는 엣지 디바이스에 적합한 소형 모델부터 클라우드 배포용 대형 모델까지 다양한 크기로 출시되었다. 정확한 파라미터 수는 완전히 공개되지 않았지만, 이전 버전에서 관찰된 스케일링 추세에 따라 수십억 개에서 수천억 개에 이르는 파라미터를 가진 모델이 포함되었다. 모델은 공개적으로 이용 가능한 다양한 텍스트와 이미지 데이터로 학습되었으며, 성능 향상을 위해 고품질 데이터에 중점을 두었다.
학습 및 데이터
Meta AI는 웹 텍스트, 책, 코드, 이미지를 포함한 대규모 공개 데이터 말뭉치로 Llama 4를 학습시켰다. 학습 과정에는 Deep learning 기술인 Adam (Optimizer) 및 Learning Rate Scheduling이 포함되어 모델의 파라미터를 최적화했다. Data Augmentation 및 Curriculum Learning의 사용은 일반화와 견고성을 개선하는 데 도움이 되었다. 모델은 기반 모델로 사전 학습된 후 지시 수행 데이터로 미세 조정되었으며, Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습)와 같은 방법을 사용하여 사용자 의도에 맞게 정렬되었다.
학습 데이터는 다양한 언어와 도메인을 포함하도록 선별되어 Llama 4가 다국어를 지원하고 다양한 작업을 처리할 수 있게 했다. 이미지 데이터의 포함은 멀티모달 입력을 처리하기 위한 새로운 학습 파이프라인의 개발을 요구했으며, 서로 다른 양식의 정보를 융합하기 위한 Cross-Attention 메커니즘이 포함되었다. 메타는 또한 대규모 클러스터에서 학습을 안정화하기 위해 Gradient Clipping 및 Batch Normalization과 같은 기술을 사용했다.
출시 및 이용 가능성
Llama 4는 2025년 4월에 발표되었으며, 모델은 메타의 웹사이트와 파트너 플랫폼을 통해 다운로드할 수 있게 되었다. 이번 출시에는 이전 Llama 출시와 유사하게 기반 모델과 지시 튜닝 버전이 모두 포함되었다. 가중치는 상업적 사용을 허용하는 라이선스로 배포되었지만, 스팸 생성이나 감시와 같은 특정 애플리케이션을 제한하는 허용 가능한 사용 정책이 적용되었다. 이로 인해 OpenPanel 및 기타 조직들이 라이선스가 오픈 소스 정의를 충족하지 못한다고 지적하면서, 모델이 진정한 오픈 소스로 간주될 수 있는지에 대한 논쟁이 계속되었다.
메타는 또한 Llama 4를 Facebook, WhatsApp 및 전용 웹사이트에서 이용 가능한 Meta AI 어시스턴트에 통합했다. 이를 통해 사용자는 질문 응답, 콘텐츠 생성, 이미지 분석과 같은 작업을 위해 모델과 상호작용할 수 있었다. 이번 출시에는 Llama 4가 다양한 자연어 처리 및 멀티모달 작업에서 OpenAI, Anthropic, Google DeepMind의 주요 모델과 경쟁력 있는 성능을 보여준다는 벤치마크가 함께 제공되었다.
반응 및 영향
Llama 4의 출시는 특히 네이티브 멀티모달리티와 긴 컨텍스트 창으로 인해 AI 커뮤니티에서 상당한 관심을 받았다. 연구자와 개발자들은 AMD 및 Intel 칩을 포함한 맞춤형 하드웨어와 Amazon Web Services, Microsoft Azure, Google Cloud와 같은 클라우드 플랫폼에서 미세 조정과 배포를 가능하게 하는 오픈 가중치 접근 방식을 높이 평가했다. 모델이 1,000만 토큰을 처리할 수 있는 능력은 법률 문서 검토, 과학 연구, 소프트웨어 엔지니어링 분야의 애플리케이션에 새로운 가능성을 열었다.
그러나 일부 비평가들은 특정 벤치마크에서 모델의 성능이 항상 더 작고 전문화된 모델보다 우수한 것은 아니며, 이렇게 큰 컨텍스트 창으로 추론하는 데 필요한 계산 리소스가 엄청날 수 있다고 지적했다. 이번 출시는 또한 모델의 멀티모달 기능을 고려할 때 오해를 불러일으키는 콘텐츠나 딥페이크 생성과 같은 오용 가능성에 대한 우려를 제기했다. 메타는 안전 필터를 구현하고 책임 있는 사용을 위한 지침을 제공함으로써 이러한 우려를 해결했다.
경쟁사와의 비교
Llama 4는 OpenAI의 GPT-4, Anthropic의 Claude 3, Google DeepMind의 Gemini가 이미 자리 잡은 경쟁 시장에 진입했다. 각 모델은 고유한 강점을 가지고 있었다. GPT-4는 일반 추론 및 코딩 능력으로, Claude 3는 긴 컨텍스트와 안전 기능으로, Gemini는 멀티모달 통합으로 알려져 있었다. Llama 4의 주요 차별점은 맞춤화와 로컬 배포를 가능하게 하는 오픈 가중치 배포와, 당시 대부분의 경쟁사를 능가하는 1,000만 토큰 컨텍스트 창이었다.
성능 측면에서 Llama 4의 벤치마크는 Machine learning 벤치마크와 같은 작업에서 경쟁력이 있지만 항상 최고 점수는 아니라는 것을 보여주었다. 모델의 오픈 가중치 특성은 모델을 연구하거나 미세 조정하려는 연구자와 벤더 종속을 피하려는 기업에게 매력적이었다. 이번 출시는 또한 개발자들이 제한된 하드웨어에서 대형 모델을 실행하려고 함에 따라 효율적인 추론 기술의 혁신을 촉진했다.
향후 방향
Llama 4 출시 이후 메타는 모델의 추론, 코딩 및 다국어 기능을 개선하기 위한 계획과 함께 AI 연구에 계속 투자했다. 회사는 또한 AWS Trainium 또는 Groq 가속기와 같은 특수 하드웨어를 잠재적으로 사용하여 학습 및 추론의 계산 비용을 줄이는 방법을 모색했다. 2026년 4월, Meta Superintelligence Labs는 Llama를 대체하는 Muse Spark를 출시하여 더욱 발전된 기능을 가진 모델로의 전환을 알렸다. Muse Spark는 Llama 4에서 얻은 교훈을 바탕으로 새로운 아키텍처와 학습 기술을 통합하여 AI에서 가능한 것의 경계를 확장할 것으로 기대되었다.
Llama 4의 유산은 오픈 가중치 모델이 독점 모델과 경쟁할 수 있고, 네이티브 멀티모달리티와 긴 컨텍스트 창이 대규모로 실현 가능하다는 것을 입증한 데 있다. 또한 AI 개발에서 개방성과 안전성 사이의 지속적인 긴장을 부각시켰으며, 이는 계속해서 AI 분야를 형성하는 논쟁이다.