Llama 3.1 Nemotron은 NVIDIA가 개발한 대규모 언어 모델 계열로, Meta의 Llama 3.1 아키텍처를 기반으로 구축되었다. 이 모델들은 향상된 추론, 지시 수행, 인간 선호도 정렬을 위해 설계되었다. 오픈 가중치 모델로 출시되어 연구자와 개발자가 다양한 애플리케이션에서 미세 조정 및 배포할 수 있다. 이 계열은 여러 매개변수 크기를 포함하며, LLM 리더보드의 공개 벤치마크 스냅샷에 세 가지 변형이 나타난다.
개발 및 출시
NVIDIA는 2024년 7월 Meta의 Llama 3.1 모델 출시에 이어 2024년 말에 Llama 3.1 Nemotron 계열을 발표했다. 초기 출시에는 Nemotron-70B 변형이 포함되었으며, 추론 벤치마크에서의 성능으로 빠르게 주목을 받았다. NVIDIA는 이 모델들을 오픈소스 AI 생태계에 대한 기여로 포지셔닝하면서 고급 정렬 기술의 사용을 강조했다. 모델들은 Hugging Face와 같은 플랫폼에서 제공되었으며, 가중치는 허용적 라이선스 하에 연구 및 상업적 사용 모두에 접근 가능했다.
아키텍처 및 훈련
이 모델들은 트랜스포머 아키텍처, 특히 Llama 3.1에서 사용된 디코더 전용 설계를 기반으로 한다. 멀티 헤드 어텐션 및 회전 위치 인코딩과 같은 기법을 통합한다. NVIDIA는 보상 모델을 사용하여 출력을 인간 선호도에 정렬하는 AI 피드백 기반 강화 학습(RLAIF) 및 지도 미세 조정을 포함한 훈련 파이프라인을 채택했다. 훈련 데이터는 공개적으로 이용 가능한 말뭉치와 다른 대규모 모델이 생성한 합성 데이터의 혼합으로 구성되었다. NVIDIA는 정확한 데이터 세트 구성이나 훈련에 사용된 총 컴퓨팅 자원을 공개하지 않았다.
성능 및 벤치마크
Llama 3.1 Nemotron 모델은 MMLU(대규모 다작업 언어 이해), GSM8K(초등 수학), HumanEval(코드 생성)을 포함한 다양한 표준 벤치마크에서 평가되었다. 70B 변형은 특정 추론 작업에서 더 큰 독점 모델과 경쟁하거나 능가하는 점수를 달성한 것으로 보고되었다. LMArena(이전 Chatbot Arena)와 같은 공개 리더보드에서 모델들은 상위 계층의 Elo 등급으로 나열되었지만, 구체적인 수치는 스냅샷에 따라 다르다. 벤치마크 스냅샷의 세 가지 변형은 서로 다른 매개변수 크기, 아마도 8B, 70B 및 더 큰 구성에 해당하지만, 모든 변형의 정확한 사양은 균일하게 공개되지 않았다.
애플리케이션 및 생태계
NVIDIA는 Llama 3.1 Nemotron을 NVIDIA AI Enterprise 소프트웨어 스택에 통합하여 각각의 마켓플레이스를 통해 Azure, Google Cloud 및 AWS에 배포할 수 있게 했다. 이 모델들은 또한 저지연 추론을 위해 Groq 및 SambaNova에서 지원된다. 개발자들은 코드 생성, 수학적 추론, 대화형 에이전트와 같은 작업에 모델을 사용해 왔다. 모델의 오픈 가중치 특성은 의료 및 금융을 포함한 도메인별 애플리케이션을 위한 미세 조정을 용이하게 했다.
수용 및 영향
Llama 3.1 Nemotron의 출시는 머신 러닝 커뮤니티에서 특히 전통적인 RLHF에 대한 대안을 제공한 RLAIF 사용으로 관심을 받았다. 일부 연구자들은 모델이 추론 벤치마크에서 강력한 성능을 보여 오픈 모델과 폐쇄 모델 간의 격차를 좁혔다고 언급했다. 그러나 일부 평가는 작업 간 성능의 불일치를 지적했으며, 모델이 보편적으로 최상위 순위에 오르지는 않았다. NVIDIA는 Nemotron 라인을 계속 반복하며 향상된 기능을 갖춘 후속 버전을 출시하고 있다.
라이선스 및 가용성
Llama 3.1 Nemotron 모델은 NVIDIA 오픈 모델 라이선스에 따라 배포되며, 상업적 사용, 수정, 재배포를 허용하되 파생 작업에 유사한 라이선스 조건을 포함해야 한다. 가중치는 Hugging Face에서 다운로드할 수 있으며, 모델은 AMD 및 Intel GPU뿐만 아니라 NVIDIA GPU를 포함한 호환 하드웨어에서 로컬로 실행할 수 있다. 라이선스는 연구 목적의 모델 사용을 제한하지 않으며, NVIDIA는 미세 조정 및 배포를 위한 문서와 예제 코드를 제공한다.