DeepSeek-V2는 2024년 5월 중국 인공지능 기업 딥시크(DeepSeek)가 출시한 대규모 언어 모델이다. 이 모델은 Mixture-of-Experts(MoE) 아키텍처를 사용하여 각 입력에 대해 매개변수의 일부만 활성화함으로써 효율적인 계산과 훈련 비용 절감을 가능하게 한다. 이 모델은 서구 개발자들의 당시 최신 모델에 대한 고성능 대안으로 자리매김했으며, 보고된 훈련 비용은 유사한 시스템보다 훨씬 낮았다.
DeepSeek-V2의 출시는 대규모 언어 모델 분야가 급속도로 발전하던 시기에 이루어졌으며, OpenAI, Anthropic, Google DeepMind와 같은 개발자들도 새로운 시스템을 공개하고 있었다. DeepSeek의 접근 방식은 오픈 가중치와 비용 효율성을 강조했다는 점에서 달랐으며, 이는 하드웨어 제약 속에서 알고리즘 효율성을 극대화하려는 회사의 광범위한 전략과 일치한다.
아키텍처 및 설계
DeepSeek-V2는 현대 생성형 AI 시스템의 지배적인 프레임워크인 Transformer 아키텍처를 기반으로 구축되었다. 이 모델의 정의적 특징은 Mixture-of-Experts 설계로, 모델의 매개변수를 여러 전문가 모듈로 분할한다. 추론 중에는 게이팅 메커니즘이 각 토큰에 대해 소수의 전문가만 선택하여 계산 부하를 줄이면서도 총 매개변수 수는 크게 유지한다.
이 모델은 효율성을 개선하기 위해 멀티 헤드 어텐션 및 위치 인코딩의 혁신을 통합했다. 구체적으로, DeepSeek-V2는 긴 컨텍스트 작업에서 일반적인 병목 현상인 키-값 캐시의 메모리 사용량을 줄이는 새로운 어텐션 메커니즘을 도입했다. 이 설계 선택은 하드웨어 요구 사항을 비례적으로 증가시키지 않으면서 더 긴 시퀀스를 처리할 수 있게 한다.
유사한 매개변수 크기의 밀집 모델과 비교하여 DeepSeek-V2는 훈련 및 추론 중 토큰당 더 적은 부동 소수점 연산을 필요로 한다. 회사는 이 모델이 상당히 적은 계산량으로 주요 시스템과 경쟁력 있는 성능을 달성했다고 보고했으며, 이는 MoE 아키텍처와 훈련 파이프라인의 세심한 엔지니어링 덕분으로 여겨진다.
훈련 및 비용
DeepSeek-V2는 DeepSeek의 모회사인 High-Flyer가 운영하는 맞춤형 시스템인 Fire-Flyer 2 컴퓨팅 클러스터에서 훈련되었다. 이 클러스터는 고대역폭으로 상호 연결된 수천 개의 Nvidia GPU로 구성되며, 3FS 분산 파일 시스템과 맞춤형 통신 라이브러리를 포함한 공동 설계된 소프트웨어 스택을 갖추고 있다. 이 인프라는 특히 미국의 첨단 칩 수출 제한을 고려하여 사용 가능한 하드웨어에서 효율성을 극대화하도록 개발되었다.
DeepSeek-V2의 훈련 실행은 공개 웹 소스, 서적 및 기타 텍스트 코퍼스에서 수집된 수조 개의 토큰으로 구성된 데이터 세트를 사용했다. 회사는 데이터 세트의 정확한 구성을 공개하지 않았으며, 이는 모델 가중치를 공개하면서도 훈련 데이터를 독점적으로 유지하는 관행과 일치한다. 보고된 훈련 비용은 약 560만 달러로, 서구 연구소의 유사한 모델 추정치보다 한 자릿수 낮은 수치로 주목을 받았다.
이러한 비용 효율성은 알고리즘 개선, 하드웨어 최적화 및 MoE 아키텍처의 감소된 계산 요구 사항의 조합을 통해 달성되었다. DeepSeek의 엔지니어들은 또한 그래디언트 클리핑 및 학습률 스케줄링과 같은 기술을 사용하여 훈련을 안정화하고 수렴을 개선했다.
성능 및 벤치마크
DeepSeek-V2는 언어 이해, 추론 및 코드 생성과 같은 자연어 처리 작업에 대한 일련의 표준 벤치마크에서 평가되었다. MMLU(Massive Multitask Language Understanding) 및 HumanEval과 같은 널리 사용되는 여러 테스트에서 이 모델은 다른 개발자의 당시 오픈 가중치 모델과 비교하여 유사하거나 더 높은 점수를 달성했다.
이 모델의 성능은 특히 수학적 추론 및 중국어 작업에서 두드러졌으며, 이는 훈련 데이터의 구성과 국내외 사용자 모두에게 서비스를 제공하려는 회사의 초점을 반영한다. 직접 비교에서 DeepSeek-V2는 여러 대형 밀집 모델을 능가하여 MoE 접근 방식이 더 적은 활성 매개변수로 강력한 결과를 제공할 수 있음을 입증했다.
제3자 연구자들의 독립적인 평가는 일반적으로 회사의 주장을 확인했지만, 일부는 특정 벤치마크에서 모델의 성능이 정확한 평가 설정에 따라 달라질 수 있다고 지적했다. 출시에는 더 작은 변형 모델도 포함되어 덜 강력한 하드웨어에서도 배포할 수 있으면서도 전체 모델의 기능을 상당 부분 유지했다.
출시 및 반응
2024년 5월 DeepSeek-V2의 공개 출시에는 모델 가중치와 아키텍처 및 훈련 방법론을 설명하는 기술 문서가 모두 포함되었다. 이러한 오픈 가중치 접근 방식은 API 전용 액세스를 통해 제공되는 독점 모델과 차별화되어 연구자와 개발자가 자체 인프라에서 모델을 다운로드하고 미세 조정하며 배포할 수 있게 했다.
머신 러닝 커뮤니티의 반응은 대체로 긍정적이었으며, 많은 사람들이 기술 혁신과 출시의 투명성을 칭찬했다. 낮은 훈련 비용은 논의의 초점이 되었으며, 다른 개발자들도 유사한 효율성 향상을 달성할 수 있는지에 대한 질문을 촉발했다. 일부 평론가들은 이 출시를 고급 AI 개발이 더 이상 자금이 풍부한 서구 기업의 전유물이 아니라는 증거로 해석했다.
그러나 이 출시는 오픈 가중치와 일부 상용 제품에 비해 내장된 안전 필터가 없다는 점을 고려할 때 오용 가능성에 대한 우려도 제기했다. DeepSeek의 중국과의 연관성 및 일부 연구자의 이전 군사 관련 경력이 보도에서 언급되었지만, 회사는 군사 응용보다 연구에 초점을 맞추고 있음을 강조했다.
동시대 모델과의 비교
출시 당시 DeepSeek-V2는 오픈 가중치 또는 오픈 소스 접근 방식을 사용한 Meta의 Llama 3 및 Mistral의 Mixtral과 같은 모델과 자주 비교되었다. 원시 벤치마크 점수 측면에서 DeepSeek-V2는 이러한 시스템과 경쟁력이 있었으며, 훈련 비용은 유사한 모델에 대해 공개적으로 보고된 수치보다 훨씬 낮았다.
이 모델은 또한 OpenAI 및 Anthropic의 독점 시스템과 비교되었지만, 직접 비교는 평가 방법론의 차이와 이러한 시스템의 폐쇄적 특성으로 인해 복잡했다. DeepSeek가 상세한 기술 보고서를 게시하기로 한 결정은 API 전용 모델보다 더 철저한 분석을 가능하게 했다.
한 가지 주목할 만한 차이점은 DeepSeek-V2의 중국어 작업 성능으로, 종종 주로 영어 데이터로 훈련된 모델을 능가했다. 이는 금융, 교육 및 정부 분야의 기업 사용 사례를 포함하여 중국어 사용 시장의 응용 프로그램에 특히 매력적으로 만들었다.
영향 및 유산
DeepSeek-V2는 효율적인 훈련 기술이 최첨단 결과를 산출할 수 있음을 입증함으로써 회사를 글로벌 AI 환경에서 중요한 플레이어로 자리매김했다. 이 모델의 성공은 Mixture-of-Experts 아키텍처에 대한 관심 증가와 비용 인식 훈련 방법을 포함하여 분야의 후속 발전에 영향을 미쳤다.
이 출시는 또한 고급 하드웨어에 대한 수출 통제에도 불구하고 중국 기업이 고급 AI 시스템을 개발할 수 있는 능력을 강조하면서 지정학적 영향도 있었다. 부분적으로 필요성에서 태어난 DeepSeek의 알고리즘 효율성에 대한 초점은 유사한 제약에 직면한 다른 개발자들에게 모델이 되었다.
출시 후 몇 달 동안 DeepSeek는 기술을 계속 반복하여 추가 개선 사항이 포함된 후속 모델을 결국 출시했다. DeepSeek-V2로 확립된 원칙 - 오픈 가중치, 비용 효율성 및 아키텍처 혁신 - 은 이후 출시에서도 회사의 접근 방식의 중심으로 남았다.
기술 사양
DeepSeek-V2의 총 매개변수 수는 2360억 개로 보고되었으며, MoE 아키텍처로 인해 토큰당 활성 매개변수는 210억 개에 불과하다. 이 모델은 메모리 사용량을 줄이는 효율적인 어텐션 메커니즘 덕분에 128,000 토큰의 컨텍스트 창을 사용했다. 훈련은 BF16 및 FP32 형식을 결합한 혼합 정밀도를 사용하여 정확성과 속도의 균형을 맞췄다.
모델의 토크나이저는 다국어 코퍼스에서 훈련되었으며, 특히 중국어와 영어 텍스트에 중점을 두었다. 출시에는 vLLM 및 TensorRT와 같은 인기 있는 추론 프레임워크와 호환되는 여러 형식의 가중치가 포함되었다. 총 매개변수 수가 적은 더 작은 버전의 모델도 덜 강력한 하드웨어에 배포할 수 있도록 제공되었다.
DeepSeek-V2의 아키텍처는 회사 라인업의 후속 모델의 기반이 되었으며, 이후 출시에서는 혁신을 기반으로 하면서 인간 피드백 기반 강화 학습과 같은 추가 기술을 통합했다. 이 모델은 여전히 다운로드할 수 있으며, 기술 문서는 효율적인 언어 모델 훈련에 대한 학술 연구에서 계속 인용되고 있다.