DeepSeek-V3는 저장성 항저우에 본사를 둔 중국 인공지능 기업 DeepSeek가 개발한 대규모 언어 모델이다. 2024년 12월에 출시된 이 모델은 총 6710억 개의 파라미터를 가진 혼합 전문가(MoE) 아키텍처를 사용하며, 그중 370억 개가 토큰당 활성화된다. 이 모델은 OpenAI, Anthropic, Google DeepMind의 독점 모델과 경쟁하도록 설계되었으며, 오픈 가중치 모델로 출시되어 파라미터가 공개적으로 공유되지만 훈련 데이터는 공개적으로 라이선스되지 않는다.
DeepSeek-V3의 출시는 Generative AI 환경에서 중요한 이정표를 세웠으며, 특히 미국의 첨단 칩 수출 제한으로 인해 구형 하드웨어에서도 고성능 모델을 효율적으로 훈련할 수 있음을 입증했다. 이 모델의 출시에는 기술 보고서와 오픈 가중치가 포함되어 연구자와 개발자가 이를 사용하고 미세 조정할 수 있게 했으며, 다양한 애플리케이션에서 빠른 채택에 기여했다.
배경
DeepSeek는 2023년 7월 Liang Wenfeng에 의해 설립되었으며, 그는 AI 기반 거래에 처음 초점을 맞춘 중국 헤지펀드 High-Flyer의 공동 창립자이기도 하다. 이 회사의 기원은 2019년 200 Gbit/s로 상호 연결된 1,100개의 GPU를 포함한 Fire-Flyer로 시작하여 GPU 기반 컴퓨팅 클러스터에 대한 High-Flyer의 투자로 거슬러 올라간다. 2021년까지 High-Flyer는 미국 수출 제한이 시행되기 전에 10,000개의 Nvidia A100 GPU를 확보하여 625개 노드에 5,000개의 PCIe A100 GPU를 갖춘 더 큰 클러스터인 Fire-Flyer 2를 구축할 수 있었다.
DeepSeek의 사명은 오픈 가중치 모델에 초점을 맞춘 인공 일반 지능 연구를 발전시키는 것이다. 이 회사는 중국 최고 대학에서 연구원을 모집하고 시와 고급 수학 같은 비전통적 분야에서 인재를 고용하여 모델 역량을 확장한다. 이러한 접근 방식은 연구 우선 전략과 결합되어 DeepSeek가 모델 아키텍처와 훈련 효율성에서 혁신을 이룰 수 있게 했다.
모델 아키텍처
DeepSeek-V3는 혼합 전문가 아키텍처를 사용하며, 이는 모델을 여러 전문 하위 네트워크(전문가)로 나누고 각 입력에 대해 하위 집합만 활성화하는 설계이다. 이 접근 방식은 높은 용량을 유지하면서 계산 비용을 줄인다. 이 모델은 6710억 개의 파라미터를 가지지만 토큰당 370억 개만 활성화되어 효율적인 추론과 훈련을 가능하게 한다.
이 아키텍처는 다중 헤드 잠재 주의와 보조 손실 없는 부하 균형 같은 혁신을 통합하여 훈련 안정성과 성능을 개선한다. 이러한 기술은 Transformer (architecture) 모델과 Multi-Head Attention의 초기 연구를 기반으로 하여 DeepSeek-V3가 긴 컨텍스트와 복잡한 추론 작업을 효과적으로 처리할 수 있게 한다.
훈련 및 인프라
DeepSeek-V3는 맞춤형 소프트웨어와 하드웨어로 공동 설계된 컴퓨팅 클러스터인 Fire-Flyer 2에서 훈련되었다. 이 클러스터는 200 Gbps 상호 연결과 높은 이분 대역폭을 위한 팻 트리 네트워크 토폴로지를 갖춘 Nvidia GPU를 사용한다. 소프트웨어 스택에는 비동기 무작위 읽기에 최적화된 분산 병렬 파일 시스템인 3FS와 비동기 통신용 라이브러리인 hfreduce가 포함된다.
이 규모의 모델을 훈련하려면 상당한 계산 리소스가 필요했다. DeepSeek는 Fire-Flyer 2가 2022년에 96% 이상의 용량으로 사용되었으며 총 5,674만 GPU 시간을 기록했다고 보고했다. 이 클러스터의 설계는 효율성을 강조하며, 모델이 40 GB VRAM에 맞았기 때문에 처음에는 PCIe A100 GPU를 사용했고, 이후 모델 병렬 처리가 필요한 더 큰 모델을 위해 NVLink와 NCCL을 통합했다.
훈련 과정은 Adam (Optimizer) 변형, Learning Rate Scheduling, Gradient Clipping 같은 기술을 사용했을 가능성이 높다. DeepSeek의 알고리즘 효율성에 대한 초점은 하드웨어 제약에도 불구하고 경쟁력 있는 모델을 훈련할 수 있게 했으며, 이는 미국 칩 제한에 대한 대응으로 주목받는 전략이다.
성능 및 벤치마크
DeepSeek-V3는 다양한 벤치마크에서 경쟁력 있는 성능을 입증하며 OpenAI와 Google DeepMind의 폐쇄 소스 모델에 필적했다. 내부 평가에서 자연어 이해, 코드 생성, 수학적 추론에서 강력한 결과를 달성했다. 예를 들어 특정 코딩 작업에서 GPT-4o 같은 모델을 능가하는 것으로 보고되었지만, 출시 당시 독립적 검증은 제한적이었다.
이 모델의 오픈 가중치 특성은 연구 커뮤니티가 그 역량을 테스트하고 검증할 수 있게 했으며, 학술 및 상업 환경에서 광범위한 채택으로 이어졌다. 효율성과 성능은 제한된 계산 리소스를 가진 조직에 특히 매력적이었다.
출시 및 반응
2024년 12월 DeepSeek-V3의 출시는 AI 커뮤니티에서 상당한 주목을 받았다. 이는 오픈 가중치 모델이 독점 시스템에 도전할 수 있다는 증거로 여겨졌으며, AI 개발의 미래에 대한 논쟁을 촉발했다. 이 모델은 Microsoft Azure와 Perplexity AI 같은 클라우드 제공업체에 호스팅되어 광범위한 사용자에게 접근 가능하게 했다.
비평가들은 DeepSeek의 오픈 가중치 접근 방식이 파라미터에 대해 투명하지만 훈련 데이터를 공개하지 않아 데이터 출처와 잠재적 편향에 대한 의문을 제기한다고 지적했다. 또한 이 회사의 High-Flyer와의 연관성 및 연구원들의 중국 국방 기관과의 관련성은 조사를 받았지만, DeepSeek는 연구에 초점을 맞추고 있다고 밝혔다.
영향 및 유산
DeepSeek-V3는 2025년 1월 추론 기능을 통합한 DeepSeek-R1의 출시를 포함하여 AI 분야의 후속 개발에 영향을 미쳤다. 이 모델은 또한 효율적인 AI의 광범위한 추세에 기여하여 다른 기업들이 더 낮은 리소스 소비를 위해 최적화하도록 장려했다.
이 출시는 지리 정치적 함의를 가지며 수출 통제에도 불구하고 중국 기업의 혁신 능력을 강조했다. 또한 오픈 가중치 모델이 고급 기술에 대한 더 넓은 접근을 가능하게 함에 따라 AI의 민주화에 대한 논의를 촉발했다.
향후 방향
DeepSeek-V3 이후 DeepSeek는 오픈 소스 라이선스로 모델을 계속 출시하며 포트폴리오를 확장했다. 연구와 효율성에 초점을 맞춘 회사의 전략은 글로벌 AI 환경에서 핵심 플레이어로 자리매김하게 한다. 2025년 현재 Fire-Flyer 2는 계속 운영되며 지속적인 연구 개발을 지원하고 있다.
DeepSeek의 아프리카 확장은 저렴하고 에너지 효율적인 AI 솔루션을 제공하며 서비스가 부족한 시장에 도달하려는 야망을 나타낸다. 이 회사의 향후 출시는 DeepSeek-V3에서 도입된 혁신을 기반으로 할 가능성이 높으며, 차세대 Large language model에 영향을 미칠 수 있다.