DeepSeek V3.1은 중국 AI 기업 DeepSeek가 개발한 대규모 언어 모델 제품군이다. 2025년에 출시되었으며, 2024년 말에 도입된 DeepSeek V3의 후속 모델이다. V3.1 제품군에는 공개 LLM 및 미디어 리더보드에 등장한 네 가지 변형이 포함되지만, 회사는 이들 모두에 대한 상세한 기술 사양을 공개하지 않았다. 이 모델들은 일반 목적의 텍스트 생성, 추론, 코딩 작업을 위해 설계되었으며, 오픈소스 라이선스로 제공된다.
DeepSeek V3.1의 개발은 Transformer (architecture) 아키텍처를 기반으로 하며, 특히 Mixture-of-Experts (MoE) 설계를 사용하여 토큰당 활성화되는 매개변수 하위 집합만을 활성화함으로써 계산 효율성을 향상시킨다. 이 모델 제품군은 점점 더 크고 강력한 시스템을 지향하는 생성형 AI의 광범위한 추세의 일부이며, OpenAI, Anthropic, Google DeepMind의 제품과 경쟁한다. DeepSeek는 V3.1을 비용 효율적인 대안으로 포지셔닝했으며, 훈련 및 추론 비용이 많은 서구 경쟁사보다 크게 낮다.
아키텍처 및 훈련
DeepSeek V3.1은 신경망과 Mixture-of-Experts 아키텍처를 사용하며, 각 토큰은 소수의 전문가 모듈에 의해 처리된다. 이 설계는 높은 모델 용량을 유지하면서 토큰당 계산 비용을 줄인다. 기본 모델인 DeepSeek V3는 총 6710억 개의 매개변수와 토큰당 370억 개의 활성화 매개변수를 가졌으며, V3.1은 유사한 구조를 따를 가능성이 높지만 새 변형의 정확한 매개변수 수는 공식적으로 공개되지 않았다. 모델은 딥러닝 기술을 사용하여 훈련되며, 인간 피드백 기반 강화 학습(RLHF)과 함께 지도 미세 조정을 포함하여 출력을 인간 선호도에 맞춘다.
V3.1의 훈련 데이터에는 영어와 중국어에 중점을 둔 대규모 다국어 텍스트 코퍼스가 포함된다. 회사는 데이터 세트의 크기나 구성에 대한 구체적인 세부 사항을 공개하지 않았지만, DeepSeek가 공개 웹 데이터와 독점 소스를 결합하여 사용하는 것으로 알려져 있다. 훈련 과정은 GPU 클러스터를 활용하며, DeepSeek는 FP8 혼합 정밀도 훈련을 포함한 훈련 효율성 최적화에 관한 연구를 발표했다.
변형 및 벤치마크
DeepSeek V3.1의 네 가지 변형이 공개 벤치마크 스냅샷에서 확인되었으며, 매개변수 수나 미세 조정에서 차이가 있을 가능성이 있다. 이 변형들은 MMLU(지식), HumanEval(코드 생성), MATH(수학적 추론)와 같은 표준 LLM 벤치마크에서 평가되었다. 예를 들어, 한 변형은 MMLU에서 88.5%의 점수를 달성하여 동일한 테스트에서 원래 V3의 86.2%를 능가한다. HumanEval에서는 한 변형이 82.3%를 기록하여 V3의 78.1%와 비교된다. 이러한 점수는 V3.1을 최고 성능의 오픈 가중치 모델 중 하나로 위치시키지만, 구체적인 수치는 변형 및 평가 설정에 따라 다르다.
LMArena(Chatbot Arena) Elo 등급과 같은 미디어 리더보드에서 DeepSeek V3.1 변형은 GPT-4o 및 Claude 3.5 Sonnet과 같은 독점 모델과 비교할 수 있는 1300-1400 범위의 Elo 점수를 달성했다. 그러나 정확한 Elo 등급은 더 많은 사용자 투표가 수집됨에 따라 변경될 수 있다. 모델은 또한 코딩 작업에서 강력한 성능을 보여주며, 한 변형은 실제 소프트웨어 엔지니어링 문제를 테스트하는 SWE-bench 벤치마크에서 pass@1 점수 75.4%를 달성했다.
출시 및 가용성
DeepSeek V3.1은 2025년 초에 출시되었으며, 첫 번째 변형은 회사의 API와 오픈소스 다운로드로 등장했다. 모델은 MIT 라이선스로 배포되어 상업적 및 연구용 사용을 허용한다. DeepSeek는 Hugging Face에서 모델 가중치를 제공하고, GitHub에서 추론 코드를 제공한다. 회사는 또한 OpenAI 또는 Anthropic의 비교 가능한 모델보다 훨씬 낮은 가격의 API를 제공한다 - 예를 들어, 입력 토큰은 백만 개당 $0.27, 출력 토큰은 백만 개당 $1.10으로 출시일 기준으로 책정되었다.
출시에는 훈련 방법론과 평가 결과를 자세히 설명하는 기술 보고서가 동반되었지만, 정확한 훈련 토큰 수와 같은 일부 세부 사항은 생략되었다. DeepSeek는 또한 모델 아키텍처에서 멀티 헤드 어텐션과 위치 인코딩의 사용에 관한 논문을 발표하여 머신러닝에 대한 광범위한 학술 문헌에 기여했다.
반응 및 영향
DeepSeek V3.1의 출시는 독점 모델 비용의 일부로 경쟁력 있는 성능을 제공하여 AI 커뮤니티에서 상당한 주목을 받았다. 소셜 미디어와 기술 언론에서 널리 논의되었으며, 일부 평론가들은 중국 AI 기업의 빠른 발전을 보여준다고 언급했다. 모델의 오픈소스 특성은 연구 및 산업에서의 채택을 촉진했으며, 다양한 타사 도구와 플랫폼에 통합되었다.
그러나 일부 전문가들은 훈련 데이터의 투명성 부족과 잠재적 편향에 대한 우려를 제기했다. DeepSeek는 상세한 모델 카드를 공개하지 않았으며, 독립적인 감사도 수행되지 않았다. 2025년 현재 모델은 여전히 활발히 개발 중이며, 향후 업데이트가 예상된다.
이전 모델과의 비교
DeepSeek V3.1은 추론, 코딩, 다국어 이해를 포함한 여러 주요 영역에서 V3를 개선한다. 회사는 V3.1이 12개 표준 벤치마크에서 V3 대비 평균 2.3% 개선을 달성했다고 보고한다. 예를 들어, MMLU 벤치마크에서 V3.1은 88.5%를 기록하여 V3의 86.2%와 비교되고, HumanEval 벤치마크에서는 82.3%를 기록하여 78.1%와 비교된다. 이러한 개선은 더 나은 훈련 데이터, 더 정교한 미세 조정, 아키텍처 조정에 기인한다.
단일 모델이었던 V3와 달리, V3.1은 변형 제품군으로 구성되어 사용자가 성능과 리소스 사용을 균형 있게 조정하는 모델을 선택할 수 있다. 이 접근 방식은 OpenAI의 GPT-4o 및 GPT-4o mini와 같은 다른 제공업체의 방식과 유사하지만, DeepSeek의 변형은 모두 오픈 가중치이다. V3.1 출시에는 업데이트된 토크나이저와 컨텍스트 길이도 포함되며, 최대 128K 토큰을 지원하여 선도 모델의 기능과 일치한다.
향후 방향
DeepSeek는 모델 제품군을 계속 반복하고 있으며, V3.1 이후 추가 업데이트가 예상된다. 회사는 텍스트 외에도 이미지와 오디오를 처리할 수 있는 멀티모달 기능에 대한 작업을 암시했다. 2025년 현재 V4의 공식 출시 날짜는 발표되지 않았지만, 빠른 개발 속도는 올해 안에 새 버전이 등장할 것임을 시사한다. DeepSeek 모델이 더 넓은 AI 환경에 미치는 영향은 특히 인공지능의 글로벌 경쟁 맥락에서 관심의 대상으로 남아 있다.