영어에서 번역됨

DeepSeek V3는 2024년 12월에 출시된 DeepSeek이 개발한 대규모 언어 모델이다. 이는 총 671B 파라미터를 가진 Mixture-of-Experts 트랜스포머로, 공개 벤치마크에서의 강력한 성능과 비용 효율적인 훈련으로 알려져 있다.

DeepSeek V3은 중국 AI 기업 DeepSeek이 개발한 대규모 언어 모델로, 2024년 12월 26일에 처음 출시되었다. 이 모델은 트랜스포머 기반 아키텍처를 사용하며, Mixture-of-Experts(MoE) 설계를 채택하여 총 6710억 개의 매개변수를 보유하고 있으며, 그중 370억 개가 토큰당 활성화된다. 이 모델은 14.8조 개의 토큰으로 훈련되었으며, 약 278만 8천 개의 H800 GPU 시간만을 사용한 비용 효율적인 훈련 과정으로 주목받고 있다.

DeepSeek V3은 출시 직후 공개 LLM 및 미디어 리더보드에 등장했으며, 벤치마크 스냅샷에서 여러 변형 간의 일관된 성능을 보여주었다. 모델 제품군에는 이러한 스냅샷에서 최소 5개의 변형이 포함되어 있으며, 이는 서로 다른 구성이나 미세 조정 상태를 반영하지만 각 변형의 구체적인 세부 사항은 공개적으로 문서화되지 않았다. 기본 모델과 명령어 튜닝 버전은 표준 학술 벤치마크에서 평가되었다.

아키텍처 및 훈련

DeepSeek V3은 61개의 트랜스포머 블록 레이어로 구성된 딥러닝 아키텍처를 사용한다. 효율적인 추론을 위해 다중 헤드 잠재 주의(MLA)를 통합하고, 피드포워드 레이어에 DeepSeekMoE 구조를 적용하여 각 토큰이 전문가의 하위 집합만 활성화하도록 한다. 이 모델은 128,000개의 토큰 어휘를 사용하며 128K 토큰의 컨텍스트 길이를 지원한다.

훈련은 최대 학습률 2.4e-3의 학습률 스케줄을 사용하여 수행되었으며, 대규모 훈련에 적합한 기울기 클리핑배치 정규화 기법을 결합했다. 데이터 세트는 주로 영어와 중국어로 구성된 14.8조 개의 토큰으로, 웹 텍스트, 서적 및 기타 선별된 코퍼스에서 수집되었다. 훈련 과정은 TSMC에서 제조한 H800 GPU를 활용했으며, 최종 훈련 실행 비용은 약 560만 달러로 보고되었다.

성능 및 벤치마크

공개 벤치마크에서 DeepSeek V3은 주목할 만한 점수를 달성했다. MMLU(Massive Multitask Language Understanding) 벤치마크에서는 5샷 설정에서 88.5%를 기록했다. MATH-500 벤치마크에서는 제로샷 설정에서 90.2%를 달성했다. 이 모델은 코딩 작업에서도 우수한 성능을 보여 HumanEval에서 82.6%, 더 어려운 LiveCodeBench에서 67.3%를 기록했다.

동시대 모델과 비교하여 DeepSeek V3의 성능은 OpenAIAnthropic의 주요 독점 시스템과 경쟁력이 있었으며, 훈련 비용은 훨씬 저렴했다. GPQA(대학원 수준 Google-Proof Q&A) 벤치마크에서는 제로샷 설정에서 59.1%를 기록했고, DROP 벤치마크에서는 3샷 설정에서 91.6%를 달성했다.

출시 및 변형

2024년 12월 26일의 초기 출시에는 기본 모델과 채팅 최적화 버전인 DeepSeek-V3-Chat이 포함되었다. 두 버전 모두 MIT 라이선스로 제공되어 상업적 사용과 수정이 가능했다. 모델 가중치는 Hugging Face 및 기타 플랫폼을 통해 배포되어 생성형 AI 커뮤니티에서 광범위한 채택을 가능하게 했다.

2025년 초의 공개 벤치마크 스냅샷에는 DeepSeek V3의 최소 5개의 뚜렷한 변형이 나타나 있으며, 이는 서로 다른 미세 조정 실행이나 양자화 수준을 나타내는 것으로 보인다. 이러한 변형은 LMSYS Chatbot Arena 및 Open LLM 리더보드와 같은 리더보드에 등장했지만, 각 변형의 정확한 구성은 공식적으로 문서화되지 않았다. 2025년 초 현재 기본 및 채팅 버전 외에 추가 공식 변형은 발표되지 않았다.

영향 및 평가

DeepSeek V3의 출시는 높은 성능과 낮은 훈련 비용의 결합으로 인공지능 커뮤니티에서 상당한 주목을 받았다. 이는 효율적인 훈련 기법이 훨씬 더 큰 예산으로 개발된 모델의 능력과 경쟁할 수 있음을 입증했다. MIT 라이선스 하의 모델의 오픈소스 특성은 다양한 애플리케이션과 연구 프로젝트에 빠르게 통합되는 데 기여했다.

비평가와 분석가들은 DeepSeek V3의 훈련 효율성이 부분적으로 추론 중 계산 비용을 줄이는 MoE 아키텍처 덕분이라고 지적했다. 그러나 모델의 큰 총 매개변수 수에 대한 의존성은 배포에 상당한 메모리를 여전히 요구한다. 이 모델은 또한 머신러닝의 경쟁 구도, 특히 중국 AI 기업이 오픈소스 모델을 발전시키는 역할에 대한 논의를 촉발했다.

기술적 세부 사항 및 한계

DeepSeek V3은 사용자 정의 위치 인코딩 방식을 사용하며 다중 헤드 주의 메커니즘을 사용한다. 주의 레이어에서 전통적인 드롭아웃을 사용하지 않으며, 이는 훈련 효율성을 향상시키는 설계 선택이다. 모델의 추론은 제어된 생성을 위해 top-p 샘플링온도 스케일링을 지원한다.

강점에도 불구하고 DeepSeek V3에는 한계가 있다. 훈련 데이터에 존재하는 편향을 나타낼 수 있으며, 중국어 이외의 비영어 언어에 대한 성능은 덜 철저히 평가되었다. 모델의 큰 메모리 공간은 소비자 하드웨어에서의 배포를 제한하며, 일부 환경에서 실용적인 사용을 위해 모델 가지치기 또는 양자화가 필요하다. 2025년 초 현재 모델은 후속 버전으로 업데이트되지 않았지만, DeepSeek의 지속적인 연구는 계속되고 있다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·artificial-intelligence·open-source-software·chinese-ai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사