영어에서 번역됨

DeepSeek는 항저우에 본사를 둔 중국 AI 연구소로, 퀀트 헤지펀드 하이플라이어(High-Flyer)에서 분사한 기관이다. 이 연구소는 2025년 1월, 효율적인 오픈 웨이트 추론 모델을 공개하여 전 세계적인 주목을 받았으며, 이로 인해 시장이 크게 흔들렸다.

DeepSeek는 2023년 Liang Wenfeng이 설립한 중국 항저우에 본사를 둔 인공지능 연구 기업이다. 그는 2015년 공동 설립한 퀀트 헤지펀드인 High-Flyer를 통해 자금을 조달하고 지속적으로 투자했다. High-Flyer의 트레이딩 사업은 이미 알고리즘 트레이딩을 위해 대규모 GPU (in AI) 하드웨어를 축적해 두었으며, 이는 미국의 수출 통제가 중국 기업들의 최첨단 NVIDIA 칩 접근을 제한하는 상황에서도 DeepSeek가 일반적인 AI 스타트업에 비해 이례적인 컴퓨팅 기반을 활용할 수 있게 해주었다.

모델과 2025년 1월의 충격

DeepSeek는 점점 더 강력한 일련의 Open-weights models 모델을 출시했으며, DeepSeek-V2와 V3를 거쳐 2025년 1월 DeepSeek-R1을 공개했다. 이 모델은 Reinforcement learning 기법으로 상당 부분 훈련된 Reasoning model로, 여러 수학 및 코딩 AI benchmark 벤치마크에서 OpenAI의 OpenAI o1 성능에 필적하거나 근접하면서도 오픈 가중치와 훈련 과정을 설명하는 기술 논문과 함께 공개되었다. DeepSeek는 서구 유사 연구소들이 지출하는 것으로 알려진 비용보다 훨씬 낮은 훈련 비용을 보고했지만, 정확한 수치와 비교 가능성에 대해서는 논란이 있었다. 이번 공개는 DeepSeek market shock을 촉발하여 AI 관련 주식의 급격한 매도세를 불러일으켰으며, 특히 Nvidia의 사상 최대 하루 시가총액 손실을 초래했다. 투자자들이 Frontier model 수준에 도달하는 데 필요한 컴퓨팅 규모에 대한 기존 가정을 재평가했기 때문이다.

기술적 접근

DeepSeek의 모델은 훈련 및 추론 효율성을 높이기 위해 Mixture of experts 아키텍처를 적극적으로 활용했으며, 회사는 메모리와 통신 오버헤드를 줄이는 접근법을 포함한 훈련 최적화 세부 사항을 공개하여 다른 연구소들이 널리 연구했다. DeepSeek-R1의 훈련 파이프라인은 방대한 인간 라벨링 RLHF 데이터 없이도 검증 가능한 작업에 대한 강화 학습만으로 Chain-of-thought 방식 추론의 큰 개선이 가능함을 입증한 점에서 주목할 만했으며, 회사는 훨씬 더 저렴한 하드웨어에서 실행할 수 있는 더 작은 증류 버전의 모델도 공개하여 Hugging Face 같은 호스트를 통한 외부 개발자들의 채택을 가속화했다.

반응과 지정학적 맥락

DeepSeek의 부상은 미국의 첨단 칩 수출 통제가 중국 연구소들의 AI 최전선 도달을 막지 못했다는 증거로 널리 해석되었으며, 워싱턴에서 하드웨어 제한의 효과에 대한 논쟁을 격화시키고 Qwen 개발사인 알리바바와 같은 연구소들과 함께 AI governance 및 국가 경쟁에 대한 논의에 긴급성을 더했다. 일부 분석가와 경쟁 연구소들은 DeepSeek가 보고한 훈련 비용의 일부 측면에 의문을 제기하고 데이터 출처와 폐쇄형 서구 모델 출력물의 잠재적 증류 가능성에 대한 우려를 제기했지만, DeepSeek는 이에 대해 공개적으로 완전히 대응하지 않았다. 그럼에도 이 사건은 DeepSeek를 Mistral AI와 같은 연구소들과 함께 가장 큰 폐쇄형 미국 개발자들에 대한 신뢰할 수 있는 오픈 가중치 대안으로 자리매김하게 했다.

분류:industry·large-language-models·china
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사