Qwen은 중국의 대기업 알리바바 그룹의 클라우드 컴퓨팅 부문인 알리바바 클라우드가 개발한 대규모 언어 모델 제품군이다. 최초의 Qwen 모델은 2023년에 출시되었으며, 이후 여러 세대와 특수 변형으로 확장되어 기본 언어 모델, 채팅 튜닝 버전, 비전-언어 모델(Qwen-VL), 코딩 특화 모델(Qwen-Coder), 오디오 모델을 포함한다. 알리바바는 대부분의 Qwen 모델을 오픈 가중치 라이선스(주로 Apache 2.0)로 출시했으며, 이는 2025년까지 이 제품군이 Hugging Face에서 가장 많이 다운로드된 모델 제품군 중 하나가 되는 데 기여했다. 이는 직접 다운로드뿐만 아니라, 더 넓은 오픈소스 커뮤니티가 Qwen 체크포인트를 기반으로 미세 조정한 수많은 파생 모델을 통해서도 이루어졌다.
모델 계보
Qwen1은 2023년에 최대 720억 매개변수 규모로 출시되었다. Qwen2는 2024년에 이어졌으며, 다국어 지원과 더 긴 컨텍스트 창이 개선되었다. 2024년 9월에 출시된 Qwen2.5는 10억 미만에서 720억 매개변수에 이르는 다양한 크기를 아우르며, 코딩 및 수학 특화 변형도 포함했고, Meta AI의 Llama 제품군의 유사한 크기 오픈 모델과 경쟁력이 있는 것으로 널리 벤치마킹되었다. 2025년에 출시된 Qwen3는 하이브리드 추론 기능을 도입하여, 단일 모델이 빠른 직접 응답 모드와 확장된 Chain-of-thought 추론 모드 사이를 전환할 수 있게 했으며, 이는 일반 채팅 기능과 추론 모델 성능을 결합하려는 다른 연구소들의 설계 방향과도 일치한다. Qwen3는 Mixture of experts 변형을 포함한 다양한 크기로 출시되어, 성능과 추론 비용 간의 균형을 목표로 했다.
오픈 가중치 생태계에서의 위치
Qwen 모델은 연구자, 스타트업, 취미 개발자들이 미세 조정의 기반으로 자주 사용한다. 이는 허용적인 라이선스와 MMLU 같은 표준 벤치마크 및 HumanEval 같은 코딩 평가에서 다른 오픈 옵션과 비교해 유리한 성능 덕분이다. 예를 들어, DeepSeek의 DeepSeek-R1 증류 추론 모델은 Qwen 체크포인트를 증류의 기본 모델 중 하나로 사용했다. Qwen의 빠른 반복과 소비자 하드웨어에서 실행할 수 있을 만큼 작은 모델부터 더 큰 폐쇄형 모델과 경쟁하는 변형까지의 광범위한 크기 범위는 알리바바를 DeepSeek, Mistral AI, 메타와 함께 오픈 가중치 생태계에서 가장 활발한 기여자 중 하나로 자리매김하게 했다.
수용 및 전략적 맥락
Qwen의 출시는 종종 2024년과 2025년에 걸쳐 DeepSeek 및 다른 기관과 함께 중국 AI 연구소에서 나온 유능한 오픈 가중치 모델의 더 넓은 물결의 맥락에서 해석된다. 분석가와 서방 정책 입안자들은 이를 미국의 고급 GPU 수출 통제에도 불구하고 중국의 AI 산업이 경쟁력을 유지하고 있다는 증거로 인용했다. 알리바바는 Qwen을 연구 기여이자 자체 상업용 클라우드 AI 제품의 기반으로 포지셔닝하여, Qwen 모델을 알리바바 클라우드의 엔터프라이즈 제품에 통합했다. 독립 평가자들은 다른 중국 개발 모델과 마찬가지로, 호스팅된 소비자 대상 Qwen 제품이 민감한 정치적 주제에 대해 중국 규제 요구 사항에 부합하는 콘텐츠 제한을 적용한다고 지적했지만, 공개적으로 출시된 모델 가중치 자체는 제3자가 독립적으로 실행할 때 이를 강제하지 않았다.