Qwen3.8은 대규모 언어 모델 제품군으로, 알리바바 클라우드가 개발했습니다. 이 시리즈는 2025년에 Qwen2.5 세대의 후속 모델로 출시되었으며, 밀집 모델부터 혼합 전문가(MoE) 아키텍처까지 다양한 매개변수 크기를 제공합니다. 이 모델들은 오픈소스 배포와 알리바바 클라우드 플랫폼을 통한 상업적 배포 모두를 위해 설계되었습니다.
Qwen3.8 제품군은 여러 구성으로 제공되며, 주력 밀집 모델은 80억 및 320억 매개변수이며, 토큰당 22억 매개변수를 활성화하는 Qwen3.8-A14B와 같은 MoE 변형도 포함됩니다. 이 모델들은 131,072 토큰의 컨텍스트 길이를 지원하며, 30개 이상의 언어를 포함한 다국어 데이터로 훈련되었으며, 특히 영어와 중국어에 강점을 보입니다.
아키텍처 및 훈련
Qwen3.8 모델은 Transformer (architecture) 디코더 전용 아키텍처를 기반으로 하며, 다중 헤드 어텐션, SwiGLU 활성화, 회전 위치 임베딩과 같은 개선 사항을 채택했습니다. 훈련 과정은 두 단계로 진행되었습니다: 웹 텍스트, 서적, 코드로 구성된 대규모 말뭉치에 대한 초기 사전 훈련과, 이후 인간 선호도에 맞추기 위한 지도 미세 조정 및 AI 피드백 기반 강화 학습(RLAIF)입니다.
Qwen3.8의 주목할 만한 특징은 하이브리드 사고 모드로, 모델이 빠른 응답 생성과 확장된 추론 사이를 전환할 수 있게 합니다. 이는 시스템 프롬프트를 통해 제어되며, 사용자가 속도와 분석 깊이를 균형 있게 조정할 수 있습니다. 또한 모델은 추론 중 그리디 샘플링 및 top-p 샘플링 전략을 통합합니다.
성능 및 벤치마크
공개 벤치마크에서 Qwen3.8 모델은 경쟁력 있는 성능을 입증했습니다. Qwen3.8-32B 모델은 MMLU-Pro 벤치마크에서 75.1점을 기록하여 여러 더 큰 모델을 능가했습니다. AIME24 수학 경시대회에서 32B 모델은 67.0점을, MoE 변형인 Qwen3.8-A14B는 81.0점을 기록했습니다. 코딩 작업에서는 LiveCodeBench 및 SWE-bench에서 강력한 결과를 보였으며, 32B 모델은 후자에서 45.0의 통과율을 달성했습니다.
이 모델들은 LMArena 및 Open LLM 리더보드를 포함한 공개 LLM 리더보드에 등장했으며, 크기 등급에서 최고 수준의 오픈 가중치 모델 중 하나로 선정되었습니다. 독립 평가에서는 효율성을 강조했으며, 특히 MoE 변형은 감소된 계산 비용으로 밀집 모델과 유사한 성능을 제공합니다.
출시 및 가용성
Qwen3.8은 단계적으로 출시되었으며, 먼저 더 작은 0.6B 및 1.7B 모델이 제공된 후, 8B 및 32B 밀집 모델, 마지막으로 MoE 변형이 제공되었습니다. 가중치는 Apache 2.0 라이선스로 배포되어 연구 및 상업적 사용이 모두 허용됩니다. 모델은 Hugging Face 및 ModelScope를 통해 다운로드할 수 있으며, 알리바바 클라우드의 Model Studio 서비스를 통해 배포할 수 있습니다.
하드웨어 지원에는 NVIDIA GPU가 포함되며, 모델은 AMD 및 Intel 하드웨어에서의 추론에도 최적화되었습니다. 배포 옵션은 vLLM 또는 SGLang을 사용한 로컬 추론부터 클라우드 기반 API까지 다양합니다. 출시에는 GPTQ 및 AWQ 기술을 사용한 양자화 버전도 포함되어 메모리 사용량을 줄였습니다.
수용 및 영향
Qwen3.8 시리즈는 오픈소스 AI 커뮤니티에서 호평을 받았으며, 개발자들은 성능 대비 크기 비율과 하이브리드 사고 모드의 유연성을 높이 평가했습니다. 모델은 코딩 어시스턴트부터 다국어 번역 도구까지 다양한 애플리케이션에 통합되었습니다. 이 출시는 생성형 AI 민주화의 더 넓은 추세에 기여하여, 소비자급 하드웨어에서 실행할 수 있는 고품질 모델을 제공했습니다.
2025년 말 기준으로 Qwen3.8 제품군은 지속적으로 유지 관리되고 있으며, 주기적인 업데이트와 추가 미세 조정 변형이 출시되고 있습니다. 모델은 또한 모델 가지치기 및 데이터 증강과 같은 분야의 추가 연구를 위한 기반으로 활용되었습니다.