영어에서 번역됨

Qwen3는 2025년에 출시된 알리바바 클라우드가 개발한 대규모 언어 모델 제품군이다. 이 제품군은 공개 가중치를 가진 밀집형 및 혼합 전문가 변형을 포함하며, 공개 리더보드에 등장한다.

Qwen3는 알리바바 클라우드가 개발한 대규모 언어 모델 제품군이다. 2025년 4월에 출시된 이 제품군은 밀집(dense) 및 혼합 전문가(MoE) 아키텍처를 모두 포함하며, 매개변수 수는 6억 개에서 2350억 개에 이른다. 이 모델들은 공개 가중치 제공과 공개 벤치마크에서의 강력한 성능으로 주목받으며, 미디어 및 LLM 리더보드에 등장했다. 출시 시점에는 다양한 크기와 구성을 아우르는 20개 변형이 벤치마크 스냅샷에 포함되었다.

Qwen3 시리즈는 이전에 알리바바 클라우드가 개발한 Qwen 및 Qwen2 모델 제품군을 기반으로 한다. 이 모델들은 텍스트 생성, 추론, 코딩을 포함한 다양한 작업을 위해 설계되었다. 또한 영어와 중국어에 특히 중점을 둔 여러 언어를 지원하며, 이는 알리바바의 글로벌 및 국내 사용자 기반을 반영한다.

아키텍처 및 변형

Qwen3 모델은 현대 대규모 언어 모델의 표준인 Transformer (architecture) 아키텍처를 사용한다. 이 제품군에는 밀집 모델(모든 토큰에 대해 모든 매개변수가 활성화됨)과 MoE 모델(토큰당 매개변수의 일부만 활성화되어 효율성을 높임)이 포함된다. 가장 큰 밀집 모델은 320억 개의 매개변수를 가지며, 가장 큰 MoE 모델은 총 2350억 개의 매개변수 중 토큰당 220억 개가 활성화된다.

벤치마크 스냅샷의 20개 변형에는 0.6B, 1.7B, 4B, 8B, 14B, 32B 밀집 매개변수 모델과 30B-A3B, 57B-A14B, 235B-A22B 구성의 MoE 모델(두 번째 숫자는 활성화된 매개변수를 나타냄)이 포함된다. 각 크기는 기본 및 명령어 튜닝 버전으로 제공되며, 일부는 응답 전에 확장된 추론을 가능하게 하는 "사고" 모드도 갖추고 있다.

훈련 및 기능

Qwen3 모델은 대규모 텍스트 데이터 말뭉치로 훈련되었지만, 알리바바 클라우드는 정확한 데이터셋 크기를 공개하지 않았다. 훈련 과정에서는 Adam 옵티마이저학습률 스케줄링과 같은 표준 기법이 사용되었다. 이 모델들은 트랜스포머 기반 언어 모델에서 흔한 멀티 헤드 어텐션위치 인코딩과 같은 기능을 통합한다.

Qwen3의 핵심 기능은 하이브리드 사고 모드이다. 사용자는 빠르고 직접적인 응답 모드와 최종 답변을 생성하기 전에 내부 추론 단계를 생성하는 사고 모드 사이를 전환할 수 있다. 이는 OpenAI의 o1 시리즈와 같은 다른 모델 제품군에서 사용되는 접근 방식과 유사하지만, Qwen3의 구현은 오픈소스이다.

명령어 튜닝 버전은 RLHF(인간 피드백 기반 강화 학습) 및 지도 미세 조정과 같은 기법을 사용하여 정렬되었다. 이 모델들은 출력 무작위성을 제어하기 위한 top-p 샘플링온도 스케일링도 지원한다.

성능 및 벤치마크

Qwen3 모델은 LMArena(이전 Chatbot Arena) 및 다양한 학술 벤치마크를 포함한 공개 LLM 리더보드에 등장했다. 가장 큰 모델인 Qwen3-235B-A22B는 수학, 코딩, 일반 지식과 같은 작업에서 OpenAI, Anthropic, Google DeepMind의 주요 비공개 모델과 경쟁력 있는 성능을 보여주었다.

벤치마크 스냅샷에서 20개 변형은 다양한 크기를 아우르며, 사용자가 성능과 계산 비용의 균형을 맞출 수 있도록 한다. 작은 모델(0.6B~8B)은 엣지 배포에 적합한 반면, 큰 모델은 상당한 GPU 리소스를 필요로 한다. 이 모델들은 MMLU, HumanEval, GSM8K와 같은 표준 벤치마크에서 테스트되었지만, 구체적인 점수는 변형에 따라 다르다.

가용성 및 생태계

Qwen3 모델은 상업적 및 연구용 사용을 허용하는 오픈 라이선스로 출시되었다. Hugging Face 및 기타 모델 저장소에서 다운로드할 수 있다. 알리바바 클라우드는 또한 클라우드 플랫폼을 통해 API 배포용 모델을 제공한다.

이 모델들은 vLLM 및 Ollama를 포함한 로컬 추론용 도구 및 라이브러리의 성장하는 생태계에 의해 지원된다. Hugging Face Transformers 및 PyTorch와 같은 프레임워크를 사용하여 미세 조정할 수 있다. 공개 가중치 특성은 소비자 하드웨어에서 실행되는 양자화 버전을 포함한 커뮤니티 적응으로 이어졌다.

수용 및 영향

Qwen3의 출시는 규모와 개방성 측면에서 주목할 만했다. 출시 당시 Meta의 Llama 시리즈 및 Mistral AI의 모델과 경쟁하는 가장 큰 공개 가중치 모델 제품군 중 하나였다. MoE 변형의 포함은 추론 중 더 적은 계산 리소스를 필요로 하므로 대규모 모델에 대한 접근성을 높였다.

미디어 보도는 추론 작업에서 Qwen3의 강력한 성능과 다국어 능력을 강조했다. 이 모델들은 챗봇, 코드 어시스턴트, 교육 도구를 포함한 다양한 응용 프로그램에서 사용되었다. 그러나 모든 대규모 언어 모델과 마찬가지로 잠재적 편향 및 오용에 대한 우려가 있으며, 알리바바 클라우드는 안전 미세 조정 및 사용 지침을 통해 이를 해결했다.

2025년 중반 현재 Qwen3는 계속 업데이트되고 있으며, 알리바바 클라우드는 패치와 추가 변형을 출시하고 있다. 이 모델 제품군은 독점 시스템에 대한 고성능 대안을 제공함으로써 오픈소스 AI 커뮤니티에 중요한 기여를 하고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·alibaba·open-source·transformer
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사