Qwen1.5는 2024년 초에 출시된 알리바바 클라우드가 개발한 대규모 언어 모델 제품군이다. 이 제품군은 5억 개에서 720억 개에 이르는 다양한 매개변수 크기를 포함하며, 기본 모델과 지시 조정 변형 모두를 제공한다. Qwen1.5 모델은 텍스트 생성, 번역, 질문 응답을 포함한 다양한 자연어 처리 작업을 위해 설계되었으며, 공개 LLM 및 미디어 리더보드에 등장하여 벤치마크 스냅샷에서 일곱 가지 변형이 포착되었다.
이 모델들은 Transformer (architecture) 아키텍처를 기반으로 구축되었으며, 이는 Large language model 개발에서 표준이 된 Neural network 유형이다. 이들은 Deep learning 기술을 사용하여 대규모 데이터 세트와 계산 자원을 활용해 훈련된다. Qwen1.5는 입력 프롬프트를 기반으로 인간과 유사한 텍스트를 생성하는 모델을 다루는 더 넓은 Generative AI 추세의 일부이다.
모델 변형 및 크기
Qwen1.5는 0.5B, 1.8B, 4B, 7B, 14B, 32B, 72B의 여러 매개변수 구성을 포함한다. 각 크기는 기본(사전 훈련) 및 채팅(지시 조정) 버전으로 제공된다. 72B 변형은 가장 크며 일반적으로 복잡한 작업에서 더 높은 성능을 보여주는 반면, 더 작은 변형은 효율성과 자원 제약이 있는 장치 배포에 최적화되어 있다. 이 모델들은 오픈 소스 라이선스로 출시되어 연구자와 개발자가 사용 및 수정할 수 있지만, 대규모 응용 프로그램에서 상업적 사용에는 일부 제한이 있다.
훈련 및 아키텍처
Qwen1.5 모델은 다른 현대 LLM과 유사한 표준 디코더 전용 트랜스포머 아키텍처를 사용한다. 이들은 Multi-Head Attention 메커니즘과 Positional Encoding을 사용하여 순차 데이터를 처리한다. 훈련에는 Adam (Optimizer) 및 Learning Rate Scheduling 기술이 포함되며, Gradient Clipping으로 훈련을 안정화한다. 이 모델들은 다양한 텍스트 데이터 말뭉치로 훈련되지만, 훈련 데이터 세트에 대한 구체적인 세부 사항은 완전히 공개되지 않았다. 지시 조정 변형은 Reinforcement Learning from AI Feedback (RLAIF)(AI 피드백 기반 강화 학습) 및 지도 미세 조정과 같은 기술을 사용하여 사용자 의도에 맞게 미세 조정된다.
성능 및 벤치마크
Qwen1.5 모델은 언어 이해, 추론, 코딩 작업을 포함한 다양한 벤치마크에서 평가되었다. 이들은 Open LLM Leaderboard와 같은 공개 리더보드에 등장하여 다른 오픈 소스 모델들 사이에서 경쟁력 있는 순위를 기록했다. 특히 72B 변형은 강력한 성능을 보여주며, 종종 더 큰 독점 모델과 비교할 만하다. 그러나 정확한 벤치마크 점수는 작업에 따라 다르며 새로운 평가가 수행됨에 따라 변경될 수 있다.
가용성 및 배포
Qwen1.5는 여러 채널을 통해 제공된다. 오픈 소스 버전은 Hugging Face와 같은 모델 저장소에서 다운로드할 수 있으며, DashScope API를 포함한 Alibaba Cloud 서비스에 통합되어 있다. 이 모델들은 Amazon Web Services, Microsoft Azure, Google Cloud를 포함한 다양한 플랫폼과 AWS Trainium 및 Groq와 같은 추론 가속화를 위한 특수 하드웨어에 배포할 수 있다. 이러한 유연성 덕분에 Qwen1.5는 연구 및 생산 사용 모두에 접근 가능하다.
수용 및 영향
Qwen1.5는 특히 더 낮은 계산 요구 사항으로 경쟁력 있는 결과를 제공하는 더 작은 변형에서 성능 대비 크기 비율로 AI 커뮤니티에서 좋은 평가를 받았다. 이는 오픈 소스 LLM의 확산에 기여하여 고급 AI 기능에 대한 더 넓은 접근을 가능하게 했다. 이 모델 제품군은 학술 연구 및 산업 응용 프로그램에서도 사용되어 Artificial intelligence의 진화하는 환경에서 그 역할을 더욱 공고히 했다.