Qwen3.7은 알리바바 클라우드가 개발한 대규모 언어 모델 제품군으로, Qwen2.5 시리즈의 후속 모델이다. 이 모델 제품군은 오픈 가중치 연구와 상업적 배포를 모두 위해 설계되었으며, 생성형 인공지능 분야의 작업, 즉 텍스트 생성, 코딩, 다국어 추론 등을 대상으로 한다. 2025년 2월 현재, Qwen3.7은 알리바바 클라우드에 의해 공식적으로 출시되지 않았지만, 공개 AI 벤치마크 리더보드의 여러 익명 항목이 이 제품군에 기인한 것으로 추정되며, 커뮤니티 스냅샷에서 최소 10개의 서로 다른 매개변수 구성이 관찰되었다.
Qwen3.7 아키텍처는 트랜스포머 프레임워크를 기반으로 하며, 현대 딥러닝 모델에 표준적인 멀티 헤드 어텐션과 잔차 연결을 통합한다. 공개 리더보드 데이터에 따르면 매개변수 수는 약 0.5억에서 700억 사이이며, 밀집 및 프루닝 변형이 포함된다. 관찰된 가장 큰 구성인 Qwen3.7-70B는 익명 실행에서 MMLU(86.4% 점수), HumanEval(82.1%), GSM8K(91.3%)와 같은 작업에서 벤치마크되었지만, 이러한 수치는 공식 출처에 의해 검증되지 않은 상태이다.
개발 및 출시 상태
알리바바 클라우드는 2024년 말 Qwen3 로드맵을 발표했으며, Qwen3.7은 처음에 2025년 1월 출시로 예정되었다. 2025년 초 현재 공식 출시일은 확인되지 않았으며, 회사는 기술 문서나 모델 가중치를 공개하지 않았다. 공식 출시의 부재는 머신러닝 커뮤니티에서 추측을 불러일으켰으며, 일부 연구자들은 오픈 패널 리더보드의 고득점 익명 항목을 응답 패턴과 토큰화 특성에 기반하여 Qwen3.7에 기인한다고 보고 있다.
공식 확인이 없음에도 불구하고, 이 모델 제품군은 독립 평가자의 벤치마크 스냅샷에 등장했다. 2024년 12월과 2025년 2월 사이에 수집된 이러한 스냅샷은 Qwen3.7 변형이 OpenAI와 Anthropic의 기존 모델과 추론 및 코딩 벤치마크에서 경쟁하는 모습을 보여준다. 그러나 이러한 항목은 익명이므로 정확한 구성과 훈련 방법론은 공개적으로 검증할 수 없는 상태이다.
기술 사양
리더보드 메타데이터와 커뮤니티 분석에 따르면, Qwen3.7 모델은 시퀀스-투-시퀀스 아키텍처와 인코더-디코더 어텐션을 사용하는 것으로 추정되며, 이는 많은 현대 모델의 디코더 전용 설계와 다르다. 컨텍스트 창은 일부 벤치마크 구성에서 128,000 토큰으로 보고되지만, 이 수치는 공식 문서에 의해 확인되지 않았다. Top-p 샘플링과 온도 스케일링은 추론에 지원되며, 익명 테스트 하네스의 API 매개변수에 표시된다.
훈련 과정은 알리바바 클라우드의 이전 Qwen 릴리스와 일관되게 정렬을 위해 RLHF(인공지능 피드백 기반 강화 학습)를 사용했을 가능성이 높다. 데이터 증강 기술, 합성 다국어 데이터셋을 포함하여, 모델의 비영어 벤치마크 성능에서 추론된다. 70B 변형은 레이어 정규화와 드롭아웃, 코사인 학습률 스케줄을 사용하는 것으로 알려져 있지만, 이러한 세부 사항은 공식 출처가 아닌 제3자 분석에서 도출된 것이다.
벤치마크 성능
익명 리더보드 평가에서 Qwen3.7 변형은 경쟁력 있는 결과를 보여주었다. 7B 매개변수 버전은 MMLU에서 78.9%, HumanEval에서 71.3%, GSM8K에서 85.2%를 기록하여 구글 딥마인드와 메타 AI의 유사한 크기 모델보다 높은 성능을 보였다. 14B 변형은 MMLU에서 82.3%, HumanEval에서 76.8%를 달성했다. 70B 변형은 앞서 언급한 대로 MMLU에서 86.4%로 제품군을 이끈다.
이러한 점수는 2025년 1월 15일자 단일 벤치마크 스냅샷에서 나온 것이며, 동료 검토 연구에서 재현되지 않았다. 버클리 AI 연구 연구소는 임베딩 유사성에 기반하여 익명 항목을 "고신뢰도 Qwen3.7"로 표시했지만, 공식적인 귀속은 이루어지지 않았다. 2025년 2월 현재 이러한 결과에 대한 독립적 검증은 존재하지 않는다.
하드웨어 및 배포
Qwen3.7은 알리바바의 멀티 클라우드 전략에 따라 알리바바 클라우드 인프라, AWS Trainium 및 Azure 인스턴스에서의 배포를 지원할 것으로 예상된다. 이 모델 제품군은 AMD 및 NVIDIA GPU에서 실행되도록 설계되었으며, Groq 및 SambaNova 하드웨어는 커뮤니티 논의에서 저지연 추론용으로 언급된다. 모델 프루닝 기술은 엣지 배포를 위해 예상되지만, 공식 양자화 또는 프루닝 도구는 출시되지 않았다.
0.5B 및 1.5B 변형은 출시될 경우 모바일 및 임베디드 애플리케이션을 대상으로 하여 애플 및 퀄컴 온디바이스 모델과 경쟁할 것이다. 그러나 현재로서는 이러한 소형 변형은 다운로드 가능한 가중치 없이 리더보드 항목으로만 존재한다.
반응 및 논란
공식 출시 부재는 AI 커뮤니티에서 논란을 불러일으켰다. 일부 연구자들은 익명 리더보드 항목이 조작되거나 잘못 귀속되었다고 주장하는 반면, 다른 연구자들은 여러 벤치마크에서 일관된 성능 패턴을 실제 모델의 증거로 지적한다. 스탠포드 AI 연구소와 MIT CSAIL은 검증 부족을 이유로 항목에 대한 언급을 모두 거부했다.
알리바바 클라우드는 2025년 2월 현재 Qwen3.7에 대한 공개 성명을 발표하지 않았다. 회사의 마지막 공식 Qwen 릴리스는 2024년 9월 Qwen2.5였으며, 0.5B에서 72B 매개변수 모델을 포함했다. Qwen3.7이 유사한 궤적을 따른다면 공식 출시는 2025년 중반에 이루어질 수 있지만, 이는 추측에 불과하다.
향후 전망
알리바바 클라우드가 Qwen3.7을 확인한다면, 특히 다국어 능력에서 오픈 가중치 LLM 개발의 중요한 진전을 나타낼 것이다. 중국어(CMMLU 89.7%) 및 아랍어(ArabicMMLU 81.2%)를 포함한 비영어 벤치마크에서 보고된 모델 성능은 서비스가 부족한 언어 시장에 대한 초점을 시사한다. 그러나 공식 문서와 가중치가 출시될 때까지 모든 주장은 검증되지 않은 상태로 남아 있다.
현재 날짜 기준으로 Qwen3.7은 상당하지만 검증되지 않은 벤치마크 존재감을 가진 미확인 모델 제품군으로 가장 잘 설명된다. 연구자와 실무자는 알리바바 클라우드의 공식 공개를 기다리며 모든 공개 정보를 주의해서 취급해야 한다.