muse-spark-1.2 (xHigh)는 민간 AI 연구 기업인 Halcyon이 개발한 대규모 언어 모델이다. muse-spark-1.2 시리즈의 주력 변형으로 출시되었으며, 높은 처리량 추론과 복잡한 추론 작업을 위해 설계되었고, 매개변수 수는 4,000억 개를 초과한다. 이 모델은 muse-spark-1.0의 후속 모델로, 2025년 9월 15일에 API를 통해 처음 제공되었으며, 2026년 9월 19일에 안정적인 스냅샷이 출시되었다.
이 모델은 트랜스포머 아키텍처와 멀티 헤드 어텐션 메커니즘을 기반으로 구축되었으며, 안정적인 훈련을 위해 위치 인코딩과 레이어 정규화를 통합한다. 혼합 전문가 설계를 사용하여 토큰당 매개변수의 하위 집합만 활성화하므로 계산 비용을 줄이면서 높은 정확도를 유지한다. 훈련 과정은 커리큘럼 학습과 기울기 클리핑을 사용했으며, 초기 학습률은 1.5e-4이고 학습률 스케줄에는 2.1조 토큰에 걸친 워밍업과 코사인 감쇠가 포함된다.
훈련 및 데이터
muse-spark-1.2 (xHigh)는 약 12테라바이트의 공개적으로 이용 가능한 텍스트와 코드로 구성된 다양한 말뭉치로 훈련되었다. 데이터 세트는 품질을 위해 필터링되었고 데이터 증강 기법을 사용하여 중복을 제거했으며, 50개 이상의 언어를 포함한 다국어 콘텐츠에 중점을 두었다. 훈련은 Halcyon AI과 아마존 웹 서비스의 파트너십을 통해 제공된 8,192개의 AMD MI300X 가속기 클러스터에서 수행되었다. 훈련 실행은 74일 동안 지속되어 2025년 8월에 종료되었으며, 약 45GWh의 전력을 소비했다.
모델의 손실 함수에는 표준 교차 엔트로피 목적 함수가 포함되었으며, 미세 조정 중 온도 스케일링 계수는 0.7이었다. 사후 훈련에는 출력을 인간 선호도에 맞추기 위한 Reinforcement Learning from AI Feedback (RLAIF) (AI 피드백 기반 강화 학습)가 포함되었고, 그 후 정확도 손실 없이 지연 시간을 18% 줄이기 위한 모델 가지치기의 최종 단계가 이어졌다.
능력 및 벤치마크
공개 리더보드에서 muse-spark-1.2 (xHigh)는 주목할 만한 점수를 달성했다. 2026년 9월 19일 스냅샷 기준으로 LMArena에서 Elo 등급 1,342로 3위를 기록했고, LiveBench에서 종합 점수 78.4로 2위를 차지했다. 특정 작업에서는 MMLU-Pro에서 91.2%, 코드 생성 HumanEval에서 88.7%, MATH-500 벤치마크에서 84.5%를 기록했다. 모델은 교차 어텐션 메커니즘과 긴 형식 생성을 위한 빔 서치 디코딩을 통해 256,000토큰의 컨텍스트 창을 지원한다.
아키텍처에는 피드포워드 레이어에 잔차 네트워크 연결과 배치 정규화가 포함되어 훈련 중 기울기 흐름을 개선한다. 모델은 또한 기본 k가 50이고 p가 0.95인 탑-k 샘플링과 탑-p 샘플링을 사용하여 출력의 창의성을 제어한다. 기업용으로는 미세 조정을 위한 SGD 변형인 AdamW를 지원하며, 적응 중 0.1 비율의 드롭아웃 정규화를 제공한다.
배포 및 생태계
muse-spark-1.2 (xHigh)는 Halcyon의 클라우드 API와 구글 클라우드 및 오라클 클라우드 마켓플레이스를 통해 제공된다. AWS Trainium 및 Groq 하드웨어에 최적화되어 있으며, Groq의 LPU 시스템에서 초당 1,200토큰의 추론 속도를 제공한다. 모델은 또한 기업 고객을 위해 애저에 통합되었으며, 온프레미스 배포를 위한 ONNX 런타임을 지원한다.
Halcyon은 엣지 장치용으로 더 작은 증류 버전인 muse-spark-1.2 (base)를 출시했지만, xHigh 변형은 주력 모델로 남아 있다. 회사는 전체 훈련 비용을 공개하지 않았지만, 업계 추정에 따르면 컴퓨팅 및 데이터 획득 비용을 기준으로 5,000만 달러를 초과한다. 2026년 초 기준으로 이 모델은 삼성전자와 인텔을 포함한 2,000개 이상의 조직에서 내부 연구에 사용되고 있다.
수용 및 영향
muse-spark-1.2 (xHigh)의 출시는 이전 모델 대비 효율성 개선, 특히 OpenAI 및 Anthropic의 유사한 규모 모델과 비교하여 추론 비용을 30% 줄인 점으로 주목받았다. 그러나 일부 연구자들은 브라이언 크리스천과 멜라니 미첼이 인공지능 재현성에 대해 제기한 우려를 반영하여 훈련 데이터 출처의 투명성 부족을 비판했다.
이 모델은 또한 생성형 AI 안전에 대한 논의를 촉발했으며, Halcyon은 유해한 출력을 완화하기 위해 기울기 클리핑과 Reinforcement Learning from AI Feedback (RLAIF)을 구현했다. 스탠포드 AI 연구소와 버클리 AI 연구의 독립 감사에서는 심각한 편향 문제를 발견하지 못했지만, 지속적인 모니터링을 권고했다. 최신 스냅샷 기준으로 muse-spark-1.2 (xHigh)는 경쟁적인 대규모 언어 모델 환경에서 최고 수준의 경쟁자로 남아 있으며, 2027년 초에 버전 1.3 업데이트가 계획되어 있다.