Muse-Spark 1.1은 생성형 AI 시스템을 전문으로 하는 기업인 Halcyon이 개발한 대규모 언어 모델이다. 2026년 9월에 출시된 이 모델은 원래 Muse-Spark 모델의 후속작으로, 텍스트 생성, 요약, 대화형 AI를 포함한 다양한 자연어 처리 작업을 위해 설계되었다. 이 모델은 LMArena 및 LiveBench를 포함한 공개 벤치마크 리더보드에서 평가되었으며, 동급 크기 모델 중 최상위권에 꾸준히 랭크되었다.
이 모델의 아키텍처는 Transformer (architecture) 프레임워크를 기반으로 하며, 다른 현대 대규모 언어 모델과 유사한 디코더 전용 설계를 활용한다. 텍스트의 장거리 의존성을 처리하기 위해 멀티 헤드 어텐션 및 위치 인코딩과 같은 고급 기술을 통합한다. 훈련 과정은 지도 미세 조정과 인간 피드백 기반 강화 학습(RLHF)의 조합을 사용하여 모델 출력을 인간의 선호도에 맞추는 데 도움을 주었다.
개발 및 출시
Muse-Spark 1.1은 Halcyon의 수석 AI 연구원인 Dr. Elena Vasquez가 이끄는 팀에 의해 개발되었으며, 샌프란시스코와 방갈로르 사무소의 엔지니어와 연구원들이 기여했다. 프로젝트는 2025년 초에 시작되었으며, 초기 버전(Muse-Spark 1.0)은 2026년 3월에 출시되었다. 2026년 9월 18일에 출시된 1.1 업데이트는 향상된 추론 능력과 감소된 지연 시간을 포함한 여러 개선 사항을 도입했다.
이 모델은 공개적으로 이용 가능한 웹 텍스트, 서적, 과학 논문 및 코드 저장소로 구성된 다양한 데이터셋으로 훈련되었다. 훈련 코퍼스는 10조 개 이상의 토큰을 포함했으며, 영어, 스페인어 및 중국어의 고품질 소스에 중점을 두었다. 훈련 인프라는 Amazon Web Services 및 AWS Trainium 인스턴스를 통해 제공되는 4,096개의 AMD MI300X 가속기 클러스터를 활용하여 90일 동안 효율적인 분산 훈련을 가능하게 했다.
아키텍처 및 사양
Muse-Spark 1.1은 1,750억 개의 매개변수를 가지고 있어 OpenAI의 GPT-3.5와 같은 다른 대형 모델과 크기가 비슷하다. 이 모델은 128,000 토큰의 컨텍스트 창을 사용하여 긴 문서를 처리하고 확장된 대화에서 일관성을 유지할 수 있다. 네트워크의 마지막 1/3에 혼합 전문가(MoE) 계층을 사용하여 토큰당 매개변수의 하위 집합만 활성화하여 성능을 희생하지 않으면서 효율성을 개선한다.
모델의 훈련은 과적합을 방지하기 위해 드롭아웃 및 계층 정규화를 포함한 여러 정규화 기술을 통합했다. 또한 Adam 옵티마이저 및 그래디언트 클리핑을 사용한 맞춤형 학습률 스케줄을 사용하여 훈련을 안정화했다. 최종 모델은 모델 가지치기 기술을 사용하여 메모리 사용량을 20% 줄이면서 정확도를 유지했다.
성능 및 벤치마크
LMArena 리더보드에서 Muse-Spark 1.1은 2026년 9월 기준 Elo 등급 1,342를 달성하여 평가된 모든 모델 중 상위 5%에 위치했다. 추론, 코딩 및 수학 능력을 테스트하는 LiveBench 평가에서 모델은 전체 78.4점을 기록했으며, 특히 코드 생성(82.1) 및 논리적 추론(79.6)에서 강력한 성능을 보였다. 이러한 점수는 최신 스냅샷인 2026-09-18 날짜를 기준으로 한다.
다른 모델과의 비교 테스트에서 Muse-Spark 1.1은 MMLU 벤치마크에서 Anthropic의 Claude 3.5 Sonnet을 능가했으며(90.2% 대 88.7%), HumanEval 코딩 벤치마크에서 Google DeepMind의 Gemini 1.5 Pro와 일치했다(85.3% 대 85.1%). 그러나 MATH 벤치마크에서는 OpenAI의 GPT-4o에 뒤처졌다(72.8% 대 76.5%). Groq 하드웨어에서 측정된 모델의 추론 속도는 초당 1,200 토큰으로, 최적화된 아키텍처 덕분에 많은 경쟁사보다 빨랐다.
응용 및 배포
Muse-Spark 1.1은 Halcyon의 API를 통해 제공되며, Microsoft Azure, Google Cloud 및 Oracle Cloud를 포함한 주요 클라우드 플랫폼에서도 사용할 수 있다. 고객 지원 챗봇, 법률 문서 분석 및 실시간 번역 서비스와 같은 여러 엔터프라이즈 애플리케이션에 통합되었다. 이 모델은 특히 자연어 처리 및 기계 학습 분야의 학술 연구에도 사용된다.
Halcyon은 엣지 디바이스 및 모바일 애플리케이션에 최적화된 70억 개의 매개변수를 가진 경량 버전인 Muse-Spark 1.1 Lite를 출시했다. 이 버전은 대부분의 핵심 기능을 유지하지만 효율성을 위해 일부 성능을 희생한다. 회사는 또한 재현성을 용이하게 하기 위해 모델의 토크나이저 및 평가 스크립트를 오픈소스로 공개했다.
수용 및 영향
Muse-Spark 1.1의 출시는 AI 커뮤니티에서 긍정적인 평가를 받았다. Stanford AI Lab 및 Berkeley AI Research의 연구원들은 강력한 추론 능력과 효율적인 추론을 칭찬했다. 그러나 일부 비평가들은 모델의 훈련 데이터에 편향이 포함될 수 있다고 지적했으며, Halcyon은 이러한 문제를 완화하기 위한 노력을 상세히 설명하는 투명성 보고서를 발표했다.
이 모델은 또한 대규모 AI 훈련의 환경 영향에 대한 논의를 촉발했다. Halcyon은 훈련 과정이 약 12GWh의 전기를 소비했다고 보고했으며, 이는 유사한 크기의 다른 모델과 비슷한 수준이다. 회사는 향후 훈련 실행에 재생 에너지원을 사용하겠다고 약속했다.
2026년 말 현재 Muse-Spark 1.1은 대규모 언어 모델 환경에서 여전히 두드러진 모델로 남아 있으며, 후속 모델인 Muse-Spark 2.0은 이미 개발 중이며 2027년 초 출시가 예상된다.