WizardLM은 마이크로소프트 리서치 아시아(Microsoft Research Asia)가 개발한 대규모 언어 모델 계열이다. 이 프로젝트는 머신 러닝 미세 조정에 사용되는 복잡한 지시 데이터를 자동으로 생성하는 기술인 Evolve-Instruct 방법을 도입했다. 첫 번째 WizardLM 모델은 2023년에 출시되었으며, 멀티 헤드 어텐션과 레이어 정규화에 의존하는 트랜스포머 모델인 LLaMA 아키텍처를 기반으로 했다.
"WizardLM"이라는 이름은 마법사의 전문성처럼 복잡한 사용자 지시를 처리할 수 있는 모델을 만드는 목표를 반영한다. 이 모델들은 생성형 AI의 광범위한 분야의 일부이며, 인공지능 연구의 발전을 바탕으로 한다. WizardLM은 모델이 사용자 요청을 높은 정확도로 해석하고 실행해야 하는 지시 따르기(instruction following)의 과제를 해결하기 위해 설계되었다.
배경 및 동기
지시 튜닝(instruction tuning)은 신경망을 사용자 프롬프트에 따르도록 적응시키는 표준적인 방법이다. 이 과정에서 기본 모델은 지시와 원하는 응답의 쌍으로 미세 조정된다. 그러나 다양하고 복잡한 지시를 수동으로 제작하는 것은 노동 집약적이며 종종 깊이가 부족한 데이터셋을 초래한다. WizardLM은 AI 시스템을 사용하여 단순한 시드 지시를 더 복잡한 형태로 진화시킴으로써 이를 해결한다. 이 접근 방식은 모델이 점진적으로 더 어려운 예제에 대해 훈련되는 커리큘럼 학습과 관련이 있다. 목표는 모델을 더 넓은 범위의 추론 패턴과 제약 조건에 노출시켜 실제 사용자 요청을 처리하는 능력을 향상시키는 것이다.
Evolve-Instruct 방법은 2023년 4월 arXiv에 게시된 "WizardLM: Empowering Large Language Models to Follow Complex Instructions"라는 제목의 논문에서 소개되었다. 저자들은 마이크로소프트 리서치 아시아에 소속되어 있었다. 이 논문은 심층 진화(deep evolution)와 심화 진화(in-depth evolution)라는 두 단계 과정을 제안했다. 심층 진화에서 모델은 제약 조건을 추가하거나, 추론을 심화하거나, 입력을 복잡하게 만들어 새로운 지시를 생성한다. 심화 진화에서 모델은 기존 지시를 다시 작성하여 복잡성을 증가시킨다. 결과 데이터셋은 기본 모델을 미세 조정하는 데 사용된다.
Evolve-Instruct 방법
Evolve-Instruct 방법은 ChatGPT와 같은 교사 모델을 사용하여 제약 조건 추가, 추론 심화, 입력 복잡화와 같은 작업을 통해 시드 지시를 다시 작성한다. 진화된 지시는 미세 조정을 위한 데이터 증강의 한 형태로 작용한다. 이 방법에는 제약 조건 추가, 심화, 구체화, 추론 단계 증가를 포함한 여러 진화 유형이 포함된다. 예를 들어, "시를 쓰세요"와 같은 단순한 지시는 "사랑을 배우는 로봇에 대해 셰익스피어 스타일로 시를 쓰세요"로 진화될 수 있다. 이는 작업의 복잡성과 구체성을 증가시킨다.
이 과정은 반복적이며, 모델은 더 어려운 지시에 반복적으로 노출된다. 저자들은 또한 너무 모호하거나 답변할 수 없는 지시를 걸러내는 품질 관리 메커니즘을 도입했다. 이는 훈련 데이터가 유용하게 유지되고 모델 성능을 저하시키지 않도록 보장한다. 진화된 지시는 원래 시드 지시와 결합되어 최종 훈련 세트를 만든다.
모델 버전 및 벤치마크
첫 번째 WizardLM 모델인 WizardLM-7B는 LLaMA-7B에서 미세 조정되었다. 이후 버전에는 WizardLM-13B와 WizardLM-30B가 포함되었다. 이 모델들은 Evol-Instruct 테스트 세트 및 기타 벤치마크에서 평가되었다. 저자들은 평가에서 WizardLM-7B가 복잡한 지시 따르기에서 ChatGPT를 능가한다고 보고했다. 구체적으로, 그들은 GPT-4를 심사자로 사용하여 응답을 비교했고, WizardLM-7B가 Evol-Instruct 테스트 세트에서 더 높은 승률을 달성했음을 발견했다. WizardLM v1.1 및 v1.2와 같은 후속 버전은 더 큰 훈련 데이터셋과 개선된 진화 전략을 포함한 추가 개선을 통합했다.
모델 가중치는 공개적으로 출시되어 연구자와 개발자가 사용하고 미세 조정할 수 있게 했다. WizardLM 모델은 또한 다양한 오픈 소스 프로젝트에 통합되었고 이후 지시 따르기 모델의 기준선 역할을 했다. 2024년 기준으로 WizardLM 계열에는 다양한 크기의 모델이 포함되며, Evolve-Instruct 방법은 다른 도메인에도 적용되었다.
영향 및 관련 연구
WizardLM의 Evolve-Instruct 방법은 코드 생성을 위한 WizardCoder와 수학적 추론을 위한 WizardMath를 포함한 이후 모델에 영향을 미쳤다. 이 모델들은 유사한 진화 기술을 전문 도메인에 적용하여 접근 방식의 다용성을 입증했다. 이 접근 방식은 해당 분야의 다른 연구자들에 의해 채택되었으며, 논문은 널리 인용되었다. WizardLM은 자동화된 데이터 생성을 통해 지시 따르기를 개선하는 딥 러닝의 더 넓은 추세의 일부이다. 이 방법은 또한 지시 따르기 모델을 위한 더 정교한 평가 벤치마크 개발에 기여했다.