Zephyr는 Hugging Face 팀이 개발한 오픈 가중치 대규모 언어 모델 제품군으로, 유용하고 정렬된 어시스턴트 역할을 하도록 설계되었습니다. 이 모델들은 Mistral AI가 만든 기본 모델을 기반으로, 증류된 직접 선호 최적화(dDPO)라는 기법을 사용하여 미세 조정되었습니다. 이 접근 방식은 더 크고 더 유능한 교사 모델의 피드백을 활용하여 미세 조정 과정을 안내하며, 지시를 따르고 유용하면서도 해롭지 않은 응답을 생성하는 모델의 능력을 향상시키는 것을 목표로 합니다.
시리즈의 첫 번째 모델인 Zephyr-7B-alpha는 2023년 10월에 출시되었고, Zephyr-7B-beta는 2023년 11월에 출시되었습니다. 이 모델들은 70억 개의 매개변수를 가진 Transformer (architecture) 모델인 Mistral-7B 아키텍처를 기반으로 합니다. Zephyr 시리즈는 크기에 비해 다양한 벤치마크에서 강력한 성능을 보여주며, 종종 훨씬 더 큰 모델과 경쟁합니다. 이 프로젝트는 가중치와 훈련 코드를 공개적으로 제공하여 오픈 액세스를 강조하며, Generative AI 연구 및 개발의 광범위한 생태계에 기여합니다.
개발 및 훈련
Zephyr 모델은 다단계 과정을 통해 훈련되었습니다. 처음에는 기본 Mistral-7B 모델이 지시 및 응답 데이터셋에서 감독 미세 조정(SFT)을 사용하여 기본적인 대화 및 지시 행동을 가르치기 위해 미세 조정되었습니다. 그 다음에는 인간 피드백 기반 강화 학습(RLHF)의 변형인 dDPO가 적용되었습니다. dDPO에서 모델은 직접적인 인간 주석보다는 GPT-4와 같은 교사 모델에서 파생된 선호도에 맞춰 최적화됩니다. 선호 데이터는 교사 모델이 프롬프트에 대한 여러 응답을 생성하고 순위를 매겨 구성되었으며, 광범위한 인간 라벨링 없이 정렬을 개선할 수 있는 확장 가능한 방법을 제공합니다.
훈련의 핵심 측면은 60,000개 이상의 프롬프트와 선호 쌍을 포함하는 UltraFeedback이라는 선별된 데이터셋의 사용이었습니다. 훈련 과정은 또한 추론 중 창의성과 일관성의 균형을 맞추기 위해 RLHF 및 Top-P (Nucleus) Sampling과 같은 기법을 통합했습니다. 개발자들은 dDPO 방법이 별도의 보상 모델과 훈련 중 온라인 샘플링의 필요성을 피함으로써 전통적인 RLHF에 비해 계산적으로 효율적이라고 강조했습니다.
모델 변형 및 성능
Zephyr-7B-alpha와 Zephyr-7B-beta는 주요 출시 변형으로, 둘 다 70억 개의 매개변수를 가지고 있습니다. 베타 버전은 훈련 데이터와 하이퍼파라미터의 개선을 통합하여 MT-Bench, AlpacaEval 및 Open LLM Leaderboard와 같은 벤치마크에서 향상된 성능을 보였습니다. MT-Bench에서 Zephyr-7B-beta는 7.34점을 달성하여 유사한 크기의 많은 모델과 Llama-2-70B-chat과 같은 일부 더 큰 모델을 능가했습니다. 이 모델들은 소비자급 하드웨어에서 실행되도록 설계되어 연구자와 취미 사용자에게 접근성을 제공합니다.
Zephyr 시리즈는 또한 커뮤니티에 의한 추가 미세 조정의 기반으로 사용되어 전문 응용 프로그램을 위한 기반으로서의 유용성을 입증했습니다. 그러나 이 모델들은 잠재적 편향과 그럴듯하지만 부정확한 정보를 생성하는 경향을 포함한 LLM의 일반적인 한계를 유지하며, 개발자들은 이를 모델 카드에 문서화했습니다.
기술적 접근
Zephyr의 기술적 기반은 그룹화된 쿼리 어텐션과 슬라이딩 윈도우 어텐션을 사용하여 추론 속도와 메모리 효율성을 개선하는 Mistral-7B 아키텍처에 있습니다. 미세 조정 과정은 워밍업이 있는 학습률 스케줄과 Gradient Clipping을 사용하여 훈련을 안정화했습니다. dDPO 목적은 참조 모델에 대한 정책의 직접 최적화로, 선호 쌍에 대한 이진 교차 엔트로피 손실을 사용합니다. 이 방법은 별도의 보상 모델의 필요성을 제거하여 RLHF 파이프라인을 단순화하는 DPO(직접 선호 최적화) 프레임워크에서 파생되었습니다.
Zephyr의 추론은 일반적으로 개발자가 균형 잡힌 출력을 달성하기 위해 권장하는 대로 약 0.7의 Temperature Scaling과 0.95의 Top-P (Nucleus) Sampling을 사용합니다. 모델은 8,192 토큰의 컨텍스트 길이를 지원하여 중간 길이의 대화를 허용합니다.
영향 및 수용
Zephyr의 출시는 더 큰 대응 모델과 경쟁할 수 있는 더 작고 효율적인 모델의 추세에 기여했습니다. 이는 인간 가치에 모델을 정렬하는 데 있어 선호 최적화 기법의 효과를 강조했으며, 프로젝트의 오픈 소스 특성은 광범위한 채택과 실험을 촉진했습니다. 이 모델은 학술 연구에서 인용되었고 챗봇에서 교육 도구에 이르는 다양한 응용 프로그램에 사용되었습니다. 그 성공은 또한 Machine learning 커뮤니티 내에서 dDPO 및 유사한 정렬 방법에 대한 추가 작업을 촉진했습니다.
한계 및 윤리적 고려 사항
다른 LLM과 마찬가지로 Zephyr는 편향되거나 해로운 콘텐츠를 생성할 수 있으며 사실을 환각할 수 있습니다. 개발자들은 추가적인 안전 장치 없이 고위험 의사 결정에 적합하지 않다고 언급합니다. 공개 소스와 합성 선호도에서 파생된 훈련 데이터는 기존의 사회적 편향을 반영할 수 있습니다. 사용자는 모델을 배포할 때 적절한 안전 조치를 구현하는 것이 권장됩니다. 이 프로젝트는 책임 있는 사용의 필요성을 인정하면서 유능한 모델에 대한 접근을 민주화하려는 Artificial intelligence의 광범위한 노력과 일치합니다.
미래 방향
Zephyr 시리즈는 다른 모델로 계승되었지만, 그 방법론은 여전히 영향력이 있습니다. 효율적인 정렬과 오픈 가중치에 대한 초점은 유사한 프로젝트에 영감을 주었으며, 그 기법은 더 큰 규모의 훈련 파이프라인에 통합되고 있습니다. Hugging Face 팀은 견고성과 안전성에 중점을 두고 선호 최적화 및 모델 평가의 개선을 계속 탐구하고 있습니다.
참고 문헌 및 추가 읽을거리
자세한 기술 정보는 Hugging Face Hub의 Zephyr 모델 카드에서 훈련 세부 사항, 벤치마크 결과 및 사용 예제를 포함한 포괄적인 문서를 제공합니다. "Zephyr: Direct Distillation of LM Alignment"라는 제목의 관련 연구 논문은 dDPO 방법과 그 경험적 결과에 대한 심층 분석을 제공합니다.