Phi-2는 2023년 12월에 출시된 마이크로소프트가 개발한 27억 개의 매개변수를 가진 대규모 언어 모델입니다. 이는 Phi 시리즈의 소형 언어 모델 중 하나로, 추론 작업에서 경쟁력 있는 성능을 달성하면서도 당시의 최첨단 모델보다 훨씬 작은 크기를 유지하도록 설계되었습니다. Phi-2는 고품질의 교과서와 유사한 콘텐츠에 초점을 맞춘 훈련 데이터의 세심한 선별이 대규모 확장 없이도 강력한 추론 능력을 산출할 수 있음을 입증했습니다.
이 모델은 1.4조 개의 토큰으로 훈련되었으며, 이는 크기에 비해 비교적 적은 데이터셋이지만 "교과서 품질" 데이터 - 더 큰 모델이 생성한 합성 데이터셋과 필터링된 웹 콘텐츠를 포함 - 를 강조했습니다. 커리큘럼 학습 원칙에 기반한 이 접근 방식은 Phi-2가 GSM-8K(수학적 추론) 및 BIG-Bench와 같은 벤치마크에서 최대 25배 더 큰 모델을 능가하도록 했습니다. 마이크로소프트는 Phi-2를 연구 도구로 포지셔닝하고, 학술 및 상업적 사용을 위한 허용적 라이선스로 출시했으며, 소형 모델 효율성에 대한 추가 연구를 가능하게 하는 것을 명시된 목표로 삼았습니다.
아키텍처 및 훈련
Phi-2는 대부분의 현대 대규모 언어 모델에서 사용되는 표준 아키텍처를 따르는 디코더 전용 트랜스포머 모델입니다. 32개의 레이어, 2560의 은닉 크기, 32개의 어텐션 헤드를 가지며, 컨텍스트 창은 2048 토큰입니다. 이 모델은 GPT 계열에서 일반적인 멀티-헤드 어텐션 및 위치 인코딩 기법을 사용합니다. 일부 더 큰 모델과 달리 혼합 전문가 또는 기타 희소성 기법을 사용하지 않고, 대신 밀집 계산에 의존합니다.
훈련은 약 14일 동안 96개의 NVIDIA A100 GPU 클러스터에서 수행되었습니다. 데이터셋은 1.4조 개의 토큰으로 구성되었으며, 상당 부분이 GPT-3.5 및 GPT-4와 같은 더 큰 모델에 의해 합성적으로 생성되었고, "RefinedWeb" 코퍼스의 필터링된 웹 페이지가 함께 포함되었습니다. 합성 데이터는 단계별 추론을 가르치도록 설계되었고, 웹 데이터는 일반 지식을 제공했습니다. 마이크로소프트는 Adam 옵티마이저 및 그래디언트 클리핑을 사용한 학습률 스케줄을 사용했고, 안정성을 위해 레이어 정규화를 적용했습니다. 합성 생성 프로세스 외에는 데이터 증강이 사용되지 않았습니다.
성능 및 벤치마크
Phi-2는 표준 추론 벤치마크에서 주목할 만한 결과를 달성했습니다. GSM-8K에서 56.7%의 정확도를 기록하여 70억 매개변수 Llama-2 및 130억 매개변수 Llama-2를 능가했고, GPT-3.5와 같은 훨씬 더 큰 모델의 성능에 근접했습니다. BIG-Bench Hard 스위트에서는 57.4%를 기록하여 다시 한 번 크기가 몇 배 더 큰 모델을 능가했습니다. 코딩 작업에서는 HumanEval에서 48.4%의 pass@1을 달성하여 StarCoder-15B와 같은 모델과 경쟁력 있는 성능을 보였습니다.
이러한 결과는 아키텍처 혁신보다는 훈련 데이터의 품질에 기인한 것으로 평가되었습니다. 마이크로소프트 연구원들은 Phi-2의 추론 작업 성능이 크기에 비해 "놀라울 정도로 강력"하다고 언급하며, 신경망의 용량이 효율적으로 활용되었음을 시사했습니다. 그러나 이 모델은 더 작은 규모와 집중된 훈련 데이터에 부합하는 한계로 사실적 지식 및 장문 생성에서 제한을 보였습니다.
출시 및 접근성
Phi-2는 2023년 12월 12일에 Hugging Face 모델 허브를 통해 MIT 라이선스로 출시되었습니다. 이 허용적 라이선스는 상업적 응용 프로그램을 포함한 무제한 사용을 허용했으며, 이는 당시 유사한 성능의 모델에게는 드문 일이었습니다. 마이크로소프트는 또한 Phi-2를 Azure 클라우드 플랫폼에 통합하여 Azure AI Studio 및 Azure Machine Learning을 통한 배포를 가능하게 했습니다. 이 모델은 CPU 및 GPU 실행을 모두 지원하며 미세 조정 및 추론에 사용할 수 있었습니다.
이 출시는 소비자 하드웨어에서 실행할 수 있는 더 큰 모델에 대한 경량 대안을 제공하여 AI 연구를 민주화하려는 마이크로소프트의 광범위한 전략의 일부였습니다. Phi-2의 작은 크기(FP16에서 약 5.4GB)는 개별 개발자와 연구자에게 접근 가능하게 했으며, GPT-4 또는 Claude와 같은 모델의 리소스 요구 사항과 대조를 이루었습니다.
영향 및 유산
Phi-2는 효율적인 머신 러닝 및 소형 모델 설계에 대한 후속 연구에 영향을 미쳤습니다. 그 성공은 규모가 능력의 주요 동인이라는 기존 가정에 도전하면서 데이터 품질의 중요성을 수량보다 강조했습니다. 이 접근 방식은 Google DeepMind 및 Anthropic을 포함한 다른 조직이 더 작은 모델에 대해 유사한 데이터 선별 전략을 탐구하도록 영감을 주었습니다.
마이크로소프트 내에서 Phi-2는 더 큰 매개변수 수(최대 140억)와 향상된 성능으로 동일한 원칙을 확장한 Phi-3 제품군의 전신 역할을 했습니다. 이 모델은 또한 훈련이 대규모 모델보다 훨씬 적은 계산을 요구하여 지속 가능성 목표와 일치함에 따라 AI의 환경 영향에 대한 논의에 기여했습니다. 2024년 현재 Phi-2는 모델 크기, 데이터 품질 및 추론 능력 간의 균형을 연구하는 연구자들에게 기준점으로 남아 있습니다.
한계
강점에도 불구하고 Phi-2는 알려진 한계가 있었습니다. 지식 차단 시점은 2023년 말이었고, 실시간 정보에 접근할 수 없었습니다. 이 모델은 특히 훈련 분포 외부의 영역에서 그럴듯하지만 부정확한 답변을 생성할 때가 있었습니다. 2048 토큰의 컨텍스트 창은 많은 현대 모델보다 짧아 장문 문서 작업에 사용이 제한되었습니다. 또한 추론에 탁월했지만 창의적 글쓰기와 미묘한 사실 회상에는 어려움을 겪었으며, 이는 훈련 데이터의 좁은 초점을 반영했습니다.
마이크로소프트는 사용자에게 Phi-2를 프로덕션 준비 시스템보다는 연구 산출물로 취급하고 특정 응용 프로그램에 대한 미세 조정을 권장했습니다. 이 모델은 안전을 위해 정렬되지 않았으며, 프롬프트가 주어지면 편향되거나 유해한 콘텐츠를 생성할 수 있었는데, 이는 당시 모델의 일반적인 문제였습니다.