Phi는 마이크로소프트 리서치가 개발한 일련의 소형 언어 모델(SLM)이다. 이 제품군은 대규모 모델보다 훨씬 적은 매개변수를 사용하면서도 추론 및 언어 이해 작업에서 경쟁력 있는 성능을 달성하도록 설계되었으며, 엣지 디바이스 및 제한된 컴퓨팅 리소스 환경에 배포하기에 적합하다. 이 모델들은 단순한 데이터셋 규모보다 고품질의 선별된 훈련 데이터의 중요성을 강조하며, 이는 많은 현대 대규모 언어 모델 프로젝트와 차별화되는 원칙이다.
첫 번째 Phi 모델인 Phi-1은 2023년 6월에 출시되었다. 이는 주로 더 큰 모델이 생성한 합성 데이터로 훈련된 13억 매개변수 트랜스포머로, 특히 Python 코딩 작업을 대상으로 했다. Phi-1은 상대적으로 작은 모델이 코딩 벤치마크에서 강력한 결과를 달성할 수 있음을 보여주었으며, 대규모가 능력에 필수적이라는 기존의 가정에 도전했다. 그 뒤를 이어 2023년 9월에 Phi-1.5가 출시되었으며, 다시 합성 데이터 접근 방식을 사용하여 상식 추론과 자연어 이해에 초점을 확장했다.
아키텍처 및 훈련
Phi 모델은 다른 Large language model과 유사한 표준 Transformer (architecture) 아키텍처를 기반으로 한다. 그러나 이들의 정의적 특징은 훈련 방법론에 있다. 방대하고 필터링되지 않은 웹 크롤링에 의존하는 대신, Phi의 훈련 코퍼스는 주로 OpenAI의 GPT-4와 같은 더 강력한 모델이 생성한 합성 데이터로 구성된다. 이 합성 데이터는 고품질이고 사실에 근거하며 교육학적으로 구조화되도록 설계되었으며, 종종 교과서 스타일의 설명과 연습 문제와 유사하다.
마이크로소프트 연구원들은 훈련 데이터의 품질과 구조가 양보다 더 중요하다고 주장했다. 논리적 추론과 명확한 설명을 강조하는 데이터를 필터링하고 생성함으로써 모델이 더 효율적으로 학습할 수 있었다. 훈련 과정에는 또한 저품질 또는 반복적인 콘텐츠를 제거하기 위해 기존 웹 데이터를 신중하게 필터링하는 작업이 포함되었다. 이 접근 방식은 모델이 크기가 몇 배 더 큰 모델을 종종 능가하는 추론 벤치마크 성능을 달성할 수 있게 했다.
모델 출시 및 변형
Phi 제품군은 여러 차례의 반복을 거쳤다. Phi-1과 Phi-1.5 이후, 마이크로소프트는 2023년 12월에 27억 매개변수 모델인 Phi-2를 출시했으며, 추론, 수학, 코딩 능력에서 추가적인 개선을 보여주었다. Phi-2는 허용적인 연구 라이선스로 제공되었다.
2024년 4월, 마이크로소프트는 Phi-3 제품군을 도입했으며, 여기에는 Phi-3-mini(38억 매개변수), Phi-3-small(70억), Phi-3-medium(140억) 모델이 포함되었다. 이들은 양자화 기술을 통해 스마트폰 및 기타 엣지 하드웨어에서 실행할 수 있도록 온디바이스 추론에 최적화된 점이 주목할 만했다. Phi-3 모델은 또한 Microsoft Azure AI 모델 카탈로그에 통합되어 클라우드 서비스를 통해 엔터프라이즈 고객이 접근할 수 있게 되었다.
2024년 후반, 마이크로소프트는 Phi-3.5와 Phi-4를 출시했다. 2024년 12월에 출시된 Phi-4는 고급 추론에 초점을 맞추었으며 합성 데이터와 고품질 웹 데이터의 혼합으로 훈련되었다. 이는 더 작은 매개변수 수로 가능한 것의 경계를 계속 넓히는 추세를 이어갔다.
성능 및 벤치마크
Phi 모델은 상식 추론(예: HellaSwag, WinoGrande), 언어 이해(예: MMLU), 수학(예: GSM8K)을 포함한 다양한 벤치마크에서 유사한 크기의 다른 모델을 지속적으로 능가했다. 예를 들어, 27억 매개변수의 Phi-2는 여러 추론 작업에서 70억 매개변수의 Llama-2 모델의 성능을 능가하는 것으로 보고되었다. Phi-3-mini는 작은 크기에도 불구하고 특히 코드 생성 및 추론에서 특정 벤치마크에서 GPT-3.5와 같은 모델과 비교할 수 있는 결과를 달성했다.
이러한 결과는 Generative AI 분야에 중요한 의미를 가진다. 이는 데이터 품질에 대한 집중이 규모 부족을 부분적으로 보완할 수 있으며, AI 시스템 훈련 및 배포와 관련된 컴퓨팅 비용과 에너지 소비를 잠재적으로 줄일 수 있음을 시사한다. 이는 특히 로컬 처리가 선호되는 모바일 디바이스 및 개인정보 보호에 민감한 환경에서의 Artificial intelligence 애플리케이션과 관련이 있다.
영향 및 반응
Phi 시리즈는 데이터 중심 AI에 대한 혁신적인 접근 방식으로 Machine learning 커뮤니티에서 좋은 반응을 얻었다. 이는 단순히 모델을 확장하는 것의 한계와 훈련 데이터셋을 선별하는 중요성에 대한 논의를 촉발했다. 이 모델들은 코드 완성, 텍스트 요약, 간단한 대화형 에이전트와 같은 온디바이스 지능이 필요한 작업에서 학술 연구 및 산업 애플리케이션에 널리 사용되었다.
마이크로소프트는 Phi를 OpenAI와의 파트너십을 통해 개발된 더 큰 모델의 보완재로 포지셔닝했다. 대규모 모델은 복잡한 클라우드 기반 작업에 사용되는 반면, Phi 모델은 지연 시간, 비용 또는 개인정보 보호가 가장 중요한 시나리오에 대한 경량 대안을 제공한다. Phi 모델이 허용적인 라이선스로 출시된 것은 또한 미세 조정된 변형 및 커뮤니티 기여의 활기찬 생태계를 조성했다.
향후 방향
2025년 초 현재, Phi 제품군은 계속 진화하고 있다. 마이크로소프트 리서치는 데이터 선별, 모델 아키텍처 및 효율성의 추가 개선을 탐구하고 있다. Phi의 성공은 다른 조직들이 유사한 데이터 중심 접근 방식을 조사하도록 영향을 주었으며, Phi 뒤에 있는 원칙이 차세대 Deep learning 모델에서 역할을 할 가능성이 높다. 지속적인 과제는 모델 크기를 더 줄이면서 높은 성능을 유지하여 사물인터넷 및 기타 리소스 제약 환경 전반에 걸쳐 더 넓은 배포를 가능하게 하는 것이다.