Phi 4는 마이크로소프트 리서치(Microsoft Research)가 개발한 대규모 언어 모델 계열이다. 이 시리즈는 최첨단 시스템에 비해 상대적으로 작은 모델 크기를 특징으로 하면서도 추론, 수학, 코딩 작업에서 경쟁력 있는 성능을 목표로 한다. Phi 4의 여러 변형이 공개 LLM 및 미디어 리더보드에 등장했으며, 벤치마크 스냅샷에는 최소 네 가지의 서로 다른 구성이 기록되어 있다.
최초로 공개적으로 문서화된 Phi 4 모델은 2024년 말에 출시되었으며, 이전의 Phi-3 시리즈를 기반으로 한다. 마이크로소프트는 Phi 4를 단순한 규모보다는 데이터 품질과 합성 데이터 생성에 중점을 둔 연구 지향적 모델로 포지셔닝했다. 주력 변형인 Phi-4 (14B)는 MATH 및 GSM8K와 같은 표준 추론 벤치마크에서 강력한 결과를 보여주었으며, 종종 다른 조직의 더 큰 모델을 능가했다.
모델 변형 및 벤치마크
AI 평가 플랫폼이 호스팅하는 공개 리더보드에는 최소 네 가지 Phi 4 변형이 나열되어 있다. 여기에는 기본 14B 모델, 14B 명령어 튜닝 버전, 그리고 일부 정확도를 낮은 계산 요구 사항과 맞바꾼 더 작은 구성(예: 7B 및 3.8B)이 포함된다. 벤치마크 스냅샷에서 14B 명령어 튜닝 모델은 코드 생성(HumanEval) 및 논리 추론(ARC)과 같은 작업에서 70B 이상의 매개변수를 가진 모델과 비교할 수 있는 점수를 달성하며 최고의 컴팩트 모델 중 하나로 꾸준히 순위를 차지한다.
이 모델들은 Transformer 아키텍처와 멀티 헤드 어텐션 및 위치 인코딩을 사용하여 훈련된다. 훈련에는 선별된 웹 데이터, 필터링된 코드 저장소, 그리고 더 큰 교사 모델이 생성한 합성 데이터 세트가 혼합되어 사용되었다. 마이크로소프트는 전체 훈련 세부 사항을 공개하지 않았지만, 이 접근 방식은 작업 복잡성을 점진적으로 증가시키는 커리큘럼 학습 원칙과 일치한다.
기술 사양
Phi 4 모델은 밀집형 비-MoE(혼합 전문가) 설계를 사용하여 표준 하드웨어에서 배포를 단순화한다. 14B 변형은 140억 개의 매개변수, 8,192 토큰의 컨텍스트 창을 가지며 생성 시 top-k 및 top-p 샘플링을 지원한다. 모델은 허용적 라이선스(연구 및 상업용 MIT, 14B 버전에는 일부 제한) 하에 출시된다.
추론은 Azure 클라우드와 로컬 배포 모두에 최적화되어 있다. 모델은 Hugging Face Transformers 및 vLLM과 같은 인기 있는 프레임워크와 호환된다. 마이크로소프트는 Phi 4가 개선된 커널 융합 덕분에 AWS Trainium 인스턴스에서 Phi-3보다 2배 속도 향상을 달성한다고 보고했다.
성능 및 한계
공개 리더보드에서 Phi 4 변형은 수학과 논리에서 강력한 성능을 보여주지만, OpenAI 및 Google DeepMind의 최첨단 모델에 비해 개방형 창의적 글쓰기와 미묘한 지시 따르기에서는 뒤처진다. 모델은 사실적 질문에 대해 가끔 환각을 나타내며, 이는 해당 분야 전반의 일반적인 문제이다. 마이크로소프트는 정렬을 개선하기 위해 RLHF(인간 피드백 기반 강화 학습) 데이터를 게시했지만, 모델은 틈새 주제에 대해 그럴듯하지만 부정확한 답변을 생성하는 경향이 여전히 있다.
3.8B 변형은 스마트폰 및 임베디드 시스템을 포함한 엣지 디바이스에서 실행되는 점에서 주목할 만하며, 메모리 제약에 맞추기 위해 양자화가 필요하다. 이는 Phi 4를 Apple 및 Samsung Electronics의 노력과 유사한 온디바이스 생성형 AI 애플리케이션의 후보로 만든다.
생태계 및 채택
Phi 4는 Microsoft의 Azure AI Foundry에 통합되었으며 API를 통해 사용할 수 있다. Groq 및 SambaNova와 같은 타사 플랫폼은 14B 모델에 대한 가속 추론을 제공한다. 공개 가중치는 의료 및 법률 추론을 포함한 전문 분야의 커뮤니티 파인튜닝을 촉발했지만, 공식적으로 보증되지는 않는다.
Stanford AI Lab 및 Berkeley AI Research의 연구자들은 데이터 효율성에 관한 연구에서 Phi 4를 인용하며, 그 성능이 원시 매개변수 수보다 훈련 데이터 선별의 중요성을 시사한다고 지적했다. 이 모델은 또한 모델 가지치기 실험에 사용되어 최대 30%의 가중치를 제거해도 정확도 손실이 최소화됨을 보여주었다.
향후 방향
마이크로소프트는 Phi 5를 발표하지 않았지만, 회사는 향후 반복에 영향을 줄 수 있는 합성 데이터 생성 및 손실 함수에 대한 연구를 계속 게시하고 있다. 2025년 초 현재 Phi 4는 컴팩트하고 고성능인 모델의 기준점으로 남아 있으며, 그 변형은 효율적인 딥러닝에 관한 학술 논문에서 기준 모델로 자주 사용된다.
이 모델 계열은 소비자 하드웨어에서 실행할 수 있는 더 작고 전문화된 모델로의 광범위한 추세의 일부이며, 규모가 능력으로 가는 유일한 경로라는 가정에 도전한다. 이 접근 방식이 더 확장될 수 있을지는 여전히 열린 질문이지만, Phi 4는 신중하게 선별된 데이터가 더 적은 매개변수를 부분적으로 보완할 수 있음을 입증했다.