GPT-3.5는 OpenAI가 개발한 대규모 언어 모델로, 2022년에 GPT-3의 개선된 후속 모델로 출시되었다. 이는 디코더 전용 트랜스포머 아키텍처로, 이전 모델과 동일한 딥러닝 원리를 기반으로 하면서도 지시 따르기, 사실 정확성, 대화 일관성에서 개선을 이루었다. GPT-3.5는 2022년 11월에 출시된 ChatGPT의 첫 공개 버전의 엔진으로 사용되었으며, 그 시대에 가장 널리 사용된 생성형 AI 시스템 중 하나가 되었다.
이 모델은 2018년 GPT-1으로 시작하여 2019년 GPT-2, 2020년 GPT-3로 이어진 OpenAI의 GPT 시리즈의 일부였다. GPT-3.5는 GPT-3와 이후의 GPT-4 사이의 중간 단계를 대표하며, OpenAI의 InstructGPT 연구에서 얻은 기법을 통합하여 사용자 의도에 더 잘 부합하는 출력을 생성하도록 했다. 자주 신중한 프롬프트 엔지니어링이 필요했던 GPT-3와 달리, GPT-3.5는 직접적인 지시에 더 자연스럽게 반응하도록 설계되어 챗봇과 같은 대화형 응용 프로그램에 적합했다.
개발 및 출시
OpenAI는 2022년 초에 일련의 모델 버전을 통해 GPT-3.5를 소개했으며, 첫 공개 API는 2022년 3월에 제공되었다. "GPT-3.5"라는 이름은 각각 다른 작업에 최적화된 code-davinci-002와 text-davinci-003을 포함한 모델 제품군을 지칭하는 데 사용되었다. 가장 주목할 만한 출시는 2022년 11월 30일에 대화용으로 미세 조정된 GPT-3.5 모델을 사용한 ChatGPT 인터페이스였다. 이 출시는 인공지능에 대한 대중의 인식에 전환점을 마련했으며, ChatGPT는 두 달 만에 1억 명 이상의 사용자를 달성했다.
GPT-3.5의 개발은 1750억 개의 매개변수를 가지고 16비트 정밀도에서 350GB의 저장 공간을 필요로 했던 GPT-3과 동일한 훈련 인프라를 활용했다. GPT-3.5의 정확한 매개변수 수는 공개되지 않았지만, 규모는 유사하며 개선은 원시 크기보다는 훈련 데이터 선별, 미세 조정, 정렬에 초점을 맞춘 것으로 널리 이해되었다. OpenAI는 모델의 행동을 개선하기 위해 지도 미세 조정과 인간 피드백 기반 강화 학습을 결합했으며, 이 기법은 2022년 초에 발표된 InstructGPT 논문에서 처음 자세히 설명되었다.
기능 및 성능
GPT-3.5는 텍스트 생성, 요약, 번역, 질문 응답, 코드 작성에서 강력한 기능을 보여주었다. 일부 버전에서는 최대 4,096 토큰의 컨텍스트 창을 처리할 수 있었는데, 이는 GPT-3의 2,048 토큰의 두 배로 더 긴 입력을 처리할 수 있게 했다. 이 모델은 프롬프트에 몇 가지 예시만으로 새로운 작업을 수행할 수 있는 퓨샷 학습에서 뛰어났으며, GPT-3에 비해 제로샷 지시 따르기에서도 현저한 개선을 보였다.
벤치마크에서 GPT-3.5는 SuperGLUE 제품군 및 다양한 코딩 과제를 포함한 여러 자연어 이해 및 생성 작업에서 GPT-3을 능가했다. 또한 일관된 다중 턴 대화를 생성할 수 있는 능력은 챗봇 응용 프로그램에 특히 적합하게 만들었다. 그러나 여전히 가끔 발생하는 사실 오류, 프롬프트 표현에 대한 민감성, 그럴듯하지만 부정확한 정보를 생성하는 경향과 같은 한계를 보였으며, OpenAI는 이를 인정하고 이후 버전에서 완화하기 위해 노력했다.
응용 및 영향
GPT-3.5 기반 ChatGPT의 출시는 기술 산업과 머신러닝에 대한 공개 담론에 깊은 영향을 미쳤다. 이는 생성형 AI 스타트업에 대한 투자 물결을 촉발했으며 구글 딥마인드, 앤트로픽과 같은 주요 기업들이 자체 대규모 언어 모델 노력을 가속화하도록 만들었다. GPT-3.5는 마이크로소프트의 Azure OpenAI 서비스를 포함한 다양한 제품에 통합되었으며, 이 서비스는 클라우드 인프라를 통해 기업 고객에게 모델을 제공했다.
챗봇 외에도 GPT-3.5는 콘텐츠 생성, 코드 지원, 교육 도구, 고객 지원 자동화에 사용되었다. 인간과 유사한 텍스트를 생성하는 능력은 기회와 우려를 동시에 제기했으며, 잘못된 정보, 일자리 대체, AI의 윤리적 사용에 대한 논의로 이어졌다. OpenAI는 이러한 위험 중 일부를 해결하기 위해 콘텐츠 조정 도구와 사용 정책을 구현했지만, 모델의 광범위한 가용성은 AI 개발의 규제와 투명성에 대한 요구도 촉발했다.
기술 아키텍처
GPT-3.5는 GPT-3의 핵심 아키텍처를 유지했으며, 이는 다층 디코더 스택을 가진 트랜스포머 기반 신경망이다. 멀티 헤드 어텐션 메커니즘을 사용하여 입력의 서로 다른 단어의 관련성을 가중치화함으로써 텍스트의 장거리 의존성을 포착할 수 있다. 이 모델은 필터링된 Common Crawl 데이터, 책, 위키백과를 포함한 다양한 인터넷 텍스트 코퍼스에서 다음 토큰 예측 목표를 사용하여 사전 훈련되었다. 지시 따르기를 위한 미세 조정은 인간이 작성한 시연과 비교에 대한 추가 훈련을 포함했으며, 이 과정은 모델의 출력을 사용자 기대에 맞추었다.
GPT-3.5의 주목할 만한 기술적 개선 중 하나는 더 정제된 훈련 데이터 필터링과 중복 제거를 사용한 것으로, 저품질 또는 반복적인 텍스트의 존재를 줄였다. 이는 GPT-3에 비해 더 일관되고 편향이 적은 출력에 기여했다. 모델은 또한 학습률 스케줄 및 기울기 클리핑 기법의 발전에서 이점을 얻었지만, 구체적인 훈련 세부 사항은 OpenAI에 의해 완전히 공개되지 않았다.
유산 및 후속 모델
GPT-3.5는 연구 중심의 GPT-3과 OpenAI가 2023년 3월에 출시한 더 고급 GPT-4 사이의 다리 역할을 했다. GPT-4가 추론과 정확성에서 상당한 개선을 제공했지만, GPT-3.5는 낮은 계산 비용과 빠른 응답 시간 덕분에 많은 응용 프로그램에서 계속 사용되었다. OpenAI는 GPT-3.5 모델을 계속 업데이트했으며, gpt-3.5-turbo와 같은 버전은 성능과 효율성 사이의 균형을 원하는 개발자에게 인기 있는 선택이 되었다.
GPT-3.5의 성공은 또한 모델 정렬, 안전, 해석 가능성에 대한 연구를 장려하며 더 넓은 AI 생태계에 영향을 미쳤다. 이는 대규모 언어 모델이 작업별 훈련 없이도 다양한 작업을 수행할 수 있는 잠재력을 강조했으며, 이 개념은 이전 모델에서 탐구되었지만 대규모로 실용화되었다. 2024년 현재 GPT-3.5는 여전히 OpenAI의 API를 통해 제공되었지만, 많은 사용 사례에서 점차 새로운 모델로 대체되고 있었다.