Generative Pre-trained Transformer 3(GPT-3)는 2020년 OpenAI가 회사의 GPT 모델 시리즈의 일부로 출시한 대규모 언어 모델이다. 이는 Transformer (architecture) 모델의 디코더 전용 심층 신경망으로, 주의 메커니즘을 사용하여 관련 입력 세그먼트에 선택적으로 집중한다. 1750억 개의 매개변수를 각각 16비트 정밀도로 저장하는 GPT-3는 350GB의 저장 공간을 필요로 하며 2,048개의 토큰 컨텍스트 창을 지원한다. 이는 많은 작업에서 강력한 제로샷 및 퓨샷 학습을 입증했으며, 2020년 6월 11일 API를 통한 출시가 발표되었다.
배경
이코노미스트에 따르면, 개선된 알고리즘, 더 강력한 컴퓨터, 그리고 증가하는 디지털화된 말뭉치가 Machine learning의 혁명을 촉진했다. 2010년대의 새로운 기술은 뇌를 대략적으로 기반으로 한 신경 아키텍처에 의존하여 언어 조작의 빠른 개선을 이끌었다. 2017년에 도입된 Transformer (architecture) 아키텍처는 Natural language processing 시스템의 기초가 되었다. 2018년 6월, OpenAI는 대규모 텍스트 말뭉치로 훈련된 후 특정 작업에 맞게 미세 조정된 첫 번째 생성 사전 훈련 트랜스포머(GPT-1)를 발표했다. GPT-2는 2019년 2월에 이어졌으며, 매개변수와 데이터 세트 크기를 10배로 확장하여 800만 개의 웹 페이지에서 훈련된 15억 개의 매개변수에 도달했다. 2020년 2월, 마이크로소프트는 당시 가장 큰 모델로 간주된 170억 매개변수 모델인 Turing NLG를 도입했다.
훈련 및 능력
2020년 5월 28일, 31명의 OpenAI 엔지니어와 연구원이 작성한 arXiv 사전 인쇄본은 GPT-3의 개발을 설명했으며, GPT-2에서 모델 용량을 두 자릿수 이상 증가시켜 해당 기간의 가장 큰 비희소 언어 모델이 되었다. 그 정확성은 마이크로소프트의 Turing NLG보다 10배 더 큰 증가된 용량과 매개변수에서 비롯되었다. Lambdalabs는 2020년 단일 GPU에서 훈련 비용을 460만 달러와 355년으로 추정했다. 사전 훈련 데이터에는 필터링된 Common Crawl(가중 데이터의 60%)에서 추출한 4,100억 개의 바이트 쌍 인코딩 토큰과 WebText2, Books1, Books2, Wikipedia(3%)가 포함되었다. GPT-3는 Python, JSX, CSS로도 코딩할 수 있었다.
GPT-3는 작업별 미세 조정이 부족했지만 광범위한 지시를 처리했다. 그러나 훈련 데이터에는 모델이 때때로 재현할 수 있는 유해한 언어가 포함되어 있었다. 워싱턴 대학 연구는 GPT-3의 유해성이 GPT-2 및 CTRL과 유사하다는 것을 발견했다. OpenAI는 완화 전략을 구현하여 GPT-1에 비해 유해한 출력을 줄였다.
API 접근 및 평가
2020년 6월 11일, OpenAI는 단일 사용 사례가 아닌 모든 영어 언어 작업을 가능하게 하는 텍스트 입력-텍스트 출력 인터페이스를 갖춘 범용 API를 출시했다. 초기 테스터들은 GPT-3가 일관된 텍스트 생성에 놀라울 정도로 능숙하다고 설명했다. 80명의 미국 참가자를 대상으로 한 실험에서 GPT-3 기사와 인간 작성 기사를 구별하는 정확도는 52%에 불과했으며, 이는 무작위 추측보다 약간 우위에 있었다. 2021년 11월 18일, OpenAI는 콘텐츠 조정 도구를 통해 API에 대한 접근을 확대했다. 2022년 1월 27일, InstructGPT가 기본 API 모델이 되어 지시 따르기를 개선하고 조작된 사실을 줄였다.
라이선스 및 영향
2020년 9월 22일, 마이크로소프트는 GPT-3의 기본 모델에 대한 독점 라이선스를 발표했다. 다른 사람들은 공개 API를 사용할 수 있었지만 마이크로소프트만 코드와 가중치에 접근할 수 있었다. GPT-3는 인간 작성과 구별하기 어려운 뉴스 기사를 생성할 수 있는 잠재력을 입증했으며, 이는 잘못된 정보와 사기에 대한 우려를 촉발했다. 연구원들은 스팸 및 법적 남용을 포함한 잠재적인 유해 영향에 대해 설명했다.