Generative Pre-trained Transformer 3(GPT-3)은 2020년 OpenAI가 회사의 GPT 시리즈의 일부로 출시한 Large language model이다. 이는 Deep learning의 디코더 전용 Transformer (architecture) 모델로, 모델이 관련 입력 텍스트에 선택적으로 집중할 수 있게 하는 주의 메커니즘을 통해 순환 및 합성곱 기반 아키텍처를 대체했다. GPT-3는 1,750억 개의 매개변수를 가지며, 각각 16비트 정밀도로 350GB의 저장 공간이 필요하다. 2,048개의 토큰으로 구성된 컨텍스트 창을 가지며, 많은 작업에서 강력한 제로샷 및 퓨삿 학습 능력을 입증했다.
배경
이코노미스트에 따르면, 개선된 알고리즘, 더 강력한 컴퓨터, 그리고 증가된 디지털화된 자료는 Machine learning의 혁명을 촉진했다. 2010년대의 새로운 기술은 언어 조작 작업의 급속한 개선으로 이어졌다. 소프트웨어 모델은 뇌의 신경 구조를 대략적으로 기반으로 한 구조에서 수천 또는 수백만 개의 예시를 사용하여 훈련된다. 핵심 아키텍처는 2017년에 도입된 transformer로, 이는 Natural language processing 시스템의 중심이 되었다.
2018년 6월 11일, OpenAI 연구원들은 다양한 텍스트 코퍼스에서 사전 훈련된 생성형 대규모 언어 모델의 일종인 최초의 생성형 사전 훈련 transformer(GPT)를 소개하는 논문을 발표했으며, 이후 판별적 미세 조정이 이어졌다. GPT-1은 2019년 2월 GPT-2로 이어졌으며, 매개변수와 데이터 세트 크기를 10배로 확장하여 800만 개의 웹 페이지에서 훈련된 15억 개의 매개변수에 도달했다. 2020년 2월, 마이크로소프트는 170억 개의 매개변수를 가진 Turing Natural Language Generation(T-NLG)을 도입했으며, 이는 당시 가장 큰 공개된 언어 모델이었다.
훈련 및 기능
2020년 5월 28일, 31명의 OpenAI 엔지니어와 연구원들이 작성한 arXiv 사전 인쇄본은 3세대 최첨단 언어 모델인 GPT-3를 설명했다. 팀은 GPT-2에서 용량을 두 자릿수 이상 늘려 GPT-3를 당시 가장 큰 비희소 언어 모델로 만들었다. 그 정확도는 증가된 용량과 매개변수에 기인하며, 마이크로소프트의 Turing NLG보다 10배 더 크다. Lambdalabs는 2020년 단일 GPU에서 훈련하는 데 약 460만 달러와 355년이 소요될 것으로 추정했으며, 병렬 GPU를 사용하면 실제 시간은 더 짧아진다.
가중치 사전 훈련 데이터 세트의 60%는 Apache Spark의 MinHashLSH를 사용한 퍼지 중복 제거를 통해 4,100억 개의 바이트 쌍 인코딩 토큰을 가진 Common Crawl의 필터링된 버전에서 나왔다. 다른 소스로는 WebText2(190억 토큰, 22%), Books1(120억 토큰, 8%), Books2(550억 토큰, 8%), Wikipedia(30억 토큰, 3%)가 포함되었다. GPT-3는 수백억 개의 단어로 훈련되었으며 CSS, JSX 및 Python으로 코딩할 수 있었다.
훈련 데이터가 모든 것을 포괄했기 때문에 GPT-3는 별도의 작업에 대한 추가 훈련이 필요하지 않다. 그러나 훈련 데이터를 모방하는 유해한 언어를 때때로 생성한다. 워싱턴 대학의 연구에 따르면 GPT-3는 GPT-2 및 CTRL과 유사한 유해한 언어를 생성하는 것으로 나타났다. OpenAI는 유해성을 제한하는 전략을 구현하여 GPT-1보다 덜 유해한 출력을 생성했지만 CTRL Wiki보다는 더 많았다.
API 및 접근
2020년 6월 11일, OpenAI는 사용자가 범용 텍스트 입력, 텍스트 출력 인터페이스를 갖춘 기계 학습 도구 세트인 GPT-3 API에 대한 액세스를 요청할 수 있다고 발표했다. 한 초기 사용자는 간단한 프롬프트로 일관된 텍스트를 작성하는 데 소름 끼칠 정도로 능숙하다고 설명했다. 실험에서 80명의 미국 피험자가 짧은 기사를 인간 또는 GPT-3가 작성한 것으로 판단했으며, 정확도는 52%로 무작위보다 약간 나았다.
2020년 9월 22일, 마이크로소프트는 GPT-3를 독점적으로 라이선스했다고 발표했다. 다른 사람들은 여전히 공개 API에서 출력을 받을 수 있었지만, 기본 모델에 대한 액세스 권한은 마이크로소프트만 가졌다. 2021년 11월 18일, OpenAI는 콘텐츠 중재 도구와 함께 무제한 API 액세스를 발표했다. 2022년 1월 27일, OpenAI는 InstructGPT를 기본 모델로 만들었으며, 이는 지침을 더 잘 따르고 허구적 사실을 더 적게 생성했다.
영향 및 우려
GPT-3는 인간 평가자가 인간이 작성한 기사와 구별하기 어려워하는 뉴스 기사를 생성할 수 있으며, 유익한 응용과 유해한 응용 모두에 잠재력이 있다. 2020년 5월 논문은 잘못된 정보, 스팸, 피싱 및 법적 및 정부 프로세스 남용을 포함한 잠재적 피해를 자세히 설명했다. 이 모델의 출시는 Generative AI의 추가 개발을 촉진하고 Anthropic 및 Google DeepMind의 후속 모델에 영향을 미쳤다. 그 아키텍처와 훈련 접근 방식은 이후 대규모 언어 모델의 기초가 되었으며, API 모델은 Microsoft Azure 및 Amazon Web Services의 상업용 AI 서비스에 영향을 미쳤다.
유산
GPT-3는 대규모 언어 모델에 대한 대중의 인식에 전환점을 표시했으며, transformer 모델을 확장하면 새로운 능력이 나타날 수 있음을 입증했다. 1,750억 개의 매개변수 규모는 벤치마크를 설정했지만, 이후 모델은 이를 초과할 것이다. 마이크로소프트에 대한 독점 라이선스는 그러한 모델의 상업적 가치를 강조했다. GPT-3의 퓨삿 학습 능력은 작업별 미세 조정의 필요성을 줄였으며, Reinforcement Learning from AI Feedback (RLAIF) 및 지침 따르기 연구에 영향을 미쳤다. 그 출시는 또한 AI 안전, 편향 및 대규모 모델 훈련의 환경 비용에 대한 논의를 촉발했다.