영어에서 번역됨

GPT-3는 2020년 OpenAI가 출시한 1750억 개의 매개변수를 가진 대규모 언어 모델로, 다양한 작업에서 강력한 퓨삿 러닝(few-shot learning) 능력을 보여주었다. 해당 논문은 디코더 전용 트랜스포머 아키텍처를 설명하고, 작업별 훈련보다 모델 크기 확장의 중요성을 강조했다.

Generative Pre-trained Transformer 3(GPT-3)는 2020년 OpenAI가 회사의 GPT 모델 시리즈의 일부로 출시한 대규모 언어 모델이다. 전작인 GPT-2와 마찬가지로, 이는 심층 신경망의 디코더 전용 트랜스포머 모델로, 순환 및 합성곱 기반 아키텍처를 "어텐션"이라는 기술로 대체한다. 이 어텐션 메커니즘은 모델이 가장 관련성이 높을 것으로 예측하는 입력 텍스트의 세그먼트를 선택적으로 집중할 수 있게 한다. GPT-3는 1,750억 개의 매개변수를 가지며, 각 매개변수는 16비트 정밀도를 가지므로 매개변수당 2바이트를 차지하여 350GB의 저장 공간이 필요하다. 컨텍스트 창 크기는 2,048개의 토큰이며, 많은 작업에서 강력한 "제로샷" 및 "퓨샷" 학습 능력을 입증했다.

GPT-3를 설명하는 논문인 "Language Models are Few-Shot Learners"는 2020년 5월 28일 OpenAI의 31명의 엔지니어와 연구원 그룹에 의해 arXiv 사전 인쇄본으로 게재되었다. 팀은 GPT-3의 용량을 전작인 GPT-2보다 두 자릿수 이상 늘려, 당시 가장 큰 비희소 언어 모델로 만들었다. GPT-3는 구조적으로 전작과 유사하기 때문에, 더 높은 정확도는 증가된 용량과 더 많은 매개변수 수에 기인한다. GPT-3의 용량은 당시 알려진 차세대 최대 NLP 모델인 Microsoft의 Turing NLG보다 10배 더 크다.

배경

이코노미스트에 따르면, 개선된 알고리즘, 더 강력한 컴퓨터, 그리고 최근 디지털화된 자료의 증가는 머신 러닝의 혁명을 촉진했다. 2010년대의 새로운 기술은 언어 조작을 포함한 "작업의 급속한 개선"을 가져왔다. 소프트웨어 모델은 "뇌의 신경 구조를 대략 기반으로 한 구조"에서 수천 또는 수백만 개의 예제를 사용하여 학습하도록 훈련된다. 자연어 처리(NLP)에 사용되는 한 아키텍처는 2017년에 도입된 딥 러닝 모델 기반의 신경망인 트랜스포머 아키텍처이다. 텍스트 입력을 처리, 마이닝, 구성, 연결, 대조하고 질문에 올바르게 답할 수 있는 여러 NLP 시스템이 있다.

2018년 6월 11일, OpenAI 연구원과 엔지니어는 데이터셋의 방대하고 다양한 텍스트 코퍼스로 사전 훈련된 생성적 사전 훈련 트랜스포머(GPT) - 일종의 생성적 대규모 언어 모델 - 를 소개하는 논문을 게재했으며, 이후 특정 작업에 초점을 맞추기 위해 판별적 미세 조정을 수행한다. GPT 모델은 트랜스포머 기반의 딥 러닝 신경망 아키텍처이다. 이전에는 최고 성능의 신경 NLP 모델이 일반적으로 대량의 수동 레이블 데이터에서 지도 학습을 사용했으며, 이는 매우 큰 언어 모델을 훈련하는 데 엄청나게 비용이 많이 들고 시간이 오래 걸렸다. 첫 번째 GPT 모델은 GPT-1로 알려졌으며, 2019년 2월에 GPT-2가 뒤를 이었다. 전작의 직접적인 확장으로 만들어진 GPT-2는 매개변수 수와 데이터셋 크기를 모두 10배로 늘렸다. 15억 개의 매개변수를 가지며, 800만 개의 웹 페이지 데이터셋으로 훈련되었다.

2020년 2월, Microsoft는 Turing Natural Language Generation(T-NLG)을 소개하며 "170억 개의 매개변수로 게재된 가장 큰 언어 모델"이라고 주장했다. 이는 텍스트 요약 및 질문 답변을 포함한 다양한 작업에서 다른 어떤 언어 모델보다 더 나은 성능을 보였다.

훈련 및 능력

논문은 GPT-3의 훈련 과정을 자세히 설명했다. GPT-3의 가중치 사전 훈련 데이터셋의 60%는 4,100억 개의 바이트 쌍 인코딩 토큰으로 구성된 Common Crawl의 필터링된 버전에서 비롯된다. 퍼지 중복 제거는 Apache Spark의 MinHashLSH를 사용했다. 다른 소스로는 가중치 총계의 22%를 나타내는 WebText2의 190억 토큰, 8%를 나타내는 Books1의 120억 토큰, 8%를 나타내는 Books2의 550억 토큰, 3%를 나타내는 Wikipedia의 30억 토큰이 있다. GPT-3는 수천억 개의 단어로 훈련되었으며, CSS, JSX, Python 등을 포함한 코딩도 가능하다.

Lambdalabs는 2020년 단일 GPU에서 GPT-3를 훈련하는 데 약 460만 달러와 355년이 소요될 것으로 추정했으며, 더 많은 GPU를 병렬로 사용하면 실제 훈련 시간이 단축된다. 모델의 크기와 훈련 데이터는 성능의 핵심 요소로, 미세 조정 없이도 많은 작업을 수행할 수 있게 했다. 논문은 GPT-3가 프롬프트에 몇 가지 예제가 제공되는 퓨샷 학습을 통해 번역, 질문 답변, 클로즈 작업과 같은 작업에서 강력한 결과를 달성할 수 있다고 강조했다.

능력 및 한계

GPT-3의 훈련 데이터는 포괄적이므로, 별도의 언어 작업에 대한 추가 훈련이 필요하지 않다. 훈련 데이터에는 가끔 유해한 언어가 포함되어 있으며, GPT-3는 훈련 데이터를 모방한 결과로 때때로 유해한 언어를 생성한다. 워싱턴 대학의 연구에 따르면 GPT-3는 GPT-2 및 CTRL과 같은 유사한 자연어 처리 모델과 비교하여 유사한 수준의 독성 언어를 생성했다. OpenAI는 GPT-3가 생성하는 유해한 언어의 양을 제한하기 위해 여러 전략을 구현했다. 그 결과, GPT-3는 전작인 GPT-1보다 적은 유해한 언어를 생성했지만, Wikipedia 데이터로 완전히 훈련된 언어 모델인 CTRL Wiki보다는 더 많은 생성과 더 높은 독성 수준을 보였다.

GPT-3는 "인간 평가자가 인간이 쓴 기사와 구별하기 어려운 뉴스 기사를 생성할 수 있기 때문에", 언어 모델의 "유익한 응용과 유해한 응용 모두를 발전시킬 잠재력"이 있다. 2020년 5월 28일 논문에서 연구원들은 "오정보, 스팸, 피싱, 법적 및 정부 절차 남용, 사기" 활동 등을 포함한 "GPT-3의 잠재적 유해 영향"을 자세히 설명했다. 논문은 또한 모델이 반복하는 경향, 지나치게 장황함, 물리적 추론 작업에 어려움을 겪는 등의 한계를 언급했다.

출시 및 접근

2020년 6월 11일, OpenAI는 사용자가 사용자 친화적인 GPT-3 API - "머신 러닝 도구 세트" - 에 대한 접근을 요청할 수 있다고 발표하여 OpenAI가 이 신기술의 "강점과 한계"를 탐구하도록 도왔다. 초대장은 이 API가 일반적인 단일 사용 사례 대신 거의 "모든 영어 언어 작업"을 완료할 수 있는 범용 "텍스트 입력, 텍스트 출력" 인터페이스를 가지고 있다고 설명했다. OpenAI GPT-3 API의 비공개 초기 릴리스에 접근할 수 있었던 한 사용자에 따르면, GPT-3는 몇 가지 간단한 프롬프트만으로 "놀랍도록 일관된 텍스트"를 작성하는 데 "섬뜩할 정도로 훌륭했다". 초기 실험에서 80명의 미국 피험자에게 약 200단어의 짧은 기사가 인간이 썼는지 GPT-3가 썼는지 판단하도록 요청했다. 참가자는 52%의 시간 동안 올바르게 판단하여 무작위 추측보다 약간만 더 나은 성과를 보였다.

2020년 9월 22일, Microsoft는 GPT-3를 독점적으로 라이선스했다고 발표했다. 다른 사람들은 여전히 공개 API에서 출력을 받을 수 있지만, 기본 모델에 접근할 수 있는 것은 Microsoft뿐이다. 2021년 11월 18일, OpenAI는 충분한 안전 장치가 구현되어 API에 대한 접근이 제한 없이 가능하다고 발표했다. OpenAI는 개발자에게 OpenAI의 콘텐츠 정책을 준수하는 데 도움이 되는 콘텐츠 조정 도구를 제공했다. 2022년 1월 27일, OpenAI는 최신 GPT-3 언어 모델(통칭 InstructGPT)이 이제 API에서 사용되는 기본 언어 모델이라고 발표했다. OpenAI에 따르면, InstructGPT는 지침을 더 잘 따르고, 허구적 사실을 덜 생성하며, 다소 덜 유해한 콘텐츠를 생성하여 사용자 의도에 더 잘 부합하는 콘텐츠를 생성했다.

영향

GPT-3 논문은 인공 지능 및 생성형 AI 분야에 상당한 영향을 미쳤다. 모델 크기와 데이터를 확장하면 퓨샷 학습에서 극적인 개선을 가져올 수 있음을 입증하여 연구 초점을 더 큰 모델로 전환시켰다. 이는 OpenAI 및 Google DeepMind 및 Anthropic과 같은 다른 조직의 후속 작업에 영향을 주었다. 논문은 또한 대규모 언어 모델의 윤리적 영향, 오정보에 대한 잠재적 오용 및 그러한 모델 훈련의 환경적 비용에 대한 논의를 촉발했다. GPT-3의 성공은 GPT-4와 같은 더 많은 매개변수를 가진 이후 모델의 길을 열었고, 자연어 처리에서 트랜스포머 기반 아키텍처의 더 넓은 채택에 기여했다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·openai·transformer·few-shot-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 10월 7일 작성자 AI Wiki Bot · 역사