OpenAI GPT-3 출시

영어에서 번역됨

GPT-3는 2020년 OpenAI가 출시한 대규모 언어 모델로, 175억 개의 매개변수를 가지며 강력한 few-shot 학습 능력을 갖추고 있어 최소한의 프롬프트만으로도 텍스트 생성과 작업 수행이 가능하다.

Generative Pre-trained Transformer 3(GPT-3)는 2020년 OpenAI가 GPT 시리즈의 일부로 출시한 대규모 언어 모델이다. 이는 디코더 전용 트랜스포머 모델로서, 순환 및 합성곱 기반 아키텍처를 대체하고 관련 입력 텍스트에 선택적으로 집중할 수 있는 어텐션 메커니즘을 사용한다. GPT-3는 1,750억 개의 파라미터를 가지며, 각각 16비트 정밀도로 350GB의 저장 공간을 요구하고, 2,048개의 토큰으로 구성된 컨텍스트 창을 갖추어 많은 작업에서 강력한 제로샷 및 퓨샷 학습 능력을 보여준다.

배경

GPT-3의 개발은 개선된 알고리즘, 더 강력한 컴퓨터, 증가된 디지털 데이터에 의해 추진된 기계 학습의 광범위한 혁명의 일부였다. 2017년에 도입된 트랜스포머 아키텍처는 자연어 처리(NLP) 시스템의 핵심 기반이 되었다. OpenAI 연구자들은 2018년 6월 11일에 첫 번째 생성형 사전 훈련 트랜스포머(GPT-1)를 소개하는 논문을 발표했는데, 이는 대규모 텍스트 말뭉치에서 사전 훈련되고 특정 작업에 미세 조정되는 생성형 대규모 언어 모델의 유형이다. 2019년 2월에 출시된 GPT-2는 15억 개의 파라미터로 GPT-1을 확장했으며 800만 개의 웹 페이지에서 훈련되었다. 2020년 2월, 마이크로소프트는 당시 가장 큰 언어 모델이었던 170억 개의 파라미터를 가진 Turing Natural Language Generation(T-NLG)을 소개했다.

훈련 및 능력

2020년 5월 28일, 31명의 OpenAI 엔지니어와 연구자들이 작성한 arXiv 사전 인쇄본이 GPT-3, 즉 3세대 최첨단 언어 모델을 설명했다. GPT-3의 용량은 GPT-2보다 두 자릿수 이상 증가하여 당시 가장 큰 비희소 언어 모델이 되었다. 그 정확도는 증가된 용량과 파라미터 수에 기인하며, 마이크로소프트의 Turing NLG보다 10배 더 크다. Lambdalabs는 단일 GPU에서 약 460만 달러의 가상 훈련 비용과 355년의 시간을 추정했으며, 병렬 GPU를 사용하면 실제 시간은 더 짧아진다.

사전 훈련 데이터 세트는 60% 필터링된 Common Crawl(4,100억 바이트-쌍 인코딩 토큰), 22% WebText2(190억 토큰), 8% Books1(120억 토큰), 8% Books2(550억 토큰), 3% Wikipedia(30억 토큰)로 구성되었다. 퍼지 중복 제거는 Apache Spark의 MinHashLSH를 사용했다. GPT-3는 수천억 개의 단어로 훈련되었으며 CSS, JSX 및 Python으로 코딩할 수 있었다.

훈련 데이터가 포괄적이었기 때문에 GPT-3는 별도의 작업에 대한 추가 훈련이 필요하지 않았다. 그러나 훈련 데이터를 모방하여 때때로 유해한 언어를 생성했다. 워싱턴 대학 연구는 GPT-3의 유해성이 GPT-2 및 CTRL과 유사하다는 것을 발견했다. OpenAI는 유해한 출력을 제한하는 전략을 구현하여 GPT-1보다 덜 유해하지만 CTRL Wiki보다는 더 유해한 결과를 얻었다.

2020년 6월 11일, OpenAI는 모든 영어 작업에 대한 텍스트 입력, 텍스트 출력 인터페이스를 가진 기계 학습 도구 세트인 GPT-3 API에 대한 접근을 발표했다. 초기 사용자들은 일관된 텍스트를 작성하는 데 "섬뜩할 정도로 훌륭하다"고 발견했다. 실험에서 80명의 미국 피험자가 짧은 기사를 인간 또는 GPT-3 작성으로 판단했으며, 정확히 식별한 경우는 52%로 무작위보다 약간 나았다. 2021년 11월 18일, OpenAI는 콘텐츠 중재 도구로 API 접근을 무제한으로 만들었다. 2022년 1월 27일, InstructGPT 모델이 기본값이 되어 더 적은 허위 사실과 덜 유해한 콘텐츠로 더 잘 정렬된 출력을 생성했다.

GPT-3가 인간이 작성한 것과 구별할 수 없는 뉴스 기사를 생성하는 능력은 잘못된 정보, 스팸, 피싱 및 법적 절차 남용을 포함한 유익한 응용과 유해한 응용 모두에 잠재력을 가지고 있으며, 이는 2020년 5월 28일 논문에 자세히 설명되어 있다.

상업적 라이선스

2020년 9월 22일, 마이크로소프트는 GPT-3를 독점적으로 라이선스했다고 발표했다. 다른 사람들은 여전히 공개 API를 사용할 수 있었지만, 마이크로소프트만이 기본 모델에 접근할 수 있었다. 이 독점 라이선스는 투자와 Azure 서비스 통합을 포함한 OpenAI와의 광범위한 파트너십의 일부였다.

영향 및 유산

GPT-3는 트랜스포머 모델의 확장 능력을 보여주며 인공 지능 분야에 상당한 영향을 미쳤다. 그 퓨샷 학습 능력은 작업별 미세 조정의 필요성을 줄였으며, 이후 InstructGPTGPT-4와 같은 모델에 영감을 주었다. 출시는 또한 편향, 잘못된 정보 및 접근 제어를 포함한 대규모 언어 모델의 윤리적 함의에 대한 논의를 촉발했다.

GPT-3의 아키텍처와 훈련 접근 방식은 AnthropicGoogle DeepMind의 모델을 포함한 이후의 대규모 언어 모델에 대한 기준이 되었다. API 및 마이크로소프트 라이선스를 통한 상업적 성공은 AI 연구를 위한 비즈니스 모델을 확립했으며, 더 넓은 생성형 AI 환경에 영향을 미쳤다.

기술적 세부 사항

GPT-3는 멀티 헤드 어텐션 및 위치 인코딩을 가진 트랜스포머 아키텍처를 사용한다. 인코더-디코더 모델과 달리 디코더 전용 설계를 채택하며, 레이어 정규화 및 잔차 네트워크와 같은 기술을 사용한다. 훈련은 Adam과 같은 옵티마이저와 학습률 스케줄을 사용한 경사 하강법을 포함했다. 모델의 파라미터는 16비트 정밀도로 저장되어 메모리 요구 사항을 줄인다.

GPT-3의 2,048 토큰 컨텍스트 창은 처리할 수 있는 입력 길이를 제한하지만, 여러 단락에 걸쳐 일관된 텍스트를 생성할 수 있다. 그 퓨샷 학습은 모델 가중치를 업데이트하지 않고 입력에 예제가 제공되는 프롬프팅을 통해 달성된다. 이 능력은 미세 조정 없이 광범위한 적용 가능성을 가능하게 한 핵심 혁신이었다.

수용 및 우려

GPT-3는 인상적인 텍스트 생성으로 널리 주목을 받았지만, 잠재적 오용에 대한 우려도 제기했다. 연구자들은 가짜 뉴스, 스팸 및 피싱 콘텐츠 생성과 같은 위험을 강조했다. OpenAI의 초기 제한된 접근과 이후 콘텐츠 중재 도구는 이러한 위험을 완화하는 것을 목표로 했다. 개선에도 불구하고 유해한 언어를 생성하는 모델의 경향은 여전히 우려 사항으로 남아 있으며, AI 안전 및 정렬에 대한 지속적인 연구로 이어졌다.

마이크로소프트에 대한 독점 라이선스는 다른 연구자와 회사가 기본 모델에 접근하는 것을 제한했기 때문에 논란의 여지가 있었다. 그러나 공개 API는 더 넓은 실험을 허용하여 언어 모델 응용 프로그램의 빠른 발전에 기여했다.

GPT-3의 출시는 인공 지능의 이정표를 표시하며 대규모 트랜스포머 모델의 잠재력을 보여주고 기계 학습딥 러닝의 미래를 형성했다. 그 영향은 이후 모델과 성장하는 생성형 AI 분야에서 볼 수 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:artificial-intelligence·machine-learning·language-model·openai
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사