GPT-3 (2020년)

영어에서 번역됨

GPT-3는 2020년 OpenAI가 출시한 대규모 언어 모델로, 1750억 개의 매개변수를 가지며 강력한 few-shot 학습 및 광범위한 텍스트 생성 능력으로 알려져 있습니다.

Generative Pre-trained Transformer 3(GPT-3)는 2020년에 OpenAI가 회사의 GPT 시리즈의 일부로 출시한 Large language model이다. 이는 Deep learning 신경망 아키텍처의 디코더 전용 Transformer (architecture) 모델로, 순환 및 합성곱 기반 설계를 대체하고 입력 텍스트의 관련 세그먼트에 선택적으로 집중할 수 있게 해주는 어텐션 메커니즘을 사용한다. GPT-3는 1750억 개의 파라미터를 가지며, 각각 16비트 정밀도로 저장되어 350GB의 저장 공간이 필요하고, 컨텍스트 창은 2,048개의 토큰이다. 이 모델은 많은 작업에서 강력한 제로샷 및 퓨샷 학습 능력을 입증했다.

2020년 9월 22일, 마이크로소프트는 GPT-3를 독점적으로 라이선스했다고 발표했다. 다른 사람들은 여전히 공개 API에서 출력을 받을 수 있었지만, 기본 모델에 접근할 수 있는 것은 마이크로소프트뿐이었다.

배경

알고리즘의 개선, 더 강력한 컴퓨터, 그리고 증가된 디지털화된 자료는 2010년대 Machine learning의 혁명을 촉진하여 언어 조작을 포함한 작업의 빠른 개선으로 이어졌다. 소프트웨어 모델은 뇌의 신경 구조를 느슨하게 기반으로 한 구조에서 수천 또는 수백만 개의 예제를 사용하여 훈련된다. 자연어 처리에 사용되는 한 아키텍처는 2017년에 도입된 transformer 아키텍처를 기반으로 한 신경망이다. 이는 텍스트 입력을 처리, 마이닝, 구성, 연결 및 대조할 수 있을 뿐만 아니라 질문에 답변할 수 있는 시스템을 가능하게 했다.

2018년 6월 11일, OpenAI 연구원들은 첫 번째 생성 사전 훈련 transformer(GPT)를 소개하는 논문을 발표했는데, 이는 방대하고 다양한 텍스트 코퍼스에서 사전 훈련된 생성형 대규모 언어 모델의 한 유형으로, 특정 작업을 위한 판별적 미세 조정이 뒤따랐다. 이전에는 가장 성능이 좋은 신경 NLP 모델이 일반적으로 대량의 수동 레이블 데이터에서 지도 학습을 사용했으며, 이는 비용이 많이 들고 시간이 많이 소요되었다. 첫 번째 GPT 모델은 2019년 2월에 GPT-2가 뒤따랐는데, 이는 8백만 개의 웹 페이지에서 훈련된 15억 개의 파라미터를 가진 직접적인 규모 확장이었다. 2020년 2월, 마이크로소프트는 170억 개의 파라미터로 가장 큰 언어 모델이라고 주장되는 Turing Natural Language Generation(T-NLG)을 도입했다.

훈련 및 능력

2020년 5월 28일, OpenAI의 31명의 엔지니어와 연구원들이 작성한 arXiv 사전 인쇄본이 GPT-3를 설명했는데, 이는 3세대 최첨단 언어 모델이다. 팀은 GPT-2에서 용량을 두 자릿수 이상 늘려 GPT-3를 당시 가장 큰 비희소 언어 모델로 만들었다. 더 큰 정확도는 용량과 파라미터 증가에 기인하며, 마이크로소프트의 Turing NLG보다 10배 더 크다. Lambdalabs는 2020년에 단일 GPU에서 GPT-3를 훈련하는 데 약 460만 달러와 355년이 소요될 것으로 추정했으며, 병렬 GPU를 사용하면 실제 훈련 시간은 더 짧았다.

가중치가 적용된 사전 훈련 데이터셋의 60%는 4100억 개의 바이트 쌍 인코딩 토큰으로 구성된 Common Crawl의 필터링된 버전에서 나왔다. 퍼지 중복 제거는 Apache Spark의 MinHashLSH를 사용했다. 다른 소스에는 WebText2의 190억 개 토큰(가중치 총계의 22%), Books1의 120억 개 토큰(8%), Books2의 550억 개 토큰(8%), Wikipedia의 30억 개 토큰(3%)이 포함되었다. GPT-3는 수천억 개의 단어로 훈련되었으며 CSS, JSX 및 Python으로 코딩할 수도 있었다.

훈련 데이터가 포괄적이었기 때문에 GPT-3는 개별 언어 작업에 추가 훈련이 필요하지 않았다. 훈련 데이터에는 가끔 유해한 언어가 포함되어 있었고, GPT-3는 이를 모방하여 때때로 유해한 언어를 생성했다. 워싱턴 대학의 연구에 따르면 GPT-3는 GPT-2 및 CTRL과 비슷한 수준의 유해한 언어를 생성했다. OpenAI는 유해한 출력을 제한하는 전략을 구현하여 GPT-1보다 덜 유해한 언어를 생성했지만, 전적으로 Wikipedia 데이터로 훈련된 모델인 CTRL Wiki보다 더 많은 생성과 더 높은 유해성을 보였다.

공개 접근 및 진화

2020년 6월 11일, OpenAI는 사용자가 기술의 강점과 한계를 탐구하기 위해 GPT-3 API(기계 학습 도구 세트)에 대한 접근을 요청할 수 있다고 발표했다. API는 거의 모든 영어 작업을 완료할 수 있는 범용 텍스트 입력, 텍스트 출력 인터페이스를 가졌다. 한 초기 사용자는 GPT-3가 간단한 프롬프트로 일관된 텍스트를 작성하는 데 섬뜩할 정도로 능숙하다고 설명했다. 초기 실험에서 80명의 미국 피험자가 짧은 기사를 인간이 작성했는지 GPT-3가 생성했는지 판단했으며, 정확히 식별한 경우는 52%에 불과해 무작위 추측보다 약간 나았다.

2021년 11월 18일, OpenAI는 API 접근을 무제한으로 만들기에 충분한 안전장치가 구현되었다고 발표했으며, 개발자에게 콘텐츠 조정 도구를 제공했다. 2022년 1월 27일, OpenAI는 통칭 InstructGPT로 불리는 최신 GPT-3 모델이 API의 기본값이 되었다고 발표했으며, 사용자 의도와 더 잘 정렬된 콘텐츠를 생성하고, 지침을 더 잘 따르며, 지어낸 사실을 더 적게 생성하고, 다소 덜 유해한 콘텐츠를 생성했다.

영향 및 우려

GPT-3는 인간 평가자가 인간이 작성한 기사와 구별하기 어려운 뉴스 기사를 생성할 수 있었기 때문에 언어 모델의 유익한 응용과 유해한 응용 모두를 발전시킬 잠재력이 있었다. 2020년 5월 28일 논문에서 연구원들은 잘못된 정보, 스팸, 피싱, 법적 및 정부 절차의 남용, 사기 활동을 포함한 잠재적 유해 영향에 대해 설명했다. 모델의 광범위한 능력은 Generative AI의 사회적 영향과 책임 있는 배포의 필요성에 대한 논의를 촉발했다.

유산

GPT-3는 Artificial intelligence 개발에서 중요한 이정표를 세웠으며, transformer 모델의 확장이 언어 이해와 생성에서 극적인 개선을 가져올 수 있음을 입증했다. 그 아키텍처와 훈련 접근 방식은 OpenAI 내의 후속 모델과 AnthropicGoogle DeepMind와 같은 다른 조직의 노력을 포함한 후속 모델에 영향을 미쳤다. 마이크로소프트에 대한 독점 라이선스는 대규모 언어 모델의 상업적 가치를 강조하고 클라우드 컴퓨팅 서비스의 경쟁 구도를 형성했으며, Microsoft Azure는 GPT-3를 제공에 통합했다. GPT-3는 또한 대규모 모델의 정렬, 안전 및 평가에 대한 연구를 촉진하여 Neural network 연구의 더 넓은 분야에 기여했다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:large-language-model·openai·generative-ai·machine-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사