GPT-2(Generative Pre-trained Transformer 2)는 OpenAI가 개발한 Large language model로, GPT 시리즈의 두 번째 버전을 대표한다. 이 모델은 800만 개의 웹 페이지로 구성된 데이터셋으로 사전 훈련되었으며, 텍스트 생성, 번역, 요약, 질의응답에서 상당한 발전을 보여주었다. 이 모델은 잠재적인 오용 우려로 인해 처음에는 공개가 보류되었지만, 2019년 11월에 완전히 공개되었다.
GPT-2는 이전 모델인 GPT-1을 직접 확장한 것으로, 매개변수 수와 훈련 데이터셋 크기 모두 10배 증가했다. 이 모델은 Transformer (architecture) 아키텍처를 사용하며, 이는 입력 텍스트의 관련 부분에 선택적으로 집중하는 어텐션 메커니즘을 활용하여 더 큰 병렬화를 가능하게 하고 이전의 RNN/CNN/LSTM 기반 모델보다 뛰어난 성능을 보였다. GPT-2의 범용 학습 능력은 시퀀스의 다음 항목을 정확히 예측함으로써 다양한 작업을 수행할 수 있게 했지만, 더 긴 구절에서는 반복적이거나 무의미한 출력을 생성할 수 있었다. GPT-2는 이후 GPT-3 및 GPT-4와 같은 모델로 대체되었으며, 이러한 모델은 더 이상 오픈 소스가 아니다.
훈련 및 아키텍처
GPT-2의 훈련은 transformer 아키텍처의 대규모 병렬화 능력을 활용하여 이전의 자연어 처리 모델보다 더 큰 말뭉치로 훈련할 수 있게 했다. OpenAI는 처음에는 대규모 웹 크롤링 말뭉치인 CommonCrawl을 고려했지만, 이해할 수 없는 콘텐츠로 인해 이를 거부했다. 대신 2017년 12월 이전에 최소 3 카르마를 가진 Reddit 게시물에서 링크된 페이지를 스크래핑하여 만든 새로운 말뭉치인 WebText를 개발했다. 이 말뭉치는 HTML을 일반 텍스트로 파싱하고 중복을 제거하며 과적합을 피하기 위해 Wikipedia 페이지를 제외하는 방식으로 정리되었다.
GPT-2의 훈련 비용은 Andrej Karpathy의 진술에 기반하여 약 43,000달러로 추정되며, 32개의 TPU v3 칩을 168시간 동안 칩당 시간당 약 8달러로 사용했다. 다른 출처에서는 시간당 약 256달러의 비용을 언급한다. 비교하자면, BERT와 XLNet의 훈련 비용은 각각 6,912달러와 245,000달러였다. GPT-2의 아키텍처는 재귀나 합성곱 대신 어텐션을 구현한 생성적 사전 훈련 transformer를 갖춘 깊은 Neural network이다.
출시 및 초기 제한
GPT-2는 2019년 2월 14일에 발표되었다. 이전 OpenAI 모델과 달리 악의적인 사용의 위험을 이유로 소스 코드가 즉시 공개되지 않았다. 선정된 언론 매체에 제한된 접근이 부여되었으며, OpenAI는 스팸 필터를 우회할 수 있는 제품 리뷰 생성에 미세 조정된 버전을 시연했다. Jeremy Howard와 같은 연구자들은 웹을 설득력 있는 산문으로 채울 가능성에 대해 경고했으며, Allen Institute for Artificial Intelligence는 "신경 가짜 뉴스" 탐지 도구를 발표했다.
위협에 대한 의견은 분분했다. Anima Anandkumar와 같은 일부는 제한을 "악의적인 헛소리"라고 불렀으며, The Gradient는 기술을 인쇄기와 Photoshop에 비유하는 공개 서한을 게재했다. 논란에도 불구하고 OpenAI는 2019년 8월 20일에 7억 7,400만 개의 매개변수를 가진 부분 버전을 공개했고, 2019년 11월 5일에 전체 15억 개의 매개변수 모델을 공개했다.
모델 변형 및 복제
GPT-2 시리즈는 다양한 크기의 네 가지 모델을 포함하며, 단계적으로 출시되었다. 가장 작은 모델은 2019년 2월에 제공되었고, 이후 더 큰 모델이 출시되었다. 전체 15억 개의 매개변수 모델이 최종 출시였다. 이 모델의 방법은 출판물에 설명되어 다른 사람들이 자유 소프트웨어로 복제할 수 있게 했다. 그러한 복제 중 하나인 OpenGPT-2는 2019년 8월에 OpenWebText라는 자유 라이선스 버전의 WebText와 함께 출시되었으며, 컴퓨팅 비용은 약 50,000달러였다.
영향 및 유산
GPT-2의 출시는 Generative AI에서 중요한 이정표를 세웠으며, 대규모 transformer의 잠재력을 보여주었다. 일관된 텍스트를 생성하는 능력은 The Verge와 The Guardian과 같은 매체에서 칭찬을 받았지만, 긴 구절에서는 반복적이 될 수 있다는 점이 지적되었다. 이 모델의 초기 보류는 AI 연구에서의 개방적 접근과 안전에 대한 논쟁을 촉발했으며, 책임 있는 AI 개발에 대한 향후 논의에 영향을 미쳤다. GPT-2는 GPT-3와 GPT-4로 이어졌으며, 이들은 분야를 계속 발전시켰지만 오픈 소스 가용성에서 멀어졌다.