PaLM 2(Pathways Language Model 2)는 2023년 5월 연례 Google I/O 기조연설에서 발표된 Google AI가 개발한 대규모 언어 모델이다. 이는 원래 PaLM 모델의 업데이트 버전으로, 3,400억 개의 매개변수와 3.6조 개의 토큰으로 훈련된 것으로 보고되었다. PaLM 2는 상식 추론, 산술 추론, 코드 생성, 번역을 포함한 광범위한 작업에서 뛰어난 성능을 발휘하도록 설계되었으며, 특히 다국어 능력 향상에 중점을 두고 있다.
원래 PaLM 모델은 2022년 4월에 도입되었으며, 5,400억 개의 매개변수를 가진 밀집 디코더 전용 트랜스포머 기반 대규모 언어 모델이었다. 연구자들은 또한 모델 규모의 영향을 연구하기 위해 80억 개와 620억 개의 매개변수를 가진 더 작은 버전을 훈련했다. PaLM 2는 이러한 기반 위에 구축되어 향상된 성능과 더 넓은 언어 범위를 제공한다.
아키텍처 및 훈련
PaLM 2는 이전 모델과 유사한 밀집 디코더 전용 트랜스포머 모델이다. 이는 필터링된 웹페이지, 서적, Wikipedia 기사, 뉴스 기사, GitHub의 오픈소스 저장소에서 가져온 소스 코드, 소셜 미디어 대화를 포함하는 7,800억 개의 토큰으로 구성된 고품질 코퍼스로 사전 훈련되었다. 데이터셋은 Google의 LaMDA 모델을 훈련하는 데 사용된 데이터셋을 기반으로 하며, 소셜 미디어 대화가 코퍼스의 50%를 차지하여 대화 능력을 향상시킨다.
원래 PaLM 540B는 각각 768개 호스트에 연결된 3,072개의 TPU v4 칩을 갖춘 두 개의 TPU v4 Pod에서 모델 및 데이터 병렬 처리의 조합을 사용하여 훈련되었다. 총 6,144개의 칩으로 구성된 이 구성은 기록적인 하드웨어 FLOPs 활용률 57.8%를 달성하여 해당 규모에서 대규모 언어 모델의 최고 훈련 효율성을 기록했다.
기능 및 변형
PaLM 2는 상식 추론, 산술 추론, 농담 설명, 코드 생성, 번역을 포함한 광범위한 작업을 수행할 수 있다. 연쇄 사고 프롬프팅과 결합하면 단어 문제나 논리 기반 질문과 같은 다단계 추론이 필요한 데이터셋에서 훨씬 더 나은 성능을 달성한다.
Google과 DeepMind는 의료 데이터로 미세 조정된 PaLM 540B 버전인 Med-PaLM을 개발했으며, 이는 의료 질문 응답 벤치마크에서 이전 모델보다 뛰어난 성능을 보인다. Med-PaLM은 미국 의료 면허 시험 문제에서 합격 점수를 얻은 최초의 모델로, 정확한 답변 외에도 추론과 자기 평가를 제공한다.
Google은 또한 비전 트랜스포머를 사용하여 PaLM을 확장해 로봇 조작을 위한 비전-언어 모델인 PaLM-E를 만들었으며, 이는 재훈련이나 미세 조정 없이 작동한다. 2023년 6월, Google은 PaLM-2 아키텍처와 초기화를 사용하는 음성 간 번역을 위한 AudioPaLM을 발표했다.
출시 및 접근
원래 PaLM은 2023년 3월 Google이 PaLM 및 기타 여러 기술에 대한 API를 출시할 때까지 비공개로 유지되었다. API는 처음에 공개 출시 전에 대기자 명단에 등록한 제한된 수의 개발자에게 제공되었다. PaLM 2는 2023년 5월에 발표되었으며 다양한 Google 제품 및 서비스에 통합될 예정이다.
영향 및 유산
PaLM 2는 특히 다국어 이해와 추론 측면에서 대규모 언어 모델의 중요한 발전을 나타낸다. 이의 개발은 인공지능 및 머신러닝 분야의 지속적인 노력과 일치하며 생성형 AI의 더 넓은 환경에 기여한다. PaLM 2는 LaMDA의 후속 모델이자 Gemini의 전신으로 간주되며, 이는 이 분야에서 Google의 지속적인 혁신을 반영한다.