PaLM 2는 2023년 5월 연례 Google I/O 기조연설에서 발표된 Google이 개발한 대규모 언어 모델(LLM)이다. 이는 Google AI가 개발한 5,400억 개의 매개변수를 가진 밀집 디코더 전용 트랜스포머 기반 LLM인 Pathways Language Model(PaLM)의 후속 모델이다. PaLM 2는 3.6조 개의 토큰으로 학습된 3,400억 개의 매개변수 모델로 보고되며, 전임 모델 대비 규모와 성능에서 상당한 발전을 나타낸다.
이 모델은 현대 Deep learning 시스템의 기초를 이루는 트랜스포머 아키텍처를 기반으로 한 Generative AI 및 Large language model 연구에 대한 Google의 광범위한 노력의 일부이다. PaLM 2는 Google DeepMind와 함께 개발되었으며, 이는 Google의 AI 연구 부서 통합을 반영한다.
아키텍처 및 기능
PaLM 2는 전임 모델이 확립한 디코더 전용 트랜스포머 설계를 따르며, Multi-Head Attention 메커니즘과 Positional Encoding을 활용하여 순차 데이터를 처리한다. 이 모델은 상식 추론, 산술 추론, 농담 설명, 코드 생성, 번역을 포함한 광범위한 작업을 수행할 수 있다. 연쇄 사고 프롬프팅과 결합될 때, PaLM 2는 단어 문제 및 논리 기반 질문과 같은 다단계 추론이 필요한 데이터 세트에서 훨씬 더 나은 성능을 달성한다.
원래 PaLM에 사용된 7,800억 개의 토큰에서 상당히 증가한 3.6조 개의 토큰에 대한 모델 학습은 다양한 도메인에서 향상된 성능을 가능하게 한다. 이 학습 말뭉치에는 필터링된 웹 페이지, 서적, 위키백과 문서, 뉴스 기사, 오픈 소스 저장소의 소스 코드, 소셜 미디어 대화가 포함되며, 소셜 미디어 부분은 대화 기능을 지원하기 위해 말뭉치의 50%를 차지한다.
학습 인프라
원래 PaLM 540B는 각 Pod에 3,072개의 TPU v4 칩이 있고 768개의 호스트에 연결된 두 개의 TPU v4 Pod에서 모델 및 데이터 병렬 처리의 조합을 사용하여 학습되었다. 총 6,144개의 칩을 사용하는 이 구성은 하드웨어 FLOPs 활용률 57.8%로 해당 규모의 LLM에 대해 달성된 최고의 학습 효율성 기록을 세웠다. PaLM 2의 학습 인프라는 유사한 원칙을 따르지만, 하드웨어 구성에 대한 구체적인 세부 사항은 완전히 공개되지 않았다.
관련 모델 및 응용 분야
Google은 여러 특수 변형을 만들기 위해 PaLM 아키텍처를 확장했다. 의료 데이터에 미세 조정된 버전인 Med-PaLM은 의료 질문 응답 벤치마크에서 이전 모델보다 우수하며 미국 의료 면허 질문에서 합격 점수를 얻은 최초의 모델이다. 이는 추론을 제공하고 다지선다 및 개방형 질문에 정확하게 답하는 것 외에도 자체 응답을 평가할 수 있다.
비전 트랜스포머를 사용하는 또 다른 확장인 PaLM-E는 재학습이나 미세 조정 없이 로봇 조작을 위한 비전-언어 모델로 사용된다. 2023년 6월, Google은 PaLM-2 아키텍처와 초기화를 사용하는 음성 간 번역을 위한 AudioPaLM을 발표했다.
가용성 및 영향
원래 PaLM은 2022년 4월에 처음 발표되었으며 2023년 3월까지 비공개로 유지되었고, 그때 Google은 대기자 명단을 통해 제한된 수의 개발자에게 처음 제공되는 API를 출시했다. 2023년 5월 Google I/O에서의 PaLM 2 발표는 OpenAI 및 Anthropic과 같은 다른 주요 업체와 함께 빠르게 진화하는 Artificial intelligence 환경에서 경쟁하려는 Google의 의지를 나타냈다. 이 모델의 기능은 Google Cloud 서비스 및 더 넓은 기업 응용 분야에 영향을 미치며, 고급 Machine learning 시스템 개발에서 Google을 중요한 세력으로 자리매김한다.