Groq Chip은 AI 가속기로, Groq 사가 대규모 언어 모델 및 기타 딥러닝 워크로드의 추론을 극도로 낮은 지연 시간으로 수행하기 위해 개발한 특수 칩입니다. AI에 사용되는 기존 GPU와 달리 Groq Chip은 텐서 스트리밍 프로세서(LPU) 아키텍처를 기반으로 하며, 이는 복잡한 스케줄링을 제거하고 오버헤드를 줄이는 결정적이고 데이터 흐름 지향적인 설계입니다. 이 칩은 트랜스포머 기반 모델에 높은 처리량을 제공하도록 설계되어 대화형 AI 및 코드 생성과 같은 실시간 애플리케이션에 특히 적합합니다.
Groq Chip의 1세대 제품인 GroqChip 1은 2020년 1월에 발표되었습니다. 이 칩은 TSMC의 14나노미터 공정으로 제조되었으며, 220MB의 온칩 SRAM을 갖춘 단일 다이로 구성되었습니다. 이 칩은 추론 작업에 일반적인 8비트 정수 정밀도에서 최대 750테라 연산/초(TOPS)의 성능을 달성합니다. 이후 2024년에 Groq는 6나노미터 공정으로 제작된 GroqChip 2를 출시하여 성능과 효율성을 개선했습니다. GroqChip 2는 더 큰 모델과 더 높은 배치 크기를 지원하도록 설계되어 추론 지연 시간을 더욱 줄였습니다.
LPU 아키텍처는 기존 GPU의 아키텍처와 근본적으로 다릅니다. 복잡한 제어 로직을 가진 많은 수의 코어에 의존하는 대신, Groq Chip은 명령이 순서대로 발행되고 데이터가 예측 가능한 방식으로 칩을 통해 흐르는 단순하고 결정적인 데이터 흐름 모델을 사용합니다. 이 설계는 동적 스케줄링의 필요성을 제거하고 분기 예측 및 비순차 실행과 관련된 오버헤드를 줄입니다. 결과적으로 Groq Chip은 실시간 응답이 필요한 애플리케이션에 중요한 일관된 저지연 성능을 달성합니다.
역사 및 개발
Groq는 2016년에 Google 엔지니어 출신 팀이 설립했으며, 여기에는 Google에서 텐서 처리 장치(TPU) 프로젝트에 참여했던 Jonathan Ross도 포함되었습니다. 이 회사는 기존 하드웨어의 한계를 해결하기 위해 AI 추론 전용의 새로운 유형의 프로세서를 만드는 것을 목표로 했습니다. 첫 번째 GroqChip은 2019년에 테이프아웃되었고 2020년 초에 공개적으로 사용 가능해졌습니다. 이후 Groq는 설계를 반복하여 2024년에 GroqChip 2를 출시했으며, 현재 클라우드 서비스에 배포되고 있습니다.
Groq의 접근 방식은 주요 기술 기업들의 관심을 끌었습니다. 2021년에 이 회사는 Intel Capital과 Samsung Catalyst Fund가 주도하는 시리즈 C 자금 조달 라운드에서 3억 달러를 모금했습니다. 이 자금은 2세대 칩 개발과 클라우드 플랫폼 확장을 지원했습니다.
아키텍처 및 설계
Groq Chip의 LPU 아키텍처는 칩 전체에 복제된 단일 코어 설계를 기반으로 합니다. 각 코어에는 벡터 및 행렬 곱셈 유닛을 포함한 기능 유닛 세트와 대량의 SRAM이 포함되어 있습니다. 이 칩은 소프트웨어 정의 접근 방식을 사용하며, 컴파일러가 전체 모델을 하드웨어에 매핑하고 모든 연산을 정적으로 스케줄링합니다. 이는 하드웨어 기반 스케줄링의 필요성을 제거하고 데이터 이동에 대한 정밀한 제어를 가능하게 합니다.
Groq Chip의 주요 특징 중 하나는 스트리밍 데이터 흐름 모델의 사용입니다. 데이터는 시스톨릭 배열 방식으로 칩을 통해 스트리밍되며, 각 처리 요소는 데이터가 통과할 때 특정 연산을 수행합니다. 이 설계는 온칩 SRAM이 중간 결과를 저장하는 데 사용되므로 외부 메모리에서 데이터를 가져올 필요성을 최소화합니다. 이 칩은 또한 멀티 헤드 어텐션 및 기타 신경망 연산을 하드웨어에서 직접 지원하여 지연 시간을 더욱 줄입니다.
성능 및 벤치마크
독립적인 벤치마크에서 Groq Chip은 추론 작업에 대해 탁월한 성능을 입증했습니다. 예를 들어, GPT-3급 모델에서 GroqChip 1은 칩당 초당 300토큰 이상의 속도로 토큰을 생성할 수 있으며, 이는 많은 GPU 기반 시스템보다 훨씬 빠릅니다. GroqChip 2는 유사한 모델에 대해 초당 500토큰 이상을 달성하여 이를 개선합니다. 이 성능은 배칭이나 다른 최적화 없이 달성되므로 저지연 애플리케이션에 이상적입니다.
Groq는 또한 자사 칩이 LLaMA-2 70B 모델을 단일 토큰에 대해 100밀리초 미만의 지연 시간으로 실행할 수 있다는 결과를 발표했으며, 이는 다른 가속기와 경쟁력이 있거나 더 우수합니다. 이 회사는 LPU의 결정적 실행이 프로덕션 환경에서 중요한 일관된 성능을 보장한다고 강조합니다.
소프트웨어 및 생태계
Groq Chip을 지원하기 위해 회사는 컴파일러, 런타임 및 SDK를 포함한 포괄적인 소프트웨어 스택을 개발했습니다. Groq Compiler라고 불리는 컴파일러는 TensorFlow 및 PyTorch와 같은 인기 프레임워크의 모델을 가져와 LPU용 최적화된 명령으로 변환합니다. 런타임은 빔 검색 및 기타 디코딩 전략을 지원하여 프로덕션 환경에서 모델을 배포하기 위한 API를 제공합니다.
Groq는 또한 개발자가 하드웨어에 원격으로 액세스할 수 있는 클라우드 서비스인 GroqCloud를 제공합니다. 이 서비스는 AI21 Labs 및 Inflection AI와 같은 회사가 AI 애플리케이션을 구동하는 데 사용했습니다. 소프트웨어 스택은 사용하기 쉽도록 설계되었으며 AI 모델 배포의 복잡성을 줄이는 데 중점을 둡니다.
애플리케이션 및 사용 사례
Groq Chip은 주로 생성형 AI 애플리케이션(예: 챗봇, 코드 생성, 콘텐츠 제작)의 추론에 사용됩니다. 낮은 지연 시간은 사용자가 즉각적인 응답을 기대하는 실시간 상호 작용에 적합합니다. 예를 들어, OpenAI의 ChatGPT 및 유사한 서비스는 칩의 속도로 이점을 얻을 수 있지만, Groq는 주요 AI 연구소와의 특정 파트너십을 공개하지 않았습니다.
언어 모델 외에도 Groq Chip은 컴퓨터 비전 및 음성 인식을 포함한 다른 AI 워크로드에도 사용됩니다. 결정적 성능은 자율 주행 차량 및 의료 진단과 같은 안전이 중요한 애플리케이션에서 일관된 타이밍이 필수적이므로 유리합니다.
다른 가속기와의 비교
Groq Chip은 AWS Trainium, Google의 TPU, AMD의 Instinct 시리즈와 같은 다른 AI 가속기와 경쟁합니다. GPU는 더 유연하고 널리 채택되었지만, Groq Chip은 추론 작업에서 우수한 지연 시간을 제공합니다. 그러나 특정 유형의 모델에 최적화되어 있고 훈련에는 효율적이지 않을 수 있으므로 유연성 측면에서 한계가 있습니다. 이 회사는 추론에 집중했으며 훈련은 다른 하드웨어에 맡겼습니다.
SambaNova의 재구성 가능한 데이터 흐름 아키텍처와 비교하여 Groq Chip은 더 경직되어 있지만 표준 트랜스포머 모델에 대해 더 높은 성능을 제공합니다. 이러한 가속기 간의 선택은 지연 시간, 처리량 및 비용과 같은 애플리케이션의 특정 요구 사항에 따라 달라지는 경우가 많습니다.
향후 방향
Groq는 AI 하드웨어 분야에서 계속 혁신하고 있습니다. 이 회사는 NVIDIA의 DGX 시스템의 기능과 잠재적으로 경쟁할 수 있는 더 큰 모델을 지원하도록 확장할 수 있는 멀티 칩 시스템을 개발할 계획을 발표했습니다. 또한 Groq는 수율을 개선하고 비용을 줄이기 위해 칩렛 설계를 탐구하고 있습니다. AI 추론에 대한 수요가 증가함에 따라 Groq Chip은 미래의 AI 인프라에서 중요한 역할을 할 수 있는 좋은 위치에 있습니다.
결론
Groq Chip은 대규모 언어 모델에 대해 전례 없는 속도와 효율성을 제공하는 AI 추론 하드웨어의 중요한 발전을 나타냅니다. 독특한 LPU 아키텍처와 강력한 소프트웨어 스택을 결합하여 실시간 AI 기능이 필요한 조직에 매력적인 선택입니다. 기존 업체와의 경쟁에 직면해 있지만, 저지연 추론에 대한 초점은 빠르게 진화하는 AI 하드웨어 환경에서 차별화됩니다.