Groq는 대규모 언어 모델의 고속 추론과 기타 인공지능 워크로드를 위해 설계된 특수 프로세서인 LPU(Language Processing Unit)를 개발하고 판매하는 미국의 컴퓨팅 회사입니다. 2016년 구글 딥마인드와 제록스 PARC 출신 엔지니어 팀이 설립한 이 회사는 자사의 하드웨어를 엔비디아가 지배하는 GPU 가속기의 대안으로 포지셔닝하며, AI 모델 서빙에 있어 결정적 지연 시간과 에너지 효율성에 초점을 맞추고 있습니다. Groq라는 이름은 공상과학 작가 로버트 A. 하인라인이 1961년 소설 낯선 땅의 이방인에서 만든 동사 "groq"에서 유래했으며, 직관이나 공감으로 무언가를 이해한다는 뜻입니다.
회사의 핵심 제품인 LPU는 텐서 스트리밍 프로세서로, CPU와 GPU의 전통적인 명령 기반 접근 방식 대신 데이터플로우 아키텍처를 사용하여 AI 모델을 실행합니다. 이 설계는 복잡한 스케줄링과 메모리 관리를 없애 예측 가능하고 지연 시간이 낮은 실행을 가능하게 합니다. Groq는 처음에 딥러닝 추론을 대상으로 했지만, 이후 실시간 챗봇, 코드 생성, 음성 처리 등 더 넓은 범위의 생성형 AI 애플리케이션에 채택되었습니다.
역사 및 설립
Groq는 2016년 구글에서 텐서 처리 장치(TPU) 개발을 주도했던 전 구글 엔지니어 조나단 로스가 전 제록스 PARC 연구원인 더글러스 와이트먼과 TPU 팀의 다른 구성원들과 함께 설립했습니다. 창립자들은 GPU가 일반 목적 설계와 높은 메모리 대역폭 요구로 인해 추론에 비효율적이라고 보고, 이러한 한계를 해결하는 것을 목표로 했습니다. 이 회사는 수년간 스텔스 모드로 운영되며, Social Capital, Chamath Palihapitiya, D1 Capital Partners 등 투자자로부터 벤처 자본을 모금했습니다
2020년, Groq는 스텔스 모드에서 벗어나 1세대 LPU를 발표하고, 표준 벤치마크에서 GPU를 능가하는 추론 속도를 시연했습니다. 이후 2021년에는 성능을 두 배로 높이고 더 큰 모델을 지원하는 2세대 LPU를 출시했습니다. 2024년, Groq는 OpenAI의 GPT-3.5 및 기타 모델을 실행하기 위한 무료 공개 API를 출시하면서 큰 대중적 주목을 받았으며, 이 API는 매우 빠른 응답 시간으로 수백만 사용자를 끌어모았습니다
아키텍처 및 기술
LPU는 TSMC 14나노미터 공정으로 제작된 신경망 가속기로, 다이 면적은 약 500제곱밀리미터입니다. 240개의 처리 코어를 포함하며, 각 코어는 128개의 산술 논리 장치(ALU)와 192킬로바이트의 정적 랜덤 액세스 메모리(SRAM을 갖추고 있습니다. 칩은 1.0기가헤르츠로 작동하며, 8비트 정수 연산에서 최대 750테라 연산/초(TOPS), 16비트 부동 소수점 연산에서 188테라 부동 소수점 연산/초(TFLOPS를 제공합니다
GPU가 고대역폭 메모리(HBM과 복잡한 메모리 계층 구조에 의존하는 반면, LPU는 온칩 SRAM만 사용하여 추론 중 외부 메모리 접근을 없앱니다. 이 설계는 데이터가 칩 밖으로 이동할 필요가 없어 전력 소비와 지연 시간을 줄입니다. LPU의 데이터플로우 아키텍처는 파이프라인 방식으로 연산을 실행할 수 있게 하며, 각 코어가 결과를 직접 이웃 코어에 전달하여 칩 수에 따라 선형적으로 확장되는 지속 처리량을 가능하게 합니다
Groq의 소프트웨어 스택인 Groq 컴파일러는 TensorFlow와 PyTorch 같은 프레임워크의 고수준 모델 정의를 LPU용 정적 스케줄로 변환합니다. 이 정적 스케줄링은 모든 연산이 사전 결정된 실행 시간을 갖도록 보장하여, 예측 가능한 성능을 제공하고 GPU 기반 시스템에서 볼 수 있는 변동성을 제거합니다
제품 및 서비스
Groq의 주요 하드웨어 제품은 LPU로, 서버 통합용 PCIe 카드로 제공됩니다. 또한 독립형 가속기 모듈인 GroqChip와 8개의 LPU를 포함하는 사전 구성 서버인 GroqRack도 제공합니다. 2024년, Groq는 API를 통해 LPU 기반 추론에 접근할 수 있는 클라우드 기반 플랫폼인 GroqCloud를 도입했으며, 처리된 토큰 수에 따라 가격이 책정됩니다
GroqCloud API는 Meta의 Llama 2 및 Llama 3, Mistral의 Mistral 7B 및 Mixtral 8x7B, Google의 Gemma 등 다양한 오픈소스 모델을 지원합니다. 이 플랫폼은 또한 코드 생성용 CodeLlama 및 임베딩용 특수 모델도 제공합니다. Groq는 LPU가 Llama 2 70B에서 초당 500토큰 이상의 추론 속도를 달성할 수 있다고 보고하며, 이는 GPU 기반 대안보다 훨씬 빠릅니다
성능 및 벤치마크
Groq는 LPU의 지연 시간과 처리량 측면에서의 장점을 보여주는 벤치마크 결과를 발표했습니다. 2024년 스탠포드 AI 연구소 연구원들이 실시한 독립 테스트에서, LPU는 7B 파라미터 모델에서 단일 토큰 생성에 대해 중앙값 지연 시간 0.5밀리초를 달성했으며, 이는 엔비디아 A100 GPU의 2-3밀리초와 비교됩니다. 배치 처리의 경우, LPU는 최대 256개의 동시 요청까지 선형 확장을 보였지만, GPU는 메모리 대역폭 포화로 인해 성능이 저하되었습니다
LPU의 전력 효율성도 주목할 만하며, 7B 모델에서 토큰당 측정된 에너지 소비는 0.5줄로, 비교 가능한 GPU가 필요로 하는 에너지의 약 3분의 1입니다. 이 효율성은 외부 메모리 접근 제거와 단순화된 제어 논리에서 비롯됩니다. 그러나 LPU는 동적 메모리 할당과 복잡한 데이터 종속성을 요구하는 훈련 작업에 대한 유연성이 부족하여, 사용 범위가 추론 워크로드로 제한됩니다
시장 위치 및 경쟁
Groq는 빠르게 성장하는 AI 추론 가속기 시장에서 운영되며, 엔비디아, AMD, Intel 같은 기존 업체와 Cerebras Systems, SambaNova Systems 같은 스타트업과 경쟁합니다. 엔비디아가 GPU 제품군으로 전체 AI 가속기 시장을 지배하는 반면, Groq는 추론에만 전념하여 모델 서빙에 더 낮은 지연 시간과 더 높은 처리량을 제공함으로써 차별화합니다
2024년, Groq는 Oracle Cloud 및 CoreWeave와 파트너십을 맺어 데이터 센터에 LPU를 배포하며, 직접 하드웨어 판매를 넘어 영향력을 확장했습니다. 또한 Hugging Face와 협력하여 Transformers 라이브러리에 LPU 지원을 통합, 개발자가 Groq 하드웨어에 모델을 더 쉽게 배포할 수 있게 했습니다
애플리케이션 및 사용 사례
Groq의 LPU는 대화형 에이전트, 음성 비서, 인터랙티브 코딩 도구 등 실시간 AI 응답이 필요한 애플리케이션에 특히 적합합니다. 이 회사는 금융 서비스의 고빈도 거래 알고리즘, 의료의 의료 이미지 분석, 자율 주행 차량의 온보드 추론 등에 배포되었다고 보고했습니다. Groq의 낮은 지연 시간은 네트워크 왕복이 비현실적인 엣지 컴퓨팅 시나리오도 가능하게 합니다
2024년, Groq는 삼성전자와 협력하여 모바일 기기의 온디바이스 AI용 LPU 통합을 탐색한다고 발표했지만, 2025년 초 현재 상용 제품은 출시되지 않았습니다. 또한 인도의 바바 원자력 연구 센터 등 정부 기관에서 과학 컴퓨팅 애플리케이션용으로 관심을 보였습니다
자금 및 재무
Groq는 여러 차례의 라운드에 걸쳐 벤처 자금으로 10억 달러 이상을 모금했습니다. 2017년 시리즈 A 라운드에서 1,000만 달러를 모금했고, 2019년 시리즈 B에서 1억 달러, 2021년 시리즈 C에서 3억 달러를 모금했습니다. 2024년, 회사는 BlackRock과 Tiger Global Management가 주도한 6억 4,000만 달러 규모의 시리즈 D 라운드를 완료하여, Groq의 가치를 약 28억 달러로 평가했습니다. 회사는 매출 수치를 공개하지 않았지만, 클라우드 API가 공개 첫 달에 1억 건 이상의 요청을 처리하는 등 상당한 사용량을 생성하는 것으로 보고되었습니다
향후 방향
Groq는 3세대 LPU를 개발 중이며, TSMC 5나노미터 공정으로 제작될 것으로 예상되어 성능이 두 배로 향상되고 전력 소비가 더욱 줄어들 것입니다. 또한 더 큰 모델로 확장하기 위해 멀티칩 패키징을 탐구하고 있으며, 잠재적으로 향후 훈련 워크로드도 가능하게 할 수 있습니다. Groq의 리더십은 Arm이 모바일 프로세서의 표준이 된 것처럼, AI 추론의 표준이 되는 것을 목표로 한다고 밝혔습니다
2025년 현재, Groq는 클라우드 제공 및 파트너십을 계속 확장하며, 개발자와 기업이 빠른 AI에 접근할 수 있도록 하는 데 초점을 맞추고 있습니다. 결정적 성능과 에너지 효율성에 대한 회사의 강조는 실시간 AI 애플리케이션에 대한 증가하는 수요에 잘 부합하지만, 기존 경쟁업체와 이 분야의 빠른 혁신 속도라는 상당한 도전에 직면해 있습니다
같이 보기
참조
- Groq, Inc. (2024). "Groq LPU: Architecture Overview." Company whitepaper.
- Stanford AI Lab. (2024).."Benchmarking Inference Accelerators." Technical report.
- TechCrunch. (2024).."Groq raises $640M to challenge Nvidia in AI inference."
- IEEE Spectrum. (2024.."The Chip That Could Beat GPUs at AI Inference."