Groq, Inc.는 AI 가속기 주문형 집적 회로(ASIC)를 구축하는 미국의 인공지능(AI) 기업이다. 이 아키텍처는 원래 텐서 스트리밍 프로세서(TSP)로 소개되었으나, ChatGPT의 돌파 이후 대규모 언어 모델이 널리 채택되면서 언어 처리 장치(LPU)로 브랜드가 변경되었다. 이 회사는 AI 추론 성능을 가속화하기 위한 관련 컴퓨터 하드웨어와 소프트웨어도 개발한다. Groq의 LPU에서 실행되는 AI 워크로드 유형의 예로는 대규모 언어 모델(LLM), 이미지 분류, 예측 분석이 있다. Groq는 캘리포니아주 마운틴뷰에 본사를 두고 있으며, 캘리포니아주 새너제이, 워싱턴주 리버티레이크, 캐나다 토론토, 영국 런던에 사무소를 두고 있고, 북미와 유럽 전역에 원격 직원을 두고 있다.
2025년 12월, Nvidia와 Groq는 Groq의 AI 추론 기술을 라이선스하고 여러 고위 Groq 임원을 Nvidia로 이전하는 계약을 약 200억 달러 규모로 체결했다고 발표했다. Groq는 독립 기업으로 계속 운영될 것이라고 밝혔다.
역사
Groq는 2016년 전직 Google 엔지니어 그룹에 의해 설립되었으며, AI 가속기 ASIC인 텐서 처리 장치(TPU)의 설계자 중 한 명인 Jonathan Ross와 회사의 초대 CEO를 역임한 기업가이자 전 Google X(X Development로 알려짐) 엔지니어인 Douglas Wightman이 주도했다. 창립 팀은 DeepMind 및 기타 AI 연구 그룹의 경험을 바탕으로 AI 워크로드의 요구 사항에 특별히 맞춘 하드웨어를 구축하는 것을 목표로 했다.
Groq는 Social Capital의 Chamath Palihapitiya로부터 시드 펀딩을 받았으며, 2017년에 1,000만 달러를 투자받았고 곧 추가 자금을 확보했다. 2021년 4월, Groq는 Tiger Global Management와 D1 Capital Partners가 주도한 시리즈 C 라운드에서 3억 달러를 모금했다. 현재 투자자로는 Infinitum, The Spruce House Partnership, Addition, GCM Grosvenor, Xⁿ, Firebolt Ventures, General Global Capital, Tru Arrow Partners가 있으며, Infinitum, TDK Ventures, XTX Ventures의 후속 투자도 포함된다. Groq의 시리즈 C 펀딩 라운드 이후, 이 회사는 10억 달러 이상으로 평가되어 유니콘 스타트업이 되었다.
2022년 3월 1일, Groq는 데이터플로우 시스템 기술로 알려진 Maxeler Technologies를 인수했다. Dr. Oskar Mencer와 팀의 오랜 성과와 전문 분야에서의 연구 출판으로 인해 Maxeler는 브랜드를 유지하기로 결정되었다. 2023년 8월 16일, Groq는 차세대 칩 제조를 위해 텍사스주 테일러에 있는 삼성전자 파운드리를 선택했으며, 삼성의 4나노미터(nm) 공정 노드를 사용한다. 이는 이 새로운 삼성 칩 공장의 첫 주문이었다.
2024년 2월 19일, Groq는 개발자가 Groq API를 사용하고 칩에 대한 액세스를 임대할 수 있도록 개발자 플랫폼인 GroqCloud™를 소프트 런칭했다. 2024년 3월 1일, Groq는 클라우드 플랫폼을 지원하기 위해 비즈니스 중심 AI 솔루션을 제공하는 스타트업인 Definitive Intelligence를 인수했다. Groq는 2024년 8월 BlackRock Private Equity Partners가 주도한 시리즈 D 라운드에서 6억 4천만 달러를 모금하여 회사 가치를 28억 달러로 평가했다.
2025년 2월 10일, Groq는 사우디아라비아 왕국으로부터 15억 달러 규모의 자금 약속을 확보하여 LPU 기반 AI 추론 인프라 제공을 확장한다고 발표했으며, 이는 사우디아라비아 담맘에 있는 새로운 GroqCloud 데이터 센터와 연결된다. 2025년 기준으로 Groq는 미국, 캐나다, 중동, 유럽 전역에 12개의 데이터 센터를 기술과 함께 구축했다.
2025년 12월, Nvidia는 약 200억 달러에 Groq의 자산을 구매하기로 합의했으며, 이는 Nvidia에게 기록적인 규모이다. Groq는 이를 비독점 라이선스 계약으로 설명했다. 이 계약의 일환으로 Groq 창립자 Ross와 Groq 사장 Sunny Madra가 Nvidia에 합류할 예정이다. 2026년 5월, Groq는 AI 추론 클라우드 사업으로의 전환 자금을 마련하기 위해 기존 투자자로부터 6억 5천만 달러를 모금하는 것으로 보고되었으며, 이 라운드는 투자자 Disruptive와 Infinitum이 백스톱한 비례 배분 제공 방식으로 구성되었다.
언어 처리 장치
Groq의 ASIC 초기 이름은 텐서 스트리밍 프로세서(TSP)로 코드명 "Alan"이었으나, 나중에 브랜드 부사장 Mark Heaps와 CEO/창립자 Jonathan Ross에 의해 TSP에서 언어 처리 장치(LPU)로 브랜드가 변경되어 프로세서의 특성을 더 명확하게 했다. LPU는 대규모 언어 모델 및 기타 AI 모델의 추론 단계에 특별히 설계되었으며, 낮은 지연 시간과 높은 처리량에 중점을 둔다.
LPU는 기능적으로 슬라이스된 마이크로아키텍처를 특징으로 하며, 메모리 유닛이 벡터 및 행렬 계산 유닛과 인터리브된다. 이 설계는 AI 계산 그래프에서 데이터플로우 지역성을 활용하여 실행 성능과 효율성을 개선한다. LPU는 두 가지 핵심 관찰을 기반으로 설계되었다: AI 워크로드는 상당한 데이터 병렬성을 나타내며, 이를 목적에 맞게 구축된 하드웨어에 매핑하여 성능 이점을 얻을 수 있다는 점; 그리고 결정론적 프로세서 설계가 생산자-소비자 프로그래밍 모델과 결합되어 하드웨어 구성 요소에 대한 정밀한 제어와 추론을 가능하게 하여 최적화된 성능과 에너지 효율성을 허용한다는 점이다.
기능적으로 슬라이스된 마이크로아키텍처 외에도 LPU는 단일 코어, 결정론적 아키텍처로 특징지을 수 있다. LPU는 전통적인 반응형 하드웨어 구성 요소(분기 예측기, 중재자, 재정렬 버퍼, 캐시)를 사용하지 않고 모든 실행이 컴파일러에 의해 명시적으로 제어되도록 함으로써 결정론적 실행을 달성할 수 있으며, 이는 LPU 프로그램 실행의 결정론을 보장한다. 이 결정론적 접근 방식은 성능에 변동성을 도입할 수 있는 많은 CPU 설계에서 사용되는 추측 실행과 대조된다.
LPU(TSP)의 1세대는 25×29mm 14nm 칩이 900MHz의 공칭 클록 주파수로 작동할 때 실리콘 1제곱mm당 1테라옵스 이상의 계산 밀도를 제공한다. LPU의 2세대(LPU v2)는 삼성의 4nm 공정 노드로 제조될 예정이다. LPU의 아키텍처는 현대 생성형 AI 애플리케이션을 지배하는 트랜스포머 기반 모델에 특히 적합하다.
Groq는 LPU에서 실행되는 오픈소스 대규모 언어 모델을 공개 액세스용으로 호스팅한다. 이러한 데모에 대한 액세스는 Groq 웹사이트와 개발자용 플레이그라운드를 통해 제공된다. LPU의 성능은 Nvidia GPU와 벤치마크 비교되어 Llama 및 Mistral과 같은 모델의 토큰 생성에서 상당한 속도 향상을 보여주었지만, 독립적인 검증은 진행 중이다.
아키텍처 및 설계
LPU의 설계 철학은 범용 프로세서의 오버헤드를 제거하는 데 중점을 둔다. 단일 코어와 대용량 소프트웨어 관리 메모리를 사용함으로써 LPU는 복잡한 캐시 계층 구조와 일관성 프로토콜의 필요성을 피한다. 각 기능 슬라이스에는 자체 메모리와 계산 유닛이 포함되어 있으며, 데이터가 공유 버스를 통과하지 않고 직접 흐를 수 있다. 이는 Xerox PARC 및 MIT CSAIL과 같은 초기 프로젝트에서 탐구된 데이터플로우 아키텍처와 유사하지만, 현대 AI 워크로드에 적용된다.
컴파일러는 LPU 작동에서 중요한 역할을 한다. 모든 명령어와 데이터 이동을 사전에 스케줄링하여 하드웨어가 데이터를 기다리며 정체되지 않도록 보장한다. 이 정적 스케줄링은 AI 추론 그래프가 대화형 애플리케이션과 달리 일반적으로 사전에 알려져 있기 때문에 가능하다. 그 결과 높은 활용도와 예측 가능한 성능을 달성하는 프로세서가 탄생하며, 이는 실시간 AI 서비스에 중요하다.
LPU는 또한 FP32, BF16, INT8을 포함한 다양한 숫자 정밀도를 지원하여 개발자가 정확성과 속도를 절충할 수 있게 한다. 이러한 유연성은 엣지 디바이스부터 클라우드 데이터 센터까지 다양한 하드웨어 제약 조건에 모델을 배포하는 데 중요하다.
소프트웨어 및 생태계
Groq는 컴파일러, 런타임, PyTorch 및 TensorFlow와 같은 인기 프레임워크용 API를 포함하는 소프트웨어 스택을 제공한다. GroqWare 제품군에는 모델 최적화, 프로파일링, 배포 도구가 포함된다. 이 회사는 또한 Hugging Face와 파트너십을 맺어 플랫폼에서 다양한 오픈소스 모델을 제공하여 개발자가 LPU 가속을 쉽게 실험할 수 있게 한다.
2024년에 출시된 GroqCloud는 사용자가 AWS, Azure, Google Cloud와 같은 클라우드 서비스와 유사하게 주문형 LPU 용량을 임대할 수 있게 한다. 이 플랫폼은 대화형 추론과 배치 처리를 모두 지원하며, 사용량 기반 요금제를 제공한다. 2025년 기준으로 GroqCloud는 10만 명 이상의 개발자를 호스팅하고 수십억 건의 요청을 처리했다.
이 회사는 또한 Stanford AI Lab 및 Berkeley AI Research과 같은 학술 기관과 협력하여 AI용 새 아키텍처를 탐구하는 연구 부서를 유지한다. Groq의 기술은 체스 엔진부터 자율 주행 차량에 이르는 다양한 애플리케이션에 사용되었지만, 주요 초점은 여전히 LLM 추론에 있다.
시장 위치 및 경쟁
Groq는 SambaNova 및 Graphcore와 같은 다른 AI 칩 스타트업과 AMD 및 Intel과 같은 기존 업체와 경쟁한다. LPU의 결정론적 설계는 지연 시간에 민감한 애플리케이션에서 이점을 제공하지만, 훈련 작업을 위한 GPU의 유연성은 부족하다. Groq는 AI 애플리케이션의 확산으로 빠르게 성장하는 추론 시장의 전문 기업으로 자리매김했다.
2025년, 회사 가치는 시리즈 D 라운드 이후 28억 달러에 도달했으며, 2025년 12월의 Nvidia 계약은 기술을 더욱 검증했다. 라이선스 계약을 통해 Nvidia는 Groq의 추론 기술을 자사 제품에 통합할 수 있으며, LPU 기반 솔루션의 범위를 확장할 가능성이 있다.
향후 방향
앞으로 Groq는 삼성의 4nm 공정으로 제조된 LPU v2를 출시할 계획이며, 이는 1세대보다 상당한 성능 개선을 제공할 것으로 예상된다. 이 회사는 또한 HBM과 같은 새로운 메모리 기술을 탐구하여 대역폭을 늘리고 지연 시간을 더 줄이는 것을 목표로 한다.
2026년 펀딩 라운드에서 나타난 Groq의 AI 추론 클라우드 사업으로의 전환은 하드웨어 판매에서 서비스 제공으로의 전략적 변화를 시사한다. 이는 컴퓨팅이 클라우드 컴퓨팅의 진화와 유사하게 점점 유틸리티로 제공되는 산업 트렌드와 일치한다.
같이 보기
- 중앙 처리 장치
- 그래픽 처리 장치
- 텐서 처리 장치
- AI 가속기
참고 자료
- Groq, Inc. 공식 웹사이트
- Groq의 보도 자료 및 발표
- AI 하드웨어에 대한 산업 보고서