Groq, Inc. é uma empresa americana de inteligência artificial (IA) que fabrica um circuito integrado de aplicação específica (ASIC) acelerador de IA. A arquitetura foi originalmente introduzida como um Tensor Streaming Processor (TSP), mas foi posteriormente renomeada como Language Processing Unit (LPU) após a adoção generalizada de grandes modelos de linguagem após o avanço do ChatGPT. A empresa também desenvolve hardware e software de computador relacionados para acelerar o desempenho da inferência de IA. Exemplos dos tipos de cargas de trabalho de IA executadas na LPU da Groq são: grandes modelos de linguagem (LLMs), classificação de imagens e análise preditiva. A Groq está sediada em Mountain View, Califórnia, e possui escritórios em San Jose, Califórnia, Liberty Lake, Washington, Toronto, Canadá, Londres, Reino Unido, e funcionários remotos em toda a América do Norte e Europa.
Em dezembro de 2025, a Nvidia e a Groq anunciaram um acordo avaliado em aproximadamente US$ 20 bilhões para licenciar a tecnologia de inferência de IA da Groq e transferir vários executivos seniores da Groq para a Nvidia. A Groq declarou que continuaria a operar como uma empresa independente.
História
A Groq foi fundada em 2016 por um grupo de ex-engenheiros do Google, liderado por Jonathan Ross, um dos designers da Tensor Processing Unit (TPU), um ASIC acelerador de IA, e Douglas Wightman, empresário e ex-engenheiro do Google X (conhecido como X Development), que atuou como o primeiro CEO da empresa. A equipe fundadora se baseou na experiência de DeepMind e outros grupos de pesquisa de IA, com o objetivo de construir hardware especificamente para as demandas de cargas de trabalho de IA.
A Groq recebeu financiamento inicial da Social Capital, de Chamath Palihapitiya, com um investimento de US$ 10 milhões em 2017 e, logo depois, garantiu financiamento adicional. Em abril de 2021, a Groq levantou US$ 300 milhões em uma rodada da Série C liderada pela Tiger Global Management e pela D1 Capital Partners. Os investidores atuais incluem: Infinitum, The Spruce House Partnership, Addition, GCM Grosvenor, Xⁿ, Firebolt Ventures, General Global Capital e Tru Arrow Partners, bem como investimentos de acompanhamento da Infinitum, TDK Ventures e XTX Ventures. Após a rodada de financiamento da Série C da Groq, a empresa foi avaliada em mais de US$ 1 bilhão, tornando a startup um unicórnio.
Em 1º de março de 2022, a Groq adquiriu a Maxeler Technologies, uma empresa conhecida por suas tecnologias de sistemas de fluxo de dados. Foi decidido que a Maxeler manteria sua marca devido às realizações de longa data do Dr. Oskar Mencer e sua equipe, que publicam pesquisas em seu campo de especialização. Em 16 de agosto de 2023, a Groq selecionou a fundição da Samsung Electronics em Taylor, Texas, para fabricar seus chips de próxima geração, no nó de processo de 4 nanômetros (nm) da Samsung. Este foi o primeiro pedido nesta nova fábrica de chips da Samsung.
Em 19 de fevereiro de 2024, a Groq lançou suavemente uma plataforma para desenvolvedores, GroqCloud™, para atrair desenvolvedores a usar a API da Groq e alugar acesso a seus chips. Em 1º de março de 2024, a Groq adquiriu a Definitive Intelligence, uma startup conhecida por oferecer uma gama de soluções de IA voltadas para negócios, para ajudar em sua plataforma em nuvem. A Groq levantou US$ 640 milhões em uma rodada da Série D liderada pela BlackRock Private Equity Partners em agosto de 2024, avaliando a empresa em US$ 2,8 bilhões.
Em 10 de fevereiro de 2025, a Groq anunciou que havia garantido um compromisso de US$ 1,5 bilhão do Reino da Arábia Saudita para expandir a entrega de sua infraestrutura de inferência de IA baseada em LPU, vinculado a um novo data center GroqCloud em Dammam, Arábia Saudita. Em 2025, a Groq estabeleceu uma dúzia de data centers nos EUA, Canadá, Oriente Médio e Europa, com sua tecnologia.
Em dezembro de 2025, a Nvidia concordou em comprar ativos da Groq por aproximadamente US$ 20 bilhões, um recorde para a Nvidia. A Groq descreveu isso como um acordo de licenciamento não exclusivo. Como parte do acordo, o fundador da Groq, Ross, e o presidente da Groq, Sunny Madra, se juntariam à Nvidia. Em maio de 2026, foi relatado que a Groq estava levantando US$ 650 milhões de investidores existentes para financiar sua transição para um negócio de nuvem de inferência de IA, com a rodada estruturada como uma oferta pro-rata garantida pelos investidores Disruptive e Infinitum.
Language Processing Unit
O nome inicial da Groq para seu ASIC era Tensor Streaming Processor (TSP), com o codinome "Alan", mas foi posteriormente renomeado por Mark Heaps - VP de Marca, e Jonathan Ross - CEO/Fundador, de TSP para Language Processing Unit (LPU) para tornar a natureza do processador mais óbvia. A LPU é projetada especificamente para a fase de inferência de grandes modelos de linguagem e outros modelos de IA, com foco em baixa latência e alta taxa de transferência.
A LPU apresenta uma microarquitetura funcionalmente fatiada, onde unidades de memória são intercaladas com unidades de computação vetorial e matricial. Este design facilita a exploração da localidade do fluxo de dados em gráficos de computação de IA, melhorando o desempenho e a eficiência da execução. A LPU foi projetada com base em duas observações principais: as cargas de trabalho de IA exibem paralelismo de dados substancial, que pode ser mapeado em hardware de propósito específico, levando a ganhos de desempenho; e um design de processador determinístico, juntamente com um modelo de programação produtor-consumidor, permite controle e raciocínio precisos sobre os componentes de hardware, permitindo desempenho otimizado e eficiência energética.
Além de sua microarquitetura funcionalmente fatiada, a LPU também pode ser caracterizada por sua arquitetura determinística de núcleo único. A LPU pode alcançar execução determinística evitando o uso de componentes de hardware reativos tradicionais (preditores de desvio, árbitros, buffers de reordenação, caches) e tendo toda a execução explicitamente controlada pelo compilador, garantindo assim o determinismo na execução de um programa LPU. Essa abordagem determinística contrasta com a execução especulativa usada em muitos designs de CPU, que pode introduzir variabilidade no desempenho.
A primeira geração da LPU (TSP) produz uma densidade computacional de mais de 1 TeraOp/s por mm quadrado de silício para seu chip de 14nm de 25×29 mm operando a uma frequência de clock nominal de 900 MHz. A segunda geração da LPU (LPU v2) será fabricada no nó de processo de 4nm da Samsung. A arquitetura da LPU é particularmente adequada para modelos baseados em transformers, que dominam as aplicações modernas de IA generativa.
A Groq hospeda grandes modelos de linguagem de código aberto executados em suas LPUs para acesso público. O acesso a essas demonstrações está disponível através do site da Groq e de seu playground para desenvolvedores. O desempenho da LPU foi avaliado em relação às GPUs da Nvidia, mostrando acelerações significativas na geração de tokens para modelos como Llama e Mistral, embora a verificação independente esteja em andamento.
Arquitetura e Design
A filosofia de design da LPU centra-se na eliminação da sobrecarga dos processadores de propósito geral. Ao usar um único núcleo com uma grande memória gerenciada por software, a LPU evita a necessidade de hierarquias de cache complexas e protocolos de coerência. Cada fatia funcional inclui sua própria memória e unidades de computação, permitindo que os dados fluam diretamente entre elas sem passar por um barramento compartilhado. Isso é semelhante em espírito às arquiteturas de fluxo de dados exploradas por projetos anteriores como Xerox PARC e MIT CSAIL, mas aplicado a cargas de trabalho modernas de IA.
O compilador desempenha um papel crucial na operação da LPU. Ele agenda todas as instruções e movimentos de dados antecipadamente, garantindo que o hardware nunca pare esperando por dados. Essa programação estática é possível porque os gráficos de inferência de IA são tipicamente conhecidos antecipadamente, ao contrário de aplicações interativas. O resultado é um processador que alcança alta utilização e desempenho previsível, o que é crítico para serviços de IA em tempo real.
A LPU também suporta uma gama de precisões numéricas, incluindo FP32, BF16 e INT8, permitindo que os desenvolvedores troquem precisão por velocidade. Essa flexibilidade é importante para implantar modelos em diferentes restrições de hardware, desde dispositivos de borda até data centers em nuvem.
Software e Ecossistema
A Groq fornece uma pilha de software que inclui um compilador, runtime e APIs para frameworks populares como PyTorch e TensorFlow. O conjunto GroqWare inclui ferramentas para otimização de modelos, perfilamento e implantação. A empresa também fez parceria com a Hugging Face para oferecer uma ampla gama de modelos de código aberto em sua plataforma, facilitando para os desenvolvedores experimentarem a aceleração da LPU.
O GroqCloud, lançado em 2024, permite que os usuários aluguem capacidade de LPU sob demanda, semelhante aos serviços em nuvem da AWS, Azure e Google Cloud. A plataforma suporta tanto inferência interativa quanto processamento em lote, com um modelo de preço de pagamento conforme o uso. Em 2025, o GroqCloud hospeda mais de 100.000 desenvolvedores e processou bilhões de solicitações.
A empresa também mantém uma divisão de pesquisa que colabora com instituições acadêmicas como Stanford AI Lab e Berkeley AI Research para explorar novas arquiteturas para IA. A tecnologia da Groq tem sido usada em aplicações que vão desde motores de xadrez até veículos autônomos, embora o foco principal permaneça na inferência de LLM.
Posição de Mercado e Concorrência
A Groq compete com outras startups de chips de IA, como SambaNova e Graphcore, bem como com players estabelecidos como AMD e Intel. O design determinístico da LPU dá a ela uma vantagem em aplicações sensíveis à latência, mas carece da flexibilidade das GPUs para tarefas de treinamento. A Groq se posicionou como especialista em inferência, um mercado que está crescendo rapidamente com a proliferação de aplicações de IA.
Em 2025, a avaliação da empresa atingiu US$ 2,8 bilhões após sua rodada da Série D, e o acordo com a Nvidia em dezembro de 2025 validou ainda mais sua tecnologia. O acordo de licenciamento permite que a Nvidia incorpore a tecnologia de inferência da Groq em seus próprios produtos, potencialmente expandindo o alcance das soluções baseadas em LPU.
Direções Futuras
Olhando para o futuro, a Groq planeja lançar a LPU v2, fabricada no processo de 4nm da Samsung, que deve oferecer melhorias significativas de desempenho em relação à primeira geração. A empresa também está explorando novas tecnologias de memória, como HBM, para aumentar a largura de banda e reduzir ainda mais a latência.
A transição da Groq para um negócio de nuvem de inferência de IA, conforme indicado pela rodada de financiamento de 2026, sugere uma mudança estratégica de vendas de hardware para prestação de serviços. Isso está alinhado com as tendências da indústria, onde a computação é cada vez mais entregue como um utilitário, semelhante à evolução da computação em nuvem.
Ver Também
- Unidade central de processamento
- Unidade de processamento gráfico
- Unidade de processamento tensorial
- Acelerador de IA
Referências
- Site oficial da Groq, Inc.
- Comunicados de imprensa e anúncios da Groq
- Relatórios da indústria sobre hardware de IA