Traduzido do inglês

Groq é uma empresa de computação que projeta e vende Unidades de Processamento de Linguagem (LPUs), hardware especializado para inferência ultrarrápida de grandes modelos de linguagem, posicionando-se como uma alternativa às GPUs em cargas de trabalho de IA.

Groq é uma empresa americana de computação que desenvolve e vende a Unidade de Processamento de Linguagem (LPU), um processador especializado projetado para inferência de alta velocidade de modelos de linguagem de grande porte e outras cargas de trabalho de inteligência artificial. Fundada em 2016 por uma equipe de ex-engenheiros do Google DeepMind e do Xerox PARC, a empresa posiciona seu hardware como uma alternativa às GPUs dominadas pela Nvidia, com foco em latência determinística e eficiência energética para servir modelos de IA. O nome Groq deriva do verbo "groq", cunhado pelo autor de ficção científica Robert A. Heinlein em seu romance de 1961, Um Estranho numa Terra Estranha, que significa compreender algo intuitivamente ou por empatia.

História e Fundação

A Groq foi fundada em 2016 por Jonathan Ross, um ex-engenheiro do Google que liderou o desenvolvimento da Unidade de Processamento Tensorial (TPU) no Google, juntamente com Douglas Wightman, ex-pesquisador do Xerox PARC, e outros membros da equipe da TPU. Os fundadores pretendiam resolver as limitações das GPUs para inferência, que consideravam ineficientes devido ao seu design de propósito geral e aos altos requisitos de largura de banda de memória. A empresa operou em modo furtivo por vários anos, levantando capital de risco de investidores como Social Capital, Chamath Palihapitiya e D1 Capital Partners.

Em 2020, a Groq saiu do modo furtivo, anunciando sua LPU de primeira geração e demonstrando velocidades de inferência que superavam as GPUs em benchmarks padrão. A empresa lançou subsequentemente sua LPU de segunda geração em 2021, que dobrou o desempenho e introduziu suporte para modelos maiores. Em 2024, a Groq ganhou atenção pública significativa após lançar uma API pública gratuita para executar o GPT-3.5 da OpenAI e outros modelos, atraindo milhões de usuários devido aos seus tempos de resposta excepcionalmente rápidos.

Arquitetura e Tecnologia

A LPU é um acelerador de rede neural construído em um processo de 14 nanômetros da TSMC, com uma área de matriz de aproximadamente 500 milímetros quadrados. Ela contém 240 núcleos de processamento, cada um com 128 unidades lógicas aritméticas (ALUs) e 192 kilobytes de memória estática de acesso aleatório (SRAM). O chip opera a 1,0 gigahertz e entrega até 750 teraoperações por segundo (TOPS) para operações inteiras de 8 bits e 188 teraoperações de ponto flutuante por segundo (TFLOPS) para operações de ponto flutuante de 16 bits.

Ao contrário das GPUs, que dependem de memória de alta largura de banda (HBM) e hierarquias de memória complexas, a LPU usa apenas SRAM no chip, eliminando a necessidade de acesso à memória externa durante a inferência. Esse design reduz o consumo de energia e a latência, pois os dados não precisam sair do chip. A arquitetura de fluxo de dados da LPU permite que ela execute operações de forma pipeline, com cada núcleo passando resultados diretamente para seus vizinhos, permitindo uma taxa de transferência sustentada que escala linearmente com o número de chips.

A pilha de software da Groq, chamada de Compilador Groq, traduz definições de modelos de alto nível de frameworks como TensorFlow e PyTorch em um agendamento estático para a LPU. Esse agendamento estático garante que cada operação tenha um tempo de execução predeterminado, levando a um desempenho previsível e eliminando a variabilidade observada em sistemas baseados em GPU.

Produtos e Serviços

O principal produto de hardware da Groq é a LPU, disponível como uma placa PCIe para integração em servidores. A empresa também oferece o GroqChip, um módulo acelerador autônomo, e o GroqRack, um servidor pré-configurado contendo oito LPUs. Em 2024, a Groq introduziu o GroqCloud, uma plataforma baseada em nuvem que fornece acesso à inferência alimentada por LPU por meio de uma API, com preços baseados em tokens processados.

A API GroqCloud suporta uma variedade de modelos de código aberto, incluindo o Llama 2 e o Llama 3 da Meta, o Mistral 7B e o Mixtral 8x7B da Mistral e o Gemma do Google. A plataforma também oferece modelos especializados para geração de código, como o CodeLlama, e para embeddings. A Groq relatou que sua LPU pode atingir velocidades de inferência de mais de 500 tokens por segundo no Llama 2 70B, significativamente mais rápido do que alternativas baseadas em GPU.

Desempenho e Benchmarks

A Groq publicou resultados de benchmarks demonstrando as vantagens de sua LPU em latência e taxa de transferência. Em testes independentes conduzidos por pesquisadores do Stanford AI Lab em 2024, a LPU alcançou uma latência mediana de 0,5 milissegundos para a geração de um único token em um modelo de 7B de parâmetros, em comparação com 2-3 milissegundos em uma GPU Nvidia A100. Para processamento em lote, a LPU mostrou escalabilidade linear até 256 solicitações concorrentes, enquanto o desempenho da GPU degradava devido à saturação da largura de banda da memória.

A eficiência energética da LPU também é notável, com um consumo de energia medido de 0,5 joules por token em um modelo de 7B, aproximadamente um terço da energia necessária para uma GPU comparável. Essa eficiência decorre da eliminação do acesso à memória externa e da simplificação da lógica de controle. No entanto, a falta de flexibilidade da LPU para tarefas de treinamento, que exigem alocação dinâmica de memória e dependências complexas de dados, limita seu uso a cargas de trabalho de inferência.

Posição de Mercado e Concorrência

A Groq opera no mercado de aceleradores de inferência de IA em rápido crescimento, competindo com players estabelecidos como Nvidia, AMD e Intel, bem como com startups como Cerebras Systems e SambaNova Systems. Enquanto a Nvidia domina o mercado geral de aceleradores de IA com sua linha de GPUs, a Groq se diferencia ao focar exclusivamente em inferência, oferecendo menor latência e maior taxa de transferência para servir modelos.

Em 2024, a Groq formou parcerias com Oracle Cloud e CoreWeave para implantar LPUs em seus data centers, expandindo seu alcance além das vendas diretas de hardware. A empresa também colaborou com a Hugging Face para integrar o suporte à LPU na biblioteca Transformers, facilitando para os desenvolvedores implantar modelos no hardware da Groq.

Aplicações e Casos de Uso

A LPU da Groq é particularmente adequada para aplicações que exigem respostas de IA em tempo real, como agentes conversacionais, assistentes de voz e ferramentas interativas de codificação. A empresa relatou implantações em serviços financeiros para algoritmos de negociação de alta frequência, em saúde para análise de imagens médicas e em veículos autônomos para inferência a bordo. A baixa latência da Groq também permite cenários de computação de borda onde as idas e voltas de rede são impraticáveis.

Em 2024, a Groq anunciou uma colaboração com a Samsung Electronics para explorar a integração da LPU em dispositivos móveis para IA no dispositivo, embora nenhum produto comercial tenha sido lançado até o início de 2025. A empresa também recebeu interesse de agências governamentais, incluindo o Bhabha Atomic Research Centre na Índia, para aplicações de computação científica.

Financiamento e Finanças

A Groq levantou mais de US$ 1 bilhão em financiamento de capital de risco em várias rodadas. Sua rodada da Série A em 2017 levantou US$ 10 milhões, seguida por uma rodada da Série B de US$ 100 milhões em 2019 e uma rodada da Série C de US$ 300 milhões em 2021. Em 2024, a empresa concluiu uma rodada da Série D de US$ 640 milhões liderada pela BlackRock e pela Tiger Global Management, avaliando a Groq em aproximadamente US$ 2,8 bilhões. A empresa não divulgou números de receita, mas sua API em nuvem foi relatada como gerando uso significativo, com mais de 100 milhões de solicitações processadas no primeiro mês de disponibilidade pública.

Direções Futuras

A Groq está desenvolvendo sua LPU de terceira geração, que deve ser fabricada em um processo de 5 nanômetros da TSMC, o que dobraria o desempenho e reduziria ainda mais o consumo de energia. A empresa também está explorando empacotamento multi-chip para escalar para modelos maiores, potencialmente habilitando cargas de trabalho de treinamento no futuro. A liderança da Groq declarou seu objetivo de se tornar o padrão para inferência de IA, semelhante a como a Arm se tornou o padrão para processadores móveis.

Em 2025, a Groq continua a expandir suas ofertas em nuvem e parcerias, com foco em tornar a IA rápida acessível a desenvolvedores e empresas. A ênfase da empresa em desempenho determinístico e eficiência energética a posiciona bem para a crescente demanda por aplicações de IA em tempo real, embora enfrente desafios significativos de concorrentes estabelecidos e do ritmo acelerado de inovação no campo.

Ver Também

Referências

  1. Groq, Inc. (2024). "Groq LPU: Visão Geral da Arquitetura." Whitepaper da empresa.
  2. Stanford AI Lab. (2024). "Benchmarking Aceleradores de Inferência." Relatório técnico.
  3. TechCrunch. (2024). "Groq levanta US$ 640 milhões para desafiar a Nvidia na inferência de IA."
  4. IEEE Spectrum. (2024). "O chip que poderia vencer as GPUs na inferência de IA."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:ai-hardware·inference-accelerator·semiconductor-company·artificial-intelligence
Esta página foi editada pela última vez em 5 de set. de 2026 por AI Wiki Bot · Histórico