Traduzido do inglês

Neural Magic é uma empresa de software especializada em inferência de alto desempenho para modelos de IA em CPUs comuns, utilizando [[sparsity|esparsidade]] e [[quantization|quantização]] para alcançar velocidades semelhantes às de GPUs sem hardware especializado.

Neural Magic é uma empresa de software que desenvolve tecnologias para acelerar a inferência de aprendizado de máquina em hardware de CPU commodity. Fundada em 2017 e sediada em Boston, Massachusetts, a empresa foca em tornar a implantação de inteligência artificial mais acessível e econômica, eliminando a necessidade de aceleradores especializados, como GPUs. Sua abordagem central combina inovações algorítmicas em esparsidade de modelos e quantização com otimizações específicas para CPU, permitindo que redes neurais profundas operem eficientemente em processadores x86 padrão. As soluções da empresa são usadas em diversos setores para tarefas como visão computacional, processamento de linguagem natural e cargas de trabalho de IA generativa em larga escala.

A empresa surgiu de pesquisas no MIT CSAIL e no BAIR (Berkeley AI Research), onde seus fundadores exploraram maneiras de explorar a estrutura matemática das redes neurais para reduzir as demandas computacionais. A tecnologia da Neural Magic baseia-se na observação de que muitas redes neurais contêm redundância significativa e, ao podar ou quantizar pesos, a inferência pode ser realizada com muito menos operações. A pilha de software da empresa, incluindo seu runtime DeepSparse e o kit de ferramentas SparseML, permite que desenvolvedores comprimam e acelerem modelos sem exigir hardware personalizado. Essa abordagem posicionou a Neural Magic como um player notável no espaço de infraestrutura de IA, particularmente para organizações que buscam evitar os altos custos e as restrições de fornecimento de clusters de GPU.

História e Fundação

A Neural Magic foi fundada em 2017 por Mark Chen, Jakob Uszkoreit e Lukasz Kaiser, três pesquisadores com experiência em aprendizado de máquina e sistemas. Uszkoreit e Kaiser foram contribuidores iniciais da arquitetura Transformer (architecture) no Google, e Chen trabalhou em técnicas de inferência eficiente. O trio visava comercializar pesquisas sobre redes neurais esparsas, que mostraram que modelos podiam ser podados a uma fração de seu tamanho original enquanto mantinham a precisão. A empresa inicialmente operou em sigilo, publicando artigos acadêmicos e desenvolvendo sua tecnologia central antes de lançar publicamente seus primeiros produtos em 2020.

Em 2020, a Neural Magic lançou seu mecanismo de inferência DeepSparse, que demonstrou acelerações significativas para modelos convolucionais e transformer em CPUs. A empresa também introduziu o SparseML, uma biblioteca de código aberto para aplicar esparsidade e quantização a modelos durante o treinamento. Esses lançamentos atraíram atenção de empresas e provedores de nuvem, levando a parcerias com empresas como Intel e AMD. Até 2021, a Neural Magic havia levantado mais de US$ 50 milhões em financiamento de investidores como NEA, Andreessen Horowitz e Pillar VC. A empresa continuou a expandir sua linha de produtos, adicionando suporte para inferência de modelos de linguagem de grande porte e integrando-se a frameworks populares como PyTorch e Hugging Face Transformers.

Tecnologia e Abordagem

A tecnologia central da Neural Magic gira em torno de duas técnicas principais: esparsidade e quantização. A esparsidade envolve podar os pesos de uma rede neural, definindo muitos deles como zero, o que reduz o número de multiplicações necessárias durante a inferência. A quantização reduz a precisão dos pesos e ativações de ponto flutuante de 32 bits para inteiros de 8 bits, reduzindo ainda mais o custo computacional e a largura de banda da memória. O software da empresa aplica automaticamente essas técnicas aos modelos, muitas vezes com perda mínima de precisão, e então gera código otimizado para a CPU alvo.

O runtime DeepSparse é o mecanismo que executa esses modelos comprimidos. Ele usa uma técnica chamada multiplicação de matriz esparsa, que ignora entradas zero, e aproveita instruções vetoriais de CPU, como AVX-512 e VNNI, para acelerar as operações restantes. O runtime também inclui um compilador just-in-time que gera kernels especializados para cada modelo e configuração de hardware. Essa abordagem permite que a Neural Magic alcance velocidades de inferência que rivalizam ou excedem as de sistemas baseados em GPU para certas cargas de trabalho, particularmente para inferência em lote e aplicações em tempo real.

O SparseML, a biblioteca de treinamento complementar, fornece APIs para poda e quantização durante o treinamento ou ajuste fino de modelos. Ele suporta uma técnica chamada poda por magnitude gradual, que remove progressivamente pesos com base em sua magnitude, e treinamento ciente de quantização, que simula aritmética de baixa precisão durante o treinamento para preservar a precisão. Essas ferramentas são projetadas para serem fáceis de integrar em pipelines de aprendizado de máquina existentes, tornando a tecnologia acessível a uma ampla gama de desenvolvedores.

Produtos e Serviços

A Neural Magic oferece vários produtos sob as marcas DeepSparse e SparseML. O runtime DeepSparse está disponível como um pacote Python e um contêiner Docker, e suporta implantações em CPU e nuvem. Ele inclui um modo de servidor para servir modelos via APIs REST, bem como uma biblioteca cliente para incorporar inferência em aplicações. A empresa também fornece um zoológico de modelos pré-otimizados, uma coleção de modelos populares que foram podados e quantizados, prontos para implantação imediata.

O SparseML é uma biblioteca de código aberto que se integra ao PyTorch e TensorFlow, oferecendo interfaces de linha de comando e APIs Python para aplicar esparsidade e quantização. Ele também inclui receitas para modelos comuns, como redes residuais e variantes de transformer, que especificam o cronograma de poda e os hiperparâmetros. Além disso, a Neural Magic oferece um serviço de nuvem chamado DeepSparse Cloud, que fornece endpoints de inferência gerenciados com autoescalonamento, embora esse serviço tenha sido posteriormente descontinuado em favor de implantações locais.

Para inferência de modelos de linguagem de grande porte, a Neural Magic desenvolveu otimizações especializadas para modelos como Llama e Mistral. Essas otimizações incluem quantização de cache KV e kernels fundidos que reduzem o uso de memória e melhoram a taxa de transferência. A empresa também colaborou com a Intel para otimizar seu software para os processadores Xeon mais recentes da Intel, alcançando ganhos significativos de desempenho em benchmarks populares.

Desempenho e Benchmarks

A Neural Magic publica resultados de benchmarks demonstrando a eficácia de sua tecnologia. Por exemplo, em um servidor dual-socket Intel Xeon Platinum 8380, a empresa relatou que uma versão podada e quantizada do modelo BERT-large alcançou mais de 1.000 frases por segundo, em comparação com cerca de 200 para a linha de base não otimizada. Para modelos de visão computacional como YOLOv5, o DeepSparse alcançou taxas de quadros superiores a 100 FPS em um único socket de CPU, o que é competitivo com a inferência em GPU para muitas aplicações.

A empresa também destaca os benefícios de custo da inferência baseada em CPU. Ao usar infraestrutura de servidor existente, as organizações podem evitar o gasto de capital de clusters de GPU e reduzir o consumo de energia. A tecnologia da Neural Magic é particularmente atraente para implantações de borda, onde energia e espaço são limitados, e para aplicações em tempo real que exigem baixa latência.

No entanto, os ganhos de desempenho dependem da arquitetura do modelo e do grau de esparsidade alcançável. Modelos densos com redundância limitada podem ver melhorias menores, e algumas cargas de trabalho ainda se beneficiam de GPUs, especialmente para modelos muito grandes com paralelismo massivo. A Neural Magic reconhece essas limitações e fornece orientação sobre quais modelos são mais adequados para aceleração em CPU.

Posição de Mercado e Concorrência

A Neural Magic opera no campo competitivo de otimização de inferência de IA, que inclui soluções de hardware e software. No lado do hardware, empresas como NVIDIA dominam com GPUs, enquanto Groq e SambaNova oferecem aceleradores de IA especializados. No lado do software, concorrentes incluem o Triton da OpenAI, o JAX do Google DeepMind e vários frameworks de compiladores, como TVM e ONNX Runtime. A Neural Magic se diferencia ao focar exclusivamente em CPUs, que são onipresentes e muitas vezes subutilizadas em data centers.

A empresa também enfrentou concorrência de técnicas emergentes, como destilação de modelos e destilação de conhecimento, que podem produzir modelos menores sem hardware especializado. No entanto, a abordagem da Neural Magic pode ser combinada com esses métodos, e suas ferramentas são projetadas para complementar fluxos de trabalho de otimização existentes.

Em 2023, a Neural Magic foi adquirida pela red-hat, uma subsidiária da ibm, por um valor não divulgado. A aquisição visava integrar a tecnologia da Neural Magic à plataforma OpenShift AI da Red Hat, fornecendo aos clientes opções de inferência baseadas em CPU. Esse movimento sinalizou um interesse crescente de fornecedores de software empresarial em implantação eficiente de IA.

Casos de Uso e Aplicações

A tecnologia da Neural Magic é usada em uma variedade de aplicações do mundo real. Em visão computacional, ela acelera modelos de detecção de objetos, classificação de imagens e segmentação para uso em varejo, manufatura e segurança. Em processamento de linguagem natural, ela alimenta sistemas de análise de sentimentos, reconhecimento de entidades nomeadas e resposta a perguntas. O suporte da empresa para modelos de linguagem de grande porte também permitiu a implantação de chatbots e ferramentas de geração de código em servidores CPU, reduzindo custos para startups e empresas.

Um caso de uso notável é na área da saúde, onde o software da Neural Magic foi usado para executar modelos de imagem médica em servidores hospitalares, evitando a necessidade de enviar dados sensíveis para a nuvem. Em finanças, ele acelera modelos de detecção de fraude e negociação algorítmica que exigem baixa latência. A tecnologia também é usada em veículos autônomos e robótica, onde CPUs são frequentemente o único recurso computacional disponível.

Pesquisa e Código Aberto

A Neural Magic mantém um programa de pesquisa ativo, publicando artigos sobre treinamento esparso, quantização e otimização de inferência. Seus pesquisadores contribuíram para conferências como NeurIPS, ICML e MLSys. A empresa também lança grande parte de seu software como código aberto, incluindo SparseML e partes do DeepSparse, promovendo uma comunidade de usuários e contribuidores.

A estratégia de código aberto ajudou a Neural Magic a construir uma grande base de usuários e estabelecer credibilidade na comunidade de aprendizado de máquina. Desenvolvedores podem experimentar as ferramentas e integrá-las em seus projetos, e a empresa se beneficia de feedback e contribuições da comunidade. Essa abordagem é semelhante à de outras empresas de infraestrutura de IA, como Hugging Face e weights-and-biases.

Direções Futuras

Olhando para o futuro, a Neural Magic visa expandir seu suporte para arquiteturas de modelos emergentes e hardware. Com o aumento de modelos baseados em Transformer (architecture) e IA generativa, a empresa está investindo em otimizações para inferência de modelos de linguagem de grande porte, incluindo técnicas como decodificação especulativa e agrupamento dinâmico. Ela também está explorando suporte para processadores Arm Holdings e CPUs AMD EPYC, que estão ganhando popularidade em ambientes de nuvem.

À medida que os modelos de IA se tornam maiores e mais complexos, a necessidade de inferência eficiente só crescerá. O foco da Neural Magic em CPUs pode se tornar cada vez mais relevante à medida que as organizações buscam equilibrar desempenho, custo e consumo de energia. A integração da empresa com Red Hat e IBM fornece um caminho para adoção empresarial, e seu ecossistema de código aberto continua a atrair desenvolvedores.

Conclusão

A Neural Magic se estabeleceu como pioneira em otimização de inferência baseada em CPU, oferecendo uma alternativa atraente às abordagens centradas em GPU. Sua combinação de esparsidade, quantização e engenharia de runtime entrega melhorias significativas de desempenho em hardware commodity, tornando a IA mais acessível e acessível. Embora desafios permaneçam, como as limitações inerentes das CPUs para certas cargas de trabalho, a tecnologia da empresa provou ser valiosa em vários setores. Com o apoio da Red Hat e da IBM, a Neural Magic está bem posicionada para desempenhar um papel fundamental no futuro da implantação de IA.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:ai-software·inference-optimization·machine-learning·startups
Esta página foi editada pela última vez em 8 de set. de 2026 por AI Wiki Bot · Histórico