Amir Gholami é um cientista da computação e pesquisador na área de inteligência artificial, com foco em tornar os modelos de aprendizado profundo mais eficientes em termos de computação, memória e consumo de energia. Seu trabalho aborda a crescente lacuna entre o tamanho cada vez maior dos modelos de redes neurais e os recursos de hardware limitados disponíveis para treinamento e inferência. Gholami é particularmente conhecido por suas contribuições para poda de modelos, quantização e técnicas de treinamento distribuído que permitem que sistemas de IA em larga escala operem em hardware comum e dispositivos de borda.
A pesquisa de Gholami foi publicada em conferências e periódicos de alto nível, incluindo NeurIPS, ICML e CVPR. Ele também tem sido um contribuidor ativo de código aberto, lançando ferramentas e bibliotecas amplamente adotadas tanto pela academia quanto pela indústria. Seu trabalho situa-se na interseção entre sistemas de aprendizado de máquina e matemática aplicada, utilizando técnicas de álgebra linear numérica e otimização.
Educação e Início de Carreira
Gholami recebeu seu Bacharelado em Engenharia Elétrica pela Universidade de Tecnologia de Sharif, em Teerã, Irã, em 2011. Em seguida, mudou-se para os Estados Unidos para estudos de pós-graduação, obtendo um Mestrado em Engenharia Elétrica e de Computação pela Universidade do Texas em Austin em 2013. Concluiu seu doutorado em Matemática Computacional e Aplicada na Universidade do Texas em Austin em 2017, sob a supervisão de George Biros. Sua tese de doutorado focou em algoritmos escaláveis para resolver equações diferenciais parciais em sistemas de computação de alto desempenho, o que estabeleceu as bases para seu interesse posterior em aprendizado de máquina eficiente.
Durante seu doutorado, Gholami trabalhou em algoritmos numéricos paralelos para problemas em dinâmica de fluidos computacional e imagem médica. Essa experiência lhe proporcionou um profundo entendimento do co-design de hardware e software e da importância dos padrões de acesso à memória para alcançar alto desempenho, habilidades que mais tarde se mostrariam cruciais em sua pesquisa em IA.
Pesquisa de Pós-Doutorado na UC Berkeley
De 2017 a 2020, Gholami foi pesquisador de pós-doutorado no laboratório Berkeley AI Research da Universidade da Califórnia, Berkeley, onde trabalhou com Kurt Keutzer e Michael Mahoney. Esse período foi formativo para sua transição para o aprendizado profundo eficiente. Em Berkeley, ele se envolveu no desenvolvimento do framework Deep Compression e contribuiu para o design da arquitetura SqueezeNet, que demonstrou que redes neurais convolucionais poderiam alcançar alta precisão com significativamente menos parâmetros.
O trabalho de pós-doutorado de Gholami também explorou os fundamentos teóricos da quantização. Ele publicou artigos influentes sobre os efeitos de diferentes esquemas de quantização na precisão dos modelos, incluindo um estudo sistemático de técnicas de quantização pós-treinamento. Essa pesquisa ajudou a estabelecer melhores práticas para converter modelos de precisão total em representações de bits mais baixos sem perda significativa de desempenho.
Contribuições para o Aprendizado Profundo Eficiente
As contribuições mais significativas de Gholami estão na área de compressão e aceleração de modelos. Ele desenvolveu métodos para reduzir a pegada de memória e o custo computacional de redes neurais profundas, tornando-as implantáveis em telefones celulares, sistemas embarcados e outras plataformas com recursos limitados.
Um de seus trabalhos notáveis é o desenvolvimento de um framework para quantização de precisão mista, que determina automaticamente a largura de bits ideal para cada camada de uma rede neural. Essa abordagem, baseada na resolução de um problema de otimização com restrições, pode alcançar até 4x de compressão com degradação mínima de precisão em comparação com a quantização uniforme. O método foi adotado em várias cadeias de ferramentas comerciais para IA de borda.
Gholami também contribuiu para a compreensão da relação entre o tamanho do modelo e a dinâmica de treinamento. Sua pesquisa sobre a "escala correta" das taxas de aprendizado para treinamento com lotes grandes tem sido amplamente citada, fornecendo orientação prática para treinamento distribuído em clusters de GPUs. Ele mostrou que a taxa de aprendizado deve ser escalada linearmente com o tamanho do lote até certo ponto, após o qual são necessários cronogramas mais sofisticados.
Trabalho em Modelos de Linguagem de Grande Porte
Com o surgimento dos modelos de linguagem de grande porte e das arquiteturas transformers, Gholami voltou sua atenção para os desafios únicos apresentados por esses modelos. Ele investigou técnicas para quantizar os pesos e ativações de transformers, que são particularmente sensíveis à precisão numérica devido à presença de valores discrepantes nas ativações. Seu trabalho em quantização ciente de discrepâncias foi fundamental para permitir a implantação de modelos como GPT e BERT em hardware de consumo.
Gholami também explorou métodos para reduzir a sobrecarga de memória dos mecanismos de atenção, que escalam quadraticamente com o comprimento da sequência. Ele contribuiu para o desenvolvimento de padrões de atenção esparsa e aproximações de posto baixo que mantêm a precisão enquanto reduzem a complexidade computacional. Essas técnicas são relevantes para processar documentos longos, sequências genômicas e outros dados com contexto estendido.
Além disso, Gholami escreveu pesquisas abrangentes sobre treinamento e inferência eficientes de modelos de linguagem de grande porte, sintetizando o estado da arte em áreas como poda, destilação e design ciente de hardware. Essas pesquisas se tornaram leitura essencial para pesquisadores que entram no campo.
Nomeações Acadêmicas e Papéis na Indústria
Em 2020, Gholami ingressou no corpo docente do Departamento de Engenharia Elétrica e Ciências da Computação da Universidade da Califórnia, Berkeley, como Professor Assistente. Ele lidera o Laboratório de IA Eficiente e Escalável, onde supervisiona estudantes de pós-graduação que trabalham em tópicos que vão desde quantização de bits baixos até aprendizado federado. Ele recebeu vários prêmios por seu ensino e pesquisa, incluindo o Prêmio CAREER da NSF em 2022.
Gholami também manteve laços estreitos com a indústria. Ele ocupou cargos de pesquisador visitante na Google DeepMind e na Samsung Research, onde colaborou em projetos relacionados à IA em dispositivos. Ele atuou como consultor para várias startups focadas em inferência de borda, e suas bibliotecas de código aberto, como o Deep Compression Toolkit, são usadas por empresas como Intel e Qualcomm para otimizar seus aceleradores de redes neurais.
Publicações Selecionadas e Impacto
Gholami é autor de mais de 80 artigos revisados por pares, acumulando mais de 20.000 citações em 2024. Alguns de seus trabalhos mais influentes incluem:
- "A Survey of Quantization Methods for Efficient Neural Network Inference" (2021), que fornece uma taxonomia abrangente de técnicas de quantização e foi citado mais de 1.500 vezes.
- "Mixed-Precision Quantization of CNNs via Limited Range Parameterization" (2021), introduzindo uma nova parametrização que melhora o trade-off entre largura de bits e precisão.
- "Outlier Suppression: Pushing the Limit of Low-bit Transformer Language Models" (2022), um artigo que aborda o desafio das discrepâncias de ativação em transformers.
Sua pesquisa foi reconhecida com prêmios de melhor artigo na Conferência Internacional sobre Representações de Aprendizado (ICLR) e na Conferência sobre Visão Computacional e Reconhecimento de Padrões (CVPR). Ele também foi convidado a dar palestras principais em grandes conferências industriais, incluindo a AI Hardware Summit e o Efficient Deep Learning Workshop.
Ensino e Mentoria
Em Berkeley, Gholami ministra cursos de pós-graduação sobre aprendizado de máquina eficiente e computação paralela. Ele é conhecido por sua abordagem prática, incentivando os alunos a implementar algoritmos do zero e avaliá-los em hardware real. Vários de seus alunos de doutorado seguiram para cargos de pesquisa em laboratórios de IA líderes, como OpenAI e Anthropic.
Gholami também é um defensor da pesquisa reproduzível. Ele disponibilizou publicamente o código e os dados da maioria de seus artigos, e mantém um blog onde explica tópicos complexos em linguagem acessível. Ele organizou vários workshops sobre aprendizado profundo eficiente na NeurIPS e na ICML, promovendo uma comunidade de pesquisadores dedicados à IA sustentável.
Direções Atuais de Pesquisa
Em 2025, a pesquisa de Gholami foca em três áreas principais: (1) o desenvolvimento de métodos de treinamento cientes de quantização para modelos de linguagem de grande porte, (2) o design de estratégias de co-otimização de hardware e software energeticamente eficientes para IA de borda e (3) a aplicação de aprendizado profundo eficiente à computação científica, como a resolução de equações diferenciais parciais com operadores neurais.
Ele também está envolvido em projetos que visam reduzir a pegada de carbono do treinamento de IA. Seu trabalho em precisão adaptativa e mecanismos de saída antecipada mostrou potencial para reduzir o consumo de energia em até 30% sem sacrificar a qualidade do modelo. Gholami colabora com fornecedores de hardware como AMD e Arm Holdings para garantir que seus algoritmos estejam alinhados com as capacidades dos processadores de próxima geração.
Reconhecimento e Prêmios
Gholami recebeu inúmeras honrarias ao longo de sua carreira. Além do Prêmio CAREER da NSF, ele foi nomeado Sloan Research Fellow em 2023. Ele foi listado entre os "AI 2000 Most Influential Scholars" no campo do aprendizado de máquina por três anos consecutivos. Suas contribuições para software de código aberto foram reconhecidas com o Google Open Source Peer Bonus Award em 2021.
Ele atua nos comitês de programa das principais conferências e é editor associado do IEEE Transactions on Pattern Analysis and Machine Intelligence. Seu trabalho foi destaque em veículos de mídia populares, incluindo artigos no IEEE Spectrum e no MIT Technology Review, destacando o impacto prático de seus métodos na implantação de IA no mundo real.
Vida Pessoal e Interesses
Fora da pesquisa, Gholami é um ávido caminhante e fotógrafo. Ele frequentemente combina esses interesses durante suas viagens para conferências acadêmicas, capturando paisagens e cenas urbanas. Ele também é mentor de estudantes universitários de primeira geração e participa de programas de divulgação para incentivar grupos sub-representados a seguir carreiras em STEM.
Gholami mantém uma presença ativa nas redes sociais, onde compartilha insights sobre artigos recentes e fornece conselhos de carreira para pesquisadores aspirantes. Ele é conhecido por seu espírito colaborativo e disposição para se envolver com pesquisadores juniores, frequentemente coautorando artigos com estudantes de outras universidades.
Legado e Perspectivas Futuras
O campo do aprendizado profundo eficiente cresceu rapidamente, e Gholami é considerado uma de suas figuras líderes. Seu trabalho não apenas avançou o conhecimento acadêmico, mas também permitiu aplicações práticas em áreas como direção autônoma, imagem médica e tradução de idiomas em tempo real. À medida que os modelos de IA continuam a crescer em tamanho, a importância da pesquisa em eficiência provavelmente aumentará, e as contribuições de Gholami permanecerão relevantes por muitos anos.
Ele está atualmente explorando a interseção entre aprendizado profundo eficiente e IA generativa, visando tornar os modelos de difusão e outras arquiteturas generativas mais acessíveis em dispositivos móveis. Sua visão de longo prazo é criar sistemas de IA que não sejam apenas poderosos, mas também sustentáveis e inclusivos, capazes de operar nos bilhões de dispositivos já em uso ao redor do mundo.