Mohit Bansal é professor de ciência da computação na Universidade da Carolina do Norte em Chapel Hill (UNC Chapel Hill). Sua pesquisa concentra-se em inteligência artificial, particularmente em abordagens de aprendizado profundo e redes neurais para o processamento de linguagem natural (PLN). Ele é conhecido por suas contribuições ao aprendizado multimodal, que combina texto com imagens ou vídeo, e por melhorar a robustez de modelos de PLN contra entradas adversariais e mudanças de distribuição.
Bansal lidera o grupo de PLN da UNC, que produziu trabalhos influentes em modelos de visão-linguagem, raciocínio de senso comum e interpretabilidade de modelos. Sua pesquisa frequentemente faz a ponte entre a teoria de aprendizado de máquina e aplicações práticas, com publicações em conferências de alto nível como ACL, EMNLP, NeurIPS e ICML.
Carreira Acadêmica e Educação
Bansal concluiu seu doutorado em ciência da computação na Universidade de Illinois em Urbana-Champaign, onde trabalhou sob a supervisão de Dan Roth. Sua pesquisa de doutorado focou em predição estruturada e parsing semântico, estabelecendo as bases para seu trabalho posterior em PLN multimodal e robusto. Após o doutorado, ele atuou como pesquisador de pós-doutorado na Universidade de Washington, colaborando com pesquisadores em compreensão de linguagem fundamentada.
Ele ingressou na UNC Chapel Hill como professor assistente em 2016 e foi promovido a professor associado, tornando-se posteriormente professor titular. Seu laboratório recebeu financiamento de agências nacionais e parceiros da indústria, apoiando pesquisas sobre alinhamento e avaliação de grandes modelos de linguagem.
Pesquisa Multimodal e em Visão-Linguagem
Uma parte significativa do trabalho de Bansal aborda a integração de informações visuais e textuais. Sua equipe desenvolveu modelos que aprendem representações conjuntas a partir de imagens e texto, permitindo tarefas como resposta a perguntas visuais e legenda de imagens. Eles introduziram métodos para alinhar características visuais com estruturas linguísticas, melhorando o desempenho em benchmarks como VQA e COCO Captions.
Sua pesquisa também explora como arquiteturas de transformadores podem ser adaptadas para entradas multimodais. Ao aproveitar mecanismos de atenção multi-cabeça e atenção cruzada, seus modelos raciocinam efetivamente sobre relações entre objetos em imagens e palavras em frases. Este trabalho tem implicações para aplicações em sistemas autônomos e tecnologias assistivas.
Robustez e PLN Adversarial
Bansal fez contribuições notáveis para tornar os modelos de PLN mais confiáveis. Seu grupo estuda ataques adversariais - pequenas mudanças, muitas vezes imperceptíveis, no texto de entrada que fazem os modelos cometerem erros. Eles desenvolveram estratégias de defesa, incluindo técnicas de aumento de dados e procedimentos de treinamento que melhoram o recorte de gradiente e a regularização.
Seu trabalho em treinamento robusto mostrou que modelos ajustados com exemplos adversariais generalizam melhor para dados fora da distribuição. Isso é crítico para a implantação de sistemas de IA generativa em cenários do mundo real, onde as entradas podem ser ruidosas ou maliciosas. Suas descobertas influenciaram as melhores práticas em avaliação e segurança de modelos.
Raciocínio de Senso Comum e Interpretabilidade
Outra linha de pesquisa envolve ensinar modelos a realizar raciocínio de senso comum. A equipe de Bansal criou conjuntos de dados e modelos que exigem a compreensão de conhecimento implícito, como convenções físicas ou sociais. Eles usaram aprendizado curricular para aumentar gradualmente a complexidade das tarefas, melhorando a eficiência do aprendizado.
Ele também investiga a interpretabilidade de modelos, com o objetivo de explicar por que redes neurais fazem certas previsões. Ao analisar padrões de atenção e representações aprendidas, seu trabalho fornece insights sobre o funcionamento interno de grandes modelos de linguagem. Esta pesquisa ajuda a identificar vieses e erros, contribuindo para sistemas de IA mais transparentes.
Impacto e Reconhecimento
O trabalho de Bansal tem sido amplamente citado e reconhecido na comunidade de PLN. Ele atuou como área chair e área chair sênior em conferências importantes, e seus artigos receberam prêmios e indicações de melhor artigo. Sua pesquisa foi apresentada em colaborações com a indústria, e ele proferiu palestras convidadas em ambientes acadêmicos e industriais.
Suas contribuições ajudaram a moldar a direção do PLN multimodal e robusto, influenciando tanto a pesquisa acadêmica quanto as implementações práticas. Em 2025, ele continua a liderar um grupo de pesquisa ativo na UNC Chapel Hill, orientando estudantes que seguiram para posições na academia e na indústria.
Publicações Selecionadas
Bansal é autor de mais de 100 artigos revisados por pares. Trabalhos notáveis incluem estudos sobre treinamento adversarial para classificação de texto, pré-treinamento de visão-linguagem e resposta robusta a perguntas. Seus artigos colaborativos com estudantes e colegas avançaram a compreensão de como construir sistemas de IA que sejam capazes e confiáveis.
Sua pesquisa foi apoiada por bolsas da National Science Foundation e da Defense Advanced Research Projects Agency, entre outras. Ele é membro da Association for Computational Linguistics e do Institute of Electrical and Electronics Engineers.
Links Externos e Leitura Adicional
Para mais informações, os leitores podem consultar sua página de professor na universidade e seu perfil no Google Scholar, que listam publicações e projetos em andamento. O site de seu laboratório fornece recursos e código aberto para reproduzir resultados.
Referências
Este artigo é baseado em informações publicamente disponíveis sobre a carreira e a pesquisa de Mohit Bansal. Detalhes específicos de citações foram omitidos para manter a brevidade, mas leitores interessados podem encontrar fontes primárias por meio de bancos de dados acadêmicos e seu perfil oficial na universidade.