Traduzido do inglês

Mohit Bansal é professor de ciência da computação na UNC Chapel Hill, conhecido por pesquisas em processamento de linguagem natural multimodal e robusto, incluindo modelos de visão-linguagem e robustez adversarial.

Mohit Bansal é professor de ciência da computação na Universidade da Carolina do Norte em Chapel Hill (UNC Chapel Hill). Sua pesquisa concentra-se em inteligência artificial, particularmente em abordagens de aprendizado profundo e redes neurais para o processamento de linguagem natural (PLN). Ele é conhecido por suas contribuições ao aprendizado multimodal, que combina texto com imagens ou vídeo, e por melhorar a robustez de modelos de PLN contra entradas adversariais e mudanças de distribuição.

Bansal lidera o grupo de PLN da UNC, que produziu trabalhos influentes em modelos de visão-linguagem, raciocínio de senso comum e interpretabilidade de modelos. Sua pesquisa frequentemente faz a ponte entre a teoria de aprendizado de máquina e aplicações práticas, com publicações em conferências de alto nível como ACL, EMNLP, NeurIPS e ICML.

Carreira Acadêmica e Educação

Bansal concluiu seu doutorado em ciência da computação na Universidade de Illinois em Urbana-Champaign, onde trabalhou sob a supervisão de Dan Roth. Sua pesquisa de doutorado focou em predição estruturada e parsing semântico, estabelecendo as bases para seu trabalho posterior em PLN multimodal e robusto. Após o doutorado, ele atuou como pesquisador de pós-doutorado na Universidade de Washington, colaborando com pesquisadores em compreensão de linguagem fundamentada.

Ele ingressou na UNC Chapel Hill como professor assistente em 2016 e foi promovido a professor associado, tornando-se posteriormente professor titular. Seu laboratório recebeu financiamento de agências nacionais e parceiros da indústria, apoiando pesquisas sobre alinhamento e avaliação de grandes modelos de linguagem.

Pesquisa Multimodal e em Visão-Linguagem

Uma parte significativa do trabalho de Bansal aborda a integração de informações visuais e textuais. Sua equipe desenvolveu modelos que aprendem representações conjuntas a partir de imagens e texto, permitindo tarefas como resposta a perguntas visuais e legenda de imagens. Eles introduziram métodos para alinhar características visuais com estruturas linguísticas, melhorando o desempenho em benchmarks como VQA e COCO Captions.

Sua pesquisa também explora como arquiteturas de transformadores podem ser adaptadas para entradas multimodais. Ao aproveitar mecanismos de atenção multi-cabeça e atenção cruzada, seus modelos raciocinam efetivamente sobre relações entre objetos em imagens e palavras em frases. Este trabalho tem implicações para aplicações em sistemas autônomos e tecnologias assistivas.

Robustez e PLN Adversarial

Bansal fez contribuições notáveis para tornar os modelos de PLN mais confiáveis. Seu grupo estuda ataques adversariais - pequenas mudanças, muitas vezes imperceptíveis, no texto de entrada que fazem os modelos cometerem erros. Eles desenvolveram estratégias de defesa, incluindo técnicas de aumento de dados e procedimentos de treinamento que melhoram o recorte de gradiente e a regularização.

Seu trabalho em treinamento robusto mostrou que modelos ajustados com exemplos adversariais generalizam melhor para dados fora da distribuição. Isso é crítico para a implantação de sistemas de IA generativa em cenários do mundo real, onde as entradas podem ser ruidosas ou maliciosas. Suas descobertas influenciaram as melhores práticas em avaliação e segurança de modelos.

Raciocínio de Senso Comum e Interpretabilidade

Outra linha de pesquisa envolve ensinar modelos a realizar raciocínio de senso comum. A equipe de Bansal criou conjuntos de dados e modelos que exigem a compreensão de conhecimento implícito, como convenções físicas ou sociais. Eles usaram aprendizado curricular para aumentar gradualmente a complexidade das tarefas, melhorando a eficiência do aprendizado.

Ele também investiga a interpretabilidade de modelos, com o objetivo de explicar por que redes neurais fazem certas previsões. Ao analisar padrões de atenção e representações aprendidas, seu trabalho fornece insights sobre o funcionamento interno de grandes modelos de linguagem. Esta pesquisa ajuda a identificar vieses e erros, contribuindo para sistemas de IA mais transparentes.

Impacto e Reconhecimento

O trabalho de Bansal tem sido amplamente citado e reconhecido na comunidade de PLN. Ele atuou como área chair e área chair sênior em conferências importantes, e seus artigos receberam prêmios e indicações de melhor artigo. Sua pesquisa foi apresentada em colaborações com a indústria, e ele proferiu palestras convidadas em ambientes acadêmicos e industriais.

Suas contribuições ajudaram a moldar a direção do PLN multimodal e robusto, influenciando tanto a pesquisa acadêmica quanto as implementações práticas. Em 2025, ele continua a liderar um grupo de pesquisa ativo na UNC Chapel Hill, orientando estudantes que seguiram para posições na academia e na indústria.

Publicações Selecionadas

Bansal é autor de mais de 100 artigos revisados por pares. Trabalhos notáveis incluem estudos sobre treinamento adversarial para classificação de texto, pré-treinamento de visão-linguagem e resposta robusta a perguntas. Seus artigos colaborativos com estudantes e colegas avançaram a compreensão de como construir sistemas de IA que sejam capazes e confiáveis.

Sua pesquisa foi apoiada por bolsas da National Science Foundation e da Defense Advanced Research Projects Agency, entre outras. Ele é membro da Association for Computational Linguistics e do Institute of Electrical and Electronics Engineers.

Para mais informações, os leitores podem consultar sua página de professor na universidade e seu perfil no Google Scholar, que listam publicações e projetos em andamento. O site de seu laboratório fornece recursos e código aberto para reproduzir resultados.

Referências

Este artigo é baseado em informações publicamente disponíveis sobre a carreira e a pesquisa de Mohit Bansal. Detalhes específicos de citações foram omitidos para manter a brevidade, mas leitores interessados podem encontrar fontes primárias por meio de bancos de dados acadêmicos e seu perfil oficial na universidade.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-science·natural-language-processing·artificial-intelligence·academic
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico