Traduit de l'anglais

Mohit Bansal est professeur d'informatique à l'UNC Chapel Hill, connu pour ses recherches en traitement automatique du langage naturel multimodal et robuste, notamment les modèles vision-langage et la robustesse adversarial.

Mohit Bansal est un professeur d'informatique à l'Université de Caroline du Nord à Chapel Hill (UNC Chapel Hill). Ses recherches portent sur l'intelligence artificielle, en particulier sur les approches de apprentissage profond et de réseaux neuronaux pour le traitement du langage naturel (NLP). Il est connu pour ses contributions à l'apprentissage multimodal, qui combine le texte avec des images ou des vidéos, et pour l'amélioration de la robustesse des modèles NLP face aux entrées adverses et aux changements de distribution.

Bansal dirige le groupe NLP de l'UNC, qui a produit des travaux influents sur les modèles vision-langage, le raisonnement de sens commun et l'interprétabilité des modèles. Ses recherches font souvent le pont entre la théorie du apprentissage automatique et les applications pratiques, avec des publications dans des conférences de premier plan telles que ACL, EMNLP, NeurIPS et ICML.

Parcours académique et formation

Bansal a obtenu son doctorat en informatique à l'Université de l'Illinois à Urbana-Champaign, où il a travaillé sous la supervision de Dan Roth. Ses recherches doctorales portaient sur la prédiction structurée et l'analyse sémantique, jetant les bases de ses travaux ultérieurs en NLP multimodal et robuste. Après son doctorat, il a passé du temps en tant que chercheur postdoctoral à l'Université de Washington, collaborant avec des chercheurs sur la compréhension du langage ancré.

Il a rejoint l'UNC Chapel Hill en tant que professeur assistant en 2016 et a été promu professeur associé, devenant plus tard professeur titulaire. Son laboratoire a reçu des financements d'agences nationales et de partenaires industriels, soutenant la recherche sur l'alignement et l'évaluation des grands modèles de langage.

Recherche multimodale et vision-langage

Une partie importante des travaux de Bansal aborde l'intégration des informations visuelles et textuelles. Son équipe a développé des modèles qui apprennent des représentations conjointes à partir d'images et de texte, permettant des tâches telles que la réponse à des questions visuelles et la génération de légendes d'images. Ils ont introduit des méthodes pour aligner les caractéristiques visuelles avec les structures linguistiques, améliorant les performances sur des références comme VQA et COCO Captions.

Ses recherches explorent également comment les architectures transformeur peuvent être adaptées aux entrées multimodales. En exploitant les mécanismes de attention multi-têtes et de attention croisée, ses modèles raisonnent efficacement sur les relations entre les objets dans les images et les mots dans les phrases. Ce travail a des implications pour les applications dans les systèmes autonomes et les technologies d'assistance.

Robustesse et NLP adversarial

Bansal a apporté des contributions notables pour rendre les modèles NLP plus fiables. Son groupe étudie les attaques adversariales - de petites modifications, souvent imperceptibles, du texte d'entrée qui amènent les modèles à faire des erreurs. Ils ont développé des stratégies de défense, y compris des techniques de augmentation de données et des procédures d'entraînement qui améliorent le écrêtage de gradient et la régularisation.

Ses travaux sur l'entraînement robuste ont montré que les modèles affinés avec des exemples adversariales généralisent mieux aux données hors distribution. Cela est crucial pour déployer des systèmes de IA générative dans des environnements réels où les entrées peuvent être bruitées ou malveillantes. Ses conclusions ont influencé les meilleures pratiques en matière d'évaluation et de sécurité des modèles.

Raisonnement de sens commun et interprétabilité

Un autre axe de recherche consiste à enseigner aux modèles à effectuer un raisonnement de sens commun. L'équipe de Bansal a créé des ensembles de données et des modèles qui nécessitent la compréhension de connaissances implicites, telles que les conventions physiques ou sociales. Ils ont utilisé le apprentissage par curriculum pour augmenter progressivement la complexité des tâches, améliorant l'efficacité de l'apprentissage.

Il étudie également l'interprétabilité des modèles, visant à expliquer pourquoi les réseaux neuronaux font certaines prédictions. En analysant les schémas d'attention et les représentations apprises, son travail fournit des informations sur le fonctionnement interne des grands modèles de langage. Cette recherche aide à identifier les biais et les erreurs, contribuant à des systèmes d'IA plus transparents.

Impact et reconnaissance

Les travaux de Bansal ont été largement cités et reconnus dans la communauté NLP. Il a servi en tant que président de section et président principal de section pour des conférences majeures, et ses articles ont reçu des prix et des nominations pour le meilleur article. Ses recherches ont été mises en avant dans des collaborations industrielles, et il a donné des conférences invitées dans des institutions académiques et industrielles.

Ses contributions ont aidé à façonner la direction du NLP multimodal et robuste, influençant à la fois la recherche académique et les déploiements pratiques. En 2025, il continue de diriger un groupe de recherche actif à l'UNC Chapel Hill, encadrant des étudiants qui ont poursuivi des carrières dans le milieu académique et industriel.

Publications sélectionnées

Bansal a authored plus de 100 articles évalués par des pairs. Parmi les travaux notables figurent des études sur l'entraînement adversarial pour la classification de texte, le pré-entraînement vision-langage et la réponse robuste aux questions. Ses articles collaboratifs avec des étudiants et des collègues ont fait progresser la compréhension de la construction de systèmes d'IA à la fois capables et dignes de confiance.

Ses recherches ont été soutenues par des subventions de la National Science Foundation et de la Defense Advanced Research Projects Agency, entre autres. Il est membre de l'Association for Computational Linguistics et de l'Institute of Electrical and Electronics Engineers.

Liens externes et lectures complémentaires

Pour plus d'informations, les lecteurs peuvent consulter sa page de faculté universitaire et son profil Google Scholar, qui listent les publications et les projets en cours. Le site web de son laboratoire fournit des ressources et du code open-source pour reproduire les résultats.

Références

Cet article est basé sur des informations publiquement disponibles concernant la carrière et les recherches de Mohit Bansal. Les détails de citation spécifiques sont omis pour maintenir la concision, mais les lecteurs intéressés peuvent trouver les sources primaires via des bases de données académiques et son profil universitaire officiel.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-science·natural-language-processing·artificial-intelligence·academic
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique