Traduit de l'anglais

Jitendra Malik est un informaticien indo-américain et professeur à l'UC Berkeley, connu pour ses recherches pionnières en vision par ordinateur, notamment les contextes de forme, le jeu de données de segmentation de Berkeley et la détection d'objets R-CNN.

Jitendra Malik (né le 11 octobre 1960) est un universitaire indo-américain, professeur Arthur J. Chick de génie électrique et d'informatique à l'Université de Californie à Berkeley. Il est connu pour ses recherches en vision par ordinateur, couvrant la reconnaissance visuelle, la segmentation et la robotique, et a influencé le domaine à la fois par ses contributions techniques et son leadership.

Les travaux de Malik ont fait le pont entre la modélisation computationnelle et la vision biologique, en s'appuyant sur la psychologie et les neurosciences. Il a encadré plus de quatre-vingts étudiants au doctorat et chercheurs postdoctoraux, dont beaucoup dirigent désormais des groupes de recherche académiques et industriels. Ses contributions ont été reconnues par de nombreux prix, notamment le Computer Pioneer Award de l'IEEE Computer Society en 2019.

Biographie académique

Malik est né à Mathura, en Inde, le 11 octobre 1960. Il a terminé sa scolarité à la St. Aloysius Senior Secondary School de Jabalpur. Il a obtenu un BTech en génie électrique à l'Indian Institute of Technology Kanpur en 1980 et un doctorat en informatique à l'Université Stanford en 1985. En janvier 1986, il a rejoint l'UC Berkeley, où il est devenu professeur Arthur J. Chick dans la division des sciences informatiques, département de génie électrique et d'informatique (EECS). Il occupe également des postes de professeur en bioingénierie et dans les groupes de sciences cognitives et de sciences de la vision. Il a été président de la division des sciences informatiques de 2002 à 2004 et président du département EECS de 2004 à 2006 et de 2016 à 2017.

Malik a été chercheur invité chez Google en 2015-2016. Il a ensuite rejoint la recherche fondamentale en IA (FAIR) de Meta, où il a été directeur de recherche et responsable de site à Menlo Park avant de devenir vice-président de la recherche en robotique en 2025. En 2026, il a rejoint Amazon en tant que vice-président et scientifique distingué à son laboratoire Frontier AI and Robotics (FAR) tout en restant affilié à l'UC Berkeley.

Aperçu des recherches

Malik est un leader en vision par ordinateur depuis plusieurs décennies, contribuant à de nombreux résultats fondamentaux. Son approche s'inspire souvent de la psychologie et des neurosciences, contribuant à des modèles computationnels de la vision biologique. Il a formulé les problèmes centraux de la vision par ordinateur comme les « 3R » - reconnaissance, reconstruction et réorganisation - en soulignant leur couplage étroit. Plus récemment, son groupe s'est tourné vers la robotique, apportant des contributions significatives à la navigation et à la locomotion à pattes.

Reconnaissance visuelle

La fin des années 1990 a marqué une transition des techniques géométriques vers les techniques d'apprentissage pour la reconnaissance visuelle. Le groupe de Malik a été pionnier dans les caractéristiques conçues à la main telles que les textons (sorties de filtres quantifiées vectoriellement) et les contextes de forme (arrangements relatifs de points), ainsi que dans de nouvelles techniques d'apprentissage automatique comme les noyaux d'intersection rapides et SVM-KNN. Ces avancées ont permis des performances record sur des tâches telles que la reconnaissance de chiffres manuscrits (2001), le cassage de CAPTCHA (2002), les catégories Caltech101 (2005-07) et la détection de personnes (2009). La méthode du contexte de forme a reçu le prix Helmholtz test-of-time et compte plus de 9 000 citations.

En 2012, le travail « AlexNet » du groupe de Geoff Hinton a lancé la révolution du apprentissage profond. Malik a joué un rôle catalyseur en encourageant Hinton à prouver que l'apprentissage profond fonctionnait mieux en compétitionnant sur des benchmarks standard de reconnaissance visuelle, en particulier ImageNet. Après AlexNet, la communauté est restée sceptique quant à la généralité, car ImageNet ne nécessitait pas de localisation d'objets. Girshick et al ont inventé la méthode R-CNN, qui a prouvé que cela pouvait être fait avec un pré-entraînement sur la classification ImageNet suivi d'un ajustement fin pour la détection d'objets. Cet article, avec plus de 44 000 citations pour sa version CVPR 2014, a reçu le prix Longuet-Higgins test-of-time. Les variantes de R-CNN ont dominé la reconnaissance d'objets pendant près d'une décennie jusqu'à ce qu'elles soient supplantées par les modèles vision-langage.

Segmentation

Le regroupement visuel et la discrimination figure-fond ont été étudiés pour la première fois par l'école de la Gestalt il y a plus d'un siècle. Le groupe de Malik, sur deux décennies (1995-2015), a transformé ce domaine d'une collection hétéroclite de techniques en une science fondée sur l'empirisme. Ils ont créé le Berkeley Segmentation Data Set (BSDS) en utilisant plusieurs observateurs humains pour marquer les frontières perçues, montrant une cohérence avec un modèle hiérarchique de segmentation. L'article BSDS compte plus de 10 000 citations et a reçu le prix Helmholtz test-of-time.

Armés de cet ensemble de données, Malik et al ont développé une rationalisation de divers indices gestaltistes comme « optimaux » si la vision humaine a évolué pour s'adapter aux statistiques du monde naturel. Cela a permis une comparaison quantitative des algorithmes de segmentation, plutôt que des exemples choisis. L'idée de benchmarking sur des ensembles de données standard est devenue une norme, en particulier dans la reconnaissance d'objets menée par Perona (Caltech 101) et Everingham et al (PASCAL VOC).

Impact et héritage

L'influence de Malik s'étend au-delà de ses propres recherches. Il a supervisé plus de quatre-vingts étudiants au doctorat et chercheurs postdoctoraux, dont beaucoup sont devenus des universitaires de premier plan dans des institutions telles que le MIT, l'UC Berkeley, l'Université Carnegie Mellon, l'Université Cornell, l'Université de l'Illinois à Urbana-Champaign, l'Université de Pennsylvanie et l'Université du Michigan, ainsi que des chercheurs industriels chez Google, Meta et d'autres grandes organisations. Ses travaux ont façonné la trajectoire de la vision par ordinateur, de l'ingénierie des caractéristiques précoce à l'ère de l'apprentissage profond, et continuent d'influencer la robotique et l'intelligence artificielle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-vision·artificial-intelligence·indian-american-academics·university-of-california-berkeley
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique