Traducido del inglés

Jitendra Malik es un científico informático indio-estadounidense y profesor en UC Berkeley, conocido por su investigación pionera en visión por computadora, incluidos los contextos de forma, el Conjunto de Datos de Segmentación de Berkeley y la detección de objetos R-CNN.

Jitendra Malik (nacido el 11 de octubre de 1960) es un académico indio-estadounidense que ocupa la cátedra Arthur J. Chick de Ingeniería Eléctrica y Ciencias de la Computación en la Universidad de California, Berkeley. Es conocido por su investigación en visión por computadora, que abarca el reconocimiento visual, la segmentación y la robótica, y ha influido en el campo tanto a través de contribuciones técnicas como de liderazgo.

El trabajo de Malik ha tendido puentes entre el modelado computacional y la visión biológica, basándose en la psicología y la neurociencia. Ha sido mentor de más de ochenta estudiantes de doctorado e investigadores posdoctorales, muchos de los cuales ahora lideran grupos de investigación académicos e industriales. Sus contribuciones han sido reconocidas con numerosos premios, incluido el Premio Pionero de la Computación de la Sociedad de Computación del IEEE en 2019.

Biografía académica

Malik nació en Mathura, India, el 11 de octubre de 1960. Completou su educación escolar en la Escuela Secundaria Superior St. Aloysius en Jabalpur. Obtuvo un título de BTech en ingeniería eléctrica del Instituto Indio de Tecnología Kanpur en 1980 y un doctorado en ciencias de la computación de la Universidad de Stanford en 1985. En enero de 1986, se unió a UC Berkeley, donde se convirtió en el Profesor Arthur J. Chick en la División de Ciencias de la Computación, Departamento de Ingeniería Eléctrica y Ciencias de la Computación (EECS). También ocupa nombramientos docentes en bioingeniería y en los grupos de Ciencia Cognitiva y Ciencia de la Visión. Se desempeñó como presidente de la División de Ciencias de la Computación de 2002 a 2004 y como presidente del departamento de EECS de 2004 a 2006 y de 2016 a 2017.

Malik fue investigador científico visitante en Google durante 2015-2016. Posteriormente, se unió a la Investigación Fundamental de IA (FAIR) de Meta, sirviendo como Director de Investigación y Líder de Sitio en Menlo Park antes de convertirse en Vicepresidente de Investigación en Robótica en 2025. En 2026, se unió a Amazon como Vicepresidente y Científico Distinguido en su laboratorio de IA y Robótica de Frontera (FAR), mientras permanecía afiliado a UC Berkeley.

Resumen de investigación

Malik ha sido un líder en visión por computadora durante varias décadas, contribuyendo a muchos resultados fundamentales. Su enfoque comúnmente se inspira en la psicología y la neurociencia, contribuyendo a modelos computacionales de visión biológica. Enmarcó los problemas centrales de la visión por computadora como las "3R" - reconocimiento, reconstrucción y reorganización - enfatizando su estrecho acoplamiento. Más recientemente, su grupo se ha orientado hacia la robótica, realizando contribuciones significativas a la navegación y la locomoción con patas.

Reconocimiento visual

A finales de la década de 1990 se marcó una transición de técnicas geométricas a técnicas de aprendizaje para el reconocimiento visual. El grupo de Malik fue pionero en características diseñadas a mano, como textones (salidas de filtros cuantificadas vectorialmente) y contextos de forma (arreglos relativos de puntos), así como en nuevas técnicas de aprendizaje automático como núcleos de intersección rápida y SVM-KNN. Estas permitieron un rendimiento récord mundial en tareas que incluyen el reconocimiento de dígitos manuscritos (2001), la ruptura de CAPTCHAs (2002), las categorías Caltech101 (2005-07) y la detección de personas (2009). El método de contexto de forma recibió el premio Helmholtz de prueba de tiempo y tiene más de 9,000 citas.

En 2012, el trabajo "AlexNet" del grupo de Geoff Hinton lanzó la revolución del Deep learning. Malik desempeñó un papel catalizador al alentar a Hinton a demostrar que el aprendizaje profundo funcionaba mejor compitiendo en puntos de referencia estándar de reconocimiento visual, específicamente ImageNet. Después de AlexNet, la comunidad permaneció escéptica sobre la generalidad, ya que ImageNet no requería localización de objetos. Girshick et al inventaron el método R-CNN, que demostró que esto podía lograrse con un preentrenamiento en la clasificación de ImageNet seguido de un ajuste fino para la detección de objetos. Este artículo, con más de 44,000 citas para su versión CVPR 2014, recibió el premio Longuet-Higgins de prueba de tiempo. Las variantes de R-CNN dominaron el reconocimiento de objetos durante casi una década hasta que fueron superadas por los modelos de visión y lenguaje.

Segmentación

La agrupación visual y la discriminación figura-fondo fueron estudiadas por primera vez por la escuela Gestalt hace más de un siglo. El grupo de Malik, durante dos décadas (1995-2015), transformó el área de una colección miscelánea de técnicas a una ciencia basada empíricamente. Crearon el Conjunto de Datos de Segmentación de Berkeley (BSDS) utilizando múltiples observadores humanos para marcar límites percibidos, mostrando consistencia con un modelo jerárquico de segmentación. El artículo de BSDS tiene más de 10,000 citas y recibió el premio Helmholtz de prueba de tiempo.

Armados con este conjunto de datos, Malik et al desarrollaron una racionalización para varias señales gestálticas como "óptimas" si la visión humana evolucionó para ser adaptativa a las estadísticas del mundo natural. Esto permitió una comparación cuantitativa de algoritmos de segmentación, en lugar de ejemplos seleccionados a dedo. La idea de evaluar en conjuntos de datos estándar se convirtió en una norma, particularmente en el reconocimiento de objetos liderado por Perona (Caltech 101) y Everingham et al (PASCAL VOC).

Impacto y legado

La influencia de Malik se extiende más allá de su propia investigación. Ha supervisado a más de ochenta estudiantes de doctorado e investigadores posdoctorales, muchos de los cuales se han convertido en académicos líderes en instituciones como MIT, UC Berkeley, la Universidad Carnegie Mellon, la Universidad de Cornell, la Universidad de Illinois Urbana-Champaign, la Universidad de Pensilvania y la Universidad de Michigan, así como investigadores industriales en Google, Meta y otras organizaciones importantes. Su trabajo ha moldeado la trayectoria de la visión por computadora, desde la ingeniería de características temprana hasta la era del aprendizaje profundo, y continúa influyendo en la robótica y la inteligencia artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·artificial-intelligence·indian-american-academics·university-of-california-berkeley
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial