Jitendra Malik(生于1960年10月11日)是一位印度裔美国学者,现任加州大学伯克利分校电气工程与计算机科学系的Arthur J. Chick教授。他以在计算机视觉领域的研究而闻名,涵盖视觉识别、分割和机器人技术,并通过技术贡献和领导力影响了该领域。
Malik的工作架起了计算建模与生物视觉之间的桥梁,借鉴了心理学和神经科学。他指导了八十多名博士生和博士后研究员,其中许多人如今领导着学术和工业研究团队。他的贡献获得了众多奖项的认可,包括2019年IEEE计算机学会计算机先驱奖。
学术传记
Malik于1960年10月11日出生在印度马图拉。他在贾巴尔普尔的圣阿洛伊修斯高级中学完成了学业。他于1980年获得印度理工学院坎普尔分校的电气工程学士学位,并于1985年获得斯坦福大学的计算机科学博士学位。1986年1月,他加入加州大学伯克利分校,成为电气工程与计算机科学系(EECS)计算机科学部的Arthur J. Chick教授。他还在生物工程以及认知科学和视觉科学小组担任教职。他于2002年至2004年担任计算机科学部主任,并于2004年至2006年及2016年至2017年担任EECS系主任。
Malik在2015年至2016年期间是谷歌的访问研究科学家。他后来加入Meta的基础人工智能研究(FAIR)部门,担任门洛帕克的研究总监和站点负责人,之后于2025年成为机器人研究副总裁。2026年,他加入亚马逊,担任其前沿人工智能与机器人(FAR)实验室的副总裁和杰出科学家,同时保持与加州大学伯克利分校的关联。
研究概述
Malik在计算机视觉领域担任领导者数十年,为许多基础性成果做出了贡献。他的方法通常从心理学和神经科学中汲取灵感,促进了生物视觉计算模型的发展。他将计算机视觉的核心问题定义为“3R”,,识别、重建和重组,并强调它们之间的紧密耦合。近年来,他的团队转向机器人技术,在导航和腿式运动方面做出了重要贡献。
视觉识别
1990年代末标志着视觉识别从几何方法向学习技术的转变。Malik的团队开创了手工设计的特征,如纹理基元(矢量量化的滤波器输出)和形状上下文(点的相对排列),以及新颖的机器学习技术,如快速交集核和SVM-KNN。这些技术在包括手写数字识别(2001年)、破解CAPTCHA(2002年)、Caltech101类别(2005-07年)和人检测(2009年)等任务上取得了世界纪录的性能。形状上下文方法获得了Helmholtz时间检验奖,并被引用超过9000次。
2012年,Geoff Hinton团队的“AlexNet”工作引发了深度学习革命。Malik通过鼓励Hinton在标准视觉识别基准(特别是ImageNet)上竞争以证明深度学习的优越性,发挥了催化作用。在AlexNet之后,社区对通用性仍持怀疑态度,因为ImageNet不需要对象定位。Girshick等人发明了R-CNN方法,证明了可以通过在ImageNet分类上进行预训练,然后针对对象检测进行微调来实现这一目标。这篇论文的CVPR 2014版本被引用超过44000次,获得了Longuet-Higgins时间检验奖。R-CNN变体主导对象识别近十年,直到被视觉-语言模型取代。
分割
视觉分组和图形-背景区分在一个多世纪前由格式塔学派首次研究。Malik的团队在二十年(1995-2015年)间将该领域从杂七杂八的技术集合转变为一门基于经验主义的科学。他们创建了伯克利分割数据集(BSDS),使用多位人类观察者标记感知到的边界,显示了与层次分割模型的一致性。BSDS论文被引用超过10000次,并获得了Helmholtz时间检验奖。
凭借这一数据集,Malik等人为各种格式塔线索提供了“最优”的合理化解释,前提是人类视觉进化以适应自然世界的统计特性。这使得分割算法能够进行定量比较,而不是挑选示例。在标准数据集上进行基准测试的想法成为一种规范,特别是在Perona(Caltech 101)和Everingham等人(PASCAL VOC)领导的物体识别领域。
影响与遗产
Malik的影响力超出了他自己的研究。他指导了八十多名博士生和博士后研究员,其中许多人已成为麻省理工学院、加州大学伯克利分校、卡内基梅隆大学、康奈尔大学、伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学和密歇根大学等机构的领先学者,以及谷歌、Meta和其他主要组织的工业研究员。他的工作塑造了计算机视觉的发展轨迹,从早期特征工程到深度学习时代,并继续影响机器人技术和人工智能。