Jonathan Long est un informaticien et chercheur reconnu pour ses contributions fondamentales à l'apprentissage profond, en particulier dans le domaine de la vision par ordinateur. Il est surtout connu pour avoir développé les réseaux entièrement convolutifs (FCN), une architecture de réseau neuronal qui a révolutionné la segmentation sémantique en permettant une prédiction de bout en bout au niveau du pixel. Ses travaux, menés durant ses études doctorales à l'Université de Californie à Berkeley, ont eu un impact durable sur les architectures et applications ultérieures en compréhension d'images.
Les recherches de Long ont émergé durant une période de progrès rapides en apprentissage profond, lorsque les réseaux de neurones convolutifs étaient principalement utilisés pour la classification d'images. Son intuition a été d'adapter ces réseaux pour produire des sorties spatiales denses, ouvrant ainsi de nouvelles possibilités pour des tâches nécessitant une compréhension détaillée de la scène. Le cadre FCN qu'il a introduit est devenu une pierre angulaire pour des modèles ultérieurs comme U-Net et a influencé de nombreux autres domaines.
Formation
Jonathan Long a effectué ses études de premier cycle à l'Université Carnegie Mellon, où il a acquis de solides bases en informatique et en apprentissage automatique. Il a ensuite rejoint l'Université de Californie à Berkeley pour ses études supérieures, intégrant le laboratoire Berkeley AI Research (BAIR). Sous la direction de conseillers éminents, notamment Alexei Efros et Trevor Darrell, Long s'est concentré sur l'avancement des architectures de réseaux neuronaux pour les tâches de reconnaissance visuelle.
Durant son doctorat, Long a collaboré avec d'autres chercheurs sur des projets faisant le pont entre la théorie et l'application pratique. Sa thèse de doctorat portait sur le développement des réseaux entièrement convolutifs, un sujet qui allait définir sa carrière et influencer toute une génération de recherche en vision par ordinateur.
Réseaux entièrement convolutifs
En 2015, Jonathan Long, avec Evan Shelhamer et Trevor Darrell, a publié l'article fondateur « Fully Convolutional Networks for Semantic Segmentation » lors de la conférence IEEE sur la vision par ordinateur et la reconnaissance de formes (CVPR). Ces travaux ont introduit une architecture novatrice qui remplaçait les couches entièrement connectées des réseaux de classification traditionnels par des couches convolutives, permettant au modèle d'accepter des images d'entrée de toute taille et de produire des cartes de sortie de dimensions correspondantes. L'innovation clé résidait dans l'utilisation de couches de déconvolution (également appelées convolutions transposées) pour suréchantillonner les cartes de caractéristiques grossières jusqu'à la résolution de l'image d'origine, permettant ainsi une prédiction dense au niveau du pixel.
L'architecture FCN a été entraînée de bout en bout à l'aide de fonctions de perte au niveau du pixel, et elle a atteint des résultats de pointe sur des références standard telles que PASCAL VOC et NYUDv2. L'article a démontré que les caractéristiques apprises pour la classification pouvaient être efficacement transférées aux tâches de segmentation, et il a introduit le concept de connexions de saut pour combiner les informations sémantiques des couches profondes avec les détails fins des couches superficielles, améliorant ainsi la précision des contours.
Ces travaux ont joué un rôle déterminant dans le passage des approches par patchs ou par fenêtres glissantes aux modèles entièrement convolutifs, désormais standard en segmentation sémantique. Le cadre FCN a également posé les bases d'architectures ultérieures comme U-Net et les modèles de segmentation basés sur ResNet, et son influence s'étend à la segmentation d'instances et à la détection d'objets.
Contributions et impact
Les contributions de Jonathan Long vont au-delà de l'article sur les FCN. Ses recherches sur les réseaux entièrement convolutifs ont été largement citées et ont inspiré de nombreuses applications dans la conduite autonome, l'imagerie médicale et la télédétection. La capacité à effectuer une prédiction dense de manière efficace a fait des FCN un choix pratique pour les systèmes temps réel, et ils ont été adoptés dans les premières versions de Tesla Autopilot et d'autres systèmes de perception pour véhicules autonomes.
Les travaux de Long ont également contribué à une meilleure compréhension de la manière dont les réseaux de neurones peuvent être conçus pour des tâches à sortie structurée. Son accent sur l'apprentissage de bout en bout et l'utilisation de déconvolutions a influencé les développements ultérieurs dans les modèles génératifs et l'IA générative.
Après avoir terminé son doctorat, Long a poursuivi ses travaux dans le domaine, contribuant à la fois à la recherche académique et aux applications industrielles. Il a été impliqué avec OpenAI et d'autres grandes organisations d'IA, où il a appliqué son expertise aux systèmes d'apprentissage automatique à grande échelle.
Distinctions et reconnaissance
L'article sur les FCN a reçu le prix Test of Time à CVPR en 2020, reconnaissant son impact durable sur la vision par ordinateur. Les travaux de Long ont également été récompensés par plusieurs autres distinctions, notamment des prix du meilleur article lors de conférences majeures. Ses recherches ont été mises en avant dans de nombreux tutoriels et articles de synthèse, consolidant son statut de figure clé dans le développement de l'apprentissage profond pour la vision.
Carrière récente
Ces dernières années, Jonathan Long s'est concentré sur la montée en échelle des modèles d'apprentissage profond et l'exploration de leurs applications dans le traitement du langage naturel et la compréhension multimodale. Il a contribué à des projets impliquant les grands modèles de langage et a travaillé sur l'amélioration de l'efficacité et de la robustesse des réseaux de neurones. Ses intérêts actuels incluent la théorie de l'apprentissage automatique et le développement de systèmes d'IA plus généralistes.
Long reste un membre actif de la communauté de recherche, collaborant fréquemment avec des institutions comme le Stanford AI Lab et le MIT CSAIL. Ses travaux continus repoussent les limites de ce qui est possible avec l'apprentissage profond, et il est considéré comme un leader d'opinion dans le domaine.
Voir aussi
Références
- Long, J., Shelhamer, E., & Darrell, T. (2015). Fully Convolutional Networks for Semantic Segmentation. CVPR.
- Shelhamer, E., Long, J., & Darrell, T. (2017). Fully Convolutional Networks for Semantic Segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence.