La formation d'image est le processus physique et mathématique par lequel la lumière réfléchie ou émise par des objets dans une scène tridimensionnelle est capturée pour produire une image bidimensionnelle. Ce processus est central pour la photographie, la cinématographie, l'imagerie médicale et les systèmes de vision par ordinateur. Il implique l'interaction de la lumière avec des éléments optiques, tels que les lentilles et les ouvertures, et la conversion de l'énergie lumineuse en un signal numérique ou analogique par un capteur. Comprendre la formation d'image est essentiel pour concevoir des caméras, interpréter des images et développer des algorithmes pour des tâches comme la détection d'objets et la reconstruction de scènes.
L'étude de la formation d'image s'appuie sur l'optique géométrique, qui décrit comment les rayons lumineux se propagent et se réfractent à travers les lentilles, et la radiométrie, qui quantifie l'énergie de la lumière. Un modèle complet de formation d'image tient compte des paramètres intrinsèques de la caméra (distance focale, point principal, distorsion de lentille) et des paramètres extrinsèques (position et orientation dans l'espace). Ces paramètres mappent les coordonnées du monde 3D aux coordonnées d'image 2D, une transformation souvent représentée par un modèle de caméra sténopé. Les caméras réelles s'écartent de ce modèle idéal en raison des aberrations de lentille, de la diffraction et du bruit du capteur, qui sont corrigés ou modélisés dans les pipelines d'imagerie avancés.
Principes optiques
Le modèle de caméra sténopé est la représentation la plus simple de la formation d'image, où la lumière passe à travers une petite ouverture et projette une image inversée sur un plan. Une lentille réelle remplace le sténopé pour collecter plus de lumière et la focaliser, en utilisant la réfraction pour faire converger les rayons d'une source ponctuelle vers un point unique sur le capteur. La distance focale détermine le grossissement et le champ de vision ; des distances focales plus courtes produisent des angles plus larges, tandis que des distances focales plus longues agrandissent les objets distants. La taille de l'ouverture contrôle la quantité de lumière et la profondeur de champ, avec des ouvertures plus petites augmentant la netteté sur une plus grande plage mais réduisant la luminosité. La diffraction, causée par la nature ondulatoire de la lumière, limite la résolution à de très petites ouvertures.
Facteurs radiométriques et photométriques
La radiométrie décrit le transfert d'énergie des sources lumineuses vers le capteur. L'éclairement à chaque pixel du capteur dépend de la réflectance de la scène, de l'intensité de l'éclairage et de l'efficacité de transmission du système optique. La fonction de distribution de réflectance bidirectionnelle (BRDF) caractérise comment une surface réfléchit la lumière en fonction des angles d'incidence et de visée, influençant l'ombrage et l'apparence. Les effets photométriques incluent le vignettage, où les bords de l'image sont plus sombres en raison d'une collecte de lumière réduite, et le flare de lentille, causé par des réflexions internes. La réponse du capteur, souvent modélisée comme une fonction linéaire ou corrigée en gamma, convertit les photons incidents en valeurs numériques, avec un bruit provenant du bruit de photons (shot noise) et du bruit de lecture électronique.
Transformation géométrique
La formation d'image mappe les points 3D aux coordonnées 2D à travers une série de transformations : coordonnées du monde aux coordonnées de la caméra (rotation et translation de corps rigide), plan de la caméra au plan image (projection perspective), et plan image aux coordonnées de pixel (mise à l'échelle et translation). Cela est exprimé comme une matrice de projection 3x4 en coordonnées homogènes. La distorsion de lentille, en particulier les composantes radiales et tangentielles, déforme la projection idéale et est corrigée à l'aide de paramètres de calibration. Pour les systèmes multi-caméras, la géométrie épipolaire décrit la relation entre les points correspondants à travers les vues, permettant l'estimation de profondeur et la reconstruction 3D.
Capteur numérique et échantillonnage
Les caméras numériques modernes utilisent des capteurs à dispositif à transfert de charge (CCD) ou à semi-conducteur à oxyde métallique complémentaire (CMOS), qui convertissent les photons en charges électriques. Chaque élément du capteur (pixel) intègre la lumière sur un temps d'exposition, et un réseau de filtres de couleur (comme un motif de Bayer) échantillonne les longueurs d'onde rouge, verte et bleue. La mosaïque résultante est dématricée pour produire une image en couleur complète. La théorie de l'échantillonnage, régie par le théorème de Nyquist-Shannon, stipule que la résolution spatiale du capteur doit être au moins deux fois la fréquence spatiale la plus élevée de la scène pour éviter le crénelage. Des filtres anti-crénelage, placés avant le capteur, floutent les détails à haute fréquence pour empêcher les motifs de moiré.
Applications en vision par ordinateur et IA
Les modèles de formation d'image sont fondamentaux pour la vision par ordinateur. La calibration de caméra, qui estime les paramètres intrinsèques et extrinsèques, est un prérequis pour des tâches comme la structure à partir du mouvement et la localisation et cartographie simultanées (SLAM). Dans intelligence artificielle et apprentissage automatique, la génération d'images synthétiques repose sur un rendu précis de la formation d'image pour créer des données d'entraînement pour les modèles réseau de neurones. Des techniques comme augmentation de données simulent des variations d'éclairage, de point de vue et de bruit de capteur pour améliorer la robustesse des modèles. Les architectures apprentissage profond, telles que réseau résiduel et U-Net, supposent souvent un modèle de formation d'image direct lors du traitement d'images pour des tâches comme le débruitage, la super-résolution et la prédiction de profondeur. La recherche dans des institutions comme MIT CSAIL et Berkeley AI Research continue d'affiner ces modèles pour des applications dans la conduite autonome, l'imagerie médicale et la réalité augmentée.
Développement historique
Le concept de formation d'image remonte aux observations de la camera obscura, où la lumière à travers un petit trou projetait une scène inversée. Le développement des lentilles photographiques au 19e siècle, initié par des figures comme Joseph Petzval, a amélioré la netteté et la collecte de lumière. Le 20e siècle a vu l'invention des capteurs électroniques, avec le CCD développé chez Bell Labs en 1969 par Willard Boyle et George Smith. L'imagerie numérique s'est généralisée dans les années 1990, et la photographie computationnelle, qui combine l'optique avec des algorithmes de post-traitement, a émergé dans les années 2000. Aujourd'hui, les modèles de formation d'image sont intégrés dans les systèmes IA générative qui synthétisent des images photoréalistes, s'appuyant sur les mêmes principes physiques qui régissent les caméras réelles.