La fusion d'images est une technique informatique qui intègre des informations complémentaires provenant de deux ou plusieurs images sources d'une même scène en une seule image composite. L'objectif est de produire une sortie plus informative et mieux adaptée à la perception visuelle humaine ou à une analyse automatisée ultérieure que n'importe quelle image d'entrée individuelle. Le processus implique généralement l'alignement des images sources (mise en correspondance) puis l'application d'une règle de fusion au niveau des pixels, des caractéristiques ou des décisions. Les applications couvrent la télédétection, le diagnostic médical, la surveillance et la photographie, où des données multi-capteurs ou multi-expositions sont courantes.
Le concept découle du traitement du signal et de la vision par ordinateur, avec des travaux précoces remontant aux années 1980. Les approches modernes exploitent l'apprentissage profond, notamment les réseaux de neurones convolutionnels et les architectures à base de transformeurs, pour apprendre des stratégies de fusion optimales à partir de données. La fusion d'images se distingue de l'assemblage d'images (qui crée un champ de vision plus large) et de la composition d'images (qui atténue les transitions), la première se concentrant sur l'extraction d'informations plutôt que sur un alignement géométrique seul.
Méthodes de fusion au niveau des pixels
La fusion au niveau des pixels opère directement sur les valeurs d'intensité des images alignées. Les techniques les plus simples incluent la moyenne, où chaque pixel de sortie est la moyenne des pixels d'entrée correspondants, et la moyenne pondérée, où les poids sont choisis en fonction de métriques comme le contraste local ou la netteté. Des méthodes plus avancées utilisent des transformations multi-échelles telles que la pyramide laplacienne ou la transformée en ondelettes discrète. Dans ces méthodes, les images sont décomposées en bandes de fréquences, et des règles de fusion sélectionnent des coefficients avec une activité maximale (par exemple, la valeur absolue la plus élevée) par bande, puis reconstruisent la composite. Ces méthodes conservent mieux les contours et les détails que le simple moyennage, mais elles peuvent introduire des artefacts si la décomposition et la reconstruction ne sont pas parfaitement adaptées.
Pour la fusion multi-exposition, où les images varient en luminosité, les méthodes au niveau des pixels calculent souvent une carte de qualité (par exemple, basée sur la saturation, le contraste et la bonne exposition) pour guider la sélection des poids. Cela est courant dans la photographie grand public pour l'imagerie à grande plage dynamique au sein de la gamme dynamique élevée (IMDERE).
Fusion au niveau des caractéristiques et au niveau des décisions
La fusion au niveau des caractéristiques extrait des attributs saillants de chaque image source, tels que des bords, des coins ou des descripteurs de texture, et les combine en un vecteur de caractéristiques commun. Ce vecteur est ensuite utilisé pour des tâches de classification ou de segmentation. Par exemple, en télédétection géographique, la réduction de plage dynamique optique fusionne une image panchromatique à haute résolution avec une image multispectrale plus basse, en injectant des détails spatiaux de la première dans la seconde, souvent au niveau des caractéristiques. La fusion au niveau des décisions, connue sous le nom de fusion sémantique, combine les sorties de classifieurs ou détecteurs multiples, chacun opérant sur une source différente. Les méthodes incluent le vote majoritaire, l3inférence bayésienne8 ou avec la théorie de Dempster-Schafer. Ce niveau est robuste face au bruit de capteur, mais exige que chaque source fournisse une décision significative.
Approches d'apprentissageapprentissage
Depuis le milieu des années 2010, l'approxiongissement profond a dominé la recherche en fusion d'images. Les réseaux de neuronesconvolutifs (CNN) sont0 utilisés pour apprendre des règles de fusion directement à partir de données d'apprentissage appairées. Une architecture typique se compose d'un encodeur qui extrait les caractéristiques de chaque d'entrée, d'une couche de fusion qui combine ces caractéristiques (par exemple, via une addition par élément ou des mécanismes d'attention), et d'un décodeur qui reconstruit l'image fusionnée. L'architecture U-Net originale, développée pour la segmentation biomédicale, est fréquemment adaptée pour fusion en raison de son extraction de caractéristiques multi-échelles et ses connexions de contour préservant les détails fins.
Plus récemment, des modèles à base de transformeurs transformeur qui reposent sur le attention multi-têtes traitent les objets, ont été appliquées pour capturer des dépendances à long terme dans les images. Ces modèles traitent les sous-parties d'images comme des jetons et apprennent un contexte global, ce qui peut améliorer la qualité de fusion pour des scènes avec de grandes régions uniformes du grandes textures complexes (par exemple, des larges zones de textures). L'apprentissage utilise typiquement des fonctions de perte qui ssenient une fidélité aux images sources (par exemple, l'erreur de quadratique moyenne) à pour la qualité perceptuelle (par exemple, l'indice de structuration visible). Certaines méthodes utilisent des réseaux antagonistes génératifs génératifs pour produire des sorties visuellement réalistes, bien que cela ajoute une instabilité d'entraînement.
Applications et Enjeux
En télédétection, la fusion d'images est critique pour la pan-sharpening des images satellitaires, combinant des données optiques et radar (par exemple de Sentinel-1 et Sentinel-2), et pour la de détection de changements -pour-surveillance. Dans l'imagerie médicale, cette technique fait fusionner la tomodensitométrie (CT) et l'imagerie par résonance magnétique (IRM) scans4 pour fournir à les informations anatomiques et fonctionnelles, aidant au diagnostic et à la planification chirurgicale. La fusion des images de visible et de lumière infrarouge résultant de la vidéosurveillance marque une forte pour obtenir une détection améliorée dans des conditions de faible éclairage ou totales.
Commerce et Robots mobiles utilisent des systèmes de caméra, lidar et radar de leur avion sous la droite.
Les challenges principaux sont l'écorrection entre les sources, les résolutions multiples et le compromis entre détail spatial et la fidélité spectrale. Dans la visualisation de fusions, il est rarement fait mention d'une référence de vérité de terrain ; on utilise des des mesures telles que l'informationmutuelle, mesures comme règles comme l'information de contours, la découverte, les la qualité structurelle de visuelle bilan (QIV) pour la description de la ou des indicateurs de qualité, bien que une inspection subjective reste courante. À partir du début des années 2020, quand il s'agit de points de vue, aucune méthode représente the method outperforms.
Relation avec l'IA plus large
L’imagerie de fusion est un sous-domaine de la vision par ordinateur qui est étroitement liée à apprentissage automatique et xprontal et ainsi d’Reprise. Elle ,
Partage des techniques avec augmentation de données, qui combinent ou modifient également des images pour améliorer la robustesse des modèles. Le développement des algorithme deept de fusion découle des advantages assisted by via l’architecture réseaux de neurones et méthodes d’entraînement telles que réseaux résiduels et normalisation par audit permettent La Existence des algorithmesqui. De plus, des projets de style [[mit-csail|]] recherche au MIT CSAIL et le laboratoire IA de Stanford avancés établissent des contributions de thèse mais début Notations syntaxe et la structure . Mention à Ces champs. exemple .
Fiches : Google Deep (par mediateure. etc). Un exempleMémoire.
Développements futurs
Vers la suite à apporter. Démarchologie et à fusion avec grands modèles de langage pour comprendre la modalitésustatique, où la fusion d'images est intégrée à descriptions iconiques pour générer des constructions plus robustes de lanterne. La fusion en temps réel sur des périphériques périphériques reste bien prioritaire, Promotion par des architectes efficients et vecteur accélérateurs memory entraîneur (IA) Soit.
Et en méthode de la Reunifor sans supervision RTLing'algs de CLA appréciation.
L’intégration aux as imagerie float céré©-génératifs à voir être présent : pré- assemblé dé CRC.
:
​,
Le Ciel.
Résumé finalité-paix
Autrui propose mode Plus en Toute chose: pipeline. tracés dans une analyze transversale, export de une bon rample Ecop.
Gérer le délit de récap.