Bildregistrierung ist der rechnerische Prozess, verschiedene Datensätze in ein einheitliches Koordinatensystem zu transformieren. Die Daten können aus mehreren Fotografien, Daten verschiedener Sensoren, aus unterschiedlichen Zeitpunkten oder aus verschiedenen Blickwinkeln stammen. Sie wird in der Computer Vision, der medizinischen Bildgebung, der militärischen automatischen Zielerkennung sowie bei der Zusammenstellung und Analyse von Satellitenbildern und -daten eingesetzt. Die Registrierung ist notwendig, um einen Vergleich oder eine Integration von Daten aus unterschiedlichen Messungen zu ermöglichen, etwa von verschiedenen Sensortypen, zu verschiedenen Zeitpunkten oder aus verschiedenen Blickwinkeln.
Das Ziel der Bildregistrierung ist es, zwei oder mehr Bilder geometrisch auszurichten, typischerweise ein Referenzbild und ein bewegtes (oder erfasstes) Bild, sodass entsprechende Merkmale oder Strukturen übereinstimmen. Der Prozess umfasst die Bestimmung einer räumlichen Transformation, die Punkte vom bewegten Bild auf das Referenzbild abbildet. Diese Transformation kann starr (Translation und Rotation), affin (einschließlich Skalierung und Scherung) oder nicht-starr (deformierbar) sein, abhängig von der Anwendung und der Art der Fehlausrichtung.
Kernschritte und Methoden
Die Bildregistrierung folgt typischerweise einer allgemeinen Pipeline. Zunächst identifiziert die Merkmalserkennung markante Punkte, Kanten oder Regionen in beiden Bildern. Zu den gängigen Merkmalsdetektoren gehören Eckendetektoren wie Harris-Ecken oder SIFT-Schlüsselpunkte (Scale-Invariant Feature Transform). Zweitens stellt die Merkmalszuordnung Korrespondenzen zwischen erkannten Merkmalen her, häufig unter Verwendung von Deskriptoren, die invariant gegenüber Änderungen in Skalierung, Rotation oder Beleuchtung sind. Drittens berechnet die Schätzung des Transformationsmodells die Parameter der gewählten räumlichen Transformation anhand der zugeordneten Korrespondenzen, oft mit robusten Methoden wie RANSAC (Random Sample Consensus), um Ausreißer zu behandeln. Schließlich wenden Bildtransformation und Resampling die geschätzte Transformation auf das bewegte Bild an, wobei Interpolationstechniken wie bilineare oder kubische Interpolation verwendet werden, um die ausgerichtete Ausgabe zu erzeugen.
Alternative Ansätze umfassen intensitätsbasierte (oder flächenbasierte) Methoden, die ein Ähnlichkeitsmaß direkt über die Transformationsparameter optimieren, ohne explizite Merkmalsextraktion. Metriken wie normalisierte Kreuzkorrelation, gegenseitige Information oder Summe der quadratischen Differenzen werden verwendet. Diese Methoden sind besonders nützlich, wenn Merkmale spärlich sind oder wenn Bilder unterschiedliche Modalitäten aufweisen, etwa beim Ausrichten einer Magnetresonanztomographie (MRT)-Aufnahme auf eine Computertomographie (CT)-Aufnahme.
Anwendungen in der medizinischen Bildgebung
In der medizinischen Bildgebung ist die Bildregistrierung entscheidend für die Kombination von Bildern verschiedener Modalitäten (z. B. PET und CT), die Verfolgung von Tumorwachstum über die Zeit oder die Ausrichtung von präoperativen und intraoperativen Bildern für die chirurgische Navigation. Beispielsweise gewährleistet die Registrierung von Planungs-CT-Bildern mit täglichen Kegelstrahl-CT-Bildern in der Strahlentherapie eine präzise Abgabe der Strahlung an das Ziel, während gesundes Gewebe geschont wird. Nicht-starre Registrierung ist oft erforderlich, um Organverformungen, Atembewegungen oder Patientenbewegungen zu berücksichtigen. Techniken wie die U-Net-Architektur, die ursprünglich für die biomedizinische Bildsegmentierung entwickelt wurde, wurden für die auf Deep Learning basierende Registrierung angepasst, bei der neuronale Netze lernen, Deformationsfelder direkt aus Bildpaaren vorherzusagen.
Anwendungen in der Fernerkundung und Computer Vision
In der Fernerkundung registriert die Bildregistrierung Satelliten- oder Luftbilder, die zu verschiedenen Zeitpunkten, von verschiedenen Sensoren oder unter verschiedenen Betrachtungswinkeln aufgenommen wurden. Dies ermöglicht Änderungserkennung, etwa die Überwachung von Stadtentwicklung oder Entwaldung, sowie die Erstellung von Mosaiken großer geografischer Gebiete. Die multimodale Registrierung, etwa das Ausrichten optischer Bilder mit Radarbildern mit synthetischer Apertur (SAR), stellt aufgrund unterschiedlicher Bildeigenschaften eine Herausforderung dar. In der Computer Vision wird die Registrierung beim Panorama-Stitching verwendet, bei dem mehrere überlappende Fotografien ausgerichtet werden, um eine Weitwinkelansicht zu erstellen, sowie in der erweiterten Realität, bei der virtuelle Objekte mit der realen Szene ausgerichtet werden. Sie bildet auch die Grundlage für autonome Fahrzeugsysteme, bei denen Bilder mehrerer Kameras und Sensoren in eine konsistente räumliche Darstellung fusioniert werden müssen.
Deep-Learning-Ansätze
Mit dem Aufkommen des Deep Learning wurden faltende neuronale Netze (CNNs) auf die Bildregistrierung angewendet. Überwachte Methoden trainieren Netze, um Transformationsparameter oder Deformationsfelder aus Bildpaaren vorherzusagen, wobei für das Training Grundwahrheits-Ausrichtungen erforderlich sind. Unüberwachte Methoden, inspiriert von räumlichen Transformationsnetzwerken, verwenden einen differenzierbaren Bildabtaster, um das bewegte Bild zu verformen und einen Ähnlichkeitsverlust, wie normalisierte Kreuzkorrelation, zu minimieren, ohne dass Grundwahrheits-Labels benötigt werden. Diese Ansätze können zur Inferenzzeit schneller sein und komplexe nicht-starre Verformungen bewältigen. Sie erfordern jedoch oft große Mengen an Trainingsdaten und generalisieren möglicherweise nicht gut auf unbekannte Anatomien oder Sensortypen. Hybride Methoden kombinieren klassische Optimierung mit Deep Learning, beispielsweise durch die Verwendung eines Netzes zur Initialisierung der Transformation oder zur Regularisierung des Deformationsfelds.
Herausforderungen und zukünftige Richtungen
Die Bildregistrierung bleibt aufgrund von Faktoren wie großen Verformungen, Okklusionen, Intensitätsschwankungen und multimodalen Unterschieden herausfordernd. Die Robustheit gegenüber Rauschen und Ausreißern ist ein anhaltendes Anliegen. Zukünftige Richtungen umfassen die Verwendung von Transformer-basierten Architekturen zur Erfassung langreichweitiger Abhängigkeiten sowie die Integration der Registrierung mit anderen Aufgaben wie Segmentierung oder Klassifikation in einem gemeinsamen Rahmen. Die Entwicklung großer Datensätze und standardisierter Bewertungsmetriken treibt weiterhin den Fortschritt voran. Mitte der 2020er Jahre werden Deep-Learning-basierte Methoden zunehmend in klinischen und industriellen Umgebungen übernommen, obwohl klassische Methoden aufgrund ihrer Interpretierbarkeit und ihres geringen Datenbedarfs weiterhin wertvoll bleiben.
Siehe auch
- Computer Vision
- Medizinische Bildgebung
- Fernerkundung
- Räumliches Transformationsnetzwerk