Ein Bildmoment ist ein statistisches Maß, das aus den Pixelintensitäten eines digitalen Bildes berechnet wird. Es stellt einen gewichteten Durchschnitt der Pixelwerte dar und ergibt eine Reihe von Skalarwerten, die die geometrischen Eigenschaften des Bildes beschreiben, wie Fläche, Schwerpunkt, Orientierung und Formkomplexität. Momente sind invariant gegenüber bestimmten Transformationen (z. B. Translation, Rotation, Skalierung), wenn sie entsprechend normalisiert werden, was sie für eine robuste Bildanalyse wertvoll macht. Sie dienen als grundlegendes Werkzeug in der Computer Vision und ermöglichen eine effiziente Darstellung und den Vergleich visueller Muster, ohne dass ein pixelweiser Abgleich erforderlich ist.
Bildmomente werden typischerweise aus Binär- oder Graustufenbildern berechnet, wobei jedes Pixel einen Intensitätswert hat. Für ein digitales Bild mit der Intensitätsfunktion \(I(x, y)\) ist das rohe Moment der Ordnung \((p+q)\) als die Summe über alle Pixel von \(x^p y^q I(x, y)\) definiert. Diese rohen Momente erfassen die Verteilung der Intensität im Bild. Da rohe Momente jedoch von der Position des Bildes abhängen, werden häufig zentrale Momente verwendet; sie werden relativ zum Schwerpunkt des Bildes berechnet und bieten Translationsinvarianz. Eine weitere Normalisierung ergibt skalierungsinvariante Momente, und Kombinationen zentraler Momente können rotationsinvariante Deskriptoren erzeugen, wie die sieben invarianten Momente von Hu, die 1962 eingeführt wurden.
Das Konzept der Bildmomente hat Wurzeln in der Wahrscheinlichkeitstheorie und Mechanik, wo Momente Massenverteilungen beschreiben. In der Bildverarbeitung wurden sie in den 1960er- und 1970er-Jahren für die Formanalyse populär. Seitdem sind sie zu einer Standardtechnik in Bereichen wie Objekterkennung, Zeichenerkennung und medizinischer Bildgebung geworden. Ihre rechnerische Einfachheit und geringe Dimensionalität machen sie für Echtzeitanwendungen geeignet, obwohl sie im Vergleich zu komplexeren Merkmalen wie denen aus dem Deep Learning feine Details verlieren können.
Anwendungen in der Computer Vision
Bildmomente werden in der Computer Vision umfassend für Aufgaben eingesetzt, die Formbeschreibung und -abgleich erfordern. Beispielsweise helfen Momente in der optischen Zeichenerkennung (OCR), Buchstaben und Ziffern anhand ihrer geometrischen Eigenschaften zu identifizieren. In der industriellen Inspektion überprüfen sie das Vorhandensein oder Fehlen von Defekten, indem sie Momente eines gefertigten Teils mit einer Referenz vergleichen. Momente ermöglichen auch die Objektverfolgung in Videosequenzen, wobei der Schwerpunkt (abgeleitet aus Momenten erster Ordnung) einen stabilen Punkt zum Verfolgen bietet. Darüber hinaus werden sie bei der Bildregistrierung verwendet, bei der das Ausrichten von Bildern derselben Szene die Schätzung von Translation und Rotation erfordert, die aus Momenten abgeleitet werden können.
Momenttypen und Eigenschaften
Es gibt verschiedene Arten von Momenten, jede mit unterschiedlichen Eigenschaften. Rohe Momente sind die einfachsten, aber nicht invariant gegenüber Transformationen. Zentrale Momente, die relativ zum Schwerpunkt definiert sind, sind translationsinvariant. Normalisierte zentrale Momente, die durch die Fläche (nulltes Moment) skaliert werden, bieten Skalierungsinvarianz. Die Momente von Hu, sieben nichtlineare Kombinationen normalisierter zentraler Momente, sind invariant gegenüber Translation, Skalierung und Rotation, was sie für die Formerkennung beliebt macht. Zernike-Momente, die 1980 eingeführt wurden, verwenden orthogonale Polynome über einer Einheitsscheibe und bieten eine bessere Rauschresistenz und geringere Informationsredundanz. Legendre-Momente, die auf Legendre-Polynomen basieren, bieten ebenfalls orthogonale Deskriptoren. Diese fortgeschrittenen Momente erfassen Details höherer Ordnung und ermöglichen eine diskriminierendere Formanalyse.
Berechnung und Implementierung
Die Berechnung von Bildmomenten ist unkompliziert und effizient. Für ein diskretes Bild wird das rohe Moment der Ordnung \((p+q)\) berechnet, indem über alle Pixel iteriert und \(x^p y^q\) mal der Intensität summiert wird. Der Schwerpunkt wird aus den Momenten erster Ordnung erhalten: \(\bar{x} = m_{10}/m_{00}\) und \(\bar{y} = m_{01}/m_{00}\), wobei \(m_{00}\) die Gesamtintensität (Fläche bei Binärbildern) ist. Zentrale Momente werden dann relativ zu diesem Schwerpunkt berechnet. In der Praxis werden Momente oft mithilfe von Integralbildern (Summed-Area-Tabellen) berechnet, um eine konstante Zeitberechnung für beliebige rechteckige Regionen zu erreichen, was für die Echtzeitverarbeitung vorteilhaft ist. Bibliotheken wie OpenCV bieten integrierte Funktionen für die Momentberechnung, was ihre Verwendung in Anwendungen vereinfacht.
Beziehung zum modernen maschinellen Lernen
Obwohl Bildmomente klassische Techniken sind, bleiben sie im Zeitalter des maschinellen Lernens und Deep Learnings relevant. Sie werden manchmal als handgefertigte Merkmale in traditionellen Klassifikatoren oder als Vorverarbeitungsschritte verwendet, um Bilder zu normalisieren, bevor sie in neuronale Netze eingespeist werden. Beispielsweise können Momente helfen, Bilder auf eine Standardorientierung auszurichten oder zuzuschneiden, was die Leistung von Systemen auf Basis faltender neuronaler Netze (CNN) verbessert. Deep-Learning-Modelle wie Residualnetzwerke und U-Net lernen jedoch typischerweise Merkmale direkt aus Rohpixeln, wodurch die Notwendigkeit einer expliziten Momentberechnung reduziert wird. Dennoch sind Momente weiterhin für die Interpretierbarkeit wertvoll, da sie intuitive geometrische Zusammenfassungen bieten, die gelernte Darstellungen ergänzen können. In hybriden Ansätzen können Momente mit gelernten Merkmalen kombiniert werden, um die Robustheit zu verbessern, insbesondere in Szenarien mit begrenzten Trainingsdaten.
Einschränkungen und Erweiterungen
Bildmomente haben Einschränkungen. Sie sind globale Deskriptoren, das heißt, sie fassen das gesamte Bild zusammen, was lokale Variationen verdecken kann. Für komplexe Szenen mit mehreren Objekten sind Momente des gesamten Bildes nicht aussagekräftig; stattdessen werden Momente pro verbundener Komponente nach der Segmentierung berechnet. Darüber hinaus sind Momente empfindlich gegenüber Rauschen, insbesondere solche höherer Ordnung, die Intensitätsschwankungen verstärken. Um dies zu mildern, werden in verrauschten Umgebungen orthogonale Momente wie Zernike bevorzugt. Zu den Erweiterungen gehören Farbmomente, die Momente über Farbkanäle berechnen, und Wavelet-Momente, die Momente mit Mehrskalenanalyse kombinieren. Diese Varianten erweitern die Anwendbarkeit von Momenten auf Farbbilder und Mehrskalenanalyse.
Zusammenfassend bieten Bildmomente eine kompakte, mathematisch fundierte Möglichkeit, Bildformen und -verteilungen zu beschreiben. Ihre Invarianzeigenschaften und rechnerische Effizienz haben ihre fortgesetzte Verwendung in der Computer Vision sichergestellt, selbst während sich moderne Methoden der künstlichen Intelligenz weiterentwickeln. Sie dienen als Brücke zwischen klassischer Bildanalyse und zeitgenössischen lernbasierten Ansätzen und bieten ein einfaches, aber leistungsfähiges Werkzeug für das geometrische Verständnis.