Aus dem Englischen übersetzt

NYU Depth V2 ist ein RGB-D-Datensatz für Innenraumszenen mit 1.449 dicht beschrifteten Bildpaaren und 407.024 unbeschrifteten Frames, der häufig zum Trainieren und Bewerten von Modellen zur Tiefenschätzung und semantischen Segmentierung verwendet wird.

NYU Depth V2 ist ein groß angelegter RGB-D-Datensatz für das Verständnis von Innenräumen, der 2012 von Forschern der New York University veröffentlicht wurde. Er besteht aus Videosequenzen, die mit einem Microsoft-Kinect-Sensor aufgenommen wurden und sowohl Farbbilder (RGB) als auch ausgerichtete Tiefenkarten erfassen. Der Datensatz ist ein Standard-Benchmark für Aufgaben wie monokulare Tiefenschätzung, semantische Segmentierung und Szenenanalyse und hat maßgeblich zur Weiterentwicklung von Deep-Learning-Ansätzen für die Wahrnehmung in Innenräumen beigetragen.

Der Datensatz enthält 1.449 dicht beschriftete Paare von RGB- und Tiefenbildern, bei denen jedes Pixel mit einer von 894 Objektkategorien annotiert ist (später für gängige Benchmarks auf 40 Klassen konsolidiert). Darüber hinaus bietet er 407.024 unbeschriftete Frames aus 464 verschiedenen Innenraumszenen, darunter Räume wie Schlafzimmer, Wohnzimmer, Büros und Küchen. Die Szenen wurden aus der Ich-Perspektive aufgenommen, was eine Person simuliert, die sich durch einen Raum bewegt, wodurch die Daten besonders relevant für Robotik- und Augmented-Reality-Anwendungen sind.

Erfassung und Annotation

Der ursprüngliche NYU-Depth-Datensatz (V1) wurde 2011 veröffentlicht, aber V2 erweiterte die Anzahl der Szenen und verbesserte die Qualität der Annotationen. Die RGB-D-Daten wurden mit einem Kinect-Sensor in einer Auflösung von 640x480 Pixeln für sowohl Farb- als auch Tiefenströme aufgenommen. Die Tiefenkarten wurden mithilfe von strukturiertem Licht erfasst, das metrische Tiefeninformationen in Millimetern liefert. Um die beschriftete Teilmenge zu erstellen, wählten die Forscher Frames aus den Videosequenzen aus und annotierten sie manuell mit einem benutzerdefinierten Werkzeug, wobei jedes Pixel mit einer semantischen Klasse beschriftet wurde. Der Annotationsprozess umfasste mehrere Durchgänge, um Konsistenz zu gewährleisten, und die endgültigen Beschriftungen wurden von menschlichen Prüfern verifiziert.

Benchmark-Aufgaben

NYU Depth V2 wird hauptsächlich für zwei Aufgaben verwendet: Tiefenschätzung und semantische Segmentierung. Für die Tiefenschätzung werden Modelle trainiert, um eine dichte Tiefenkarte aus einem einzelnen RGB-Bild vorherzusagen, mit Bewertungsmetriken wie dem mittleren quadratischen Fehler (RMSE) und dem relativen Fehler. Für die semantische Segmentierung klassifizieren Modelle jedes Pixel in eine der 40 Klassen, mit Metriken wie Pixelgenauigkeit und mittlerer Intersection over Union (mIoU). Der Datensatz unterstützt auch Multi-Task-Lernen, bei dem ein Modell gleichzeitig Tiefe und Semantik vorhersagt, was in modernen Neuronalen-Netzwerk-Architekturen üblich ist.

Auswirkungen auf die Forschung

Seit seiner Veröffentlichung ist NYU Depth V2 ein Eckpfeiler für das Verständnis von Innenräumen. Er wurde in Hunderten von Arbeiten verwendet, darunter frühe Arbeiten zu Encodern auf Basis von Residualnetzwerken und spätere transformerbasierte Modelle. Die Tiefenkarten des Datensatzes wurden auch für 3D-Rekonstruktion und Szenenvervollständigungsaufgaben verwendet. Seine Beliebtheit beruht auf den realistischen Innenraumumgebungen und der Verfügbarkeit sowohl dichter Beschriftungen als auch großer unbeschrifteter Daten, was halbüberwachte und selbstüberwachte Lerntechniken ermöglicht. Forscher haben die unbeschrifteten Frames auch zum Vortraining von Modellen mit Datenaugmentierung und kontrastivem Lernen verwendet.

Einschränkungen und Erweiterungen

Der Datensatz hat bekannte Einschränkungen, wie Sensorrauschen in Tiefenkarten, insbesondere auf reflektierenden oder dunklen Oberflächen, und eine Verzerrung hin zu Wohninnenräumen. Der 40-Klassen-Label-Satz ist grob und fasst viele feinkörnige Kategorien zusammen. Um diese Probleme zu beheben, wurden Erweiterungen wie NYU Depth V2 mit verbesserten Beschriftungen und synthetische Datensätze vorgeschlagen. Trotz dieser Herausforderungen bleibt NYU Depth V2 ein Referenzpunkt für den Vergleich von Innenraumwahrnehmungsalgorithmen, und sein Einfluss erstreckt sich auf kommerzielle Anwendungen in der Robotik und cloudbasierten Sehdiensten von Amazon Web Services.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·computer-vision·depth-estimation·semantic-segmentation
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte