Aus dem Englischen übersetzt

SUN397 ist ein Benchmark-Datensatz zur Szenenerkennung, der 108.754 Bilder aus 397 Szenenkategorien umfasst und häufig zur Bewertung von Computervisionsalgorithmen verwendet wird.

SUN397 ist ein groß angelegter Datensatz zur Szenenerkennung, der 2010 von Forschern des MIT Computer Science and Artificial Intelligence Laboratory und der Princeton University eingeführt wurde. Er enthält 108.754 Bilder, die auf 397 verschiedene Szenenkategorien verteilt sind, und ist damit eine der umfassendsten Ressourcen zur Bewertung von Algorithmen, die Bilder nach der Art der dargestellten Umgebung klassifizieren, wie etwa ein Schlafzimmer, ein Skigebiet oder eine Bibliothek. Der Datensatz wurde entwickelt, um die Grenzen des Szenenverständnisses über objektzentrierte Aufgaben hinaus zu erweitern und den ganzheitlichen Kontext eines Bildes zu betonen.

Der Datensatz ist hierarchisch organisiert, wobei Kategorien in breitere Klassen wie Innenräume, natürliche Außenbereiche und vom Menschen geschaffene Außenbereiche gruppiert sind. Jede Kategorie enthält mindestens 100 Bilder, um ausreichende Stichproben für Training und Tests zu gewährleisten. Die Bilder stammen aus öffentlichen Sammlungen, darunter Flickr und andere Online-Repositorien, und werden manuell kuratiert, um Relevanz und Qualität sicherzustellen. SUN397 wird häufig in Verbindung mit dem SUN-Benchmark verwendet, der auch Attribute und Objektannotationen für eine Teilmenge der Bilder umfasst.

Konstruktion und Annotation

Die Erstellung von SUN397 umfasste einen rigorosen Prozess, um Vielfalt und Abdeckung zu gewährleisten. Die Forscher erstellten zunächst eine Liste von Szenenkategorien aus verschiedenen Quellen, einschließlich Wörterbüchern und bestehenden Datensätzen, und erweiterten sie dann auf 397 Kategorien. Bilder wurden über Websuchen und Benutzereinsendungen gesammelt und anschließend gefiltert, um Duplikate und irrelevante Inhalte zu entfernen. Jedes Bild wurde manuell verifiziert, um seiner zugewiesenen Kategorie anzugehören. Der Datensatz wurde in Trainings- und Testsets aufgeteilt, mit einem Standardprotokoll von 50 Bildern pro Kategorie für das Training und 50 für das Testen, obwohl auch andere Aufteilungen verwendet werden.

Rolle in der Szenenerkennungsforschung

SUN397 ist zu einem Standard-Benchmark in Computer Vision und Maschinellem Lernen geworden. Er wird häufig zur Bewertung von Convolutional Neural Networks und anderen Deep-Learning-Modellen verwendet. Der Datensatz fordert Algorithmen heraus, zwischen visuell ähnlichen Szenen zu unterscheiden, wie etwa verschiedenen Arten von Küchen oder Bibliotheken, und über unterschiedliche Beleuchtungen, Perspektiven und Verdeckungen hinweg zu generalisieren. Viele State-of-the-Art-Modelle berichten die Leistung auf SUN397 als Schlüsselmetrik und erreichen oft über 90 % Genauigkeit auf dem Testset.

Vergleich mit anderen Datensätzen

SUN397 ergänzt andere beliebte Datensätze wie Places365 und ImageNet. Während sich ImageNet auf Objektklassifikation konzentriert, betont SUN397 das Verständnis auf Szenenebene. Places365, das später eingeführt wurde, ist ein größerer Szenendatensatz mit 365 Kategorien, aber SUN397 bleibt aufgrund seiner feiner abgestuften Kategorien und seiner Rolle in der frühen Szenenerkennungsforschung wertvoll. Der Datensatz enthält auch eine Teilmenge mit Attributlabels, die Aufgaben wie die Vorhersage von Szenenattributen ermöglicht.

Auswirkungen und Vermächtnis

Die Einführung von SUN397 führte zu bedeutenden Fortschritten in der Szenenerkennung und trug zur Entwicklung von Modellen bei, die Kontext und Layout verstehen. Er wurde in Anwendungen von autonomen Fahren bis hin zur inhaltsbasierten Bildabfrage eingesetzt. Der Datensatz ist für Forschungszwecke öffentlich verfügbar und wird in der akademischen Literatur weithin zitiert. Seine hierarchische Struktur und klaren Bewertungsprotokolle haben ihn zu einer dauerhaften Ressource gemacht, die bis 2025 noch in zeitgenössischen Studien referenziert wird.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·dataset·scene-recognition·benchmark
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte