Aus dem Englischen übersetzt

Charades ist ein tägliches Aktivitätserkennungs-Datenset, das 9.848 Videos von 157 Aktionsklassen enthält und zur Schulung und Bewertung von Computervisionsmodellen für das Verständnis menschlicher Aktivitäten in realen Umgebungen verwendet wird.

Charades ist ein groß angelegter Datensatz zur Erkennung alltäglicher Aktivitäten, der aus 9.848 Videos besteht, die von 267 Nutzern gesammelt wurden. Der Datensatz wurde 2016 von Forschern der Carnegie Mellon University und der University of Toronto eingeführt und konzentriert sich auf die Erkennung alltäglicher Handlungen in häuslichen Umgebungen. Jedes Video ist mit mehreren Aktionslabels annotiert, was eine reichhaltige Ressource für das Training und die Evaluierung von Modellen des maschinellen Lernens im Bereich der Computer Vision bietet.

Der Datensatz wurde erstellt, um die Einschränkungen früherer Benchmarks zur Aktionserkennung zu adressieren, die oft inszenierte oder skriptbasierte Aktionen enthielten. Charades erfasst spontane, unskriptete Aktivitäten wie Kochen, Putzen und Lesen, was ihn zu einem realistischeren Benchmark für reale Anwendungen macht. Die Videos werden von Textbeschreibungen und Aktionslabels begleitet, was Forschung sowohl in der visuellen Erkennung als auch in der Sprachverankerung ermöglicht.

Zusammensetzung des Datensatzes

Charades enthält 9.848 Videos mit einer durchschnittlichen Dauer von etwa 30 Sekunden, was insgesamt ungefähr 82 Stunden Filmmaterial ergibt. Der Datensatz umfasst 157 Aktionsklassen, die eine breite Palette alltäglicher Aktivitäten wie „Kühlschrank öffnen“, „Fernsehen schauen“ und „Telefon benutzen“ abdecken. Jedes Video ist mit mehreren Aktionsinstanzen annotiert, und die Annotationen umfassen zeitliche Grenzen, was eine Erkennung auf Frame-Ebene ermöglicht.

Die Videos wurden über Amazon Mechanical Turk gesammelt, wobei die Teilnehmer gebeten wurden, sich selbst bei Aktivitäten in ihren eigenen Häusern aufzunehmen. Dieser Crowdsourcing-Ansatz führte zu vielfältigen Umgebungen, Lichtverhältnissen und Kamerawinkeln, was die Schwierigkeit der Erkennungsaufgabe erhöht. Der Datensatz enthält außerdem 27.847 Videobeschreibungen, die für Aufgaben wie Videountertitelung und -abruf verwendet werden.

Evaluierung und Benchmarks

Charades wird häufig als Benchmark für Aktionserkennungsmodelle verwendet, insbesondere für solche, die auf Deep Learning basieren. Die Standard-Evaluierungsmetrik ist die mittlere durchschnittliche Präzision (mAP) über alle Aktionsklassen, die auf Videoebene berechnet wird. Forscher berichten oft Ergebnisse auf dem Charades-v1-Split, der 7.984 Trainingsvideos und 1.864 Testvideos umfasst.

Mehrere bemerkenswerte Modelle wurden auf Charades evaluiert, darunter Zwei-Stream-Convolutional-Netzwerke, temporale Segmentnetzwerke und in jüngerer Zeit transformerbasierte Architekturen. Der Datensatz wurde auch zur Untersuchung der Multi-Label-Klassifikation verwendet, da jedes Video mehrere gleichzeitige Aktionen enthalten kann. Stand 2025 erreichen modernste Modelle mAP-Werte über 60 %, aber der Datensatz bleibt aufgrund seiner realistischen und verrauschten Natur herausfordernd.

Anwendungen in der künstlichen Intelligenz

Charades hat eine bedeutende Rolle bei der Förderung der Forschung im Bereich künstliche Intelligenz gespielt, insbesondere in den Bereichen maschinelles Lernen und Deep Learning. Er wird häufig zum Training von Modellen für das Videoverständnis verwendet, das eine Schlüsselkomponente von Anwendungen wie Überwachung, Mensch-Computer-Interaktion und Robotik ist. Der Datensatz unterstützt auch Forschung an neuralen Netzwerk-Architekturen, einschließlich Residualnetzwerk- und Transformer-Modellen.

Über die Aktionserkennung hinaus wurde Charades für Aufgaben wie die zeitliche Aktionslokalisierung verwendet, bei der Modelle identifizieren müssen, wann Aktionen in einem Video auftreten. Er wurde auch im multimodalen Lernen eingesetzt, das visuelle und textuelle Informationen kombiniert. Die Annotationen des Datensatzes ermöglichen Forschung an Sequenz-zu-Sequenz-Modellen für die Videountertitelung, bei der das Ziel darin besteht, natürliche Sprachbeschreibungen von Aktivitäten zu generieren.

Verwandte Datensätze und Auswirkungen

Charades ist Teil einer breiteren Familie von Aktionserkennungsdatensätzen, einschließlich UCF101, ActivityNet und Kinetics. Im Gegensatz zu diesen Datensätzen, die oft kurze, zugeschnittene Clips enthalten, bietet Charades längere, unbeschnittene Videos, die reale Bedingungen besser widerspiegeln. Dies hat ihn zu einer wertvollen Ressource für die Entwicklung robuster Modelle gemacht, die zeitliche Abhängigkeiten und verrauschte Eingaben bewältigen können.

Der Datensatz wurde in Hunderten von Forschungsarbeiten zitiert und hat die Gestaltung nachfolgender Benchmarks beeinflusst, wie den Charades-Ego-Datensatz, der sich auf egozentrische Videos konzentriert. Charades wurde auch in Herausforderungen auf großen Konferenzen verwendet, einschließlich der ActivityNet Large Scale Activity Recognition Challenge, was die Zusammenarbeit zwischen Wissenschaft und Industrie förderte.

Einschränkungen und zukünftige Richtungen

Trotz seiner Stärken hat Charades Einschränkungen. Die Videos werden von Nicht-Profis aufgenommen, was zu Variabilität in der Qualität und gelegentlichen Annotationsfehlern führt. Die Aktionsklassen sind auf alltägliche Aktivitäten beschränkt, was möglicherweise nicht auf andere Bereiche wie Sport oder medizinische Verfahren verallgemeinerbar ist. Darüber hinaus ist der Datensatz im Vergleich zu neueren Benchmarks relativ klein, was das Training sehr großer Modelle einschränken kann.

Zukünftige Forschung könnte diese Einschränkungen adressieren, indem der Datensatz erweitert oder mit synthetischen Daten kombiniert wird. Der Aufstieg von generativer KI und großen Sprachmodellen hat auch neue Wege für die Nutzung von Charades in multimodalen Denkaufgaben eröffnet, bei denen Modelle sowohl visuelle als auch textuelle Informationen verstehen müssen. Stand 2025 bleibt Charades ein Standard-Benchmark für die Bewertung von Fortschritten im Videoverständnis.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·computer-vision·activity-recognition·machine-learning
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte