Traduzido do inglês

Charades é um conjunto de dados de reconhecimento de atividades diárias contendo 9.848 vídeos de 157 classes de ações, usado para treinar e avaliar modelos de visão computacional para a compreensão de atividades humanas em ambientes do mundo real.

Charades é um conjunto de dados em larga escala para reconhecimento de atividades diárias, composto por 9.848 vídeos coletados de 267 usuários. O conjunto foi introduzido em 2016 por pesquisadores da Universidade Carnegie Mellon e da Universidade de Toronto, e foca no reconhecimento de ações cotidianas realizadas em ambientes domésticos. Cada vídeo é anotado com múltiplos rótulos de ação, fornecendo um recurso rico para treinar e avaliar modelos de aprendizado de máquina no campo da visão computacional.

O conjunto foi criado para abordar as limitações de benchmarks anteriores de reconhecimento de atividades, que frequentemente apresentavam ações encenadas ou roteirizadas. Charades captura atividades espontâneas e não roteirizadas, como cozinhar, limpar e ler, tornando-o um benchmark mais realista para aplicações do mundo real. Os vídeos são acompanhados por descrições textuais e rótulos de ação, permitindo pesquisa tanto em reconhecimento visual quanto em fundamentação linguística.

Composição do Conjunto de Dados

Charades contém 9.848 vídeos com duração média de cerca de 30 segundos, totalizando aproximadamente 82 horas de filmagem. O conjunto inclui 157 classes de ação, cobrindo uma ampla gama de atividades diárias, como "abrir uma geladeira", "assistir TV" e "usar um telefone". Cada vídeo é anotado com múltiplas instâncias de ação, e as anotações incluem limites temporais, permitindo reconhecimento de ação em nível de quadro.

Os vídeos foram coletados via Amazon Mechanical Turk, onde os participantes foram solicitados a se gravar realizando atividades em suas próprias casas. Essa abordagem de crowdsourcing resultou em ambientes, condições de iluminação e ângulos de câmera diversos, o que aumenta a dificuldade da tarefa de reconhecimento. O conjunto também inclui 27.847 descrições de vídeo, usadas para tarefas como legendagem e recuperação de vídeo.

Avaliação e Benchmarks

Charades é comumente usado para avaliar modelos de reconhecimento de ação, particularmente aqueles baseados em aprendizado profundo. A métrica de avaliação padrão é a precisão média (mAP) em todas as classes de ação, calculada no nível de vídeo. Pesquisadores frequentemente relatam resultados na divisão Charades v1, que inclui 7.984 vídeos de treinamento e 1.864 vídeos de teste.

Vários modelos notáveis foram avaliados no Charades, incluindo redes convolucionais de dois fluxos, redes de segmentos temporais e, mais recentemente, arquiteturas baseadas em transformadores. O conjunto também foi usado para estudar classificação multi-rótulo, pois cada vídeo pode conter múltiplas ações simultâneas. Em 2025, modelos de última geração alcançam pontuações de mAP acima de 60%, mas o conjunto permanece desafiador devido à sua natureza realista e ruidosa.

Aplicações em Inteligência Artificial

Charades desempenhou um papel significativo no avanço da pesquisa em inteligência artificial, particularmente nas áreas de aprendizado de máquina e aprendizado profundo. É amplamente usado para treinar modelos de compreensão de vídeo, que é um componente-chave de aplicações como vigilância, interação humano-computador e robótica. O conjunto também apoia pesquisa em arquiteturas de redes neurais, incluindo modelos de redes residuais e transformadores.

Além do reconhecimento de ação, Charades tem sido usado para tarefas como localização temporal de ações, onde os modelos devem identificar quando as ações ocorrem em um vídeo. Também foi empregado em aprendizado multimodal, combinando informações visuais e textuais. As anotações do conjunto permitem pesquisa em modelos sequência a sequência para legendagem de vídeo, onde o objetivo é gerar descrições em linguagem natural das atividades.

Conjuntos de Dados Relacionados e Impacto

Charades faz parte de uma família mais ampla de conjuntos de dados de reconhecimento de atividades, incluindo UCF101, ActivityNet e Kinetics. Ao contrário desses conjuntos, que frequentemente apresentam clipes curtos e editados, Charades fornece vídeos mais longos e não editados que refletem melhor as condições do mundo real. Isso o tornou um recurso valioso para desenvolver modelos robustos que possam lidar com dependências temporais e entradas ruidosas.

O conjunto foi citado em centenas de artigos de pesquisa e influenciou o design de benchmarks subsequentes, como o conjunto Charades-Ego, que foca em vídeos egocêntricos. Charades também foi usado em desafios em conferências importantes, incluindo o Desafio de Reconhecimento de Atividades em Larga Escala da ActivityNet, promovendo colaboração entre academia e indústria.

Limitações e Direções Futuras

Apesar de seus pontos fortes, Charades tem limitações. Os vídeos são gravados por não profissionais, levando a variabilidade na qualidade e ocasionais erros de anotação. As classes de ação são limitadas a atividades diárias, o que pode não generalizar para outros domínios, como esportes ou procedimentos médicos. Além disso, o conjunto é relativamente pequeno em comparação com benchmarks mais recentes, o que pode limitar o treinamento de modelos muito grandes.

Pesquisas futuras podem abordar essas limitações expandindo o conjunto ou combinando-o com dados sintéticos. O surgimento de IA generativa e grandes modelos de linguagem também abriu novos caminhos para usar Charades em tarefas de raciocínio multimodal, onde os modelos devem entender informações visuais e textuais. Em 2025, Charades permanece um benchmark padrão para avaliar o progresso na compreensão de vídeo.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·computer-vision·activity-recognition·machine-learning
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico