Traduzido do inglês

ActivityNet é um conjunto de dados de vídeo em grande escala para localização temporal de ações e reconhecimento, contendo 200 classes de ações e mais de 28.000 vídeos com anotações temporais densas, amplamente utilizado na pesquisa de [[computer-vision|visão computacional]].

ActivityNet é um conjunto de dados de vídeo em larga escala projetado para avançar a pesquisa em localização temporal de ações e reconhecimento de ações. Ele fornece segmentos de vídeo densamente anotados, permitindo que modelos identifiquem não apenas quais ações ocorrem, mas também quando ocorrem dentro de um vídeo. Desde sua introdução, tornou-se um benchmark padrão para avaliar algoritmos em compreensão de vídeo, particularmente para tarefas envolvendo vídeos não cortados, onde as ações estão embutidas em sequências mais longas.

O conjunto de dados foi lançado pela primeira vez em 2015 por pesquisadores da Universidade de Michigan e outras instituições, liderados por Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem e Juan Carlos Niebles. A versão inicial, ActivityNet-200, contém 200 classes de ações e mais de 28.000 vídeos, com um total de mais de 648.000 anotações temporais. Os vídeos são provenientes de plataformas públicas como o YouTube, cobrindo diversas atividades, como esportes, tarefas domésticas e interações sociais. Cada vídeo é anotado com múltiplas instâncias de ações, cada uma com um tempo de início e fim, fornecendo um ground truth rico para localização temporal.

Estrutura e Anotações

O ActivityNet é organizado em três divisões: treinamento, validação e teste, com uma distribuição aproximada de 50/25/25. As anotações são fornecidas em formato JSON, incluindo URLs de vídeos, rótulos de ações e limites temporais. Para cada instância de ação, o conjunto de dados também inclui uma pontuação de confiança para a qualidade da anotação. As classes de ações são organizadas hierarquicamente em categorias, como "Esportes", "Doméstico" e "Cuidados Pessoais", o que ajuda na avaliação de modelos em diferentes granularidades.

Uma característica chave do ActivityNet é seu foco em vídeos não cortados, o que contrasta com conjuntos de dados anteriores, como UCF101 ou HMDB51, que continham clipes cortados. Esse design força os modelos a lidar com o contexto temporal completo, tornando a tarefa mais realista. O conjunto de dados também inclui uma classe "fundo" para segmentos que não correspondem a nenhuma das 200 ações, o que é crucial para treinar modelos de localização.

Tarefas de Benchmark

As principais tarefas associadas ao ActivityNet são localização temporal de ações e reconhecimento de ações. Na localização temporal de ações, um modelo deve prever os tempos de início e fim de cada instância de ação em um vídeo não cortado, juntamente com o rótulo da ação. Isso é frequentemente avaliado usando a Precisão Média (mAP) em diferentes limites de Intersecção sobre União (IoU) temporais, como 0,5 e 0,75. O reconhecimento de ações, por outro lado, envolve classificar a ação dominante em um vídeo, tipicamente avaliado com precisão top-1 e top-5.

O ActivityNet também hospeda um desafio anual, o Desafio de Reconhecimento de Ações em Larga Escala do ActivityNet, que tem sido realizado em conjunto com grandes conferências de visão computacional, como CVPR e ICCV. O desafio atraiu inúmeras submissões de grupos de pesquisa acadêmicos e industriais, impulsionando o progresso no campo. Ao longo dos anos, o conjunto de dados foi estendido com anotações adicionais, como o subconjunto ActivityNet Captions, que fornece descrições em linguagem natural para segmentos de vídeo, permitindo pesquisa em legendagem de vídeo e legendagem densa de vídeo.

Impacto na Visão Computacional

O ActivityNet influenciou significativamente o desenvolvimento de modelos de compreensão de vídeo. Ele tem sido usado para treinar e avaliar uma ampla gama de arquiteturas, desde métodos tradicionais baseados em características artesanais até abordagens modernas de aprendizado profundo. Muitos modelos de última geração para localização temporal de ações, como Boundary Matching Network (BMN) e ActionFormer, relataram resultados no ActivityNet. O conjunto de dados também estimulou pesquisa em localização fracamente supervisionada, onde os modelos são treinados usando apenas rótulos de nível de vídeo, e em processamento eficiente de vídeo, dada a grande escala dos dados.

A ênfase do conjunto de dados na estrutura temporal contribuiu para o campo mais amplo da inteligência artificial, particularmente em áreas como reconhecimento de atividades para vigilância, interação humano-computador e direção autônoma. Ele também tem sido usado em conjunto com outros conjuntos de dados, como kinetics (embora não esteja na lista fornecida, é um conjunto de dados relacionado conhecido) e Something-Something (também não está na lista), para criar benchmarks mais abrangentes.

Limitações e Direções Futuras

Apesar de seu sucesso, o ActivityNet tem limitações. Os vídeos são provenientes do YouTube, o que pode introduzir vieses em termos de conteúdo e qualidade. As classes de ações são predefinidas, o que pode não cobrir todas as atividades humanas possíveis. Além disso, as anotações temporais são criadas manualmente, o que é demorado e pode ter inconsistências. Para abordar essas questões, pesquisadores propuseram extensões como ActivityNet-1.3, que inclui mais vídeos e anotações refinadas, e exploraram o uso de técnicas de aumento de dados para melhorar a robustez dos modelos.

Trabalhos futuros podem envolver a integração do ActivityNet com outras modalidades, como áudio ou texto, para criar benchmarks multimodais. A ascensão de modelos de linguagem de grande escala e arquiteturas baseadas em transformadores também abriu novos caminhos para a compreensão de vídeo, e o ActivityNet permanece um testbed relevante para esses métodos emergentes. À medida que o campo avança em direção a tarefas mais complexas, como resposta a perguntas de vídeo e compreensão de vídeo de longo prazo, conjuntos de dados como o ActivityNet provavelmente evoluirão para atender a esses desafios.

Conclusão

O ActivityNet se destaca como um recurso fundamental na visão computacional, fornecendo um benchmark rigoroso para localização temporal de ações. Suas anotações densas e vídeos não cortados realistas o tornaram um padrão para avaliar algoritmos de compreensão de vídeo. Ao permitir modelagem temporal precisa, ele empurrou os limites do que é possível na análise automatizada de vídeo, com implicações para inúmeras aplicações do mundo real.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·video-understanding·temporal-action-localization
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico