HellaSwag 2025 é um conjunto de dados de referência projetado para avaliar as capacidades de raciocínio de senso comum de sistemas de inteligência artificial, particularmente grandes modelos de linguagem e modelos multimodais. É o sucessor do benchmark HellaSwag original, introduzido em 2019 por pesquisadores da Universidade de Toronto e do Allen Institute for AI. A versão de 2025 atualiza o conjunto de dados com exemplos mais desafiadores, cobertura expandida de cenários visuais e de áudio e um protocolo de avaliação mais rigoroso para reduzir pontuações infladas por memorização ou atalhos estatísticos.
O benchmark testa a capacidade de um modelo de escolher a continuação mais plausível de um cenário dado, exigindo compreensão de dinâmica física, convenções sociais e causalidade temporal. Ao contrário das versões anteriores, que se concentravam principalmente em texto, o HellaSwag 2025 inclui prompts multimodais que combinam texto com imagens ou clipes de áudio, forçando os modelos a integrar informações entre modalidades. O conjunto de dados é construído usando uma combinação de cenários escritos por humanos e exemplos adversariais gerados por IA, filtrados para garantir qualidade e dificuldade.
Antecedentes e Motivação
O HellaSwag original foi criado para preencher uma lacuna nos benchmarks existentes, que muitas vezes falhavam em distinguir entre modelos que realmente compreendem senso comum e aqueles que dependem de padrões linguísticos superficiais. O nome é um amálgama de "hell" e "swag" (uma referência lúdica a "sabedoria boba" ou "senso comum"). A edição de 2025 foi desenvolvida em resposta ao rápido avanço da IA generativa, que levou a modelos capazes de alcançar pontuações quase perfeitas em benchmarks mais antigos, dificultando a medição de progressos adicionais.
O benchmark é mantido por um consórcio de pesquisadores acadêmicos e da indústria, incluindo membros do Stanford AI Lab, MIT CSAIL e Berkeley AI Research. O projeto recebe financiamento de múltiplas fontes, incluindo a National Science Foundation e fundações privadas.
Construção do Conjunto de Dados
O HellaSwag 2025 contém aproximadamente 20.000 questões de múltipla escolha, cada uma com um contexto e quatro finais possíveis, dos quais apenas um está correto. Os contextos são extraídos de uma gama diversificada de fontes, incluindo roteiros de filmes, vídeos instrucionais e cenários cotidianos. Para aumentar a dificuldade, o conjunto de dados inclui exemplos "adversariais" gerados por sistemas de IA, que são então validados por anotadores humanos para garantir que sejam solucionáveis por humanos, mas desafiadores para máquinas.
O processo de construção envolve várias etapas: primeiro, um grande conjunto de cenários candidatos é coletado; segundo, modelos de IA geram finais plausíveis e implausíveis; terceiro, anotadores humanos filtram e rotulam os exemplos; finalmente, um conjunto de calibração é usado para garantir que o benchmark não seja enviesado por pistas triviais, como comprimento ou frequência de palavras. A versão de 2025 também introduz um subconjunto "contrafactual", onde a resposta correta exige raciocínio sobre mudanças hipotéticas no cenário.
Avaliação e Pontuação
Os modelos são avaliados por sua precisão no conjunto de teste, com a métrica principal sendo a porcentagem de perguntas respondidas corretamente. Para evitar overfitting, o conjunto de teste não é divulgado publicamente; em vez disso, os pesquisadores submetem seus modelos para avaliação por meio de uma API controlada, semelhante à abordagem usada por outros benchmarks, como os evals da OpenAI. O benchmark também relata uma "pontuação de robustez" que mede o desempenho em versões perturbadas das perguntas, como contextos parafraseados ou imagens alteradas.
O HellaSwag 2025 é projetado para ser mais difícil que seu predecessor. Em avaliações iniciais, modelos de última geração, como GPT-4 e Claude, alcançam cerca de 85% de precisão, em comparação com 95% no HellaSwag original. Essa diferença indica que o novo benchmark fornece um sinal melhor para distinguir entre modelos com diferentes níveis de capacidade de raciocínio.
Impacto e Recepção
O lançamento do HellaSwag 2025 foi recebido com interesse pela comunidade de pesquisa em IA. Muitos pesquisadores o usam como uma ferramenta de avaliação padrão ao desenvolver novas arquiteturas ou métodos de treinamento. O benchmark também foi adotado por laboratórios da indústria, incluindo Google DeepMind e Anthropic, como parte de seus conjuntos de avaliação internos. Alguns críticos argumentam que o benchmark ainda tem limitações, como um possível viés em relação a contextos culturais ocidentais, mas o consórcio fez esforços para incluir cenários diversos.
O benchmark também influenciou o desenvolvimento de novas técnicas de treinamento, como aprendizado curricular e aumento de dados, que visam melhorar o raciocínio de senso comum. Além disso, o HellaSwag 2025 tem sido usado para estudar o fenômeno do "aprendizado por atalhos", onde os modelos exploram regularidades estatísticas em vez de compreensão verdadeira.
Direções Futuras
Os planos para versões futuras do HellaSwag incluem expandir para mais idiomas, incorporar cenários interativos ou incorporados e adicionar um componente de raciocínio temporal. O consórcio também pretende lançar um ranking que acompanhe o progresso ao longo do tempo, semelhante ao benchmark SuperGLUE. À medida que os sistemas de IA continuam a evoluir, benchmarks como o HellaSwag 2025 desempenham um papel crucial para garantir que o progresso seja medido de maneiras significativas.