HellaSwag 2024 é um conjunto de dados de referência (benchmark) projetado para avaliar as capacidades de raciocínio de senso comum de sistemas de inteligência artificial, particularmente grandes modelos de linguagem. É uma versão atualizada do benchmark HellaSwag original, introduzido em 2019. A revisão de 2024 visa abordar limitações do conjunto de dados anterior, como a capacidade dos modelos de explorar regularidades estatísticas em vez de compreender genuinamente os cenários. O benchmark apresenta perguntas de múltipla escolha onde um modelo deve selecionar a continuação mais plausível de uma situação dada, com a resposta correta exigindo uma compreensão do senso comum físico e social.
O HellaSwag original foi criado por pesquisadores da Universidade de Washington e do Allen Institute for AI. Foi construído usando um processo de filtragem adversarial, onde finais escritos por humanos foram pareados com finais incorretos, mas plausíveis, gerados por máquina. A atualização de 2024 mantém essa estrutura central, mas introduz vários refinamentos. Estes incluem um conjunto maior de perguntas, cenários mais diversos e uma distribuição rebalanceada das opções de resposta para evitar que os modelos adivinhem com base na posição ou no comprimento. A metodologia de pontuação também foi revisada para ser mais robusta contra modelos que usam heurísticas, como escolher a resposta mais longa ou mais complexa.
Design e Construção
A construção do HellaSwag 2024 segue a mesma abordagem de filtragem adversarial que seu predecessor. Anotadores humanos escreveram finais corretos para um conjunto de descrições de atividades, enquanto um conjunto separado de finais incorretos foi gerado por um modelo de linguagem. Os finais incorretos foram projetados para serem superficialmente plausíveis, mas semanticamente errados, frequentemente envolvendo violações sutis de leis físicas ou normas sociais. O conjunto de dados final inclui apenas aquelas perguntas onde os finais incorretos não eram facilmente distinguíveis por pistas estatísticas simples, garantindo que o benchmark meça o raciocínio verdadeiro em vez de correspondência de padrões.
A versão de 2024 expande o conjunto de dados original de cerca de 10.000 perguntas para mais de 15.000 perguntas. Os cenários cobrem uma ampla gama de atividades cotidianas, como cozinhar, esportes e tarefas domésticas, bem como situações mais abstratas envolvendo interações sociais. Cada pergunta inclui quatro opções de resposta, com exatamente uma resposta correta. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste sendo reservado para avaliação oficial.
Avaliação e Pontuação
Os modelos são avaliados no HellaSwag 2024 por sua precisão em selecionar a resposta correta. A métrica principal é a precisão top-1, que mede a porcentagem de perguntas onde o modelo atribui a maior probabilidade à escolha correta. Para reduzir o impacto do viés de comprimento da resposta, a atualização de 2024 introduz um método de pontuação normalizado. Este método ajusta a probabilidade de cada resposta pelo seu comprimento, impedindo que os modelos favoreçam respostas mais longas ou mais verbosas.
Além da precisão, o benchmark relata uma pontuação de calibração, que mede quão bem a confiança do modelo se alinha com sua correção. Um modelo bem calibrado deve ter maior confiança para respostas corretas e menor confiança para respostas incorretas. A revisão de 2024 também inclui uma linha de base humana, onde o desempenho humano é medido em um subconjunto das perguntas, fornecendo um ponto de referência para comparações de modelos.
Desempenho dos Modelos Atuais
Em 2024, os melhores grandes modelos de linguagem, como os desenvolvidos pela OpenAI, Anthropic e Google DeepMind, alcançam pontuações de precisão na faixa de meados dos 90% no HellaSwag 2024. Isso é uma melhoria significativa em relação aos modelos anteriores, que pontuavam cerca de 80% no HellaSwag original. No entanto, o desempenho humano no benchmark permanece mais alto, tipicamente acima de 95%, indicando que ainda há uma lacuna entre o raciocínio de senso comum de máquinas e humanos.
O benchmark se tornou uma ferramenta padrão na comunidade de Artificial intelligence para acompanhar o progresso no raciocínio de senso comum. É frequentemente usado junto com outros benchmarks como Winogrande e ARC para fornecer uma avaliação abrangente das habilidades de raciocínio de um modelo. A atualização de 2024 foi amplamente adotada por laboratórios de pesquisa e equipes da indústria, incluindo aqueles na Amazon Web Services, Microsoft Azure e Google Cloud, como parte de seus pipelines de avaliação de modelos.
Limitações e Críticas
Apesar de suas melhorias, o HellaSwag 2024 enfrentou algumas críticas. Alguns pesquisadores argumentam que o benchmark ainda depende fortemente de padrões estatísticos na linguagem, e que os modelos podem alcançar pontuações altas memorizando fatos de senso comum em vez de se envolver em raciocínio flexível. Outros apontam que o conjunto de dados é limitado ao inglês e a cenários de contextos culturais ocidentais, o que pode não generalizar para outros idiomas ou culturas.
Outra limitação é que o benchmark é estático, o que significa que uma vez que um modelo foi treinado no conjunto de teste (intencionalmente ou acidentalmente através de contaminação de dados), seu desempenho não reflete mais a verdadeira generalização. Para mitigar isso, a versão de 2024 inclui um conjunto de teste oculto que não é divulgado publicamente, e os pesquisadores são encorajados a avaliar neste conjunto oculto através de um sistema de submissão. No entanto, essa abordagem não é infalível, e o risco de contaminação permanece uma preocupação no campo mais amplo.
Direções Futuras
O desenvolvimento do HellaSwag 2024 reflete uma tendência mais ampla na comunidade de Machine learning em direção à criação de benchmarks de avaliação mais desafiadores e robustos. Atualizações futuras podem incorporar geração dinâmica de perguntas, onde novas perguntas são criadas em tempo real para prevenir a memorização. Há também interesse em expandir o benchmark para cobrir cenários multimodais, onde os modelos devem raciocinar sobre texto e imagens, e incluir perguntas que exigem raciocínio de múltiplas etapas ou inferência causal.
À medida que os Large language model continuam a melhorar, benchmarks como o HellaSwag 2024 provavelmente precisarão evoluir para acompanhar o ritmo. O objetivo é criar avaliações que não apenas meçam as capacidades atuais, mas também impulsionem o desenvolvimento de raciocínio mais semelhante ao humano em sistemas de IA. A atualização de 2024 é um passo nessa direção, fornecendo um teste mais rigoroso da compreensão de senso comum do que seu predecessor.