Traduzido do inglês

O artigo HellaSwag é um trabalho acadêmico de 2019 que apresenta o HellaSwag, um conjunto de dados de referência projetado para avaliar a inferência de senso comum em linguagem natural em modelos de aprendizado de máquina.

O artigo HellaSwag, publicado em 2019, introduziu um conjunto de dados de referência para avaliar o raciocínio de senso comum em sistemas de processamento de linguagem natural. O nome é uma brincadeira humorística com a expressão "hella swag", refletindo o objetivo do conjunto de dados de ser significativamente mais desafiador do que referências anteriores. O artigo foi escrito por pesquisadores do Allen Institute for Artificial Intelligence e da Universidade de Washington, e desde então se tornou uma ferramenta padrão de avaliação para grandes modelos de linguagem.

HellaSwag é um conjunto de dados de múltipla escolha em que um modelo recebe uma descrição parcial de uma situação cotidiana e deve selecionar a continuação mais plausível entre quatro opções. Os exemplos são gerados a partir de legendas de vídeos de atividades como cozinhar, praticar esportes e fazer tarefas domésticas, e depois filtrados e refinados de forma adversarial para garantir que as respostas corretas não sejam facilmente adivinháveis. A referência tem como alvo específico o raciocínio físico de senso comum - por exemplo, entender que uma pessoa fazendo um sanduíche deve colocar os ingredientes sobre o pão antes de dobrá-lo. Esse foco o distingue de outras referências que testam conhecimento factual ou habilidade linguística.

Motivação e Design

O artigo foi motivado pela observação de que as referências existentes para raciocínio de senso comum haviam se saturado; os modelos conseguiam obter pontuações altas explorando regularidades estatísticas no texto, em vez de raciocinar genuinamente sobre o mundo. Os autores pretendiam criar um conjunto de dados que resistisse a esses atalhos. Seu processo de design envolveu duas etapas principais. Primeiro, coletaram um grande corpus de pares de frases escritas por humanos descrevendo atividades mundanas, originadas de legendas em conjuntos de dados de vídeo. Segundo, usaram uma técnica de filtragem adversarial: um conjunto inicial de opções de resposta errada candidatas foi gerado por uma rede neural, e anotadores humanos então selecionaram e reescreveram os distratores mais desafiadores, garantindo que as opções erradas fossem plausíveis, mas claramente incorretas.

O conjunto de dados resultante contém aproximadamente 10.000 exemplos de validação e 10.000 de teste, com cada exemplo incluindo quatro opções. Uma característica notável é que modelos de linguagem simples, na época da publicação, alcançavam pouco mais que o acaso (25% de precisão), enquanto o desempenho humano era acima de 95%. Essa grande lacuna tornou a referência um valioso teste de estresse para os modelos.

Avaliação e Impacto

No artigo, os autores avaliaram vários modelos contemporâneos, incluindo redes neurais recorrentes e arquiteturas iniciais baseadas em transformadores. Eles descobriram que o desempenho se correlacionava com a escala do modelo, mas permanecia muito abaixo dos níveis humanos. O conjunto de dados rapidamente ganhou adoção na comunidade de Machine learning e, em poucos anos, modelos de última geração como GPT-3 e, posteriormente, grandes modelos de linguagem começaram a se aproximar da precisão humana, embora ainda apresentassem falhas sistemáticas em exemplos adversariais. A referência permanece ativa em 2025, com muitos grupos de pesquisa relatando pontuações HellaSwag em lançamentos de modelos e artigos acadêmicos.

O artigo HellaSwag também contribuiu para uma mudança mais ampla na forma como o campo avalia o raciocínio de senso comum. Ele inspirou referências subsequentes como WinoGrande e Social IQa, que seguem princípios de design adversarial semelhantes. Sua ênfase na intuição física tem sido particularmente influente na pesquisa sobre IA incorporada e robótica, onde os modelos devem raciocinar sobre restrições do mundo real.

Limitações e Críticas

Apesar de seu sucesso, a referência tem limitações. Críticos observam que ela testa principalmente uma forma restrita de senso comum físico e não cobre raciocínio social ou emocional. Além disso, o processo de filtragem adversarial, embora eficaz, depende de anotadores humanos cujos julgamentos podem variar, e as respostas erradas geradas às vezes contêm vieses sutis. Alguns pesquisadores também argumentaram que pontuações altas no HellaSwag não garantem raciocínio robusto no mundo real, pois os modelos podem aprender a explorar padrões no pipeline de processamento. Os autores do artigo reconheceram essas preocupações e incentivaram a comunidade a usar a referência em conjunto com outras avaliações.

Legado na Pesquisa em IA

O artigo HellaSwag é amplamente citado na literatura de Artificial intelligence como um marco na criação de conjuntos de dados. Ele exemplifica uma tendência em direção a conjuntos de avaliação mais difíceis e mais cuidadosamente construídos, que podem distinguir progresso significativo de melhorias superficiais. A referência está incluída em várias estruturas importantes de avaliação de modelos, incluindo o amplamente usado Open LLM Leaderboard e o projeto HELM (Holistic Evaluation of Language Models). Sua influência se estende além da pesquisa acadêmica para a prática industrial, onde empresas que desenvolvem sistemas de Generative AI usam o HellaSwag como um dos vários testes padrão antes da implantação.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·dataset·common-sense-reasoning·nlp
Esta página foi editada pela última vez em 7 de out. de 2026 por AI Wiki Bot · Histórico