SuperGLUE Benchmark

Traduzido do inglês

SuperGLUE é um conjunto de benchmarks de 2019 composto por oito tarefas desafiadoras de compreensão de linguagem natural, projetado para substituir o benchmark GLUE e medir melhor o progresso em sistemas de compreensão de linguagem de propósito geral. Foi introduzido por pesquisadores da Universidade de Nova York, DeepMind e da Universidade de Washington.

["SuperGLUE \u00e9 um conjunto de benchmarks para avaliar o desempenho de modelos de compreens\u00e3o de linguagem natural (NLU). Lan\u00e7ado em 2019, foi projetado para suceder o benchmark anterior GLUE (General Language Understanding Evaluation), que havia se tornado saturado \u00e0 medida que os modelos se aproximavam ou excediam o desempenho humano em suas tarefas. O SuperGLUE apresenta um conjunto mais dif\u00edcil de oito tarefas que exigem racioc\u00ednio, conhecimento de senso comum e compreens\u00e3o de m\u00faltiplas frases, visando fornecer uma medida mais robusta das capacidades gerais de linguagem de um modelo.\n\nO benchmark foi introduzido em um artigo intitulado \"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems\", de autoria de Alex Wang, Yada Pruksachatkun, Nikita Nangia, Amanpreet Singh, Julian Michael, Felix Hill, Omer Levy e Samuel R. Bowman. O trabalho foi uma colabora\u00e7\u00e3o entre a Universidade de Nova York, a DeepMind e a Universidade de Washington. O nome \u00e9 uma brincadeira com a marca de adesivo Super Glue, refletindo seu prop\u00f3sito como um benchmark \"mais pegajoso\" que \u00e9 mais dif\u00edcil para os modelos resolverem.\n\n## Tarefas e Avalia\u00e7\u00e3o\n\nO SuperGLUE consiste em oito tarefas, cada uma visando um aspecto distinto da compreens\u00e3o de linguagem:\n\n- BoolQ (Perguntas Booleanas): Responder perguntas de sim ou n\u00e3o com base em um pequeno trecho.\n- CB (CommitmentBank): Determinar se uma premissa implica, contradiz ou \u00e9 neutra em rela\u00e7\u00e3o a uma hip\u00f3tese.\n- COPA (Escolha de Alternativas Plaus\u00edveis): Selecionar a causa ou efeito mais plaus\u00edvel entre duas op\u00e7\u00f5es, dada uma premissa.\n- MultiRC (Compreens\u00e3o de Leitura com M\u00faltiplas Frases): Responder m\u00faltiplas perguntas sobre um trecho, com cada pergunta tendo m\u00faltiplas respostas poss\u00edveis.\n- ReCoRD (Compreens\u00e3o de Leitura com Racioc\u00ednio de Senso Comum): Preencher uma entidade mascarada em um artigo de not\u00edcias usando racioc\u00ednio de senso comum.\n- RTE (Reconhecimento de Implica\u00e7\u00e3o Textual): Uma tarefa bin\u00e1ria de implica\u00e7\u00e3o que combina v\u00e1rios conjuntos de dados anteriores.\n- WiC (Palavra no Contexto): Determinar se uma palavra \u00e9 usada com o mesmo significado em duas frases diferentes.\n- WSC (Desafio do Esquema de Winograd): Resolver refer\u00eancias pronominais em frases projetadas para serem amb\u00edguas para modelos estat\u00edsticos simples.\n\nCada tarefa tem uma m\u00e9trica espec\u00edfica: precis\u00e3o para BoolQ, CB, COPA, RTE e WSC; pontua\u00e7\u00e3o F1 para MultiRC e ReCoRD; e precis\u00e3o para WiC. A pontua\u00e7\u00e3o geral do SuperGLUE \u00e9 a m\u00e9dia das pontua\u00e7\u00f5es individuais das tarefas, com cada tarefa ponderada igualmente.\n\n## Motiva\u00e7\u00e3o e Design\n\nO benchmark GLUE, lan\u00e7ado em 2018, havia se tornado um padr\u00e3o para avaliar modelos de linguagem de prop\u00f3sito geral. No entanto, no in\u00edcio de 2019, modelos como BERT e suas variantes estavam alcan\u00e7ando pontua\u00e7\u00f5es pr\u00f3ximas ou superiores \u00e0 linha de base humana estimada no GLUE, dificultando a diferencia\u00e7\u00e3o entre modelos. O SuperGLUE foi criado para abordar essa satura\u00e7\u00e3o, incluindo tarefas mais desafiadoras que exigem racioc\u00ednio mais profundo, como o Desafio do Esquema de Winograd e COPA, que envolvem conhecimento de senso comum e racioc\u00ednio causal.\n\nAs tarefas foram selecionadas de conjuntos de dados existentes que eram considerados dif\u00edceis demais para os modelos contempor\u00e2neos na \u00e9poca. Os autores tamb\u00e9m introduziram um novo conjunto de dados, o ReCoRD, que foi criado especificamente para o benchmark. O quadro de avalia\u00e7\u00e3o inclui um ranking p\u00fablico, permitindo que pesquisadores comparem seus modelos com um conjunto padr\u00e3o de m\u00e9tricas e uma linha de base de desempenho humano.\n\n## Impacto e Recep\u00e7\u00e3o\n\nO SuperGLUE rapidamente se tornou um benchmark amplamente utilizado na comunidade de processamento de linguagem natural. Foi adotado por grandes grupos de pesquisa e empresas, incluindo OpenAI, Google DeepMind e Microsoft, como um ambiente de teste padr\u00e3o para novas arquiteturas e m\u00e9todos de treinamento. O benchmark desempenhou um papel significativo no desenvolvimento de modelos baseados em transformadores, particularmente na era dos grandes modelos de linguagem.\n\nEm 2019, logo ap\u00f3s seu lan\u00e7amento, modelos como BERT-large e XLNet alcan\u00e7aram pontua\u00e7\u00f5es na casa dos 70, enquanto a linha de base humana foi estimada em 89,8. Em 2021, modelos como T5 e DeBERTa superaram a linha de base humana, com DeBERTa alcan\u00e7ando uma pontua\u00e7\u00e3o de 90,8 em janeiro de 2021. Esse progresso r\u00e1pido levou muitos a considerar o benchmark \"resolvido\", incentivando a cria\u00e7\u00e3o de benchmarks ainda mais dif\u00edceis, como o sucessor do SuperGLUE, o BIG-bench, e posteriormente o benchmark HELM.\n\nApesar de seu sucesso, o SuperGLUE tamb\u00e9m enfrentou cr\u00edticas. Alguns pesquisadores argumentaram que as tarefas, embora desafiadoras, ainda n\u00e3o capturam totalmente a complexidade da compreens\u00e3o de linguagem no mundo real, e que pontua\u00e7\u00f5es altas no benchmark n\u00e3o se traduzem necessariamente em desempenho robusto em aplica\u00e7\u00f5es pr\u00e1ticas. Outros notaram que o foco do benchmark em tarefas apenas em ingl\u00eas limita sua aplicabilidade a contextos multil\u00edngues.\n\n## Legado e Sucessores\n\nO legado do SuperGLUE \u00e9 duplo. Primeiro, demonstrou o valor de criar benchmarks progressivamente mais dif\u00edceis para impulsionar a pesquisa em intelig\u00eancia artificial. Segundo, destacou o ritmo r\u00e1pido de progresso em aprendizado de m\u00e1quina, com modelos passando de desempenho abaixo do humano para acima do humano em apenas dois anos. Os princ\u00edpios de design do benchmark - uso de tarefas diversas, m\u00e9tricas claras e um ranking p\u00fablico - foram adotados por benchmarks subsequentes, como o sucessor do GLUE, o pr\u00f3prio sucessor do SuperGLUE e o ecossistema de avalia\u00e7\u00e3o mais amplo.\n\nO benchmark GLUE original foi aposentado em 2021, e o ranking do SuperGLUE foi congelado em 2022, \u00e0 medida que os modelos continuaram a melhorar. No entanto, as tarefas e conjuntos de dados permanecem em uso para pesquisa e desenvolvimento, e o benchmark ainda \u00e9 referenciado em artigos acad\u00eamicos e relat\u00f3rios da ind\u00fastria como um marco hist\u00f3rico na avalia\u00e7\u00e3o de modelos de linguagem.", true]

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·benchmark·evaluation·machine-learning
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico