Traduzido do inglês

SIQA (Social IQa) é um conjunto de dados de referência para avaliar o raciocínio de senso comum social em IA, contendo 38.000 perguntas de múltipla escolha sobre situações sociais cotidianas.

SIQA, abreviação de Social IQa, é um conjunto de dados de referência (benchmark) projetado para avaliar as capacidades de raciocínio de senso comum social de sistemas de inteligência artificial. Ele consiste em aproximadamente 38.000 perguntas de múltipla escolha, cada uma apresentando uma breve narrativa sobre uma situação social seguida de uma pergunta sobre o provável resultado ou ação apropriada, com três opções de resposta. O benchmark foi introduzido para preencher uma lacuna na avaliação da compreensão da IA sobre normas sociais, intenções e dinâmicas interpessoais, que são distintas do raciocínio puramente factual ou lógico.

O conjunto de dados foi criado por pesquisadores da Universidade de Washington e do Allen Institute for AI, com um artigo publicado em 2019. As perguntas são derivadas da estrutura Crowdsourced Social Commonsense Reasoning (CrowS-Pairs), mas o SIQA se concentra especificamente em perguntas de múltipla escolha que exigem inferir implicações sociais. Cada pergunta é projetada para testar se um modelo pode entender pistas sociais implícitas, como polidez, empatia ou as prováveis consequências de uma ação em um determinado contexto.

Estrutura e Conteúdo

O SIQA contém 33.404 perguntas para treinamento, 1.954 para validação e 2.985 para teste, totalizando 38.343 perguntas. Cada pergunta inclui uma frase de contexto (por exemplo, "Jordan queria contar um segredo a Tracy"), uma pergunta (por exemplo, "O que Jordan fará?") e três opções de resposta (por exemplo, "Jordan contou o segredo a Tracy", "Jordan pediu a Tracy para guardar o segredo", "Jordan contou o segredo a todos"). A resposta correta é determinada pelo senso comum social, não por fatos explícitos no texto. O conjunto de dados cobre uma ampla gama de cenários cotidianos, incluindo conversas, interações familiares, situações de trabalho e amizades.

Propósito e Significância

O SIQA foi desenvolvido para ir além dos benchmarks padrão de processamento de linguagem natural que se concentram em conhecimento factual ou lexical. O raciocínio de senso comum social é um componente-chave da inteligência humana, permitindo que as pessoas naveguem em interações sociais de forma suave. Para sistemas de IA, como grandes modelos de linguagem e transformadores, ter um bom desempenho no SIQA indica uma capacidade de compreender normas sociais implícitas e prever o comportamento humano. O benchmark se tornou uma ferramenta de avaliação padrão no campo da pesquisa em inteligência artificial, frequentemente usado junto com outros benchmarks de raciocínio de senso comum, como o Winograd Schema Challenge e o Physical IQA.

Avaliação e Desempenho

Quando o SIQA foi lançado, os modelos com melhor desempenho alcançaram precisão em torno de 60-70%, o que era significativamente acima do acaso (33%), mas abaixo do desempenho humano, estimado em cerca de 86%. Melhorias subsequentes em aprendizado de máquina e aprendizado profundo, particularmente com o advento de redes neurais maiores e modelos pré-treinados, levaram a pontuações mais altas. Por exemplo, modelos baseados em BERT e suas variantes alcançaram níveis de precisão na casa dos 80%, aproximando-se do desempenho humano. No entanto, mesmo os modelos de última geração ainda enfrentam dificuldades com certos tipos de raciocínio social, como entender sarcasmo ou diferenças culturais sutis.

Limitações e Críticas

Apesar de seu uso generalizado, o SIQA enfrentou críticas. Alguns pesquisadores argumentam que o conjunto de dados pode conter vieses, pois as perguntas são coletadas por crowdsourcing e podem refletir o contexto cultural dos anotadores, principalmente de contextos ocidentais e de língua inglesa. Isso pode levar os modelos a aprender normas sociais culturalmente específicas em vez de universais. Além disso, algumas perguntas foram notadas por terem respostas ambíguas ou múltiplas respostas plausíveis, tornando o benchmark menos confiável para avaliação detalhada. Há também a preocupação de que um alto desempenho no SIQA não se traduza necessariamente em compreensão social no mundo real, pois as perguntas são simplificadas e carecem da complexidade das interações sociais reais.

Benchmarks Relacionados e Direções Futuras

O SIQA faz parte de uma família mais ampla de benchmarks de raciocínio de senso comum, incluindo o Winograd Schema e o CommonsenseQA. Esses benchmarks, coletivamente, visam testar diferentes facetas do conhecimento de senso comum, do físico ao social. Direções futuras de pesquisa incluem o desenvolvimento de conjuntos de dados mais diversos e culturalmente inclusivos, a incorporação de pistas sociais multimodais (por exemplo, expressões faciais, tom de voz) e a avaliação de modelos em ambientes interativos, onde eles devem raciocinar sobre dinâmicas sociais em tempo real. À medida que os sistemas de IA se tornam mais integrados à vida diária, benchmarks como o SIQA permanecem cruciais para garantir que eles possam interagir com humanos de maneiras socialmente apropriadas.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·commonsense-reasoning·social-ai·dataset
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico