Traduzido do inglês

BIG-Bench Hard (BBH) é um subconjunto curado de 23 tarefas desafiadoras do benchmark BIG-bench, projetado para avaliar grandes modelos de linguagem em tarefas de raciocínio nas quais eles têm desempenho inferior ao dos humanos.

BIG-Bench Hard (BBH) é um benchmark para avaliar grandes modelos de linguagem em tarefas de raciocínio complexo. Foi introduzido em 2022 por pesquisadores do Google DeepMind, OpenAI e outras instituições como um subconjunto do benchmark mais amplo BIG-bench. O BBH foca em 23 tarefas onde o desempenho humano excede significativamente o dos melhores modelos da época, fornecendo uma avaliação mais direcionada das capacidades dos modelos além do simples reconhecimento de padrões.

O benchmark foi criado para atender à necessidade de conjuntos de avaliação mais desafiadores na pesquisa de inteligência artificial. Enquanto o BIG-bench incluía mais de 200 tarefas, muitas eram fáceis demais para os modelos de última geração, levando à saturação. O BBH seleciona tarefas que exigem raciocínio em múltiplas etapas, compreensão de senso comum e conhecimento específico de domínio, tornando-o uma ferramenta valiosa para medir o progresso em aprendizado de máquina.

Seleção e Composição das Tarefas

As 23 tarefas do BBH foram escolhidas do conjunto original BIG-bench com base em um critério específico: tarefas onde o desempenho humano médio excedia o desempenho do melhor modelo por uma margem significativa. Essas tarefas abrangem domínios diversos, incluindo quebra-cabeças lógicos, raciocínio matemático, julgamento causal e compreensão de linguagem. Exemplos incluem expressões booleanas, julgamento causal, compreensão de datas, desambiguação e formas geométricas.

Cada tarefa é formatada como uma pergunta de múltipla escolha ou de resposta livre, com um modelo de prompt padrão para garantir consistência entre os modelos. As tarefas são projetadas para serem resolvíveis por humanos sem treinamento especializado, mas exigem raciocínio cuidadoso e frequentemente envolvem múltiplas etapas. Isso torna o BBH particularmente útil para avaliar as habilidades de raciocínio de modelos baseados em transformadores.

Metodologia de Avaliação

O BBH é tipicamente usado para avaliar modelos, fornecendo instruções de tarefa e alguns exemplos (aprendizado com poucos exemplos). A avaliação padrão usa uma técnica de prompting de cadeia de pensamento, onde o modelo é incentivado a produzir etapas intermediárias de raciocínio antes de dar a resposta final. Essa abordagem demonstrou melhorar significativamente o desempenho nas tarefas do BBH, especialmente para modelos maiores.

Os resultados são reportados como porcentagens de precisão, com o desempenho humano servindo como linha de base. No artigo original, o melhor modelo (PaLM 540B) alcançou 65,2% de precisão com prompting de cadeia de pensamento, em comparação com 71,2% para avaliadores humanos. Essa lacuna destacou as limitações dos modelos contemporâneos e motivou pesquisas adicionais sobre capacidades de raciocínio.

Impacto e Uso

O BBH tornou-se um benchmark padrão na comunidade de IA generativa, usado por grupos de pesquisa acadêmicos e industriais. É frequentemente incluído em suítes de avaliação de modelos junto com outros benchmarks como MMLU e HellaSwag. Muitas arquiteturas de redes neurais, incluindo modelos de aprendizado profundo, são testadas contra o BBH para avaliar suas habilidades de raciocínio.

O benchmark também influenciou o desenvolvimento de novas técnicas, como aprendizado por reforço com feedback de IA e aprendizado curricular, que visam melhorar o desempenho em tarefas de raciocínio complexo. O BBH é frequentemente citado em artigos de pesquisa e está disponível como parte do repositório BIG-bench, permitindo fácil acesso para a comunidade de pesquisa.

Limitações e Críticas

Apesar de seu uso generalizado, o BBH enfrentou algumas críticas. As tarefas são estáticas, o que significa que podem se tornar saturadas à medida que os modelos melhoram, reduzindo seu poder discriminativo ao longo do tempo. Além disso, o benchmark testa principalmente o raciocínio em inglês, o que pode não generalizar para outros idiomas ou contextos culturais. Alguns pesquisadores argumentam que as tarefas do BBH não são representativas de problemas do mundo real, pois são frequentemente abstratas e carecem de aplicação prática.

Outra limitação é que o BBH não considera a calibração ou incerteza do modelo, focando apenas na precisão. Isso pode ser enganoso, pois um modelo pode adivinhar corretamente sem compreensão genuína. No entanto, o BBH permanece uma ferramenta valiosa para rastrear o progresso no raciocínio de IA, e suas tarefas foram incorporadas a benchmarks mais abrangentes, como o BIG-bench Lite.

Direções Futuras

À medida que os grandes modelos de linguagem continuam a evoluir, benchmarks como o BBH estão sendo adaptados para permanecerem relevantes. Pesquisadores estão explorando benchmarks dinâmicos que atualizam tarefas ao longo do tempo, bem como variantes multilíngues e multimodais. O BBH também inspirou a criação de benchmarks especializados para domínios específicos, como raciocínio médico e raciocínio jurídico, que se baseiam em sua metodologia.

O desenvolvimento contínuo do BBH e de benchmarks semelhantes é crucial para garantir que os sistemas de IA sejam rigorosamente avaliados e que o progresso seja medido com precisão. Ao focar em tarefas desafiadoras, o BBH ajuda a empurrar os limites do que os modelos podem alcançar, impulsionando a inovação na pesquisa em inteligência artificial.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·reasoning·large-language-models
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico