Traduzido do inglês

BBH 2024 é uma versão atualizada do benchmark BIG-Bench Hard, introduzida em 2024 para avaliar grandes modelos de linguagem em tarefas de raciocínio desafiadoras, com prompts e pontuação revisados.

BBH 2024 é um benchmark para avaliar grandes modelos de linguagem (LLMs) em um conjunto de tarefas desafiadoras de raciocínio. É uma versão mais atualizada do benchmark BIG-Bench Hard (BBH), que por si só era um subconjunto selecionado da suíte maior BIG-Bench. O BBH 2024 foi lançado em 2024 para abordar as limitações do BBH original, particularmente a saturação do desempenho por modelos mais novos e a necessidade de protocolos de avaliação mais robustos.

O benchmark consiste em 23 tarefas selecionadas do BIG-Bench que foram identificadas como particularmente difíceis para modelos de linguagem. Essas tarefas abrangem uma variedade de habilidades de raciocínio, incluindo julgamento causal, compreensão de datas, desambiguação e dedução lógica. O BBH 2024 introduz prompts revisados, formatos de resposta atualizados e uma nova metodologia de pontuação que penaliza respostas parcialmente corretas de forma mais rigorosa do que o BBH original. O benchmark atualizado visa fornecer uma medida mais confiável das capacidades dos modelos na fronteira da pesquisa em IA.

Composição e Seleção de Tarefas

As 23 tarefas no BBH 2024 são as mesmas do BBH original, mas com modificações significativas. Por exemplo, a tarefa 'Causal Judgment' agora inclui 100 cenários contrafactuais adicionais, e a tarefa 'Date Understanding' foi expandida para cobrir uma gama mais ampla de formatos de calendário. A tarefa 'Logical Deduction' agora exige que os modelos produzam uma sequência de etapas de raciocínio em vez de apenas a resposta final. Essas mudanças foram feitas para reduzir a eficácia da correspondência de padrões simples e incentivar o raciocínio genuíno.

Cada tarefa inclui um prompt de poucos exemplos com 3 a 5 exemplares, como no BBH original. No entanto, o BBH 2024 fornece exemplares atualizados que refletem o uso mais recente da linguagem e incluem explicações para as respostas corretas. O benchmark também introduz um modo de avaliação 'cadeia de pensamento', onde os modelos são instruídos a produzir etapas intermediárias de raciocínio antes da resposta final, e um modo 'direto' sem tal instrução.

Pontuação e Avaliação

O BBH 2024 usa um sistema de pontuação que concede crédito total apenas para correspondências exatas com a resposta de referência. Crédito parcial é dado para respostas que contêm a resposta final correta, mas incluem texto extra. O benchmark relata tanto a precisão média entre as tarefas quanto o desvio padrão. Para o modo de cadeia de pensamento, a precisão é calculada na resposta final após as etapas de raciocínio, e uma métrica separada, 'coerência de raciocínio', é introduzida para avaliar a consistência lógica das etapas geradas.

No BBH original, modelos como o GPT-3 alcançavam uma precisão média de cerca de 40% nas tarefas. Em 2024, modelos de última geração como GPT-4 e Claude 3 ultrapassaram 80% no BBH original, levando à necessidade de uma versão mais desafiadora. O BBH 2024 inclui um novo 'modo difícil' onde os prompts são perturbados adversarialmente, e o benchmark relata resultados para os modos padrão e difícil.

Desempenho dos Modelos e Saturação

Resultados iniciais no BBH 2024, lançados em meados de 2024, mostram que os modelos com melhor desempenho, incluindo GPT-4 Turbo e Claude 3 Opus, alcançam cerca de 70% de precisão média no modo padrão e cerca de 50% no modo difícil. Isso é uma queda significativa em relação à quase saturação no BBH original, indicando que o benchmark atualizado fornece uma avaliação mais discriminativa. O benchmark foi adotado por vários laboratórios de pesquisa em IA, incluindo OpenAI, Anthropic e Google DeepMind, como uma ferramenta de avaliação padrão para seus modelos.

O BBH 2024 também inclui um estudo de 'linha de base humana', onde 100 participantes humanos foram recrutados através de uma plataforma de crowdsourcing. A precisão da linha de base humana no modo padrão é de 85%, e no modo difícil é de 75%, mostrando que o benchmark ainda deixa espaço para melhoria nos sistemas de IA.

Relação com Outros Benchmarks

O BBH 2024 faz parte de um ecossistema mais amplo de benchmarks de IA. Ele complementa outras suítes como MMLU (Massive Multitask Language Understanding) e HellaSwag, mas foca especificamente em tarefas que exigem raciocínio de múltiplas etapas. Ao contrário do MMLU, que cobre uma ampla gama de domínios de conhecimento, o BBH 2024 enfatiza tarefas que são fáceis para humanos, mas difíceis para IA, como originalmente definido pelo BIG-Bench. A versão atualizada mantém essa filosofia enquanto aumenta a dificuldade e a robustez da avaliação.

O benchmark está publicamente disponível no GitHub, e os autores fornecem um leaderboard com resultados de vários modelos. O leaderboard é atualizado regularmente, e até o final de 2024, a entrada principal é um modelo do Google DeepMind com uma precisão média de 72,3% no modo padrão.

Direções Futuras

Os criadores do BBH 2024 indicaram que planejam lançar atualizações anuais para acompanhar as melhorias dos modelos. Eles também estão explorando a inclusão de tarefas que exigem raciocínio multimodal, como interpretar gráficos e diagramas. Espera-se que o benchmark continue sendo um ponto de referência chave para avaliar capacidades de raciocínio em grandes modelos de linguagem no futuro previsível.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·large-language-models·reasoning·evaluation
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico