BBH 2024 é um benchmark para avaliar grandes modelos de linguagem (LLMs) em um conjunto de tarefas desafiadoras de raciocínio. É uma versão mais atualizada do benchmark BIG-Bench Hard (BBH), que por si só era um subconjunto selecionado da suíte maior BIG-Bench. O BBH 2024 foi lançado em 2024 para abordar as limitações do BBH original, particularmente a saturação do desempenho por modelos mais novos e a necessidade de protocolos de avaliação mais robustos.
O benchmark consiste em 23 tarefas selecionadas do BIG-Bench que foram identificadas como particularmente difíceis para modelos de linguagem. Essas tarefas abrangem uma variedade de habilidades de raciocínio, incluindo julgamento causal, compreensão de datas, desambiguação e dedução lógica. O BBH 2024 introduz prompts revisados, formatos de resposta atualizados e uma nova metodologia de pontuação que penaliza respostas parcialmente corretas de forma mais rigorosa do que o BBH original. O benchmark atualizado visa fornecer uma medida mais confiável das capacidades dos modelos na fronteira da pesquisa em IA.
Composição e Seleção de Tarefas
As 23 tarefas no BBH 2024 são as mesmas do BBH original, mas com modificações significativas. Por exemplo, a tarefa 'Causal Judgment' agora inclui 100 cenários contrafactuais adicionais, e a tarefa 'Date Understanding' foi expandida para cobrir uma gama mais ampla de formatos de calendário. A tarefa 'Logical Deduction' agora exige que os modelos produzam uma sequência de etapas de raciocínio em vez de apenas a resposta final. Essas mudanças foram feitas para reduzir a eficácia da correspondência de padrões simples e incentivar o raciocínio genuíno.
Cada tarefa inclui um prompt de poucos exemplos com 3 a 5 exemplares, como no BBH original. No entanto, o BBH 2024 fornece exemplares atualizados que refletem o uso mais recente da linguagem e incluem explicações para as respostas corretas. O benchmark também introduz um modo de avaliação 'cadeia de pensamento', onde os modelos são instruídos a produzir etapas intermediárias de raciocínio antes da resposta final, e um modo 'direto' sem tal instrução.
Pontuação e Avaliação
O BBH 2024 usa um sistema de pontuação que concede crédito total apenas para correspondências exatas com a resposta de referência. Crédito parcial é dado para respostas que contêm a resposta final correta, mas incluem texto extra. O benchmark relata tanto a precisão média entre as tarefas quanto o desvio padrão. Para o modo de cadeia de pensamento, a precisão é calculada na resposta final após as etapas de raciocínio, e uma métrica separada, 'coerência de raciocínio', é introduzida para avaliar a consistência lógica das etapas geradas.
No BBH original, modelos como o GPT-3 alcançavam uma precisão média de cerca de 40% nas tarefas. Em 2024, modelos de última geração como GPT-4 e Claude 3 ultrapassaram 80% no BBH original, levando à necessidade de uma versão mais desafiadora. O BBH 2024 inclui um novo 'modo difícil' onde os prompts são perturbados adversarialmente, e o benchmark relata resultados para os modos padrão e difícil.
Desempenho dos Modelos e Saturação
Resultados iniciais no BBH 2024, lançados em meados de 2024, mostram que os modelos com melhor desempenho, incluindo GPT-4 Turbo e Claude 3 Opus, alcançam cerca de 70% de precisão média no modo padrão e cerca de 50% no modo difícil. Isso é uma queda significativa em relação à quase saturação no BBH original, indicando que o benchmark atualizado fornece uma avaliação mais discriminativa. O benchmark foi adotado por vários laboratórios de pesquisa em IA, incluindo OpenAI, Anthropic e Google DeepMind, como uma ferramenta de avaliação padrão para seus modelos.
O BBH 2024 também inclui um estudo de 'linha de base humana', onde 100 participantes humanos foram recrutados através de uma plataforma de crowdsourcing. A precisão da linha de base humana no modo padrão é de 85%, e no modo difícil é de 75%, mostrando que o benchmark ainda deixa espaço para melhoria nos sistemas de IA.
Relação com Outros Benchmarks
O BBH 2024 faz parte de um ecossistema mais amplo de benchmarks de IA. Ele complementa outras suítes como MMLU (Massive Multitask Language Understanding) e HellaSwag, mas foca especificamente em tarefas que exigem raciocínio de múltiplas etapas. Ao contrário do MMLU, que cobre uma ampla gama de domínios de conhecimento, o BBH 2024 enfatiza tarefas que são fáceis para humanos, mas difíceis para IA, como originalmente definido pelo BIG-Bench. A versão atualizada mantém essa filosofia enquanto aumenta a dificuldade e a robustez da avaliação.
O benchmark está publicamente disponível no GitHub, e os autores fornecem um leaderboard com resultados de vários modelos. O leaderboard é atualizado regularmente, e até o final de 2024, a entrada principal é um modelo do Google DeepMind com uma precisão média de 72,3% no modo padrão.
Direções Futuras
Os criadores do BBH 2024 indicaram que planejam lançar atualizações anuais para acompanhar as melhorias dos modelos. Eles também estão explorando a inclusão de tarefas que exigem raciocínio multimodal, como interpretar gráficos e diagramas. Espera-se que o benchmark continue sendo um ponto de referência chave para avaliar capacidades de raciocínio em grandes modelos de linguagem no futuro previsível.
Ver Também
- BIG-Bench
- MMLU
- Cadeia de pensamento
- Avaliação de sistemas de IA