Traduzido do inglês

Yahoo! Answers foi uma plataforma de perguntas e respostas orientada pela comunidade, lançada em 2005, onde os usuários faziam perguntas e recebiam respostas do público. Seu conjunto de dados de 10 classes de tópicos é usado em aprendizado de máquina para benchmarks de classificação de texto.

Yahoo! Answers foi uma plataforma de perguntas e respostas movida pela comunidade, lançada em 2005 pela Yahoo!. Ela permitia que usuários publicassem perguntas sobre uma ampla variedade de tópicos e recebessem respostas de outros membros da comunidade. A plataforma operou até seu encerramento em 2021, mas seus dados arquivados se tornaram um recurso valioso para pesquisas em aprendizado de máquina, especialmente para tarefas de classificação de texto.

O conjunto de dados do Yahoo! Answers, derivado do conteúdo da plataforma, é um benchmark amplamente utilizado em processamento de linguagem natural. Ele consiste em perguntas e suas respostas correspondentes, rotuladas em 10 classes temáticas distintas. Esse conjunto de dados tem sido fundamental para treinar e avaliar modelos de redes neurais em tarefas como classificação de tópicos e resposta a perguntas.

Estrutura e Classes do Conjunto de Dados

O conjunto de dados do Yahoo! Answers compreende mais de 1,4 milhão de perguntas e respostas, cada uma atribuída a uma de 10 categorias: Sociedade e Cultura, Ciências e Matemática, Saúde, Educação e Referência, Computadores e Internet, Esportes, Negócios e Finanças, Entretenimento e Música, Família e Relacionamentos, e Política e Governo. O conjunto de dados é frequentemente dividido em conjuntos de treinamento e teste, com uma divisão típica de 1,4 milhão de amostras de treinamento e 60.000 amostras de teste. Cada amostra inclui o título da pergunta, o conteúdo da pergunta e a melhor resposta, juntamente com o rótulo da categoria.

Papel na Pesquisa em Aprendizado de Máquina

O conjunto de dados tem sido usado extensivamente em pesquisas de aprendizado de máquina para avaliar algoritmos de classificação. Ele é um benchmark padrão para avaliar modelos de aprendizado profundo, incluindo arquiteturas baseadas em transformadores. Pesquisadores o têm utilizado para testar o desempenho de modelos de linguagem de grande escala e outros sistemas de IA generativa na compreensão e categorização de conteúdo gerado por usuários. A natureza multiclasse do conjunto de dados e seu texto do mundo real o tornam um campo de teste desafiador e realista para a generalização de modelos.

Impacto no Desenvolvimento de IA

A disponibilidade do conjunto de dados do Yahoo! Answers contribuiu para avanços em inteligência artificial ao fornecer um corpus grande e rotulado para treinamento e avaliação. Ele tem sido usado em estudos que comparam a eficácia de várias funções de perda, técnicas de otimização e métodos de aumento de dados. O conjunto de dados também apoia pesquisas em aprendizado por transferência e aprendizado com poucos exemplos, onde modelos pré-treinados em grandes corpora são ajustados em conjuntos de dados rotulados menores, como este.

Legado e Uso Contínuo

Apesar do encerramento da plataforma, o conjunto de dados do Yahoo! Answers permanece um recurso popular em pesquisas acadêmicas e industriais. Ele está incluído em muitos conjuntos de benchmarks e é usado para avaliar o desempenho de novos modelos, incluindo aqueles baseados em atenção de múltiplas cabeças e codificação posicional. A longevidade do conjunto de dados ressalta o valor do conteúdo gerado pela comunidade para o avanço da pesquisa em inteligência artificial.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-learning·datasets·natural-language-processing·question-answering
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico