Traduzido do inglês

Dados de treinamento são o corpus de exemplos usados para ensinar um modelo de aprendizado de máquina, cuja escala, qualidade e origem são fatores determinantes da capacidade e uma fonte de controvérsia legal para sistemas de IA.

Dados de treinamento são o corpo de exemplos usados para ensinar um modelo de aprendizado de máquina, a partir do qual o modelo aprende padrões estatísticos durante o processo de treinamento. Para modelos de linguagem de grande porte modernos, os dados de treinamento geralmente consistem em quantidades enormes de texto extraído da web pública, conjuntos de dados licenciados, livros, repositórios de código e, cada vez mais, dados sintéticos gerados por outros modelos, com a escala, diversidade e qualidade desses dados atuando como um dos principais impulsionadores da capacidade do modelo, juntamente com o tamanho do modelo e o poder computacional, conforme descrito pelas leis de escalonamento.

A composição e a origem dos dados de treinamento tornaram-se um ponto significativo de controvérsia legal, ética e comercial a partir de cerca de 2023, à medida que autores, artistas, editores e outros detentores de direitos processaram desenvolvedores de IA pelo uso de material protegido por direitos autorais, e à medida que textos de alta qualidade facilmente extraídos da web se tornaram mais escassos em relação ao apetite crescente por dados de modelos cada vez maiores.

Fontes e composição

Os corpora de treinamento para modelos de linguagem de grande porte geralmente são compostos por uma mistura de fontes: varreduras amplas da web, como o Common Crawl, subconjuntos da web selecionados e filtrados, como os conjuntos de dados por trás do GPT-3 e seus sucessores, livros digitalizados, a Wikipédia e outros sites de referência, código de programação de repositórios como o GitHub, artigos acadêmicos e conteúdo licenciado obtido por meio de acordos comerciais com editores, empresas de mídia de banco de imagens e outros detentores de direitos, uma prática que cresceu significativamente entre os principais laboratórios a partir de 2023 como alternativa à extração não licenciada. Os dados geralmente são deduplicados, filtrados por qualidade e toxicidade e, cada vez mais, ponderados ou sobreamostrados em direção a categorias de maior valor, como código, livros didáticos e texto denso em raciocínio, refletindo pesquisas que sugerem que a qualidade e a mistura dos dados importam tanto quanto o volume bruto.

O muro de dados

Por volta de 2024 e 2025, vários pesquisadores e líderes de laboratórios discutiram publicamente um muro de dados iminente: o suprimento finito de texto humano de alta qualidade e prontamente disponível na internet pública, estimado em dezenas de trilhões de tokens, estava sendo aproximado ou excedido pelas execuções de treinamento dos maiores modelos. As respostas propostas incluíam o uso crescente de dados sintéticos, acordos de licenciamento para dados anteriormente indisponíveis para extração, como arquivos, fóruns privados e transcrições de vídeo, treinamento multimodal que extrai sinais de imagens, áudio e vídeo em vez de apenas texto, e abordagens arquiteturais ou algorítmicas, incluindo o escalonamento de computação em tempo de teste, destinadas a extrair mais capacidade sem um aumento proporcional nos dados de pré-treinamento.

As práticas de dados de treinamento estão no centro de uma onda de processos judiciais de direitos autorais de IA movidos a partir de 2023, incluindo casos apresentados pelo The New York Times, grupos de autores, artistas visuais e gravadoras contra empresas como OpenAI, Meta, Stability AI e Midjourney, geralmente alegando que obras protegidas por direitos autorais foram usadas para treinar modelos sem permissão ou compensação, enquanto os réus geralmente argumentam que o treinamento constitui uso justo ou uma doutrina equivalente sob a lei de IA e direitos autorais. Separadamente, pesquisadores e jornalistas documentaram que alguns conjuntos de dados de treinamento incluíam dados pessoais extraídos sem consentimento e, em pelo menos um caso documentado envolvendo o conjunto de dados LAION usado para modelos de imagem, material ilegal que exigiu remediação de emergência, provocando um escrutínio mais amplo das práticas de curadoria e divulgação de conjuntos de dados, uma área que reguladores, incluindo o Ato de IA da UE, cada vez mais exigem documentação.

Categorias:machine-learning·data
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico