Traduzido do inglês

Dados sintéticos são dados gerados artificialmente, frequentemente produzidos pelos próprios modelos de IA, usados para treinar ou aumentar sistemas de aprendizado de máquina quando dados reais são escassos, caros ou sensíveis.

Dados sintéticos são dados que foram gerados artificialmente, tipicamente por um modelo ou simulação, em vez de coletados de eventos do mundo real ou de conteúdo produzido por humanos, e são usados para treinar, ajustar ou avaliar sistemas de aprendizado de máquina. No contexto dos modernos modelos de linguagem de grande porte, dados sintéticos geralmente se referem a texto, código ou diálogo gerado por um modelo de IA existente e depois usado, muitas vezes após filtragem, como dados de treinamento para outro modelo, uma prática às vezes descrita como uma forma de destilação quando as saídas de um modelo mais forte ensinam a um mais fraco.

Os dados sintéticos ganharam importância em meados da década de 2020, à medida que os principais laboratórios se aproximavam do que os pesquisadores chamavam de teto de dados, uma desaceleração no crescimento de texto humano de alta qualidade prontamente disponível na internet, tornando os dados gerados por modelos um complemento cada vez mais significativo ao texto produzido por humanos para a continuação do escalonamento.

Usos

Os dados sintéticos servem a vários propósitos no desenvolvimento de IA. Eles podem aumentar categorias escassas de dados, como gerar exemplos adicionais de línguas raras, domínios especializados como matemática ou código, ou conversas de múltiplos turnos que são caras de coletar de humanos em escala. São amplamente usados em pipelines de aprendizado por reforço a partir de feedback humano e seus sucessores, onde um modelo ou um conjunto de modelos gera respostas candidatas que são então classificadas ou filtradas para criar sinal de treinamento. Os dados sintéticos também desempenham um papel central no treinamento de modelos de raciocínio, onde domínios verificáveis como matemática e programação permitem que as soluções geradas pelo próprio modelo sejam verificadas automaticamente e as corretas reutilizadas como exemplos de treinamento, uma abordagem central aos métodos de aprendizado por reforço por trás de sistemas como DeepSeek-R1. Além de texto, os dados sintéticos são amplamente usados em visão computacional e robótica, onde ambientes simulados geram imagens rotuladas ou dados de interação que seriam caros de coletar fisicamente.

O debate sobre o colapso de modelo

Um corpo de pesquisa começando por volta de 2023 levantou preocupações sobre o colapso de modelo, uma degradação hipotética na qualidade dos modelos que poderia ocorrer se os modelos fossem treinados repetidamente e indiscriminadamente em dados gerados por modelos anteriores, sob a teoria de que cada geração amplificaria erros e perderia cobertura de padrões raros, mas importantes, da distribuição original gerada por humanos. Pesquisas subsequentes e a prática da indústria sugeriram que o colapso de modelo é um risco real principalmente quando os dados sintéticos são usados de forma descuidada e sem filtragem de qualidade ou mistura com dados reais, e que dados sintéticos cuidadosamente curados ou verificados, particularmente em domínios verificáveis, não exibem a mesma degradação e podem melhorar substancialmente a qualidade do modelo. Em 2025, a maioria dos laboratórios de ponta usava quantidades substanciais de dados sintéticos curados como parte padrão do treinamento, em vez de evitá-los.

Qualidade e verificação

Como os dados sintéticos herdam e podem amplificar os vieses, erros e peculiaridades estilísticas do modelo que os gerou, os profissionais geralmente aplicam etapas de filtragem, como usar um modelo separado, muitas vezes mais capaz, ou um verificador baseado em regras para pontuar ou verificar a qualidade antes de incluir exemplos gerados em um conjunto de treinamento. Domínios onde a correção pode ser verificada automaticamente, como código que pode ser executado e matemática que pode ser conferida, são considerados particularmente adequados para a geração de dados sintéticos porque exemplos de baixa qualidade podem ser filtrados algoritmicamente, enquanto texto criativo ou factual de formato aberto é mais difícil de verificar automaticamente e carrega maior risco de degradar silenciosamente um modelo treinado nele.

Categorias:machine-learning·training-data
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico