Datos sintéticos

Traducido del inglés

Los datos sintéticos son datos generados artificialmente, a menudo producidos por los propios modelos de IA, que se utilizan para entrenar o aumentar sistemas de aprendizaje automático cuando los datos reales son escasos, costosos o sensibles.

Los datos sintéticos son datos que han sido generados artificialmente, típicamente mediante un modelo o simulación, en lugar de recopilarse de eventos del mundo real o contenido producido por humanos, y se utilizan para entrenar, ajustar o evaluar sistemas de aprendizaje automático. En el contexto de los grandes modelos de lenguaje modernos, los datos sintéticos suelen referirse a texto, código o diálogo generado por un modelo de IA existente y luego utilizado, a menudo tras un filtrado, como datos de entrenamiento para otro modelo, una práctica que a veces se describe como una forma de destilación cuando las salidas de un modelo más fuerte enseñan a uno más débil.

Los datos sintéticos ganaron importancia a mediados de la década de 2020, cuando los principales laboratorios se acercaron a lo que los investigadores denominaron el muro de datos, una desaceleración en el crecimiento de texto humano de alta calidad fácilmente disponible en internet, lo que hizo que los datos generados por modelos fueran un complemento cada vez más significativo del texto producido por humanos para continuar con el escalado.

Usos

Los datos sintéticos sirven para varios propósitos en el desarrollo de la IA. Pueden aumentar categorías escasas de datos, como generar ejemplos adicionales de idiomas raros, dominios especializados como matemáticas o código, o conversaciones de múltiples turnos que son costosas de recopilar de humanos a gran escala. Se utilizan extensamente en los pipelines de aprendizaje por refuerzo con retroalimentación humana y sus sucesores, donde un modelo o un conjunto de modelos genera respuestas candidatas que luego se clasifican o filtran para crear señal de entrenamiento. Los datos sintéticos también juegan un papel central en el entrenamiento de modelos de razonamiento, donde dominios verificables como matemáticas y programación permiten que las soluciones generadas por el propio modelo se verifiquen automáticamente y las correctas se reutilicen como ejemplos de entrenamiento, un enfoque central en los métodos de aprendizaje por refuerzo detrás de sistemas como DeepSeek-R1. Más allá del texto, los datos sintéticos se usan ampliamente en visión por computadora y robótica, donde entornos simulados generan imágenes etiquetadas o datos de interacción que serían costosos de recopilar físicamente.

El debate sobre el colapso del modelo

Un cuerpo de investigación que comenzó alrededor de 2023 planteó preocupaciones sobre el colapso del modelo, una degradación hipotética en la calidad del modelo que podría ocurrir si los modelos se entrenan repetida e indiscriminadamente con datos generados por modelos anteriores, según la teoría de que cada generación amplificaría errores y perdería cobertura de patrones raros pero importantes de la distribución original generada por humanos. Investigaciones posteriores y la práctica industrial sugirieron que el colapso del modelo es un riesgo real principalmente cuando los datos sintéticos se usan descuidadamente y sin filtrado de calidad o mezcla con datos reales, y que los datos sintéticos cuidadosamente curados o verificados, particularmente en dominios verificables, no muestran la misma degradación y pueden mejorar sustancialmente la calidad del modelo. Para 2025, la mayoría de los laboratorios fronterizos usaban cantidades sustanciales de datos sintéticos curados como parte estándar del entrenamiento, en lugar de evitarlos.

Calidad y verificación

Debido a que los datos sintéticos heredan y pueden amplificar los sesgos, errores y peculiaridades estilísticas del modelo que los generó, los profesionales generalmente aplican pasos de filtrado, como usar un modelo separado, a menudo más capaz, o un verificador basado en reglas para puntuar o verificar la calidad antes de incluir ejemplos generados en un conjunto de entrenamiento. Los dominios donde la corrección puede verificarse automáticamente, como código que puede ejecutarse y matemáticas que pueden comprobarse, se consideran particularmente adecuados para la generación de datos sintéticos porque los ejemplos de baja calidad pueden filtrarse algorítmicamente, mientras que el texto creativo o factual de final abierto es más difícil de verificar automáticamente y conlleva un mayor riesgo de degradar silenciosamente un modelo entrenado con él.

Categorías:machine-learning·training-data
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial