Données synthétiques

Traduit de l'anglais

Les données synthétiques sont des données générées artificiellement, souvent produites par les modèles d'IA eux-mêmes, utilisées pour entraîner ou augmenter les systèmes d'apprentissage automatique lorsque les données réelles sont rares, coûteuses ou sensibles.

Les données synthétiques sont des données générées artificiellement, généralement par un modèle ou une simulation, plutôt que collectées à partir d'événements du monde réel ou de contenus produits par des humains, et sont utilisées pour entraîner, affiner ou évaluer des systèmes d'apprentissage automatique. Dans le contexte des grands modèles de langage modernes, les données synthétiques désignent généralement du texte, du code ou des dialogues générés par un modèle d'IA existant, puis utilisés, souvent après filtrage, comme données d'entraînement pour un autre modèle, une pratique parfois décrite comme une forme de distillation lorsque les sorties d'un modèle plus fort enseignent à un modèle plus faible.

Les données synthétiques ont gagné en importance au milieu des années 2020, alors que les principaux laboratoires approchaient ce que les chercheurs appelaient le mur des données, un ralentissement de la croissance du texte humain de haute qualité facilement disponible sur Internet, rendant les données générées par des modèles un complément de plus en plus significatif au texte produit par des humains pour la poursuite du scaling.

Utilisations

Les données synthétiques servent à plusieurs fins dans le développement de l'IA. Elles peuvent augmenter des catégories de données rares, comme la génération d'exemples supplémentaires de langues peu courantes, de domaines spécialisés tels que les mathématiques ou le code, ou de conversations multi-tours coûteuses à collecter auprès d'humains à grande échelle. Elles sont largement utilisées dans les pipelines de apprentissage par renforcement à partir de retours humains et leurs successeurs, où un modèle ou un ensemble de modèles génère des réponses candidates qui sont ensuite classées ou filtrées pour créer un signal d'entraînement. Les données synthétiques jouent également un rôle central dans l'entraînement des modèles de raisonnement, où des domaines vérifiables comme les mathématiques et la programmation permettent aux solutions générées par un modèle d'être automatiquement vérifiées et aux solutions correctes d'être réutilisées comme exemples d'entraînement, une approche centrale des méthodes de apprentissage par renforcement derrière des systèmes tels que DeepSeek-R1. Au-delà du texte, les données synthétiques sont largement utilisées en vision par ordinateur et en robotique, où des environnements simulés génèrent des images étiquetées ou des données d'interaction qui seraient coûteuses à collecter physiquement.

Le débat sur l'effondrement du modèle

Un corpus de recherches commençant vers 2023 a soulevé des préoccupations concernant l'effondrement du modèle, une dégradation hypothétique de la qualité du modèle qui pourrait se produire si les modèles sont entraînés de manière répétée et indiscriminée sur des données générées par des modèles antérieurs, selon la théorie que chaque génération amplifierait les erreurs et perdrait la couverture de motifs rares mais importants de la distribution humaine d'origine. Des recherches ultérieures et la pratique industrielle ont suggéré que l'effondrement du modèle est un risque réel principalement lorsque les données synthétiques sont utilisées avec négligence et sans filtrage de qualité ou mélange avec des données réelles, et que des données synthétiques soigneusement organisées ou vérifiées, en particulier dans des domaines vérifiables, ne présentent pas la même dégradation et peuvent améliorer substantiellement la qualité du modèle. D'ici 2025, la plupart des laboratoires de pointe utilisaient des quantités substantielles de données synthétiques organisées comme partie standard de l'entraînement, plutôt que de les éviter.

Qualité et vérification

Parce que les données synthétiques héritent et peuvent amplifier les biais, les erreurs et les particularités stylistiques du modèle qui les a générées, les praticiens appliquent généralement des étapes de filtrage, comme l'utilisation d'un modèle séparé, souvent plus capable, ou d'un vérificateur basé sur des règles pour noter ou vérifier la qualité avant d'inclure des exemples générés dans un ensemble d'entraînement. Les domaines où la correction peut être automatiquement vérifiée, comme le code qui peut être exécuté et les mathématiques qui peuvent être contrôlées, sont considérés comme particulièrement adaptés à la génération de données synthétiques car les exemples de faible qualité peuvent être filtrés algorithmiquement, tandis que le texte créatif ou factuel ouvert est plus difficile à vérifier automatiquement et comporte un risque plus grand de dégrader silencieusement un modèle entraîné dessus.

Catégories:machine-learning·training-data
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique