Données d’entraînement

Traduit de l'anglais

Les données d'entraînement sont le corpus d'exemples utilisé pour enseigner un modèle d'apprentissage automatique, dont l'échelle, la qualité et la provenance sont des facteurs majeurs de capacité et une source de controverse juridique pour les systèmes d'IA.

Les données d'entraînement sont l'ensemble des exemples utilisés pour enseigner un modèle d'apprentissage automatique, à partir desquels le modèle apprend des motifs statistiques pendant le processus d'entraînement. Pour les grands modèles de langage modernes, les données d'entraînement consistent généralement en d'énormes quantités de texte extrait du web public, de jeux de données sous licence, de livres, de référentiels de code et, de plus en plus, de données synthétiques générées par d'autres modèles, l'échelle, la diversité et la qualité de ces données agissant comme l'un des principaux moteurs de la capacité du modèle, aux côtés de la taille du modèle et de la puissance de calcul, comme le décrivent les lois de mise à l'échelle.

La composition et la provenance des données d'entraînement sont devenues un point de contention juridique, éthique et commercial important à partir d'environ 2023, alors que des auteurs, artistes, éditeurs et autres titulaires de droits ont intenté des poursuites contre les développeurs d'IA pour l'utilisation de matériel protégé par le droit d'auteur, et que le texte de haute qualité facilement extractible devenait plus rare par rapport à l'appétit croissant en données des modèles toujours plus grands.

Sources et composition

Les corpus d'entraînement des grands modèles de langage sont généralement tirés d'un mélange de sources : des explorations web étendues comme Common Crawl, des sous-ensembles du web organisés et filtrés tels que les jeux de données derrière GPT-3 et ses successeurs, des livres numérisés, Wikipédia et d'autres sites de référence, du code de programmation provenant de référentiels comme GitHub, des articles académiques et du contenu sous licence obtenu via des accords commerciaux avec des éditeurs, des entreprises de médias stock et d'autres titulaires de droits, une pratique qui a considérablement augmenté parmi les grands laboratoires à partir de 2023 comme alternative à l'extraction sans licence. Les données sont généralement dédupliquées, filtrées pour la qualité et la toxicité, et de plus en plus pondérées ou suréchantillonnées vers des catégories de plus grande valeur comme le code, les manuels et le texte dense en raisonnement, reflétant des recherches suggérant que la qualité et le mélange des données importent autant que le volume brut.

Le mur des données

Vers 2024 et 2025, plusieurs chercheurs et dirigeants de laboratoires ont publiquement discuté d'un mur des données approchant : l'offre finie de texte généré par les humains, de haute qualité et facilement disponible sur le web public, estimée à des dizaines de billions de jetons, était approchée ou dépassée par les cycles d'entraînement des plus grands modèles. Les réponses proposées incluaient l'utilisation croissante de données synthétiques, des accords de licence pour des données auparavant non disponibles pour l'extraction, comme les archives, les forums privés et les transcriptions vidéo, l'entraînement multimodal qui tire des signaux des images, de l'audio et de la vidéo plutôt que du texte seul, et des approches architecturales ou algorithmiques, y compris la mise à l'échelle du calcul au moment du test, visant à extraire plus de capacité sans augmentation proportionnelle des données de pré-entraînement.

Controverses juridiques et éthiques

Les pratiques de données d'entraînement sont au cœur d'une vague de poursuites sur le droit d'auteur en IA déposées à partir de 2023, y compris des affaires portées par The New York Times, des groupes d'auteurs, d'artistes visuels et de maisons de disques contre des entreprises comme OpenAI, Meta, Stability AI et Midjourney, alléguant généralement que des œuvres protégées par le droit d'auteur ont été utilisées pour entraîner des modèles sans permission ni compensation, tandis que les défendeurs ont généralement soutenu que l'entraînement constitue un usage équitable ou une doctrine équivalente en vertu du droit d'auteur et IA. Par ailleurs, des chercheurs et des journalistes ont documenté que certains jeux de données d'entraînement incluaient des données personnelles extraites sans consentement, et dans au moins un cas documenté impliquant le jeu de données LAION utilisé pour les modèles d'images, du matériel illégal nécessitant une remédiation d'urgence, suscitant un examen plus approfondi des pratiques de curation et de divulgation des jeux de données, un domaine pour lequel les régulateurs, y compris le règlement européen sur l'IA, exigent de plus en plus de documentation.

Catégories:machine-learning·data
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique