Capacités émergentes

Traduit de l'anglais

Les capacités émergentes sont des aptitudes qui semblent apparaître brusquement dans les grands modèles de langage une fois qu'ils franchissent une certaine échelle, plutôt que de s'améliorer progressivement, bien que les chercheurs débattent de la part réelle de cet effet par rapport à un artefact de mesure.

Les capacités émergentes, dans le contexte des grands modèles de langage, désignent des aptitudes qui semblent apparaître brusquement une fois qu'un modèle franchit un certain seuil de paramètres, de données d'entraînement ou de puissance de calcul, plutôt que de s'améliorer de manière fluide et prévisible comme le fait la perte globale d'entraînement sous les lois de mise à l'échelle. Une capacité est décrite comme émergente lorsqu'elle atteint un niveau proche du hasard dans les modèles plus petits, puis bondit à une performance nettement supérieure au hasard dans un modèle plus grand de la même famille, sans signal clair de l'amélioration à venir dans les scores des modèles plus petits.

Origines du terme

Le concept a été formalisé dans un article largement cité de 2022, « Emergent Abilities of Large Language Models », par Jason Wei et ses coauteurs, qui a examiné les résultats de benchmarks à travers des familles de modèles et identifié des dizaines de tâches, notamment certains problèmes arithmétiques, certaines tâches de raisonnement en plusieurs étapes et le comportement de suivi d'instructions, où la performance restait plate près de la devinette aléatoire pour les modèles plus petits, puis augmentait fortement une fois qu'un modèle atteignait une taille particulière. L'article a relié ce schéma à des techniques telles que le apprentissage en quelques exemples et l'apprentissage en contexte, où la capacité d'un modèle à utiliser des exemples fournis dans l'invite elle-même, plutôt que par un entraînement supplémentaire, semblait dépendre du franchissement d'un seuil de capacité. Le raisonnement en chaîne de pensée, une technique où l'on demande à un modèle de raisonner étape par étape avant de répondre, a été cité comme une technique dont le bénéfice semblait n'apparaître que dans des modèles suffisamment grands, offrant peu ou pas d'avantage, et parfois nuisant à la performance dans les modèles plus petits.

La critique du « mirage »

En 2023, les chercheurs Rylan Schaeffer, Brando Miranda et Sanmi Koyejo ont publié un article intitulé « Are Emergent Abilities of Large Language Models a Mirage? », arguant que de nombreuses capacités émergentes prétendues étaient un artefact des métriques choisies par les chercheurs plutôt qu'une propriété réelle des modèles sous-jacents. Ils ont montré que passer d'une métrique de précision stricte, tout ou rien, qui note une réponse comme entièrement correcte ou entièrement incorrecte, à une métrique plus lisse avec crédit partiel, sur les mêmes tâches et les mêmes sorties de modèles, transformait souvent un saut apparemment net de performance en une amélioration graduelle et continue qui suivait de près les lois de mise à l'échelle. Selon cette vision, la capacité sous-jacente s'améliorait de manière fluide depuis le début, et seul le choix d'une règle de notation discontinue faisait paraître l'amélioration comme une émergence soudaine.

Débat en cours

Le différend n'est pas entièrement résolu. Les partisans du cadre original notent que certaines capacités semblent réellement nécessiter un seuil de mise à l'échelle pour apparaître, et que l'expérience pratique d'utilisation de modèles de tailles différentes sur des tâches réelles, pas seulement sur des benchmarks, montre souvent des différences qualitatives plutôt qu'incrémentales dans ce qu'un modèle peut faire de manière fiable. Les sceptiques répondent que la charge de la preuve devrait incomber à la démonstration d'une transition abrupte sous des métriques qui ne sont pas elles-mêmes discontinues par construction, et que de nombreux sauts spectaculaires prétendus n'ont pas résisté à un examen statistique plus approfondi. Ce débat dépasse l'intérêt académique car il influence la prévisibilité des gains de capacité futurs : si des aptitudes peuvent apparaître soudainement et de manière imprévisible à une échelle pas encore atteinte, cela complique les efforts pour prévoir les risques associés à des systèmes plus capables, une préoccupation qui relie les capacités émergentes à la discussion plus large sur l'intelligence artificielle générale et l'risque existentiel lié à l'IA.

Catégories:large-language-models·research·deep-learning
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique