Les evals, abréviation d'évaluations, sont des évaluations systématiques du comportement des modèles ou agents d'intelligence artificielle. Dans le contexte des grands modèles de langage et des applications d'IA générative, les evals fonctionnent comme des suites de tests structurées conçues pour mesurer la performance, la sécurité et la fiabilité sur une gamme de tâches et de scénarios. Ils constituent un outil de praticien essentiel pour développer, déboguer et déployer des systèmes d'IA, fournissant une base quantitative pour comparer les versions de modèles, détecter les régressions et valider qu'une application répond à ses exigences prévues.
La pratique des evals s'est développée parallèlement aux progrès rapides de l'apprentissage automatique et de l'apprentissage profond. La recherche en IA précoce s'appuyait souvent sur des ensembles de données de référence - des collections fixes de tâches avec des réponses connues - pour mesurer les progrès. À mesure que les modèles sont devenus plus performants et ont été intégrés dans des produits réels, le besoin d'évaluations plus nuancées et spécifiques à l'application a augmenté. Les evals englobent désormais non seulement la précision sur des références standard, mais aussi des évaluations du raisonnement, de la cohérence factuelle, de la sécurité, des biais, du suivi d'instructions et du comportement agentique, où un système d'IA prend des actions dans un environnement.
Contexte historique et références
La lignée des evals remonte aux suites de référence classiques en intelligence artificielle. Par exemple, le test de Turing, proposé par Alan Turing en 1950, était une évaluation conceptuelle précoce de l'intelligence machine, bien qu'il soit rarement utilisé dans la pratique moderne. Dans les décennies qui ont suivi, les chercheurs ont développé des références spécifiques aux tâches pour des domaines comme les échecs, le traitement du langage naturel et la vision par ordinateur. L'avènement des réseaux de neurones et de l'apprentissage profond dans les années 2010 a accéléré la création de références à grande échelle comme ImageNet pour la classification d'images, qui a joué un rôle central dans la révolution de l'apprentissage profond.
Pour les modèles de langage, des références comme GLUE (General Language Understanding Evaluation) et son successeur SuperGLUE, introduites vers 2018-2019, ont fourni un ensemble standardisé de tâches couvrant l'analyse des sentiments, la réponse aux questions, l'implication textuelle et plus encore. Ces références ont permis aux chercheurs de comparer les modèles sur une base commune. Cependant, à mesure que les grands modèles de langage ont grandi en échelle et en capacité, ces références sont rapidement devenues saturées, incitant au développement d'ensembles d'évaluation plus difficiles et plus diversifiés.
Evals modernes pour les grands modèles de langage
Les evals contemporains pour les grands modèles de langage sont souvent construits par des organisations telles qu'OpenAI, Anthropic, Google DeepMind et des institutions académiques. Ils consistent généralement en un ensemble de prompts ou de tâches, chacun avec une grille d'évaluation ou un résultat attendu, et un mécanisme de notation. La notation peut être automatisée - par exemple, vérifier des correspondances exactes de chaînes, utiliser un modèle séparé comme juge, ou exécuter des tests unitaires contre du code généré - ou elle peut impliquer des évaluateurs humains qui évaluent la qualité des réponses selon des dimensions comme l'utilité, l'innocuité et l'honnêteté.
Un type courant d'evals est l'ensemble de questions à choix multiples ou à réponse courte dérivé d'examens existants ou de bases de connaissances organisées. Par exemple, MMLU (Massive Multitask Language Understanding) comprend des milliers de questions dans des sujets comme les mathématiques, l'histoire, le droit et la médecine. Une autre eval largement utilisée est la référence HellaSwag, qui teste le raisonnement de bon sens en demandant à un modèle de choisir la continuation la plus plausible d'une histoire. Ces références fournissent une mesure large des connaissances et des capacités de raisonnement d'un modèle.
Evals agentiques et comportementaux
Avec l'essor des agents d'IA - des systèmes capables d'utiliser des outils, de naviguer sur le web ou d'interagir avec des environnements logiciels - les evals se sont étendus pour couvrir le comportement agentique. Ces évaluations placent souvent un agent dans un environnement simulé et mesurent sa capacité à accomplir des tâches en plusieurs étapes, à se remettre des erreurs et à suivre des instructions sur de longs horizons. Par exemple, une eval pourrait demander à un agent de réserver un vol, d'écrire et d'exécuter du code, ou de naviguer dans un bureau virtuel, avec le succès défini par la correspondance du résultat final avec le résultat attendu.
Les evals comportementaux sondent également la sécurité et l'alignement. Ils incluent des tests adverses conçus pour provoquer des sorties nuisibles, telles que des instructions pour des activités illégales, des déclarations biaisées ou des fuites d'informations personnelles. Le red-teaming, où des testeurs humains essaient délibérément de casser un modèle, est une approche complémentaire qui informe souvent la conception d'evals automatisés. Les résultats de ces evals guident l'utilisation de techniques comme l'apprentissage par renforcement à partir de retours humains (RLHF) et l'IA constitutionnelle pour orienter le comportement du modèle.
Construire et exécuter des evals
En pratique, construire une eval implique plusieurs étapes. D'abord, un praticien définit la portée : quelles capacités ou comportements sont importants pour l'application ? Ensuite, il organise ou génère un ensemble de cas de test représentant des entrées typiques et des cas limites. Pour chaque cas de test, il spécifie une fonction de notation. Cela peut être une correspondance exacte simple, un score de similarité sémantique, une évaluation humaine basée sur une grille, ou un appel à un modèle juge qui évalue la réponse selon un prompt.
L'exécution des evals est généralement automatisée et intégrée dans le flux de travail de développement. Lorsqu'une nouvelle version de modèle est entraînée ou qu'un prompt est modifié, la suite d'evals est exécutée et les résultats sont comparés à une référence. Cela permet aux équipes de détecter les régressions - des cas où un changement améliore certaines métriques mais en dégrade d'autres. De nombreuses organisations maintiennent des plateformes d'evals internes qui enregistrent les résultats au fil du temps, permettant une analyse détaillée du comportement du modèle dans différentes catégories.
Un défi clé dans les evals est de garantir qu'ils ne sont pas surajustés. Si un modèle est entraîné directement sur les données d'evals, sa performance peut ne pas refléter la généralisation dans le monde réel. Pour atténuer cela, les ensembles d'evals sont souvent tenus à l'écart de l'entraînement, et de nouvelles versions sont publiées périodiquement. De plus, le phénomène de saturation des références - où les modèles atteignent des scores quasi parfaits - a conduit à la création de références plus difficiles et à l'utilisation de méthodes d'évaluation dynamiques ou adverses.
Le rôle de l'évaluation humaine
Malgré les avancées dans la notation automatisée, l'évaluation humaine reste un étalon-or pour de nombreux aspects de la qualité de l'IA. Les évaluateurs humains peuvent juger des qualités subtiles comme le ton, la créativité et la pertinence culturelle qui sont difficiles à capturer algorithmiquement. Cependant, l'évaluation humaine est coûteuse et lente, donc elle est souvent utilisée avec parcimonie, par exemple pour valider un sous-ensemble de sorties ou pour créer des données d'entraînement pour les modèles juges.
Ces dernières années, l'utilisation de grands modèles de langage comme juges est devenue courante. Un modèle fort est invité à évaluer la sortie d'un autre modèle selon une grille, et ses verdicts sont comparés aux jugements humains pour garantir la fiabilité. Cette approche se généralise bien mais introduit ses propres biais, que les chercheurs continuent d'étudier.
Evals dans l'industrie et la recherche
Les principaux laboratoires d'IA et fournisseurs de cloud ont fait des evals une partie centrale de leurs opérations. Par exemple, Anthropic a publié des évaluations détaillées de ses modèles Claude, y compris des évaluations de sécurité et de capacité. OpenAI a publié des evals pour ses modèles GPT, et Google DeepMind a contribué de nombreuses références à la communauté de recherche. Des efforts open-source, comme le EleutherAI Language Model Evaluation Harness, fournissent des outils pour exécuter une large gamme de références standard sur n'importe quel modèle.
Les evals jouent également un rôle dans les discussions réglementaires et politiques. Alors que les gouvernements envisagent comment régir l'intelligence artificielle, la capacité à mesurer et vérifier le comportement des modèles devient cruciale. Des evals standardisés pourraient servir de base à la certification ou à la conformité, bien qu'aucun standard universel n'ait encore été adopté.
Défis et orientations futures
Le domaine des evals fait face à plusieurs problèmes ouverts. L'un est la difficulté de mesurer des capacités qui ne sont pas facilement réduites à un score, comme la planification à long terme ou le bon sens. Un autre est le risque de la loi de Goodhart, où l'optimisation d'une métrique conduit à contourner la métrique plutôt qu'à améliorer la performance réelle. Il y a aussi la question de comment évaluer des modèles qui sont continuellement mis à jour ou qui interagissent avec le monde de manière imprévisible.
Les orientations futures incluent le développement d'evals plus dynamiques et adaptatifs, où l'ensemble de test change en fonction du comportement du modèle, et l'intégration des evals dans la boucle d'entraînement elle-même, permettant aux modèles d'être optimisés directement pour la performance des evals. Les chercheurs explorent également l'utilisation des evals pour mesurer l'alignement avec les valeurs humaines et pour détecter des capacités émergentes qui n'ont pas été explicitement entraînées.
En résumé, les evals sont une infrastructure essentielle pour le développement responsable de l'IA. Ils fournissent la boucle de rétroaction empirique qui stimule l'amélioration, garantit la sécurité et construit la confiance dans les systèmes d'IA. À mesure que la technologie évolue, les méthodes et outils pour l'évaluer évolueront également, faisant des evals un domaine vibrant et critique de recherche et de pratique continues.
Voir aussi
- grand modèle de langage
- IA générative
- apprentissage par renforcement à partir de retours d'IA
- intelligence artificielle
- apprentissage automatique
- apprentissage profond
- réseau de neurones
- transformeur
- OpenAI
- Anthropic
- Google DeepMind
- référence
- red-teaming
- élagage de modèle
- augmentation de données
- apprentissage par curriculum
- fonctions de perte
- attention multi-têtes
- recherche en faisceau
- mise à l'échelle de température