TREC-6 est un benchmark largement utilisé pour la classification de questions en traitement du langage naturel. Il définit six catégories sémantiques générales dans lesquelles une question est placée : ABBREVIATION, ENTITY, DESCRIPTION, HUMAN, LOCATION et NUMERIC. Le jeu de données a été introduit dans le cadre du volet de réponse aux questions de la sixième conférence Text REtrieval Conference (TREC-6) en 1999, et il est depuis devenu un banc d'essai standard pour évaluer les classifieurs qui mappent les questions à ces catégories.
La tâche est généralement formulée comme un problème d'apprentissage supervisé : étant donné une chaîne de question, un système doit produire l'une des six étiquettes. Le jeu de données TREC-6 original contient 5 452 questions d'entraînement et 500 questions de test, avec les étiquettes générales dérivées d'une hiérarchie plus fine de 50 classes. Le benchmark est souvent utilisé aux côtés des variantes TREC-10 et TREC-11, mais TREC-6 fait spécifiquement référence au cadre général à six classes. Les chercheurs l'ont utilisé pour comparer des méthodes basées sur des caractéristiques, telles que les machines à vecteurs de support avec des caractéristiques lexicales et syntaxiques, aux approches modernes de réseaux de neurones.
Définition du jeu de données et de la tâche
Le jeu de données TREC-6 est dérivé de la collection de questions du volet QA de TREC, qui inclut des questions provenant de sources comme les corpus TREC-8 et TREC-9. Chaque question est annotée avec l'un des six types généraux. Par exemple, « Quelle est la capitale de la France ? » relève de LOCATION, tandis que « Qui a écrit Hamlet ? » relève de HUMAN. La catégorie NUMERIC couvre les questions sur les quantités, les dates et les pourcentages. La catégorie ENTITY inclut les questions sur des objets spécifiques, comme « Quel est le bâtiment le plus haut ? ». La catégorie ABBREVIATION traite des questions comme « Que signifie NATO ? » et DESCRIPTION couvre les questions sur les définitions et les explications.
La métrique d'évaluation standard est la précision de classification sur l'ensemble de test. Comme les classes sont déséquilibrées (ENTITY et NUMERIC sont plus fréquentes), la précision reste le principal chiffre rapporté, mais certaines études rapportent également les scores F1 par classe. Le benchmark est petit selon les normes modernes, mais il reste utile pour un prototypage rapide et pour étudier l'effet de la formulation des questions sur la classification.
Contexte historique
TREC-6 faisait partie de la série de conférences TREC organisée par l'Institut national des normes et de la technologie des États-Unis (NIST). Le volet de réponse aux questions a commencé en 1999 avec TREC-8, mais le label TREC-6 fait spécifiquement référence au sixième événement TREC, qui incluait une tâche pilote de QA. Le schéma de classification générale a été formalisé dans les années suivantes, et le jeu de données TREC-6 est devenu une référence courante dans les articles académiques. Les premiers systèmes reposaient sur des règles artisanales et des classifieurs statistiques, utilisant souvent des caractéristiques comme les n-grammes de mots, les étiquettes de parties du discours et la reconnaissance d'entités nommées.
Approches et performances
Les approches classiques de TREC-6 incluent l'utilisation d'une machine à vecteurs de support avec des caractéristiques de sac de mots, qui atteignait environ 80 à 85 % de précision. Des méthodes plus sophistiquées intégraient des arbres d'analyse syntaxique et un étiquetage des rôles sémantiques. Avec l'essor du apprentissage profond, les chercheurs ont appliqué des réseaux de neurones convolutifs et des réseaux récurrents, atteignant souvent 90 à 95 % de précision. L'introduction de modèles basés sur transformer, tels que BERT, a poussé la précision au-delà de 97 % sur l'ensemble de test, bien que la petite taille du jeu de données signifie que la variance entre les exécutions peut être significative.
Une technique notable est l'utilisation de augmentation de données pour étendre l'ensemble d'entraînement, car 5 452 questions est relativement limité. Certaines études ont également utilisé apprentissage par curriculum pour ordonner les exemples d'entraînement par difficulté. Le benchmark est souvent utilisé comme un test de cohérence pour de nouvelles architectures, car il est léger et rapide à entraîner.
Relation avec les systèmes modernes
Bien que TREC-6 soit une tâche de classification simple, il reste pertinent comme composant de pipelines plus larges de réponse aux questions. Les grands modèles de langage modernes peuvent résoudre TREC-6 avec une précision quasi parfaite, mais le benchmark est toujours utilisé pour évaluer l'interprétabilité des classifieurs et pour tester la robustesse face à la reformulation. Les catégories générales sont également utilisées dans les systèmes de dialogue et la recherche d'informations pour router les requêtes vers des gestionnaires appropriés.
Le benchmark a été critiqué pour être trop facile et pour ne pas refléter la complexité des questions du monde réel, mais il est encore cité dans les articles comme référence de base. Le jeu de données TREC-6 est publiquement disponible et peut être téléchargé depuis le site web du NIST ou via des bibliothèques populaires d'apprentissage automatique.