Traduit de l'anglais

ACE 2005 est un corpus largement utilisé pour la recherche en extraction d'informations, contenant des documents annotés en anglais, chinois et arabe pour les tâches d'extraction d'entités, de relations et d'événements.

ACE 2005, officiellement connu sous le nom de jeu de données d'évaluation Automatic Content Extraction 2005, est un corpus multilingue développé par l'Institut national des normes et de la technologie des États-Unis (NIST) pour la recherche en extraction d'informations. Il a été publié en 2005 dans le cadre du programme ACE, qui visait à faire progresser les technologies de détection et de caractérisation des entités, des relations et des événements dans les textes en langage naturel. Le jeu de données est devenu une référence standard en traitement automatique du langage naturel (TAL), en particulier pour des tâches telles que la reconnaissance d'entités nommées, l'extraction de relations et l'extraction d'événements.

Le corpus se compose de documents annotés dans trois langues : l'anglais, le chinois et l'arabe. La partie anglaise comprend environ 600 documents provenant de diverses sources, notamment les fils de presse, les journaux télévisés, les conversations diffusées et les blogs. Les parties chinoise et arabe sont plus petites mais tout aussi diversifiées. Les annotations couvrent sept types d'entités (par exemple, personne, organisation, lieu), six types de relations (par exemple, physique, partie-tout, personnel/social) et huit types d'événements (par exemple, conflit, vie, mouvement). Chaque mention d'entité est liée à une entité canonique, et des relations sont identifiées entre les entités. Les annotations d'événements incluent des déclencheurs, des arguments et des mentions d'événements.

ACE 2005 est souvent utilisé en conjonction avec les jeux de données ACE 2004 et ACE 2002, mais il est le plus récent et le plus largement adopté. Il a joué un rôle déterminant dans le développement de nombreux systèmes de pointe, y compris ceux basés sur l'apprentissage profond et les grands modèles de langage. Le jeu de données est distribué par le Consortium de données linguistiques (LDC) sous le numéro de catalogue LDC2006T06.

Schéma d'annotation

Le schéma d'annotation dans ACE 2005 est hiérarchique. Les entités sont classées en types généraux et sous-types. Par exemple, une entité de type personne peut avoir des sous-types tels que individu, groupe ou indéfini. Les relations sont catégorisées en types et sous-types, avec des arguments étant des mentions d'entités. Les événements sont plus complexes : chaque mention d'événement a un déclencheur (un mot ou une phrase qui évoque l'événement), des arguments (participants et attributs) et une modalité (par exemple, affirmé, nié). Le jeu de données inclut également la coréférence inter-documents, reliant les mentions de la même entité à travers différents documents.

Utilisation dans la recherche

ACE 2005 a été une référence principale pour la recherche en extraction d'informations. De nombreux premiers systèmes utilisaient des approches basées sur des caractéristiques, telles que les machines à vecteurs de support et les modèles à entropie maximale. Avec l'avènement de l'apprentissage profond, des architectures neuronales comme les LSTM bidirectionnels et les réseaux convolutifs ont été appliquées. Plus récemment, des modèles basés sur les transformeurs, tels que BERT et ses variantes, ont obtenu des résultats de pointe sur ACE 2005. Le jeu de données est également utilisé pour l'extraction conjointe d'entités et de relations, l'extraction d'événements et l'apprentissage par transfert multilingue.

Limites et critiques

Malgré sa popularité, ACE 2005 présente des limites. Les directives d'annotation sont complexes, et le jeu de données est relativement petit, ce qui peut entraîner un surapprentissage. Les documents proviennent d'une période limitée (2003-2004), et le domaine est principalement les fils de presse et la diffusion, ce qui peut ne pas se généraliser à d'autres genres. De plus, la qualité de l'annotation varie selon les langues, et certains types d'événements sont rares. Les chercheurs ont proposé des extensions et des alternatives, telles que les jeux de données TAC-KBP et les jeux de données ERE (Entity, Relation, Event) plus récents.

Jeux de données associés et héritage

ACE 2005 fait partie d'une famille plus large de jeux de données ACE, y compris ACE 2002 et ACE 2004. Il a influencé la conception de corpus ultérieurs comme le jeu de données Rich ERE et le jeu de données d'extraction d'arguments d'événements. Le jeu de données reste une référence dans la communauté du TAL, et ses métriques d'évaluation (par exemple, F1 de mention d'entité, F1 de relation, F1 de déclencheur et d'argument d'événement) sont largement utilisées. De nombreux outils open-source, tels que Stanford CoreNLP et spaCy, fournissent des modèles entraînés sur ACE 2005 pour l'extraction d'entités et de relations.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:datasets·natural-language-processing·information-extraction·evaluation-corpora
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique