Traduit de l'anglais

TweetQA est un ensemble de données de référence pour la réponse aux questions sur les publications Twitter, conçu pour évaluer la capacité des systèmes d'IA à raisonner sur des textes informels, bruités et conversationnels. Il se compose de milliers de triplets question-réponse-tweet collectés à partir de vrais tweets.

["TweetQA est un jeu de donn\u00e9es de r\u00e9f\u00e9rence pour la r\u00e9ponse aux questions (QA) qui se concentre sur le contenu de la plateforme de m\u00e9dias sociaux Twitter (d\u00e9sormais X). Introduit en 2019 par des chercheurs de l'Universit\u00e9 de Californie du Sud et d'Amazon, il a \u00e9t\u00e9 cr\u00e9\u00e9 pour pallier les limites des jeux de donn\u00e9es QA existants, qui s'appuient g\u00e9n\u00e9ralement sur des sources bien \u00e9dit\u00e9es comme Wikip\u00e9dia ou des articles de presse. TweetQA fournit un banc d'essai pour \u00e9valuer dans quelle mesure les syst\u00e8mes d'intelligence artificielle peuvent g\u00e9rer le langage informel, abr\u00e9g\u00e9 et d\u00e9pendant du contexte courant dans les publications sur les m\u00e9dias sociaux.\n\nLe jeu de donn\u00e9es comprend plus de 13 000 paires question-r\u00e9ponse d\u00e9riv\u00e9es de plus de 4 000 tweets. Chaque tweet est associ\u00e9 \u00e0 une question g\u00e9n\u00e9r\u00e9e par un humain et \u00e0 une r\u00e9ponse concise, n\u00e9cessitant souvent une synth\u00e8se d'informations provenant de plusieurs parties du tweet ou une inf\u00e9rence sur des significations implicites. Les tweets couvrent des sujets divers, notamment des \u00e9v\u00e9nements d'actualit\u00e9, des anecdotes personnelles et des annonces publiques, et se caract\u00e9risent par des hashtags, des mentions, des emojis et une grammaire non standard.\n\n## Conception et Construction\n\nLe jeu de donn\u00e9es TweetQA a \u00e9t\u00e9 construit par crowdsourcing via Amazon Mechanical Turk. Les travailleurs devaient lire un tweet et g\u00e9n\u00e9rer une question en langage naturel \u00e0 laquelle un humain pourrait r\u00e9pondre \u00e0 partir du seul tweet, puis fournir la r\u00e9ponse correspondante. Pour garantir la qualit\u00e9, plusieurs travailleurs ont annot\u00e9 chaque tweet, et le jeu de donn\u00e9es final ne comprend que les instances o\u00f9 les r\u00e9ponses ont \u00e9t\u00e9 valid\u00e9es pour leur exactitude. Les cr\u00e9ateurs ont d\u00e9lib\u00e9r\u00e9ment s\u00e9lectionn\u00e9 des tweets suffisamment autonomes pour permettre une r\u00e9ponse sans contexte externe, bien que certaines questions exigent une compr\u00e9hension des indices sociaux implicites ou des connaissances g\u00e9n\u00e9rales.\n\n## \u00c9valuation et M\u00e9triques\n\nTweetQA est g\u00e9n\u00e9ralement utilis\u00e9 comme r\u00e9f\u00e9rence d'apprentissage supervis\u00e9. Les mod\u00e8les sont entra\u00een\u00e9s sur la partition d'entra\u00eenement (environ 70 % des donn\u00e9es) et \u00e9valu\u00e9s sur un ensemble de test r\u00e9serv\u00e9. Les principales m\u00e9triques d'\u00e9valuation sont la correspondance exacte (EM) et le score F1, qui mesurent le chevauchement au niveau des jetons entre les r\u00e9ponses pr\u00e9dites et les r\u00e9ponses de r\u00e9f\u00e9rence. \u00c9tant donn\u00e9 que les r\u00e9ponses sont souvent des phrases courtes ou des entit\u00e9s uniques, ces m\u00e9triques fournissent une \u00e9valuation stricte de la compr\u00e9hension en lecture et du raisonnement. Ce benchmark a \u00e9t\u00e9 adopt\u00e9 dans plusieurs efforts de recherche, notamment dans la communaut\u00e9 du apprentissage automatique, pour comparer les performances des mod\u00e8les sur des textes issus des m\u00e9dias sociaux.\n\n## D\u00e9fis et Importance\n\nContrairement aux jeux de donn\u00e9es QA traditionnels comme SQuAD, qui utilisent une prose formelle, TweetQA pr\u00e9sente des d\u00e9fis uniques. Les tweets sont limit\u00e9s \u00e0 280 caract\u00e8res, ce qui entra\u00eene une utilisation intensive d'abr\u00e9viations, d'argot et de ponctuation manquante. Ils s'appuient \u00e9galement souvent sur un contexte externe, comme des \u00e9v\u00e9nements tendance ou des r\u00e9f\u00e9rences sp\u00e9cifiques \u00e0 un utilisateur, ce qui peut \u00eatre ambigu. De plus, les r\u00e9ponses peuvent n\u00e9cessiter de combiner des informations provenant de plusieurs clauses ou d'interpr\u00e9ter le sarcasme et l'ironie. Ces facteurs font de TweetQA un test plus difficile pour les mod\u00e8les de r\u00e9seaux de neurones, en particulier ceux bas\u00e9s sur des architectures de transformeurs, qui sont pr\u00e9-entra\u00een\u00e9s sur des textes plus formels.\n\nLe jeu de donn\u00e9es a \u00e9t\u00e9 utilis\u00e9 pour \u00e9tudier la robustesse des syst\u00e8mes de grands mod\u00e8les de langage, y compris ceux d'OpenAI et d'autres organisations, face \u00e0 des entr\u00e9es bruit\u00e9es. Il a \u00e9galement inform\u00e9 le d\u00e9veloppement de m\u00e9thodes de pr\u00e9-entra\u00eenement adaptatif au domaine, o\u00f9 les mod\u00e8les sont affin\u00e9s sur des corpus de m\u00e9dias sociaux avant d'\u00eatre \u00e9valu\u00e9s sur TweetQA.\n\n## Travaux Connexes et Extensions\n\nTweetQA s'appuie sur des efforts ant\u00e9rieurs comme le Story Cloze Test et le benchmark SituatedQA, mais il se distingue par son focus sur le contenu de microblogging. Des recherches ult\u00e9rieures ont \u00e9tendu l'id\u00e9e \u00e0 d'autres plateformes sociales, comme Reddit et Facebook, ainsi qu'\u00e0 des contextes multilingues. Le jeu de donn\u00e9es a \u00e9galement \u00e9t\u00e9 utilis\u00e9 comme composant dans des cadres d'apprentissage multit\u00e2che, o\u00f9 un mod\u00e8le unique est entra\u00een\u00e9 sur plusieurs benchmarks QA pour am\u00e9liorer la g\u00e9n\u00e9ralisation.\n\n## Limites\n\nLes critiques ont not\u00e9 que les r\u00e9ponses de TweetQA sont souvent extractives, ce qui signifie qu'elles peuvent \u00eatre directement tir\u00e9es du texte du tweet, ce qui pourrait limiter sa capacit\u00e9 \u00e0 tester un raisonnement plus profond. Le jeu de donn\u00e9es refl\u00e8te \u00e9galement les biais d\u00e9mographiques et linguistiques des annotateurs et de la base d'utilisateurs de Twitter au moment de la collecte. En 2025, le jeu de donn\u00e9es reste publiquement disponible \u00e0 des fins de recherche, mais sa pertinence a \u00e9t\u00e9 remise en question compte tenu de l'\u00e9volution rapide du langage des m\u00e9dias sociaux et de l'\u00e9mergence de benchmarks plus complexes.\n\n## Voir Aussi\n\n- intelligence artificielle\n- apprentissage automatique\n- apprentissage profond\n- r\u00e9seaux de neurones\n- grands mod\u00e8les de langage\n- transformeurs\n- OpenAI\n\n## R\u00e9f\u00e9rences\n\n- Xiong, W., et al. (2019). \"TweetQA: A Social Media Focused Question Answering Dataset.\" Actes de l'ACL.\n- Articles de recherche citant TweetQA dans le contexte du traitement du langage naturel des m\u00e9dias sociaux.", true]

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:question-answering·dataset·natural-language-processing·social-media
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique