BulSemCor est un corpus sémantique pour la langue bulgare, créé pour soutenir la recherche et le développement dans le traitement automatique du langage naturel (TAL). Il consiste en une collection de textes bulgares annotés avec des informations linguistiques, principalement axées sur les sens des mots et les rôles sémantiques. Le corpus sert de référence et de ressource d'entraînement pour les modèles d'apprentissage automatique qui doivent comprendre le sens en bulgare, une langue slave méridionale disposant de ressources numériques relativement limitées par rapport à l'anglais.
La ressource a été développée dans le cadre d'efforts plus larges visant à construire des technologies linguistiques pour les langues moins dotées. Sa création a impliqué une collaboration entre des linguistes computationnels et des informaticiens, visant à fournir un ensemble de données standardisé pouvant être réutilisé dans différentes tâches de TAL. En offrant un ensemble soigneusement sélectionné d'exemples annotés, BulSemCor permet aux chercheurs d'entraîner et d'évaluer des modèles pour des tâches telles que la désambiguïsation lexicale (déterminer quel sens d'un mot est utilisé dans un contexte) et l'étiquetage des rôles sémantiques (identifier les relations entre les verbes et leurs arguments).
Structure et annotation
BulSemCor est organisé comme un ensemble de documents textuels, chacun segmenté en phrases et en tokens. L'annotation suit des cadres linguistiques établis, y compris l'inventaire des sens de type Princeton WordNet adapté au bulgare. Chaque mot de contenu (noms, verbes, adjectifs et certains adverbes) est lié à un identifiant de sens spécifique, permettant une analyse sémantique précise. De plus, le corpus inclut des annotations pour les entités nommées et les étiquettes de parties du discours, qui sont des prérequis courants pour un traitement sémantique plus approfondi.
Le processus d'annotation a été réalisé par des annotateurs humains formés, avec des mesures de contrôle qualité pour garantir la cohérence. L'accord inter-annotateurs a été mesuré pour valider la fiabilité des étiquettes, et les désaccords ont été résolus par discussion ou adjudication. Cette approche rigoureuse fait de BulSemCor une référence fiable pour évaluer les systèmes automatiques.
Applications dans la recherche en IA
BulSemCor a été utilisé dans plusieurs projets de recherche axés sur le TAL bulgare. Il sert d'ensemble d'entraînement pour des modèles d'apprentissage automatique supervisé, y compris ceux basés sur les réseaux de neurones et les transformeurs. Par exemple, les chercheurs ont utilisé le corpus pour affiner les grands modèles de langage pour des tâches sémantiques, obtenant des améliorations par rapport aux modèles entraînés uniquement sur des données multilingues. Le corpus soutient également le développement de techniques de augmentation de données, où des exemples synthétiques supplémentaires sont générés pour élargir les données annotées limitées.
Dans le contexte plus large de l'intelligence artificielle, BulSemCor contribue à l'objectif de rendre les systèmes d'IA plus inclusifs envers les langues diverses. Alors que la plupart des ressources en TAL se concentrent sur l'anglais, des corpus comme BulSemCor permettent la création d'outils pour les locuteurs bulgares, y compris les moteurs de recherche, les chatbots et les systèmes de traduction. Cela s'aligne sur les efforts d'organisations telles que Google DeepMind et OpenAI pour améliorer les capacités multilingues, bien que ces efforts privilégient souvent les langues plus dotées en ressources.
Comparaison avec d'autres corpus
BulSemCor est similaire en objectif aux corpus sémantiques d'autres langues, tels que SemCor pour l'anglais ou MultiSemCor pour les projets multilingues. Cependant, sa taille est plus petite, reflétant les défis de l'annotation d'une langue moins dotée. Au début des années 2020, BulSemCor contenait des dizaines de milliers de phrases annotées, ce qui est suffisant pour entraîner des modèles de petite à moyenne taille, mais peut être limitant pour les très grands systèmes de apprentissage profond. Les chercheurs combinent souvent BulSemCor avec d'autres ressources, telles que des corpus parallèles ou des textes non annotés, pour améliorer les performances.
Contrairement à certains corpus qui se concentrent uniquement sur les sens des mots, BulSemCor inclut également des annotations de rôles sémantiques, ce qui le rend plus polyvalent. Cette double focalisation lui permet de soutenir à la fois la sémantique lexicale (sens des mots) et la structure prédicat-argument (qui fait quoi à qui), essentielles pour des tâches comme le réponse aux questions et le résumé de texte (bien que ces tâches spécifiques ne soient pas directement couvertes dans le corpus).
Disponibilité et orientations futures
BulSemCor est publiquement disponible à des fins de recherche, généralement distribué via des dépôts académiques ou le site officiel du projet. La licence permet une utilisation non commerciale, avec des restrictions sur la redistribution. Cette ouverture a facilité son adoption dans des cours universitaires et des laboratoires de recherche en Europe et au-delà.
Les travaux futurs sur BulSemCor pourraient impliquer l'expansion de sa taille, l'ajout de nouvelles couches d'annotation (telles que la coréférence ou les relations de discours) et la mise à jour de l'inventaire des sens pour refléter l'évolution de la langue. Il existe également un potentiel pour intégrer le corpus avec AWS Trainium ou d'autres infrastructures d'entraînement basées sur le cloud, bien que de tels efforts nécessiteraient un financement et une coordination supplémentaires. Alors que l'intérêt pour les langues peu dotées croît dans la communauté de l'IA, des ressources comme BulSemCor sont susceptibles de devenir plus importantes, soutenant le développement de systèmes d'IA générative plus équitables.
Défis et limites
Un défi majeur est le coût et le temps requis pour l'annotation manuelle, ce qui limite la taille du corpus. De plus, l'inventaire des sens peut ne pas couvrir tous les termes spécifiques à un domaine, en particulier dans les domaines techniques ou scientifiques. Une autre limitation est le manque de variation dialectale, car le corpus est basé sur le bulgare standard. Ces facteurs signifient que les modèles entraînés sur BulSemCor peuvent ne pas se généraliser parfaitement à tous les textes du monde réel, mais ils fournissent néanmoins une base solide pour des recherches supplémentaires.
Malgré ces limites, BulSemCor représente une avancée significative pour le TAL bulgare. Il démontre la faisabilité de créer des ressources sémantiques de haute qualité pour des langues avec moins d'outils numériques, et il fournit un modèle pour des projets similaires dans d'autres langues slaves ou balkaniques. Son développement continu dépendra de la collaboration entre les institutions académiques et la communauté plus large du TAL.