TACRED (TAC Relation Extraction Dataset) es un conjunto de datos de referencia ampliamente utilizado para la tarea de extracción de relaciones en el procesamiento del lenguaje natural. Fue introducido por investigadores de la Universidad de Stanford y el Instituto Allen para la Inteligencia Artificial en 2017. El conjunto de datos proporciona una gran colección de oraciones anotadas con pares de entidades y sus correspondientes relaciones semánticas, sirviendo como un banco de pruebas estándar para desarrollar y evaluar modelos de extracción de relaciones, particularmente aquellos basados en técnicas de aprendizaje automático y aprendizaje profundo.
El conjunto de datos se construyó a partir de las evaluaciones de TAC KBP (Knowledge Base Population), específicamente de las competiciones anuales de 2009 a 2012. Contiene 106,264 oraciones, cada una emparejada con un par de entidades de consulta (sujeto y objeto) y una etiqueta de relación. Las relaciones se extraen de un conjunto predefinido de 41 tipos, incluyendo 18 relaciones generales (por ejemplo, per:spouse, org:founded_by) y 23 relaciones específicas de la tarea TAC KBP (por ejemplo, per:title, org:top_members/employees). Además, se utiliza una etiqueta especial 'no_relation' para pares de entidades que no expresan ninguna de las relaciones definidas, lo que constituye la mayoría de las instancias.
TACRED es notable por su tamaño y complejidad. Cada oración es un extracto de texto del mundo real proveniente de artículos de noticias o texto web, lo que hace que la tarea sea desafiante debido a la variabilidad lingüística, las dependencias de largo alcance y la necesidad de conocimiento del mundo. El conjunto de datos se divide en conjuntos de entrenamiento (68,124 oraciones), desarrollo (22,631 oraciones) y prueba (15,509 oraciones), con una atención cuidadosa para evitar la superposición de documentos entre las divisiones, garantizando así una evaluación realista.
La métrica de evaluación principal para TACRED es la puntuación F1 micro-promediada, que equilibra la precisión y la recuperación en todos los tipos de relaciones. Los modelos de referencia tempranos, como la regresión logística con características diseñadas manualmente, lograron puntuaciones F1 de alrededor del 50-60%. La introducción de modelos de redes neuronales, particularmente aquellos que utilizan arquitecturas de transformadores, condujo a mejoras significativas. Por ejemplo, el modelo basado en BERT de Zhang et al. (2019) logró una puntuación F1 del 71.5%, y modelos posteriores con mecanismos de atención más sofisticados y conocimiento externo han elevado las puntuaciones por encima del 80%.
Construcción y Anotación
El conjunto de datos se creó extrayendo automáticamente oraciones del corpus fuente de TAC KBP, que incluye texto de agencias de noticias y web. Para cada documento, se identificaron las menciones de entidades utilizando un reconocedor de entidades nombradas, y se seleccionaron pares de entidades como instancias de relación candidatas. Luego, anotadores humanos etiquetaron cada oración con la relación apropiada, siguiendo pautas de anotación detalladas. El proceso de anotación implicó múltiples rondas de control de calidad, incluida la adjudicación de desacuerdos, para garantizar un alto acuerdo entre anotadores. El conjunto de datos final incluye no solo la oración y la etiqueta de relación, sino también las posiciones de las entidades de sujeto y objeto dentro de la oración, que son cruciales para entrenar modelos.
Impacto y Uso en la Investigación
TACRED se ha convertido en un estándar de referencia en la comunidad de extracción de relaciones. Se ha utilizado para evaluar una amplia gama de modelos, desde clasificadores basados en características tradicionales hasta enfoques modernos basados en modelos de lenguaje grandes. El conjunto de datos también ha generado varias tareas derivadas, como la extracción de relaciones con pocos ejemplos y la extracción de relaciones a nivel de documento, donde los investigadores adaptan TACRED para probar capacidades de generalización. Además, TACRED ha sido fundamental para avanzar en la investigación sobre la incorporación de bases de conocimiento externas, como Wikidata, en modelos neuronales para mejorar el rendimiento en relaciones que requieren razonamiento de sentido común o factual.
Limitaciones y Críticas
A pesar de su popularidad, TACRED tiene limitaciones conocidas. El conjunto de datos es relativamente pequeño en comparación con otros puntos de referencia de PLN, y sus tipos de relación se limitan a los definidos por TAC KBP, que pueden no cubrir la diversidad completa de relaciones en texto de dominio abierto. Además, el conjunto de datos ha sido criticado por contener errores de anotación y por su protocolo de evaluación, que puede no reflejar completamente el rendimiento en el mundo real. Algunos estudios han demostrado que los modelos pueden lograr puntuaciones altas explotando sesgos específicos del conjunto de datos, como depender de la información del tipo de entidad en lugar de aprender la semántica real de la relación. Estos problemas han motivado la creación de conjuntos de datos más nuevos, como TACREV (una versión re-anotada de TACRED) y Re-TACRED, que buscan abordar algunas de estas deficiencias.
Trabajo Relacionado y Extensiones
TACRED es parte de una familia más amplia de conjuntos de datos de extracción de relaciones. Está estrechamente relacionado con el conjunto de datos SemEval-2010 Task 8, que se centra en un conjunto más pequeño de 19 tipos de relación, y el conjunto de datos NYT-FB, que utiliza supervisión distante. Conjuntos de datos más recientes como FewRel y TACREV se basan en la estructura de TACRED para explorar el aprendizaje con pocos ejemplos y proporcionar anotaciones más limpias. En la era de la IA generativa, TACRED también se ha utilizado para evaluar la capacidad de modelos como la serie GPT de OpenAI para realizar extracción de relaciones de manera de cero disparos o con pocos ejemplos, a menudo con resultados competitivos en comparación con modelos más pequeños ajustados finamente.
Véase También
- inteligencia artificial
- procesamiento del lenguaje natural (nota: no en la lista proporcionada, pero relacionado)
- Laboratorio de IA de Stanford
- aprendizaje automático