Reconocimiento de entidades nombradas

Traducido del inglés

La identificación de entidades nombradas (NER) es una subtarea de la extracción de información que localiza y clasifica entidades nombradas en texto no estructurado en categorías predefinidas, como personas, organizaciones, ubicaciones y expresiones temporales.

El reconocimiento de entidades nombradas (NER), también conocido como identificación de entidades, fragmentación de entidades y extracción de entidades, es una subtarea de la extracción de información que busca localizar y clasificar entidades nombradas mencionadas en texto no estructurado en categorías predefinidas, como nombres de personas (PER), organizaciones (ORG), ubicaciones (LOC), entidades geopolíticas (GPE), vehículos (VEH), códigos médicos, expresiones temporales, cantidades, valores monetarios y porcentajes. La mayor parte de la investigación sobre sistemas NER se ha estructurado como la toma de un bloque de texto no anotado, como transducir "Jim compró 300 acciones de Acme Corp. en 2006" en un bloque anotado que resalta los nombres de las entidades: "[Jim]Persona compró 300 acciones de [Acme Corp.]Organización en [2006]Tiempo." En este ejemplo, se han detectado y clasificado un nombre de persona que consta de un token, un nombre de empresa de dos tokens y una expresión temporal.

El término "entidad nombrada" restringe la tarea a entidades para las cuales una o muchas cadenas, como palabras o frases, se corresponden de manera bastante consistente con algún referente. Esto está estrechamente relacionado con los designadores rígidos, según los definió Saul Kripke, aunque en la práctica el NER trata con muchos nombres y referentes que no son filosóficamente "rígidos". Por ejemplo, la empresa automotriz creada por Henry Ford en 1903 puede denominarse "Ford" o "Ford Motor Company", aunque "Ford" también puede referirse a muchas otras entidades. Los designadores rígidos incluyen nombres propios, así como términos para ciertas especies biológicas y sustancias, pero excluyen pronombres (véase resolución de correferencia), descripciones que seleccionan un referente por sus propiedades y nombres para tipos de cosas en lugar de individuos.

Definición del problema

El reconocimiento completo de entidades nombradas a menudo se divide, conceptualmente y posiblemente también en las implementaciones, en dos problemas distintos: la detección de nombres y la clasificación de los nombres según el tipo de entidad a la que se refieren (por ejemplo, persona, organización o ubicación). La primera fase se simplifica típicamente a un problema de segmentación: los nombres se definen como tramos contiguos de tokens, sin anidamiento, de modo que "Bank of America" es un solo nombre, ignorando el hecho de que dentro de este nombre, la subcadena "America" es en sí misma un nombre. Este problema de segmentación es formalmente similar al fragmentado. La segunda fase requiere elegir una ontología mediante la cual organizar categorías de cosas.

Las expresiones temporales y algunas expresiones numéricas (por ejemplo, dinero, porcentajes) también pueden considerarse entidades nombradas en el contexto de la tarea NER. Si bien algunos ejemplos de estos tipos son buenos ejemplos de designadores rígidos (por ejemplo, el año 2001), también hay muchos inválidos (por ejemplo, "me tomo mis vacaciones en junio"). En el primer caso, el año 2001 se refiere al año 2001 del calendario gregoriano. En el segundo caso, el mes de junio puede referirse al mes de un año indefinido (junio pasado, próximo junio, todos los junios). Es discutible que la definición de entidad nombrada se flexibilice en tales casos por razones prácticas. La definición del término entidad nombrada no es, por tanto, estricta y a menudo debe explicarse en el contexto en el que se utiliza.

Se han propuesto ciertas jerarquías de tipos de entidades nombradas en la literatura. Las categorías BBN, propuestas en 2002, se utilizan para la respuesta a preguntas y constan de 29 tipos y 64 subtipos. La jerarquía extendida de Sekine, también propuesta en 2002, está compuesta por 200 subtipos. Más recientemente, en 2011, Ritter utilizó una jerarquía basada en tipos de entidades comunes de Freebase en experimentos pioneros sobre NER en texto de redes sociales.

Dificultades

El NER puede tener ambigüedades de resolución de referencias donde el mismo nombre puede referirse a diferentes entidades del mismo tipo. Por ejemplo, "JFK" puede referirse al expresidente de los Estados Unidos o a su hijo. El mismo nombre puede referirse a tipos completamente diferentes: "JFK" podría referirse al aeropuerto de Nueva York, e "IRA" puede referirse a Cuenta Individual de Retiro, Asociación Internacional de Lectura o Ejército Republicano Irlandés. Esto puede ser causado por metonimia; por ejemplo, "La Casa Blanca" puede referirse a una organización en lugar de una ubicación.

Evaluación formal

Para evaluar la calidad de la salida de un sistema NER, se han definido varias medidas. Las medidas habituales se denominan precisión, recuperación y puntuación F1. Sin embargo, quedan varios problemas en cuanto a cómo calcular estos valores. Estas medidas estadísticas funcionan razonablemente bien para los casos obvios de encontrar o perder una entidad real exactamente, y para encontrar una no entidad. Sin embargo, el NER puede fallar de muchas otras maneras, muchas de las cuales son discutiblemente "parcialmente correctas" y no deberían contarse como éxito o fracaso completo. Por ejemplo, identificar una entidad real pero con menos tokens de los deseados (por ejemplo, omitir el último token de "John Smith, M.D."), con más tokens de los deseados (por ejemplo, incluir la primera palabra de "The University of MD"), particionar entidades adyacentes de manera diferente (por ejemplo, tratar "Smith, Jones Robinson" como 2 frente a 3 entidades), asignarle un tipo completamente incorrecto (por ejemplo, llamar a un nombre personal una organización), asignarle un tipo relacionado pero inexacto (por ejemplo, "sustancia" frente a "droga", o "escuela" frente a "organización"), o identificar correctamente una entidad cuando lo que el usuario quería era una entidad de alcance menor o mayor (por ejemplo, identificar "James Madison" como un nombre personal cuando es parte de "James Madison University"). Algunos sistemas NER imponen la restricción de que las entidades nunca pueden superponerse o anidarse, lo que significa que en algunos casos se deben tomar elecciones arbitrarias o específicas de la tarea.

Un método demasiado simple para medir la precisión es simplemente contar qué fracción de todos los tokens en el texto se identificaron correcta o incorrectamente como parte de referencias de entidades (o como entidades del tipo correcto). Esto sufre al menos dos problemas: primero, la gran mayoría de los tokens en texto del mundo real no son parte de nombres de entidades, por lo que la precisión base (siempre predecir "no es una entidad") es extravagantemente alta, típicamente superior al 90%; y segundo, predecir incorrectamente el tramo completo de un nombre de entidad no se penaliza adecuadamente (encontrar solo el nombre de pila de una persona cuando su apellido sigue podría puntuarse como media precisión).

En conferencias académicas como CoNLL, se ha definido una variante de la puntuación F1 de la siguiente manera: la precisión es el número de tramos de nombres de entidades predichos que coinciden exactamente con los tramos en los datos de evaluación de referencia (gold standard). Por ejemplo, cuando se predice [Persona Hans] [Persona Blick] pero se requería [Persona Hans Blick], la precisión para el nombre predicho es cero. La precisión se promedia luego sobre todos los nombres de entidades predichos. La recuperación es similarmente el número de nombres en la referencia que aparecen exactamente en la misma ubicación en las predicciones. La puntuación F1 es la media armónica de estos dos. Se deduce de la definición anterior que cualquier predicción que omita un solo token, incluya un token espurio o tenga el tipo incorrecto se cuenta como un fracaso completo para ese tramo.

Enfoques y aplicaciones

Los sistemas NER tradicionales dependían de reglas hechas a mano y modelos estadísticos basados en características, como los campos aleatorios condicionales. Con el auge del aprendizaje automático y el aprendizaje profundo, los sistemas modernos a menudo utilizan arquitecturas de red neuronal, incluidos los modelos basados en Transformer (architecture), que se han convertido en el estándar para el rendimiento de vanguardia. Estos modelos a menudo se preentrenan en grandes corpus y se ajustan finamente para tareas NER, beneficiándose de los avances en modelos de lenguaje grandes desarrollados por organizaciones como OpenAI, Anthropic y Google DeepMind. El NER se utiliza ampliamente en tuberías de extracción de información para respuesta a preguntas, búsqueda y construcción de bases de conocimiento, y es un componente clave en muchas aplicaciones de procesamiento del lenguaje natural.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·information-extraction·machine-learning
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial