Clasificación de cero disparos

Traducido del inglés

La clasificación zero-shot es una tarea de aprendizaje automático en la que un modelo clasifica datos en categorías que nunca vio durante el entrenamiento, utilizando información auxiliar como descripciones textuales o atributos para conectar las clases vistas y no vistas.

La clasificación zero-shot es un planteamiento de problema en el Machine learning donde, en el momento de la prueba, el aprendiz observa clases que no fueron observadas durante el entrenamiento, y necesita predecir su clase. El nombre es un juego de palabras basado en el concepto anterior de aprendizaje one-shot en visión por computadora, en el que la clasificación puede aprenderse a partir de un solo ejemplo. Los métodos zero-shot generalmente funcionan asociando clases observadas y no observadas mediante información auxiliar que codifica propiedades observables distintivas de los objetos. Por ejemplo, dado un conjunto de imágenes de animales a clasificar, junto con descripciones textuales auxiliares de cómo son los animales, un modelo que ha sido entrenado para reconocer caballos, pero que nunca ha visto una cebra, puede reconocer una cebra si también sabe que las cebras parecen caballos rayados. Este problema se estudia ampliamente en visión por computadora, procesamiento de lenguaje natural y percepción de máquinas.

Antecedentes e historia

El primer artículo sobre clasificación zero-shot en procesamiento de lenguaje natural apareció en 2008, escrito por Chang, Ratinov, Roth y Srikumar, en la conferencia AAAI'08, pero el nombre dado al paradigma de aprendizaje allí fue clasificación sin datos (dataless classification). El primer artículo sobre clasificación zero-shot en visión por computadora apareció en la misma conferencia, bajo el nombre de aprendizaje sin datos (zero-data learning). El término clasificación zero-shot en sí mismo apareció por primera vez en la literatura en un artículo de 2009 de Palatucci, Hinton, Pomerleau y Mitchell en NIPS'09. Esta terminología se repitió más tarde en otro artículo de visión por computadora y el término clasificación zero-shot se popularizó, como una variación del aprendizaje one-shot que se introdujo en visión por computadora años antes.

En visión por computadora, los modelos de clasificación zero-shot aprenden parámetros para clases vistas junto con sus representaciones de clase y se basan en la similitud representacional entre las etiquetas de clase para que, durante la inferencia, las instancias puedan clasificarse en clases nuevas. En procesamiento de lenguaje natural, la dirección técnica clave desarrollada se basa en la capacidad de "entender las etiquetas": representar las etiquetas en el mismo espacio semántico que los documentos a clasificar. Esto permite la clasificación de un solo ejemplo sin observar ningún dato anotado, la forma más pura de clasificación zero-shot. El artículo original utilizó la representación de Análisis Semántico Explícito (ESA), pero artículos posteriores utilizaron otras representaciones, incluyendo representaciones densas. Este enfoque también se extendió a dominios multilingües, tipificación de entidades finas y otros problemas. Además, más allá de depender únicamente de representaciones, el enfoque computacional se ha extendido para depender de la transferencia desde otras tareas, como la implicación textual y la respuesta a preguntas.

El artículo original también señala que, más allá de la capacidad de clasificar un solo ejemplo, cuando se proporciona una colección de ejemplos, con la suposición de que provienen de la misma distribución, es posible mejorar el rendimiento de manera semi-supervisada (o aprendizaje transductivo). A diferencia de la generalización estándar en el aprendizaje automático, donde se espera que los clasificadores clasifiquen correctamente nuevas muestras en clases que ya han observado durante el entrenamiento, en la clasificación zero-shot, no se proporcionan muestras de las clases durante el entrenamiento del clasificador. Por lo tanto, puede verse como un caso extremo de adaptación de dominio.

Información previa para clases zero-shot

Naturalmente, se debe proporcionar algún tipo de información auxiliar sobre estas clases zero-shot, y este tipo de información puede ser de varios tipos.

Aprendizaje con atributos: las clases van acompañadas de una descripción estructurada predefinida. Por ejemplo, para descripciones de aves, esto podría incluir "cabeza roja", "pico largo". Estos atributos a menudo se organizan de manera composicional estructurada, y tener en cuenta esa estructura mejora el aprendizaje. Si bien este enfoque se utilizó principalmente en visión por computadora, también hay algunos ejemplos en procesamiento de lenguaje natural.

Aprendizaje a partir de descripciones textuales: Como se señaló anteriormente, esta ha sido la dirección clave seguida en el procesamiento de lenguaje natural. Aquí, las etiquetas de clase se consideran con un significado y a menudo se aumentan con definiciones o descripciones textuales en lenguaje natural. Esto podría incluir, por ejemplo, una descripción de Wikipedia de la clase.

Similitud entre clases: Aquí, las clases se incrustan en un espacio continuo. Un clasificador zero-shot puede predecir que una muestra corresponde a alguna posición en ese espacio, y la clase incrustada más cercana se utiliza como clase predicha, incluso si no se observaron tales muestras durante el entrenamiento.

Clasificación zero-shot generalizada

La configuración de clasificación zero-shot descrita anteriormente asume que, en el momento de la prueba, solo se proporcionan muestras zero-shot, es decir, muestras de clases nuevas no vistas. En la clasificación zero-shot generalizada, pueden aparecer muestras tanto de clases nuevas como de clases conocidas en el momento de la prueba. Esto plantea nuevos desafíos para los clasificadores en el momento de la prueba, porque es muy difícil estimar si una muestra dada es nueva o conocida. Algunos enfoques para manejar esto incluyen:

  • un módulo de compuerta, que primero se entrena para decidir si una muestra dada proviene de una clase nueva o de una clase antigua, y luego, en el momento de la inferencia, produce una decisión dura o una decisión probabilística suave.
  • un módulo generativo, que se entrena para generar representaciones de características de las clases no vistas; luego, se puede entrenar un clasificador estándar con muestras de todas las clases, vistas y no vistas.

Dominios de aplicación

La clasificación zero-shot se ha aplicado a los siguientes campos:

  • clasificación de imágenes
  • segmentación semántica
  • generación de imágenes
  • detección de objetos
  • procesamiento de lenguaje natural
  • biología computacional
  • razonamiento abstracto

Relación con la IA moderna

Con el auge de los Large language models y las arquitecturas Transformer (architecture), la clasificación zero-shot se ha convertido en una capacidad prominente en los sistemas modernos de Artificial intelligence. Modelos como los desarrollados por OpenAI, Anthropic y Google DeepMind pueden realizar clasificación zero-shot en texto aprovechando su comprensión preentrenada del lenguaje, sin requerir un ajuste fino específico para la tarea. Esto representa un cambio desde los enfoques anteriores basados en atributos e incrustaciones hacia el uso del conocimiento semántico codificado en los pesos de las Neural network. En visión por computadora, se han logrado avances similares al alinear representaciones de imágenes y texto, lo que permite a los modelos clasificar imágenes en categorías descritas únicamente con lenguaje natural. La técnica también es fundamental para muchas aplicaciones en Generative AI, donde los modelos deben comprender y categorizar entradas novedosas.

Véase también

  • Aprendizaje few-shot
  • Aprendizaje por transferencia
  • Mapeo rápido
  • Aprendizaje basado en explicaciones
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·natural-language-processing·computer-vision·classification
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial