El prompting de cero disparos es una técnica en inteligencia artificial y aprendizaje automático donde se pide a un modelo que realice una tarea sin proporcionarle ningún ejemplo o demostración. El modelo debe depender únicamente de su conocimiento preentrenado y de las instrucciones en el prompt para generar la salida correcta. Esto contrasta con el prompting de pocos disparos, donde se incluyen algunos ejemplos en el prompt para guiar al modelo. El prompting de cero disparos es una capacidad fundamental de los grandes modelos de lenguaje (LLM), que les permite manejar una amplia gama de tareas con datos mínimos específicos de la tarea.
El concepto tiene sus raíces en el aprendizaje de cero disparos (ZSL), un planteamiento de problema en el aprendizaje automático donde un aprendiz observa muestras de clases no vistas durante el entrenamiento y debe predecir su clase. El nombre es un juego de palabras basado en el concepto anterior de aprendizaje de un solo disparo en visión por computadora. Los métodos de cero disparos generalmente funcionan asociando clases observadas y no observadas mediante información auxiliar que codifica propiedades distintivas observables. Por ejemplo, un modelo entrenado para reconocer caballos pero que nunca ha visto una cebra puede reconocer una cebra si sabe que las cebras se parecen a caballos con rayas. En el contexto del prompting, el prompting de cero disparos aprovecha las representaciones internas del modelo y su comprensión semántica para generalizar a tareas no vistas.
Antecedentes e historia
El primer artículo sobre aprendizaje de cero disparos en procesamiento de lenguaje natural apareció en 2008 por Chang, Ratinov, Roth y Srikumar en AAAI'08, bajo el nombre de "clasificación sin datos". El primer artículo sobre aprendizaje de cero disparos en visión por computadora apareció en la misma conferencia, bajo el nombre de "aprendizaje con cero datos". El término "aprendizaje de cero disparos" en sí apareció por primera vez en un artículo de 2009 de Palatucci, Hinton, Pomerleau y Mitchell en NIPS'09. Esta terminología se popularizó, como una variación del aprendizaje de un solo disparo introducido en visión por computadora años antes.
En visión por computadora, los modelos de aprendizaje de cero disparos aprendían parámetros para clases vistas junto con sus representaciones de clase, basándose en la similitud representacional entre etiquetas de clase para que, durante la inferencia, las instancias pudieran clasificarse en nuevas clases. En procesamiento de lenguaje natural, la dirección técnica clave se basó en la capacidad de "entender las etiquetas" - representando las etiquetas en el mismo espacio semántico que los documentos a clasificar. Esto apoyaba la clasificación de un solo ejemplo sin datos anotados, la forma más pura de clasificación de cero disparos. El artículo original usaba la representación de Análisis Semántico Explícito (ESA), pero artículos posteriores usaron representaciones densas. Este enfoque se extendió a dominios multilingües, tipificación fina de entidades y otros problemas. Más allá de depender únicamente de representaciones, el enfoque computacional se amplió para depender de la transferencia de otras tareas, como la implicación textual y la respuesta a preguntas.
Información prerrequisita para clases de cero disparos
El aprendizaje de cero disparos requiere información auxiliar sobre las clases no vistas. Existen varios tipos de información auxiliar:
- Aprendizaje con atributos: Las clases van acompañadas de descripciones estructuradas predefinidas. Por ejemplo, las descripciones de aves podrían incluir "cabeza roja" o "pico largo". Estos atributos suelen organizarse de manera estructurada y composicional, y tener en cuenta esa estructura mejora el aprendizaje. Este enfoque se usó principalmente en visión por computadora, con algunos ejemplos en procesamiento de lenguaje natural.
- Aprendizaje a partir de descripción textual: Se considera que las etiquetas de clase tienen un significado y a menudo se aumentan con definiciones o descripciones en lenguaje natural de texto libre, como una descripción de Wikipedia de la clase. Esta ha sido la dirección clave en procesamiento de lenguaje natural.
- Similitud clase-clase: Las clases se incrustan en un espacio continuo. Un clasificador de cero disparos puede predecir que una muestra corresponde a alguna posición en ese espacio, y la clase incrustada más cercana se usa como la clase predicha, incluso si no se observaron tales muestras durante el entrenamiento.
En el contexto del prompting de cero disparos, la información auxiliar está implícitamente codificada en los parámetros del modelo durante el preentrenamiento. El modelo ha visto grandes cantidades de texto y ha aprendido asociaciones entre conceptos, lo que le permite entender instrucciones y generar respuestas apropiadas sin ejemplos explícitos.
Aprendizaje de cero disparos generalizado
El planteamiento estándar de aprendizaje de cero disparos asume que en el momento de la prueba solo se dan muestras de cero disparos (de clases no vistas). En el aprendizaje de cero disparos generalizado, pueden aparecer muestras tanto de clases nuevas como conocidas en el momento de la prueba. Esto plantea desafíos porque es difícil estimar si una muestra dada es nueva o conocida. Los enfoques para manejar esto incluyen:
- Un módulo de compuerta, entrenado para decidir si una muestra dada proviene de una clase nueva o una antigua, y en la inferencia produce una decisión probabilística dura o blanda.
- Un módulo generativo, entrenado para generar representaciones de características de clases no vistas, permitiendo que un clasificador estándar se entrene con muestras de todas las clases, vistas y no vistas.
Para el prompting de cero disparos, el aprendizaje de cero disparos generalizado es menos relevante, ya que típicamente se pide al modelo realizar una sola tarea sin necesidad de distinguir entre clases vistas y no vistas. Sin embargo, el desafío subyacente de la generalización sigue siendo importante para un rendimiento robusto.
Dominios de aplicación
El aprendizaje de cero disparos y el prompting de cero disparos se han aplicado a una amplia gama de campos:
- Clasificación de imágenes: Reconocer objetos o escenas no vistos durante el entrenamiento.
- Segmentación semántica: Asignar etiquetas a píxeles en una imagen, incluyendo categorías no vistas.
- Generación de imágenes: Generar imágenes de conceptos no entrenados explícitamente.
- Detección de objetos: Detectar objetos de clases no vistas.
- Procesamiento de lenguaje natural: Clasificación de texto, análisis de sentimiento y respuesta a preguntas sin datos de entrenamiento específicos de la tarea.
- Biología computacional: Predecir propiedades de entidades biológicas, como funciones de proteínas, sin ejemplos etiquetados.
- Razonamiento abstracto: Resolver tareas de razonamiento que requieren generalización a situaciones novedosas.
En la era de los grandes modelos de lenguaje, el prompting de cero disparos se ha convertido en un método de evaluación estándar. Modelos como los desarrollados por OpenAI, Anthropic y Google DeepMind a menudo se prueban en su rendimiento de cero disparos en diversos puntos de referencia. Esta capacidad es un resultado directo del entrenamiento en corpus masivos y de la arquitectura transformer, que permite al modelo internalizar vastas cantidades de conocimiento y seguir instrucciones.
Desafíos y limitaciones
A pesar de su poder, el prompting de cero disparos tiene limitaciones. El modelo puede producir respuestas plausibles pero incorrectas, especialmente para tareas que requieren conocimiento especializado o razonamiento. La calidad del prompt importa significativamente; instrucciones mal formuladas pueden llevar a resultados subóptimos. Además, el rendimiento de cero disparos a menudo es menor que el de pocos disparos o el ajuste fino, ya que el modelo no tiene ejemplos explícitos para calibrar su salida. Los investigadores continúan explorando métodos para mejorar las capacidades de cero disparos, como un mejor diseño de prompts, razonamiento en cadena de pensamiento y ajuste por instrucciones.