Jurassic-1 es una familia de modelos de lenguaje de gran tamaño (LLM) desarrollada por la empresa israelí de inteligencia artificial AI21 Labs. Publicado en agosto de 2021, fue uno de los primeros LLM disponibles comercialmente en rivalizar con la escala de OpenAI's GPT-3, con la variante más grande, Jurassic-1 Jumbo, que contiene 178 mil millones de parámetros. Los modelos están diseñados para una amplia gama de tareas de procesamiento de lenguaje natural, incluida la generación de texto, resumen, respuesta a preguntas y generación de código, y son accesibles a través de una API comercial.
Jurassic-1 se basa en la arquitectura transformador, específicamente un modelo autorregresivo solo de decodificador, similar a GPT-3. Fue entrenado en un gran corpus de texto y código disponible públicamente, con un enfoque en el filtrado de alta calidad y la deduplicación. La familia de modelos incluye dos variantes principales: Jurassic-1 Jumbo (178B parámetros) y Jurassic-1 Large (7.5B parámetros), ambas comparten la misma arquitectura pero difieren en escala. Los modelos utilizan un tokenizador con un vocabulario de 250,000 tokens, que es más grande que el vocabulario de 50,000 tokens de GPT-3, lo que permite una codificación más eficiente del texto.
Arquitectura y Entrenamiento
Los modelos Jurassic-1 emplean un transformador estándar solo de decodificador con atención de múltiples cabezas y capas de avance. Utilizan normalización de capas y una estructura de conexión residual, con una configuración similar a otros LLM a gran escala. El proceso de entrenamiento utilizó una combinación de optimización Adam, recorte de gradientes y un programa de tasa de aprendizaje con calentamiento y decaimiento coseno. Los modelos fueron entrenados en un conjunto de datos de aproximadamente 300 mil millones de tokens, obtenidos de páginas web, libros y otro texto público, con una porción significativa en inglés pero también incluyendo otros idiomas.
AI21 Labs enfatizó el uso de un pipeline de filtrado de datos personalizado para eliminar contenido de baja calidad o duplicado. El entrenamiento se realizó en un clúster de GPU NVIDIA, aunque los detalles específicos del hardware no fueron completamente divulgados. La empresa también introdujo una técnica llamada "prompting estructurado" para mejorar la capacidad del modelo de seguir instrucciones y realizar tareas como respuesta a preguntas y razonamiento.
Capacidades y Rendimiento
Jurassic-1 demostró un fuerte rendimiento en una variedad de puntos de referencia, incluido SuperGLUE y otras tareas de PLN, a menudo igualando o superando los resultados de GPT-3 en evaluaciones similares. El vocabulario más grande del modelo y los datos de entrenamiento le permitieron manejar palabras raras y texto multilingüe de manera más efectiva. Además de la generación de texto estándar, Jurassic-1 podía realizar tareas como reconocimiento de entidades nombradas, análisis de sentimientos y clasificación de texto sin ajuste fino, utilizando aprendizaje de pocos ejemplos.
El modelo también admitía una característica llamada razonamiento "zero-shot", donde podía responder preguntas o resolver problemas sin ejemplos previos. AI21 Labs publicó un playground público y una API, permitiendo a los desarrolladores integrar Jurassic-1 en aplicaciones. La API ofrecía opciones para el control de temperatura, muestreo top-p y otros parámetros de generación.
Comparación con Contemporáneos
En su lanzamiento, Jurassic-1 se posicionó como un competidor directo de OpenAI's GPT-3, que había sido publicado en 2020. Mientras que GPT-3 tenía 175 mil millones de parámetros, Jurassic-1 Jumbo tenía 178 mil millones, lo que lo hacía ligeramente más grande. Sin embargo, el tokenizador de Jurassic-1 utilizaba un vocabulario más grande, lo que reducía el número de tokens necesarios para un texto dado, potencialmente mejorando la velocidad de inferencia y el costo. AI21 Labs también destacó la capacidad del modelo para manejar contextos más largos, con una longitud máxima de secuencia de 2,048 tokens, similar a GPT-3.
A diferencia de los modelos posteriores de Anthropic o los esfuerzos de Google DeepMind, Jurassic-1 no se centró en aprendizaje por refuerzo con retroalimentación humana (RLHF) en su lanzamiento, sino más bien en el aprendizaje supervisado y el prompting de pocos ejemplos. Esto lo hizo más similar al GPT-3 original en su enfoque.
Impacto y Legado
Jurassic-1 fue uno de los primeros LLM importantes de una empresa que no fuera OpenAI, ayudando a establecer a AI21 Labs como un actor significativo en el espacio de IA generativa. Se utilizó en diversas aplicaciones comerciales, incluida la asistencia de escritura, chatbots de servicio al cliente y generación de contenido. El lanzamiento del modelo también contribuyó a la tendencia más amplia de aumentar los tamaños de los modelos y el desarrollo de modelos de lenguaje de gran tamaño como servicio.
Modelos posteriores de AI21 Labs, como Jurassic-2, se basaron en la arquitectura y las lecciones aprendidas de Jurassic-1, incorporando mejoras en los datos de entrenamiento y la alineación. La empresa continuó ofreciendo Jurassic-1 a través de su API durante algún tiempo, aunque eventualmente fue descontinuado en favor de modelos más nuevos. Jurassic-1 sigue siendo un hito notable en la historia de la inteligencia artificial investigación, demostrando que LLM competitivos podían desarrollarse fuera de las empresas tecnológicas más grandes.
Recepción y Crítica
Jurassic-1 recibió críticas positivas por su rendimiento y accesibilidad, con muchos desarrolladores elogiando la facilidad de uso de la API y la capacidad del modelo para generar texto coherente y contextualmente relevante. Sin embargo, como otros LLM, enfrentó críticas con respecto a posibles sesgos en sus datos de entrenamiento y el impacto ambiental de entrenar modelos tan grandes. AI21 Labs reconoció estas preocupaciones y publicó documentación sobre el uso responsable, pero no liberó los pesos del modelo públicamente, limitando la investigación independiente.
Algunos investigadores señalaron que el rendimiento de Jurassic-1 en ciertas tareas de razonamiento no era significativamente mejor que el de modelos más pequeños, destacando las limitaciones de la escala por sí sola. A pesar de estas críticas, el lanzamiento del modelo ayudó a estimular la competencia en el mercado de LLM, lo que llevó a rápidos avances en el campo.