GLM-130B es un modelo de lenguaje de gran escala desarrollado por investigadores de la Universidad de Tsinghua y lanzado en 2022. Con 130 mil millones de parámetros, fue diseñado como un modelo de código abierto y bilingüe que admite tanto inglés como chino, una distinción notable en comparación con muchos modelos contemporáneos que eran de código cerrado o se centraban principalmente en el inglés. El modelo se basa en la arquitectura del Modelo de Lenguaje General (GLM), que combina aspectos de los diseños basados en transformadores de codificador-decodificador con generación autorregresiva, lo que le permite manejar eficazmente tareas de comprensión y generación.
El proyecto se inició para abordar la creciente brecha entre los modelos de lenguaje propietarios de gran escala y las alternativas disponibles públicamente. Al liberar los pesos del modelo y el código de entrenamiento, los desarrolladores buscaban proporcionar a la comunidad investigadora una herramienta poderosa para estudiar y avanzar en las capacidades de los modelos de lenguaje de gran escala, particularmente en contextos multilingües. GLM-130B fue entrenado con un corpus diverso de texto en inglés y chino, y su rendimiento se comparó con varios modelos prominentes de la época, incluido el GPT-3 de OpenAI y otros sistemas de gran escala.
Arquitectura y Entrenamiento
GLM-130B emplea una arquitectura única que integra un mecanismo de atención bidireccional para tareas de comprensión con un componente autorregresivo unidireccional para la generación. Este enfoque híbrido, detallado en el marco GLM, permite que el modelo sobresalga en tareas como clasificación de texto, respuesta a preguntas y resumen, al tiempo que produce texto coherente y contextualmente relevante. El modelo utiliza un mecanismo de atención de múltiples cabezas e incorpora normalización de capas y conexiones de red residual para estabilizar el entrenamiento y mejorar el flujo de gradientes.
El entrenamiento se realizó en un gran clúster de GPUs, utilizando técnicas como recorte de gradientes y programación de la tasa de aprendizaje para asegurar la convergencia. El modelo se entrenó con una mezcla de datos en inglés y chino, con un tokenizador diseñado para manejar ambos idiomas de manera eficiente. El proceso de entrenamiento también empleó poda de modelos y otras estrategias de optimización para reducir la huella de memoria y mejorar la velocidad de inferencia, haciendo que el modelo sea más accesible para su implementación en hardware estándar.
Rendimiento y Evaluación
En evaluaciones comparativas, GLM-130B demostró un rendimiento competitivo frente a otros modelos grandes, especialmente en tareas en chino, donde a menudo superaba a modelos entrenados principalmente con datos en inglés. En puntos de referencia en inglés como LAMBADA y MMLU, logró resultados comparables o superiores a los de GPT-3, a pesar de tener un número de parámetros menor que algunos competidores. Las capacidades bilingües del modelo se destacaron en tareas translingüísticas, donde mostró fuertes habilidades de aprendizaje por transferencia.
Sin embargo, el modelo también presentó limitaciones comunes a los modelos de lenguaje de gran escala de su época, incluidos errores fácticos ocasionales y sensibilidad a la redacción de las indicaciones. Los desarrolladores publicaron resultados de evaluación detallados, incluidas comparaciones con modelos como Chinchilla de Google DeepMind y Claude de Anthropic, para proporcionar transparencia sobre sus fortalezas y debilidades.
Impacto del Código Abierto
Una de las contribuciones más significativas de GLM-130B fue su naturaleza de código abierto. En un momento en que muchos modelos líderes eran propietarios, GLM-130B proporcionó a los investigadores acceso a un modelo de última generación, permitiendo estudios sobre interpretabilidad, ajuste fino y seguridad. El lanzamiento incluyó no solo los pesos del modelo, sino también el código de entrenamiento y documentación detallada, fomentando una comunidad de desarrolladores que construyeron sobre el modelo para diversas aplicaciones.
El lanzamiento del modelo también impulsó discusiones sobre la democratización de la inteligencia artificial y la importancia de la investigación abierta en el campo. Sirvió como base para variantes posteriores de GLM, incluidos modelos más grandes y eficientes, e influyó en el desarrollo de otras iniciativas de código abierto en aprendizaje automático y aprendizaje profundo.
Limitaciones y Consideraciones Éticas
Como otros modelos de lenguaje de gran escala, GLM-130B plantea preocupaciones éticas relacionadas con el sesgo, la desinformación y el posible uso indebido. Los datos de entrenamiento, extraídos de internet, pueden contener sesgos que el modelo puede amplificar. Los desarrolladores reconocieron estos problemas y recomendaron un uso cuidadoso, incluida la supervisión humana en aplicaciones donde las salidas del modelo podrían tener consecuencias significativas. También proporcionaron pautas para una implementación responsable, enfatizando la necesidad de transparencia y responsabilidad.
Las limitaciones técnicas incluían una huella de memoria relativamente grande, que requería recursos computacionales sustanciales para la inferencia. El rendimiento del modelo en idiomas distintos del inglés y el chino era limitado, lo que refleja el enfoque de sus datos de entrenamiento. En el momento de su lanzamiento, GLM-130B representó un paso significativo en la IA de código abierto, pero también destacó los desafíos continuos en la creación de modelos que sean a la vez potentes y seguros.
Legado e Influencia
El desarrollo de GLM-130B contribuyó a la tendencia más amplia de modelos de lenguaje de gran escala de código abierto, influyendo en proyectos posteriores como LLaMA y otros. Su arquitectura y metodologías de entrenamiento han sido citadas en numerosos artículos de investigación, y sus capacidades bilingües han inspirado esfuerzos similares en otros idiomas. El modelo sigue siendo un punto de referencia para los investigadores que estudian las leyes de escalado de los modelos de redes neuronales y las compensaciones entre tamaño del modelo, datos y rendimiento.
A partir de 2024, GLM-130B ya no es el modelo más grande o avanzado disponible, pero su impacto en el campo es duradero. Demostró que los modelos de código abierto de alta calidad podían rivalizar con los propietarios, allanando el camino para un enfoque más inclusivo y colaborativo en la investigación de la IA.