Mixtral 8x7B es un modelo de lenguaje de gran tamaño de mezcla dispersa de expertos (MoE) publicado por Mistral AI en diciembre de 2023. Emplea una arquitectura de transformador solo con decodificador con 46.7 mil millones de parámetros en total, pero activa solo 12.9 mil millones de parámetros por token de entrada mediante un mecanismo de enrutamiento que selecciona dos expertos de ocho módulos de avance en cada capa. Este diseño permite que el modelo alcance un rendimiento comparable o superior al de modelos densos mucho más grandes, manteniendo a la vez costos de inferencia más bajos. La publicación incluyó tanto un modelo base como una variante ajustada para seguir instrucciones, Mixtral 8x7B Instruct, con pesos disponibles públicamente bajo una licencia Apache 2.0.
El modelo fue anunciado el 11 de diciembre de 2023 mediante una publicación en un blog y un enlace de torrent, marcando un hito significativo en el panorama de la IA generativa de pesos abiertos. Fue desarrollado por Mistral AI, una empresa emergente con sede en París fundada en 2023 por antiguos investigadores de OpenAI y Google DeepMind. La publicación posicionó a Mixtral 8x7B como un competidor directo de modelos propietarios como GPT-3.5 de OpenAI y Claude 2 de Anthropic, al tiempo que desafiaba el dominio de los modelos abiertos de Meta y otros laboratorios. Su arquitectura de mezcla de expertos se basó en investigaciones anteriores sobre computación condicional, incluidos trabajos de Nokia Bell Labs y Google DeepMind, pero la aplicó a una escala nunca antes vista en publicaciones de código abierto.
Arquitectura y diseño
Mixtral 8x7B utiliza una capa MoE dispersa en lugar de cada red de avance estándar en el transformador. Cada capa contiene ocho redes de expertos, y una red de enrutamiento (a menudo un softmax sobre logits aprendidos) enruta cada token a los dos expertos principales. Esta activación dispersa reduce el costo computacional por token a aproximadamente el de un modelo denso de 12.9 mil millones de parámetros, mientras que el recuento total de parámetros de 46.7 mil millones permite una gran capacidad de conocimiento. El modelo utiliza una ventana de contexto de 32,768 tokens y admite múltiples idiomas, incluidos inglés, francés, alemán, español e italiano.
El mecanismo de enrutamiento se entrena de extremo a extremo sin pérdidas auxiliares de equilibrio de carga, basándose en la diferenciación natural para distribuir los tokens entre los expertos. Esto contrasta con los sistemas MoE anteriores que requerían restricciones de equilibrio explícitas. El modelo también incorpora atención de múltiples cabezas con atención de consulta agrupada, reduciendo el uso de memoria de la caché de clave-valor durante la inferencia. La arquitectura se basa en el marco de transformador introducido en 2017, con modificaciones para el cálculo disperso y un escalado eficiente.
Entrenamiento y datos
Los detalles del entrenamiento se divulgaron parcialmente en el anuncio de publicación. Mixtral 8x7B fue preentrenado con datos obtenidos de corpus web disponibles públicamente, sin que se publicaran oficialmente cifras específicas sobre su composición. El entrenamiento utilizó una variante del optimizador Adam con un programa de tasa de aprendizaje coseno, y empleó recorte de gradientes y normalización de capas para la estabilidad. La variante ajustada para instrucciones se refinó aún más mediante ajuste fino supervisado con datos de demostración y aprendizaje por refuerzo a partir de retroalimentación de IA, una técnica similar a RLHF pero que utiliza etiquetas de preferencia generadas por IA.
El modelo base se entrenó para predecir el siguiente token en una secuencia, utilizando una función de pérdida estándar de entropía cruzada. El modelo de instrucciones se optimizó para seguir indicaciones de usuario y producir respuestas útiles y seguras. Mistral AI no reveló el número exacto de tokens de entrenamiento, pero análisis independientes sugirieron que el modelo se entrenó con un corpus sustancial, probablemente superior a un billón de tokens, basándose en el rendimiento en evaluaciones comparativas y en la comparación con otros modelos de tamaño similar.
Rendimiento y evaluaciones comparativas
Mixtral 8x7B demostró un rendimiento sólido en una variedad de evaluaciones comparativas estándar. En la evaluación MMLU (comprensión de lenguaje multitarea masiva), obtuvo aproximadamente un 70.6% en un entorno de 5 disparos, superando a GPT-3.5 y Llama 2 70B. En la prueba de razonamiento de sentido común HellaSwag, alcanzó alrededor del 86.7%, y en la tarea de resolución de correferencias WinoGrande, obtuvo aproximadamente un 81.2%. El modelo también destacó en matemáticas y generación de código, con puntuaciones en GSM-8K (razonamiento matemático) de alrededor del 74.5% y en HumanEval (finalización de código) de aproximadamente el 40.2% para el modelo base, mientras que la variante Instruct mejoró hasta el 42.2%.
En comparaciones directas, Mixtral 8x7B igualó o superó el rendimiento de Llama 2 70B en la mayoría de las tareas, utilizando solo alrededor de una sexta parte de los parámetros activos durante la inferencia. También superó al más grande GPT-3.5 en varias evaluaciones comparativas, incluidas MMLU y HellaSwag. La eficiencia del modelo lo hizo atractivo para su implementación en dispositivos periféricos y en entornos sensibles a los costos, aunque su huella de memoria total de aproximadamente 90 GB en FP16 aún requería hardware sustancial. La publicación incluyó una versión cuantizada (de 4 bits) que podía ejecutarse en GPU de consumo con 24 GB de VRAM.
Impacto y recepción
La publicación de Mixtral 8x7B fue ampliamente cubierta en la comunidad de la inteligencia artificial y en la prensa generalista. Fue elogiado por democratizar el acceso a modelos de lenguaje de alto rendimiento, ya que sus pesos abiertos permitieron a investigadores y desarrolladores ajustarlo e implementarlo sin costos de API. El modelo también reavivó el interés en las arquitecturas MoE dispersas, influyendo en publicaciones posteriores de otros laboratorios, incluidos Qwen-MoE de Alibaba Cloud y Jamba de AI21 Labs. Evaluaciones independientes señalaron que Mixtral 8x7B mostraba sólidas capacidades multilingües y un razonamiento robusto, aunque algunos críticos señalaron posibles sesgos y limitaciones de seguridad comunes en los modelos abiertos.
La publicación coincidió con una tendencia más amplia de modelos de pesos abiertos que desafían a los sistemas propietarios. Fue seguida por el modelo más grande de Mistral AI, Mixtral 8x22B, en abril de 2024, que escaló la misma arquitectura hasta 141 mil millones de parámetros en total. El éxito de Mixtral 8x7B contribuyó a la valoración de Mistral AI, que alcanzó los 6.2 mil millones de dólares en una ronda de financiación anunciada en junio de 2024. El modelo también sirvió como punto de referencia para la investigación sobre poda de modelos y aumento de datos, ya que su estructura dispersa proporcionó un banco de pruebas natural para técnicas de eficiencia.
Detalles técnicos y disponibilidad
Mixtral 8x7B se publicó bajo la licencia Apache 2.0, lo que permite su uso comercial y modificación. Los pesos del modelo se distribuyeron a través de Hugging Face y un enlace de torrent, lo que refleja el compromiso de Mistral AI con el acceso abierto. El modelo base y la variante Instruct se proporcionaron en formatos FP16 y BF16, con cuantizaciones creadas por la comunidad disponibles para una inferencia de menor precisión. El modelo se integró en marcos de inferencia importantes, incluidos vLLM, TensorRT-LLM y el hardware basado en LPU de Groq, que logró una latencia particularmente baja gracias a la activación dispersa del modelo.
Para los desarrolladores, el modelo requería aproximadamente 90 GB de memoria de GPU en FP16, o alrededor de 24 GB en cuantización de 4 bits. Admitía una longitud de contexto de 32,768 tokens, lo que permitía el procesamiento de documentos largos. El modelo de instrucciones se optimizó para chat y finalización de tareas, con un formato de mensaje de sistema similar al de otros modelos de chat. Mistral AI también proporcionó una API para acceso alojado, pero los pesos abiertos hicieron factible la implementación local para muchas organizaciones. La documentación de publicación incluía evaluaciones comparativas, una tarjeta de modelo y código de ejemplo, lo que facilitó una adopción rápida en industrias que van desde Amazon Web Services hasta Microsoft Azure y Google Cloud.