Mixtral 8x7B es un modelo de lenguaje de gran tamaño desarrollado por Mistral AI, lanzado en diciembre de 2023. Emplea una arquitectura de mezcla de expertos (MoE) dispersa, un diseño que divide el cálculo del modelo entre múltiples subredes especializadas llamadas expertos. El modelo contiene 8 expertos por capa, con un total de 46.7 mil millones de parámetros, aunque solo se activan 12.9 mil millones de parámetros por cada token procesado. Esta activación dispersa permite que Mixtral 8x7B alcance un rendimiento comparable al de modelos densos más grandes, manteniendo una mayor eficiencia de inferencia.
El modelo se puso a disposición bajo la licencia Apache 2.0, lo que permite su uso tanto comercial como de investigación. Admite una longitud de contexto de 32,768 tokens y es competente en inglés, francés, italiano, alemán y español. Mixtral 8x7B también incluye una variante ajustada, Mixtral 8x7B Instruct, optimizada para tareas de seguimiento de instrucciones. La arquitectura se basa en el marco transformador, incorporando técnicas de atención de múltiples cabezas y normalización de capas, pero reemplaza las capas feedforward estándar con capas MoE.
Arquitectura y Diseño
Mixtral 8x7B se basa en una arquitectura de transformador solo con decodificador. Cada una de sus 32 capas contiene 8 redes feedforward expertas, y una red de enrutamiento selecciona los 2 mejores expertos para cada token. Este mecanismo de enrutamiento, conocido como compuerta top-2, asigna dinámicamente los tokens a los expertos más relevantes, permitiendo que el modelo se especialice en diferentes patrones lingüísticos o de razonamiento. El recuento total de parámetros incluye todos los expertos, pero la activación dispersa garantiza que el costo computacional por token siga siendo comparable al de un modelo denso de 12.9 mil millones de parámetros.
El modelo utiliza codificación posicional con incrustaciones rotatorias, que codifican las posiciones de los tokens sin agregar vectores posicionales aprendibles. Emplea normalización por lotes y abandono durante el entrenamiento, aunque el modelo final lanzado no usa abandono para la inferencia. Las capas MoE se intercalan con bloques estándar de autoatención, y el enrutador se entrena conjuntamente con el resto de la red utilizando funciones de pérdida estándar como la entropía cruzada.
Entrenamiento y Datos
Mixtral 8x7B se entrenó en un gran corpus de texto multilingüe, obtenido principalmente de rastreos web, libros y artículos académicos. Los datos de entrenamiento se filtraron para eliminar contenido de baja calidad y se deduplicaron para reducir la redundancia. El modelo se entrenó utilizando optimizador Adam con un programa de tasa de aprendizaje que incluía calentamiento y decaimiento coseno. Se aplicó recorte de gradientes para estabilizar el entrenamiento, y la inicialización de pesos siguió prácticas estándar de transformadores.
El proceso de entrenamiento aprovechó la computación distribuida en miles de IPUs de Graphcore, ya que Mistral AI se asoció con Graphcore para la aceleración de hardware. El cómputo total de entrenamiento se estima en alrededor de 10^24 FLOPs, aunque las cifras exactas no se divulgaron públicamente. El modelo se entrenó durante aproximadamente 2 billones de tokens, una escala comparable a la de otros modelos líderes de pesos abiertos de su generación.
Rendimiento y Evaluaciones
Mixtral 8x7B ha sido evaluado en una variedad de evaluaciones estándar. En la evaluación MMLU (Comprensión de Lenguaje Multitarea Masiva), obtiene aproximadamente un 70.6%, superando a varios modelos densos más grandes. En tareas de razonamiento matemático como GSM-8K, alcanza alrededor de un 74.5% de precisión. El modelo también muestra resultados sólidos en evaluaciones de codificación como HumanEval, con una puntuación pass@1 del 40.2%.
Evaluaciones independientes de terceros, incluyendo investigación de IA de Berkeley y laboratorio de IA de Stanford, han confirmado que Mixtral 8x7B iguala o supera el rendimiento de OpenAI GPT-3.5 en varias tareas, siendo más eficiente computacionalmente. Las capacidades multilingües del modelo son particularmente notables, con puntuaciones competitivas en evaluaciones en francés y alemán. Sin embargo, queda por detrás de los modelos propietarios más grandes como GPT-4 en razonamiento complejo y generación de texto extenso.
Despliegue y Ecosistema
Mixtral 8x7B ha sido ampliamente adoptado en la comunidad de código abierto. Está disponible en Hugging Face y puede ejecutarse localmente en hardware de consumo con cuantización. Proveedores de nube como Amazon Web Services, Azure y Google Cloud ofrecen endpoints gestionados para el modelo. Empresas especializadas en hardware de IA como Groq y SambaNova han optimizado sus sistemas para acelerar la inferencia MoE, reduciendo la latencia para aplicaciones en tiempo real.
El lanzamiento del modelo ha influido en diseños MoE posteriores, con varios modelos posteriores adoptando estrategias similares de enrutamiento top-2. Su éxito también ha impulsado la investigación sobre especialización de expertos y eficiencia de enrutamiento, con grupos académicos como MIT CSAIL y Universidad Carnegie Mellon publicando análisis de sus representaciones internas. La licencia Apache 2.0 ha facilitado la integración en productos comerciales, desde chatbots hasta asistentes de código.
Limitaciones y Consideraciones Éticas
Como otros modelos de lenguaje de gran tamaño, Mixtral 8x7B puede generar información plausible pero incorrecta, un fenómeno conocido como alucinación. También puede reflejar sesgos presentes en sus datos de entrenamiento, incluidos estereotipos y asociaciones dañinas. Los datos de entrenamiento multilingües del modelo están sesgados hacia el inglés, lo que lleva a un rendimiento más débil en idiomas con menos recursos. Además, la arquitectura MoE dispersa puede ser más intensiva en memoria para desplegar que los modelos densos con un número similar de parámetros activos, ya que todos los pesos de los expertos deben cargarse en memoria.
Mistral AI ha publicado pautas para el uso responsable, pero la licencia abierta significa que los desarrolladores posteriores son responsables de mitigar los daños. Los investigadores han propuesto técnicas como aprendizaje por refuerzo a partir de retroalimentación de IA y poda de modelos para mejorar la seguridad y la eficiencia, pero estas no se aplican en la versión base. A partir de 2024, Mixtral 8x7B sigue siendo un punto de referencia para modelos eficientes de pesos abiertos, equilibrando capacidad y accesibilidad.
Véase También
Referencias
- Publicación del blog de Mistral AI anunciando Mixtral 8x7B, diciembre de 2023
- Informe técnico sobre Mixtral 8x7B, arXiv:2401.04088
- Evaluaciones de Hugging Face y evaluaciones académicas