Traducido del inglés

DBRX es un modelo de lenguaje grande de código abierto con mezcla de expertos, desarrollado por Mosaic bajo Databricks, lanzado el 27 de marzo de 2024, con 132 mil millones de parámetros en total y 36 mil millones activos por token.

DBRX es un modelo de lenguaje de gran tamaño (LLM) desarrollado por Mosaic bajo su empresa matriz Databricks. Lanzado el 27 de marzo de 2024 bajo la Licencia de Modelo Abierto de Databricks, es un modelo transformador de mezcla de expertos con 132 mil millones de parámetros totales, de los cuales 36 mil millones están activos para cada token. El lanzamiento incluye tanto un modelo fundacional base como una variante ajustada por instrucciones, diseñada para competir con los principales modelos abiertos y propietarios en comprensión del lenguaje, programación y matemáticas.

La arquitectura del modelo y su enfoque de entrenamiento reflejan una tendencia más amplia en IA generativa hacia un escalado eficiente, utilizando activación dispersa para reducir el costo computacional mientras se mantiene una alta capacidad. DBRX se posicionó como un desafío directo a otros modelos de peso abierto, y su rendimiento en el lanzamiento estableció un nuevo punto de referencia para los sistemas disponibles públicamente.

Arquitectura y Diseño

DBRX emplea una arquitectura de mezcla de expertos (MoE), una variante del modelo transformador que enruta cada token a través de un subconjunto de redes expertas. El modelo contiene 16 expertos, con 4 activados por token, lo que produce 36 mil millones de parámetros activos de un total de 132 mil millones. Este diseño disperso reduce el cómputo de inferencia y entrenamiento en comparación con un modelo denso de tamaño similar.

El modelo utiliza una estructura de transformador estándar solo con decodificador con atención de múltiples cabezas y codificación posicional, pero incorpora un enrutamiento de expertos de grano fino para mejorar la especialización. Cada experto es una red de avance, y un mecanismo de compuerta aprendido selecciona qué expertos procesan cada token. Este enfoque permite que el modelo asigne capacidad dinámicamente, similar a otros sistemas MoE como Mixtral.

DBRX también incluye refinamientos arquitectónicos como normalización de capas y conexiones de red residual, que estabilizan el entrenamiento a escala. La variante ajustada por instrucciones se refinó aún más mediante ajuste fino supervisado y aprendizaje por refuerzo con retroalimentación de IA, alineando las salidas con las preferencias humanas para el diálogo y la finalización de tareas.

Entrenamiento y Cómputo

El entrenamiento de DBRX tomó aproximadamente 2.5 meses utilizando 3,072 GPUs Nvidia H100 conectadas por InfiniBand con un ancho de banda de 3.2 terabytes por segundo. El costo total de entrenamiento se informó en US$10 millones, una cifra que destaca el cómputo sustancial requerido para los LLM de última generación. El conjunto de datos de entrenamiento comprendió un corpus diverso de texto y código, aunque Databricks no reveló detalles completos de la composición de los datos.

El proceso de entrenamiento aprovechó técnicas de recorte de gradiente y programación de tasa de aprendizaje para garantizar la estabilidad a lo largo de miles de pasos. La configuración de hardware, utilizando Nvidia H100, refleja el papel dominante de los aceleradores de clase Nvidia en el aprendizaje profundo a gran escala durante este período, aunque competidores como AMD y AWS Trainium también estaban emergiendo. La interconexión InfiniBand permitió una comunicación eficiente entre expertos, un factor crítico para el entrenamiento MoE.

Lanzamiento y Licencia

DBRX se lanzó bajo la Licencia de Modelo Abierto de Databricks, una licencia permisiva que permite el uso, modificación y distribución, aunque incluye restricciones sobre el uso del modelo para competir con los servicios comerciales de Databricks. El lanzamiento incluyó pesos del modelo, código de inferencia y scripts de evaluación, haciéndolo accesible para investigadores y empresas.

El lanzamiento abierto contrastó con los modelos propietarios de empresas como OpenAI y Anthropic, que ofrecen acceso limitado a través de APIs. Databricks posicionó a DBRX como una herramienta para empresas que buscan control sobre su infraestructura de IA, alineándose con su plataforma más amplia para ingeniería de datos y aprendizaje automático en Amazon Web Services, Azure y Google Cloud.

Puntos de Referencia de Rendimiento

En su lanzamiento, DBRX superó a varios modelos abiertos prominentes, incluidos Llama 2 de Meta, Mixtral de Mistral AI y Grok-1 de xAI, en puntos de referencia de comprensión del lenguaje, programación y matemáticas. Por ejemplo, DBRX logró puntuaciones más altas en tareas estándar de razonamiento y pruebas de generación de código, aunque los números exactos variaron según el punto de referencia.

La variante ajustada por instrucciones mostró una fortaleza particular en seguir instrucciones complejas y generar respuestas coherentes de múltiples turnos, atribuida a su entrenamiento RLAIF. Evaluaciones independientes de terceros generalmente confirmaron estos resultados, aunque algunos notaron que la ventaja de DBRX era más estrecha en tareas que requerían un amplio conocimiento del mundo o soporte de idiomas de bajos recursos.

Comparación con Modelos Contemporáneos

DBRX entró en un panorama competitivo dominado tanto por modelos abiertos como cerrados. En comparación con Mixtral, DBRX usaba más expertos (16 frente a 8) y un mayor número total de parámetros, lo que contribuyó a sus puntuaciones más altas en los puntos de referencia. Contra Llama 2, el diseño MoE de DBRX ofrecía una mejor eficiencia por parámetro activo, aunque Llama 2 se entrenó con una arquitectura densa más establecida.

En relación con sistemas propietarios como GPT-4 de OpenAI o Gemini de Google DeepMind, DBRX generalmente se consideraba menos capaz en razonamiento complejo y tareas creativas, pero ofrecía la ventaja de implementación local y personalización. La licencia abierta del modelo permitía el ajuste fino para casos de uso específicos de dominio, un punto de venta clave para empresas en industrias reguladas.

Ecosistema y Adopción

Databricks integró DBRX en su plataforma, permitiendo a los clientes implementar el modelo a través de sus servicios gestionados o en su propia infraestructura. El modelo también se puso a disposición en los mercados de Azure y Google Cloud, ampliando su alcance. Varias startups y grupos de investigación adoptaron DBRX para aplicaciones en generación de código, análisis de documentos y soporte al cliente.

El lanzamiento impulsó el interés en las arquitecturas MoE como una alternativa rentable a los modelos densos, influyendo en trabajos posteriores de otros laboratorios. Sin embargo, el impacto de DBRX se vio parcialmente eclipsado por los rápidos avances en el campo, con modelos más nuevos como Llama 3 y Qwen 2 logrando un rendimiento comparable o mejor en cuestión de meses.

Limitaciones y Críticas

A pesar de sus fortalezas, DBRX tenía limitaciones notables. Sus 132 mil millones de parámetros totales requerían una memoria sustancial para la inferencia, a menudo necesitando múltiples GPUs o cuantización. El modelo también exhibía sesgos y errores fácticos comunes a los LLM, y su corte de datos de entrenamiento limitaba el conocimiento de eventos posteriores a principios de 2024.

Los críticos señalaron la falta de transparencia con respecto a los datos de entrenamiento y el costo ambiental del entrenamiento, que consumió energía significativa a pesar del período de entrenamiento relativamente corto. La Licencia de Modelo Abierto de Databricks también fue criticada por sus términos no estándar, que algunos argumentaron que eran menos abiertos que las licencias de código abierto tradicionales.

Legado y Direcciones Futuras

DBRX demostró que los modelos MoE podían lograr un rendimiento competitivo a una fracción del costo de entrenamiento de los modelos densos, fomentando más investigación en arquitecturas dispersas. Databricks continuó desarrollando modelos posteriores, aunque DBRX siguió siendo un punto de referencia para los LLM de peso abierto en 2024.

El lanzamiento del modelo contribuyó al discurso más amplio de la inteligencia artificial sobre sistemas abiertos frente a cerrados, con defensores citando a DBRX como evidencia de que modelos de alta calidad podían estar disponibles públicamente. A finales de 2024, DBRX todavía se usaba en varios entornos de investigación y producción, aunque modelos más nuevos lo habían superado en gran medida en los rankings de puntos de referencia.

Véase También

Referencias

  • Comunicado de prensa de Databricks, 27 de marzo de 2024
  • Informe técnico sobre la arquitectura y el entrenamiento de DBRX
  • Evaluaciones independientes de puntos de referencia de fuentes académicas e industriales
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·mixture-of-experts·open-source-ai·databricks
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial