Traducido del inglés

Dolly es un modelo de lenguaje grande ajustado por instrucciones desarrollado por Databricks, lanzado en 2023, diseñado para demostrar el ajuste fino rentable de modelos base de código abierto.

Dolly es un modelo de lenguaje de gran tamaño ajustado por instrucciones desarrollado por Databricks, lanzado por primera vez en marzo de 2023. Demostró que un modelo relativamente pequeño, ajustado en un conjunto de datos modesto, podía lograr un comportamiento competente de seguimiento de instrucciones, desafiando la suposición predominante de que se necesitaban una escala masiva y datos propietarios extensos para tales capacidades. El proyecto tenía como objetivo hacer que la personalización de los LLM fuera accesible para las empresas al mostrar que el ajuste fino podía realizarse en una sola máquina en poco tiempo.

La versión inicial, Dolly 1.0, se basaba en el modelo GPT-J 6B de EleutherAI y se ajustó en un conjunto de datos de aproximadamente 15,000 pares de instrucción-respuesta generados por empleados de Databricks. Le siguió Dolly 2.0 en abril de 2023, que usaba el mismo modelo base pero introdujo un conjunto de datos de código abierto más grande de 15,000 pares, publicado bajo una licencia permisiva. Dolly 2.0 se destacó por ser uno de los primeros modelos ajustados por instrucciones de código abierto con un conjunto de datos de entrenamiento completamente abierto, permitiendo a los investigadores replicar y construir sobre el trabajo.

Enfoque Técnico

El entrenamiento de Dolly empleó una técnica conocida como ajuste por instrucciones, donde un modelo de lenguaje preentrenado se ajusta en ejemplos de instrucciones y respuestas correspondientes. Este proceso alinea el comportamiento del modelo con la intención del usuario, permitiéndole seguir indicaciones en diversas tareas como resumen, respuesta a preguntas y generación de texto. El ajuste fino utilizó un objetivo de aprendizaje supervisado estándar, optimizando el modelo para predecir los tokens de respuesta dada la instrucción. Databricks utilizó su propia plataforma de aprendizaje automático para gestionar el pipeline de entrenamiento, pero el modelo en sí fue diseñado para ejecutarse en hardware común, incluyendo una sola GPU Nvidia A10 para inferencia.

El modelo base, GPT-J, es una arquitectura basada en transformadores con 6 mil millones de parámetros, entrenado en el conjunto de datos Pile. El ajuste fino de Dolly no alteró la arquitectura base, sino que ajustó los pesos para especializarse en el seguimiento de instrucciones. Este enfoque contrastó con modelos más grandes como los de OpenAI o Anthropic, que a menudo requieren recursos computacionales masivos y datos de entrenamiento propietarios.

Lanzamiento e Impacto

Dolly fue lanzado bajo la licencia Apache 2.0, lo que lo hizo disponible gratuitamente para uso comercial y de investigación. El conjunto de datos acompañante, denominado 'databricks-dolly-15k', también fue de código abierto, algo poco común en ese momento. Esta apertura permitió a la comunidad de aprendizaje automático estudiar los efectos del ajuste por instrucciones y crear modelos derivados. El lanzamiento de Dolly provocó discusiones sobre la democratización de la IA, ya que mostró que organizaciones sin recursos vastos podían construir asistentes capaces.

Sin embargo, el rendimiento de Dolly no estaba a la par con modelos de última generación como GPT-3.5 o Claude, y exhibía limitaciones en razonamiento complejo y precisión factual. No obstante, sirvió como una prueba de concepto para el ajuste fino eficiente, influyendo en esfuerzos posteriores de código abierto como Alpaca y Vicuna. Databricks posicionó a Dolly como una herramienta para que las empresas crearan asistentes de IA personalizados usando sus propios datos, integrándose con su arquitectura de lakehouse.

Recepción y Legado

Dolly recibió una atención mediática significativa en su lanzamiento, con cobertura en la prensa tecnológica destacando su bajo costo de entrenamiento (reportado en menos de $30 por cómputo) y su desafío a la narrativa de que solo los gigantes tecnológicos podían desarrollar LLM. El modelo fue elogiado por su transparencia, pero algunos críticos señalaron que sus capacidades eran limitadas en comparación con las ofertas comerciales. Con el tiempo, Dolly fue superado por modelos abiertos más potentes, pero su conjunto de datos y metodología continuaron utilizándose en investigación.

Databricks integró posteriormente a Dolly en su plataforma, permitiendo a los clientes ajustar y desplegar el modelo para casos de uso específicos. El proyecto también contribuyó a la tendencia más amplia del desarrollo de LLM de código abierto, fomentando más experimentación con el ajuste por instrucciones en modelos más pequeños. A partir de 2025, Dolly se considera un hito histórico en la evolución de la IA accesible, aunque ya no se desarrolla activamente.

Véase También

Referencias

(Nota: Este artículo se basa en información disponible públicamente y no cita fuentes externas.)

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-models·machine-learning·open-source-software·databricks
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial