Traduzido do inglês

Dolly é um modelo de linguagem de grande porte ajustado por instruções, desenvolvido pela Databricks e lançado em 2023, projetado para demonstrar o ajuste fino econômico de modelos-base de código aberto.

Dolly é um modelo de linguagem de grande escala ajustado por instruções, desenvolvido pela Databricks e lançado pela primeira vez em março de 2023. Demonstrou que um modelo relativamente pequeno, ajustado em um conjunto de dados modesto, podía alcanzar um comportamento competente de seguimento de instruções, desafiando a suposição predominante de que escala massiva e dados proprietários extensos eram necessários para tais capacidades. O projeto visava tornar a personalização de LLMs acessible para empresas, mostrando que o ajuste fino podía ser feito em uma única máquina em pouco tempo.

A versão inicial, Dolly 1.0, baseava-se no modelo GPT-J 6B da EleutherAI e foi ajustada em um conjunto de dados de aproximadamente 15.000 pares de instrução-resposta gerados por empregados da Databricks. Isso foi seguido pelo Dolly 2.0 em abril de 2023, que usava o mesmo modelo base, mas introducía um conjunto de dados de código aberto maior, de 15.000 pares, lançado sob uma licença permissiva. Dolly 2.0 tornou-se notável por ser um dos primeiros modelos de código aberto ajustados por instruções com um conjunto de dados de treinamento totalmente aberto, permitendo aos pesquisadores replicar e construir sobre o trabalho.

Abordagem Técnica

O treinamento de Dolly empregava uma técnica conhecida como ajuste por instruções, onde um modelo de linguagem pré-treinado é ajustado em exemplos de instruções e respostas correspondentes. Este processo alinea o comportamento do modelo com a intenção do usuário, permitendo-lhe seguir prompts em várias tarefas como resumo, resposta a perguntas e generación de texto. O ajuste fino usava um objetivo de aprendizagem supervisada padrão, optimizando o modelo para predecir os tokens de resposta dada a instrução. Databricks utilizava sua própria plataforma de aprendizado automático para gerenciar o pipeline de treinamento, mas o modelo em si foi desenhado para ser executado em hardware de commodity, incluindo uma única GPU Nvidia A10 para inferência.

O modelo base, GPT-J, é uma arquitectura baseada em transformadores com 6 bilhões de parámetros, treinada no conjunto de dados Pile. O ajuste fino de Dolly não alterou a arquitectura base, mas ajustou os pesos para especializar-se no seguimento de instruções. Esta abrodage contrastava com modelos maiores como os de OpenAI ou Anthropic, que frequentemente requerem recursos computacionais massivos e dados de treinamento proprietarios.

Lançamento e Impacto

Dolly foi lançado sob a licencia Apache 2.0, tornándolo livremente disponível para uso comercial e de pesquisa. O conjunto de dados acompanhante, denominado 'databricks-dolly-15k', também foi de código aberto, uma raridade na época. Esta abertura permitió à comunidade de aprendizado automático estudar os efeitos do ajuste por instruções e criar modelos derivados. O lançamento de Dolly provocó discussões sobre a democratização da IA, já que mostró que organizações sem recursos vastos podían construir assistentes capazes.

No entanto, o desempeño de Dolly não estava à altura de modelos de última generación como GPT-3.5 ou Claude, e exibía limitações em raciocinio complexo e precisão factual. Ainda assim, serviu como uma prova de conceito para ajuste fino eficiente, influenciando esforços posteriores de código aberto como Alpaca e Vicuna. Databricks posicionou Dolly como uma ferramenta para empresas criar assistentes de IA personalizados usando seus próprios dados, integrando-se com sua arquitectura lakehouse.

Recepción e Legado

Dolly recebiu atenção mediática significativa ao ser lançado, com cobertura na prensa tecnológica destacando seu baixo custo de treinamento (reportado em menos de $30 para computação) e seu desafío à narrativa de que só gigantes tecnológicos podían desenvolver LLMs. O modelo foi elogiado por sua transparencia, mas alguns críticos notaron que suas capacidades eram limitadas em comparação com ofertas comerciais. Com o tempo, Dolly foi superado por modelos abertos mais poderosos, mas seu conjunto de dados e metodología continuaron sendo usados em pesquisa.

Databricks posteriormente integró Dolly em sua plataforma, permitendo aos clientes ajustar e implementar o modelo para casos de uso específicos. O projeto também contribuiu à tendência mais ampla de desenvolvimento de LLMs de código aberto, encorajando mais experimentación com ajuste por instruções em modelos menores. A partir de 2025, Dolly é considerado um hito histórico na evolución da IA acessible, embora não seja mais desenvolvido ativamente.

Veja Também

Referências

(Nota: Este artigo basea-se em informação públicamente disponível e não cita fontes externas.)

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·machine-learning·open-source-software·databricks
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico