OPT (Open Pre-trained Transformer) é uma família de modelos de linguagem de grande porte desenvolvida pela Meta AI e lançada em maio de 2022. A suíte abrange tamanhos de parâmetros de 125 milhões a 175 bilhões, com o maior modelo, OPT-175B, igualando a escala do GPT-3. Diferente de muitos modelos contemporâneos, o OPT foi disponibilizado publicamente com seus pesos, código de treinamento e logs detalhados, visando democratizar o acesso à pesquisa em modelos de linguagem de grande escala.
A arquitetura do OPT segue o design padrão de decodificador transformer, incorporando melhorias como normalização de camadas e conexões residuais. Os modelos foram treinados em um corpus diversificado de 180 bilhões de tokens, incluindo fontes como Common Crawl, Wikipédia e BooksCorpus. O processo de treinamento enfatizou eficiência computacional e estabilidade, utilizando técnicas como escalonamento dinâmico de perda e recorte de gradiente.
Desenvolvimento e Lançamento
O OPT foi introduzido em um artigo intitulado "OPT: Open Pre-trained Transformer Language Models" por Susan Zhang e colegas da Meta AI. O lançamento incluiu não apenas os pesos dos modelos, mas também o código de treinamento e um registro detalhado do processo de treinamento, algo inédito para modelos dessa escala. O objetivo era incentivar a reprodutibilidade e a colaboração dentro da comunidade de pesquisa em inteligência artificial.
Os modelos foram disponibilizados sob uma licença não comercial, com acesso concedido mediante solicitação. O lançamento foi acompanhado de uma demonstração e documentação. O maior modelo, OPT-175B, exigia recursos computacionais significativos, mas variantes menores (por exemplo, 125M, 350M, 1.3B, 2.7B, 6.7B, 13B, 30B, 66B) também foram fornecidas para atender a diferentes necessidades de pesquisa.
Arquitetura e Treinamento
O OPT usa uma arquitetura de decodificador apenas, com atenção causal, semelhante ao GPT-3. As principais escolhas de design incluem pré-normalização (aplicando normalização de camadas antes de cada subcamada), ativação ReLU em vez de GELU e posições aprendidas. Os dados de treinamento foram filtrados e deduplicados, e os modelos foram treinados usando otimização Adam com um cronograma de taxa de aprendizado em cosseno.
O treinamento do OPT-175B levou aproximadamente 992 horas de GPU em GPUs NVIDIA A100, sendo notavelmente mais eficiente do que modelos comparáveis devido a técnicas de otimização. Os registros de treinamento documentaram desafios como picos de perda e as estratégias de mitigação empregadas.
Desempenho e Avaliação
Os modelos OPT foram avaliados em uma variedade de benchmarks de processamento de linguagem natural, incluindo SuperGLUE, SQuAD e OpenBookQA. Embora o OPT-175B tenha apresentado desempenho competitivo com o GPT-3 em muitas tarefas, mostrou algumas diferenças, como desempenho ligeiramente inferior em tarefas de geração de código. Os modelos também demonstraram capacidades de aprendizado com poucos exemplos, melhorando com o número de exemplos fornecidos.
Em configurações de zero-shot e few-shot, o OPT-175B alcançou resultados sólidos em tarefas de resposta a perguntas e raciocínio de senso comum. No entanto, como outros modelos grandes, podia produzir saídas tendenciosas ou prejudiciais, e o artigo discutiu limitações e considerações éticas.
Impacto e Legado
O OPT foi um lançamento marcante na comunidade de IA de código aberto, estabelecendo um precedente para transparência no desenvolvimento de modelos em larga escala. Influenciou modelos abertos subsequentes, como BLOOM e LLaMA. A disponibilidade do OPT permitiu que pesquisadores estudassem o comportamento dos modelos, ajuste fino e interpretabilidade sem as barreiras dos modelos proprietários.
O lançamento também gerou discussões sobre os riscos de disponibilizar modelos poderosos, incluindo potencial uso indevido. A Meta AI implementou uma estratégia de lançamento responsável, incluindo uma política de uso e controles de acesso. Apesar dessas preocupações, o OPT permanece como uma referência amplamente utilizada na pesquisa acadêmica e um ponto de referência para o desenvolvimento de modelos abertos.
Ver Também
Referências
- Zhang, S., et al. (2022). "OPT: Open Pre-trained Transformer Language Models." arXiv:2205.01068.
- Meta AI. (2022). "Introducing OPT."