Otimização de Hiperparâmetros

Traduzido do inglês

OPT (Open Pre-trained Transformer) é um conjunto de modelos de linguagem apenas com decodificador, desenvolvidos pela Meta AI e lançados em maio de 2022. Os modelos variam de 125 milhões a 175 bilhões de parâmetros e são notáveis por serem totalmente open-source, incluindo pesos, código e registros de treinamento.

OPT (Open Pre-trained Transformer) é uma família de modelos de linguagem de grande porte desenvolvida pela Meta AI e lançada em maio de 2022. A suíte abrange tamanhos de parâmetros de 125 milhões a 175 bilhões, com o maior modelo, OPT-175B, igualando a escala do GPT-3. Diferente de muitos modelos contemporâneos, o OPT foi disponibilizado publicamente com seus pesos, código de treinamento e logs detalhados, visando democratizar o acesso à pesquisa em modelos de linguagem de grande escala.

A arquitetura do OPT segue o design padrão de decodificador transformer, incorporando melhorias como normalização de camadas e conexões residuais. Os modelos foram treinados em um corpus diversificado de 180 bilhões de tokens, incluindo fontes como Common Crawl, Wikipédia e BooksCorpus. O processo de treinamento enfatizou eficiência computacional e estabilidade, utilizando técnicas como escalonamento dinâmico de perda e recorte de gradiente.

Desenvolvimento e Lançamento

O OPT foi introduzido em um artigo intitulado "OPT: Open Pre-trained Transformer Language Models" por Susan Zhang e colegas da Meta AI. O lançamento incluiu não apenas os pesos dos modelos, mas também o código de treinamento e um registro detalhado do processo de treinamento, algo inédito para modelos dessa escala. O objetivo era incentivar a reprodutibilidade e a colaboração dentro da comunidade de pesquisa em inteligência artificial.

Os modelos foram disponibilizados sob uma licença não comercial, com acesso concedido mediante solicitação. O lançamento foi acompanhado de uma demonstração e documentação. O maior modelo, OPT-175B, exigia recursos computacionais significativos, mas variantes menores (por exemplo, 125M, 350M, 1.3B, 2.7B, 6.7B, 13B, 30B, 66B) também foram fornecidas para atender a diferentes necessidades de pesquisa.

Arquitetura e Treinamento

O OPT usa uma arquitetura de decodificador apenas, com atenção causal, semelhante ao GPT-3. As principais escolhas de design incluem pré-normalização (aplicando normalização de camadas antes de cada subcamada), ativação ReLU em vez de GELU e posições aprendidas. Os dados de treinamento foram filtrados e deduplicados, e os modelos foram treinados usando otimização Adam com um cronograma de taxa de aprendizado em cosseno.

O treinamento do OPT-175B levou aproximadamente 992 horas de GPU em GPUs NVIDIA A100, sendo notavelmente mais eficiente do que modelos comparáveis devido a técnicas de otimização. Os registros de treinamento documentaram desafios como picos de perda e as estratégias de mitigação empregadas.

Desempenho e Avaliação

Os modelos OPT foram avaliados em uma variedade de benchmarks de processamento de linguagem natural, incluindo SuperGLUE, SQuAD e OpenBookQA. Embora o OPT-175B tenha apresentado desempenho competitivo com o GPT-3 em muitas tarefas, mostrou algumas diferenças, como desempenho ligeiramente inferior em tarefas de geração de código. Os modelos também demonstraram capacidades de aprendizado com poucos exemplos, melhorando com o número de exemplos fornecidos.

Em configurações de zero-shot e few-shot, o OPT-175B alcançou resultados sólidos em tarefas de resposta a perguntas e raciocínio de senso comum. No entanto, como outros modelos grandes, podia produzir saídas tendenciosas ou prejudiciais, e o artigo discutiu limitações e considerações éticas.

Impacto e Legado

O OPT foi um lançamento marcante na comunidade de IA de código aberto, estabelecendo um precedente para transparência no desenvolvimento de modelos em larga escala. Influenciou modelos abertos subsequentes, como BLOOM e LLaMA. A disponibilidade do OPT permitiu que pesquisadores estudassem o comportamento dos modelos, ajuste fino e interpretabilidade sem as barreiras dos modelos proprietários.

O lançamento também gerou discussões sobre os riscos de disponibilizar modelos poderosos, incluindo potencial uso indevido. A Meta AI implementou uma estratégia de lançamento responsável, incluindo uma política de uso e controles de acesso. Apesar dessas preocupações, o OPT permanece como uma referência amplamente utilizada na pesquisa acadêmica e um ponto de referência para o desenvolvimento de modelos abertos.

Ver Também

Referências

  • Zhang, S., et al. (2022). "OPT: Open Pre-trained Transformer Language Models." arXiv:2205.01068.
  • Meta AI. (2022). "Introducing OPT."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·meta-ai·open-source-ai·transformer-architecture
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico