Traduzido do inglês

Jurassic-1 é uma família de modelos de linguagem de grande porte desenvolvida pela AI21 Labs, lançada em 2021, conhecida por sua arquitetura de transformador autorregressivo e alto desempenho em tarefas de processamento de linguagem natural.

Jurassic-1 é uma família de modelos de linguagem de grande porte (LLMs) desenvolvida pela empresa israelense de inteligência artificial AI21 Labs. Lançado em agosto de 2021, foi um dos primeiros LLMs comercialmente disponíveis a rivalizar com a escala do GPT-3 da OpenAI, com a maior variante, Jurassic-1 Jumbo, contendo 178 bilhões de parâmetros. Os modelos são projetados para uma ampla gama de tarefas de processamento de linguagem natural, incluindo geração de texto, sumarização, resposta a perguntas e geração de código, e são acessíveis por meio de uma API comercial.

O Jurassic-1 é construído sobre a arquitetura Transformer (architecture), especificamente um modelo autorregressivo somente decodificador, semelhante ao GPT-3. Foi treinado em um grande corpus de texto e código publicamente disponíveis, com foco em filtragem de alta qualidade e deduplicação. A família de modelos inclui duas variantes principais: Jurassic-1 Jumbo (178B parâmetros) e Jurassic-1 Large (7,5B parâmetros), ambas compartilhando a mesma arquitetura, mas diferindo em escala. Os modelos usam um tokenizador com um vocabulário de 250.000 tokens, que é maior que o vocabulário de 50.000 tokens do GPT-3, permitindo uma codificação mais eficiente de texto.

Arquitetura e Treinamento

Os modelos Jurassic-1 empregam um Transformer (architecture) padrão somente decodificador, com atenção multi-cabeça e camadas feed-forward. Eles usam Layer Normalization e uma estrutura de conexão residual, com uma configuração semelhante a outros LLMs de grande escala. O processo de treinamento utilizou uma combinação de otimização Adam, Gradient Clipping e um agendamento de taxa de aprendizado com aquecimento e decaimento cosseno. Os modelos foram treinados em um conjunto de dados de aproximadamente 300 bilhões de tokens, provenientes de páginas da web, livros e outros textos públicos, com uma parte significativa em inglês, mas também incluindo outros idiomas.

A AI21 Labs enfatizou o uso de um pipeline personalizado de filtragem de dados para remover conteúdo de baixa qualidade ou duplicado. O treinamento foi realizado em um cluster de GPUs NVIDIA, embora os detalhes específicos do hardware não tenham sido totalmente divulgados. A empresa também introduziu uma técnica chamada "prompting estruturado" para melhorar a capacidade do modelo de seguir instruções e executar tarefas como resposta a perguntas e raciocínio.

Capacidades e Desempenho

O Jurassic-1 demonstrou forte desempenho em uma variedade de benchmarks, incluindo SuperGLUE e outras tarefas de PLN, muitas vezes igualando ou superando os resultados do GPT-3 em avaliações semelhantes. O maior vocabulário e os dados de treinamento do modelo permitiram lidar com palavras raras e texto multilíngue de forma mais eficaz. Além da geração de texto padrão, o Jurassic-1 podia executar tarefas como reconhecimento de entidades nomeadas, análise de sentimentos e classificação de texto sem ajuste fino, usando aprendizado de poucos exemplos.

O modelo também suportava um recurso chamado raciocínio "zero-shot", onde podia responder perguntas ou resolver problemas sem exemplos prévios. A AI21 Labs lançou um playground público e uma API, permitindo que desenvolvedores integrassem o Jurassic-1 em aplicações. A API oferecia opções para controle de temperatura, amostragem top-p e outros parâmetros de geração.

Comparação com Contemporâneos

No seu lançamento, o Jurassic-1 foi posicionado como um concorrente direto do GPT-3 da OpenAI, que havia sido lançado em 2020. Enquanto o GPT-3 tinha 175 bilhões de parâmetros, o Jurassic-1 Jumbo tinha 178 bilhões, tornando-o ligeiramente maior. No entanto, o tokenizador do Jurassic-1 usava um vocabulário maior, o que reduzia o número de tokens necessários para um determinado texto, potencialmente melhorando a velocidade de inferência e o custo. A AI21 Labs também destacou a capacidade do modelo de lidar com contextos mais longos, com um comprimento máximo de sequência de 2.048 tokens, semelhante ao GPT-3.

Ao contrário dos modelos posteriores da Anthropic ou dos esforços do Google DeepMind, o Jurassic-1 não focava em aprendizado por reforço com feedback humano (RLHF) no lançamento, mas sim em aprendizado supervisionado e prompting de poucos exemplos. Isso o tornava mais semelhante ao GPT-3 original em abordagem.

Impacto e Legado

O Jurassic-1 foi um dos primeiros grandes LLMs de uma empresa que não fosse a OpenAI, ajudando a estabelecer a AI21 Labs como um player significativo no espaço de IA generativa. Foi usado em várias aplicações comerciais, incluindo assistência de escrita, chatbots de atendimento ao cliente e geração de conteúdo. O lançamento do modelo também contribuiu para a tendência mais ampla de aumento do tamanho dos modelos e o desenvolvimento de modelos de linguagem de grande porte como serviço.

Modelos subsequentes da AI21 Labs, como o Jurassic-2, basearam-se na arquitetura e nas lições aprendidas com o Jurassic-1, incorporando melhorias nos dados de treinamento e no alinhamento. A empresa continuou a oferecer o Jurassic-1 por meio de sua API por algum tempo, embora tenha sido eventualmente descontinuado em favor de modelos mais novos. O Jurassic-1 permanece um marco notável na história da pesquisa em inteligência artificial, demonstrando que LLMs competitivos poderiam ser desenvolvidos fora das maiores empresas de tecnologia.

Recepção e Críticas

O Jurassic-1 recebeu avaliações positivas por seu desempenho e acessibilidade, com muitos desenvolvedores elogiando a facilidade de uso da API e a capacidade do modelo de gerar texto coerente e contextualmente relevante. No entanto, como outros LLMs, enfrentou críticas em relação a possíveis vieses em seus dados de treinamento e ao impacto ambiental do treinamento de modelos tão grandes. A AI21 Labs reconheceu essas preocupações e publicou documentação sobre uso responsável, mas não divulgou publicamente os pesos do modelo, limitando a pesquisa independente.

Alguns pesquisadores notaram que o desempenho do Jurassic-1 em certas tarefas de raciocínio não era significativamente melhor do que o de modelos menores, destacando as limitações da escala sozinha. Apesar dessas críticas, o lançamento do modelo ajudou a estimular a concorrência no mercado de LLMs, levando a avanços rápidos no campo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·artificial-intelligence·natural-language-processing·ai21-labs
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico