Traduzido do inglês

Um modelo de fundação é um grande modelo de aprendizado de máquina treinado em dados amplos em escala, que pode ser adaptado, por meio de ajuste fino ou prompting, a uma ampla gama de tarefas downstream, um termo cunhado por pesquisadores de Stanford em 2021.

Um modelo de fundação é um modelo de aprendizado de máquina treinado em dados amplos, frequentemente em escala da web, que pode ser adaptado a uma ampla gama de tarefas downstream, em vez de ser construído para um único propósito restrito. O termo foi cunhado em um relatório de 2021 do Centro de Pesquisa em Modelos de Fundação (CRFM) da Universidade Stanford, liderado por pesquisadores como Percy Liang, que argumentaram que modelos como GPT-3 e BERT representavam um novo paradigma: um único modelo, uma vez pré-treinado, serve como base para muitas aplicações por meio de ajuste fino, aprendizado em contexto ou prompting, em vez de cada tarefa exigir um modelo treinado do zero.

Origens e definição

O relatório do CRFM distinguiu modelos de fundação por sua combinação de escala, em parâmetros, dados e computação, objetivos de treinamento amplos, como autossupervisionado pré-treinamento em dados não rotulados, e generalidade, significando que as representações aprendidas de um único modelo se transferem para muitas tarefas downstream com adaptação relativamente leve. Esse enquadramento baseou-se e estendeu a ideia anterior de aprendizado por transferência, onde um modelo pré-treinado em uma tarefa ou conjunto de dados é reutilizado, tipicamente após ajuste fino, em uma tarefa relacionada.

Exemplos

Modelos de fundação abrangem modalidades: modelos focados em texto, como a série GPT, Claude, Gemini e Llama; sistemas de visão-linguagem construídos em pré-treinamento estilo CLIP; modelos de geração de imagem, como Stable Diffusion; e modelos de fala, como Whisper. A maioria dos grandes modelos de linguagem são modelos de fundação nesse sentido, embora o termo seja anterior e mais amplo que LLM, pois também cobre sistemas não textuais e multimodais.

Por que o termo é usado

O rótulo surgiu em parte para capturar uma mudança em como os sistemas de IA são construídos e implantados: em vez de um grupo de pesquisa treinar um modelo personalizado por tarefa, um modelo de fundação de pesos abertos ou proprietário é lançado uma vez e depois adaptado por muitos usuários downstream, reduzindo drasticamente o custo de construir novas aplicações de IA. Isso deu origem a um ecossistema, exemplificado por plataformas como Hugging Face, centrado em compartilhar, ajustar e implantar modelos de fundação em vez de treinar do zero. O termo também se mostrou útil em discussões de políticas, já que regulamentações como o Ato de IA da UE criaram obrigações específicas para provedores de modelos de propósito geral ou de fundação, distintas daquelas para desenvolvedores que apenas constroem aplicações sobre eles.

Críticas e ressalvas

O próprio relatório do CRFM reconheceu riscos: modelos de fundação concentram capacidade e influência nas mãos das poucas organizações capazes de treiná-los, propagam vieses presentes em seus amplos dados de treinamento para cada aplicação downstream construída sobre eles, e podem se comportar de forma imprevisível fora da distribuição de seus dados de treinamento. Críticos, incluindo alguns que, de outra forma, acolheram o enquadramento, notaram que "fundação" implica uma estabilidade e confiabilidade que os primeiros grandes modelos nem sempre tinham, e que o termo pode obscurecer diferenças significativas entre modelos, como se são abertos ou fechados, ou treinados com diferentes técnicas de alinhamento. Apesar disso, modelo de fundação tornou-se vocabulário padrão tanto em artigos de pesquisa quanto em regulamentações poucos anos após sua introdução.

Relação com outros termos

Modelo de fundação se sobrepõe fortemente, mas não é idêntico, a modelo de fronteira, que denota especificamente os modelos mais capazes em um dado momento, e a LLM, que é específico para texto. Um modelo de fundação não precisa estar na fronteira da capacidade, e nem todos os modelos de fundação são modelos de linguagem.

Categorias:deep-learning·ai-governance·industry
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico