Modelos de pesos abertos são modelos de aprendizado de máquina, tipicamente modelos de linguagem de grande porte ou outros modelos de base, cujos parâmetros treinados, ou pesos, são disponibilizados publicamente para qualquer pessoa baixar, executar localmente, inspecionar e ajustar. Isso contrasta com modelos proprietários ou fechados, como o GPT-4 ou o Claude, que são acessíveis apenas por meio de uma API paga ou interface hospedada, com os pesos subjacentes mantidos em sigilo. Parâmetros treinados, ou pesos, de um modelo são os valores numéricos ajustados durante o treinamento, que codificam o conhecimento aprendido e definem o comportamento do modelo durante a execução.
Terminologia
Pesos abertos é frequentemente usado em vez de código aberto porque apenas a publicação dos pesos não atende às definições tradicionais de código aberto, que normalmente exigem que os dados de treinamento, o código de treinamento e a metodologia também sejam públicos e livremente reutilizáveis. A maioria dos modelos abertos amplamente utilizados, incluindo Llama, as versões de Mistral e Qwen, publica os pesos e, frequentemente, os detalhes da arquitetura, mas não a íntegra dos dados de treinamento nem a receita completa de treinamento, tornando pesos-bertos um termo mais preciso do que IA de código aberto, frase que organizações como a Iniciativa de Código Aberto têm trabalhado para definir de forma mais rígida.
Histórico
Entre as primeiras divulgações abertas influentes estão os modelos Llama da Meta, lançados inicialmente em fevereiro de 2023, que vazaram antes de uma divulgação oficial mais ampla e impulsionaram uma onda de ajustes finos e modelos derivados na comunidade. O Stable Diffusion da Stability AI (2022) desempenhou um papel semelhante para a geração de imagens. Entre 2023 e 2025, as divulgações de pesos abertos se diversificaram, incluindo os modelos de Mistral AI, a família Qwen da Alibaba e, notavelmente, o DeepSeek-R1 da DeepSeek em janeiro de 2025, um modelo de raciocínio de pesos abertos cujas alegações de eficiência de treinamento contribuíram para o impacto de mercado da DeepSeek. Esforços sem fins lucrativos e de pesquisa, incluindo o projeto OLMo do Instituto Allen para Inteligência Artificial, têm buscado uma abertura mais completa, disponibilizando dados de treinamento e código junto com os pesos.
Licenciamento
Os modelos de pesos abertos são divulgados sob licenças variadas, desde licenças permissivas próximas ao código aberto tradicional até licenças personalizadas que impõem condições, como limites de uso vinculados à receita de uma empresa ou restrições ao uso das saídas para treinar modelos concorrentes. Essa variação tornou o termo "aberto" um rótulo contestado, já que dois modelos ambos descritos como de pesos abertos podem apresentar termos legais substancialmente diferentes.
Debate entre aberto e fechado
Os defensores da divulgação de pesos abertos argumentam que ela democratiza o acesso a uma IA poderosa, possibilita pesquisas de segurança independentes e trabalhos de interpretabilidade, evita olock-in de fornecedores e permite a implantação em ambientes sensíveis à privacidade ou offline. Os críticos, incluindo algumas vozes dentro da IA segura, argumentam que, uma vez públicos, os pesos, as medidas de mitigação de segurança embutidas em um modelo hospedado, como salvaguardas contra o uso prejudicial, podem ser removidas por qualquer pessoa com capacidade técnica para ajustar o modelo, e que a divulgação aberta remove a possibilidade de revogar o acesso a uma capacidade perigosa a posteriori. Figuras como Yann LeCun argumentaram que a abertura é essencial para a concorrência e o progresso científico, enquanto outros favorecem práticas de divulgação mais cautelosas e escalonadas, como a OpenAI adotou inicialmente com o GPT-2 em 2019.
Dimensões econômicas e geopolíticas
As divulgações de pesos abertos se tornaram uma estratégia competitiva: a Meta posicionou o Llama como uma forma de commoditizar a camada de modelos de base enquanto compete em produtos e infraestrutura, e as divulgações abertas agressivas de laboratórios chineses foram interpretadas em parte como uma resposta aos controles de exportação dos EUA sobre chips avançados, já que um modelo aberto amplamente adotado amplia a influência mesmo onde o acesso a APIs proprietárias líderes é restrito. Em 2025, modelos de pesos abertos de vários laboratórios se aproximam do desempenho de modelos fechados líderes em muitos benchmarks, embora os maiores modelos de fronteira tenham geralmente permanecido abertos.