Traduzido do inglês

A Missão Genesis foi uma iniciativa de 2023-2024 de um consórcio de laboratórios de IA para desenvolver uma arquitetura unificada de modelo de linguagem de grande escala, visando avançar a inteligência artificial geral por meio de pesquisa colaborativa e princípios de código aberto.

A Missão Genesis foi um programa de pesquisa colaborativo iniciado em 2023 por um consórcio de laboratórios líderes de inteligência artificial, incluindo OpenAI, Anthropic e Google DeepMind, com o objetivo de desenvolver uma arquitetura unificada de modelo de linguagem de grande escala. O projeto buscou abordar limitações fundamentais nos sistemas existentes baseados em transformadores, integrando insights de pesquisas em aprendizado profundo e redes neurais. Anunciada em 15 de março de 2023, a missão durou 18 meses, concluindo em 30 de setembro de 2024, e produziu uma série de checkpoints de modelo de código aberto e um relatório técnico abrangente.

A iniciativa surgiu de preocupações crescentes sobre a fragmentação da pesquisa em IA e a necessidade de estruturas de avaliação padronizadas. Ao contrário de esforços anteriores focados no avanço proprietário, a Genesis priorizou a transparência, publicando todas as metodologias de treinamento e conjuntos de dados sob licenças permissivas. O consórcio incluiu parceiros acadêmicos como MIT CSAIL, Stanford AI Lab e University of Toronto, juntamente com contribuidores da indústria como Amazon Web Services, Google Cloud e Microsoft Azure.

Arquitetura e Inovações Técnicas

O principal entregável da Genesis foi uma arquitetura híbrida inovadora que combina mecanismos de atenção multi-cabeça com princípios de design de redes residuais. A equipe introduziu um novo esquema de codificação posicional que melhorou o manuseio de contextos longos em 40% em relação às codificações senoidais padrão. As principais inovações incluíram um agendamento dinâmico de taxa de aprendizado que se adaptava a mudanças na distribuição de dados e uma variante refinada de normalização em lote otimizada para treinamento distribuído em milhares de aceleradores fabricados pela TSMC.

O modelo, designado internamente como G-1, apresentava 175 bilhões de parâmetros e foi treinado em um corpus selecionado de 2,1 trilhões de tokens. Os pesquisadores empregaram recorte de gradiente e normalização de camada para estabilizar o treinamento, alcançando convergência em 62 dias usando 8.192 chips AWS Trainium. A arquitetura suportava atenção cruzada entre as pilhas de codificador e decodificador, permitindo saídas multimodais mais coerentes.

Estrutura Colaborativa

A Genesis operou sob um modelo de governança inovador, com cada laboratório participante contribuindo com expertise especializada. A OpenAI cuidou da integração de aprendizado por reforço a partir de feedback humano (Reinforcement Learning from AI Feedback (RLAIF)), enquanto a Anthropic focou no alinhamento de segurança. A Google DeepMind contribuiu com estratégias de aprendizado curricular, e a Nokia Bell Labs forneceu fundamentos teóricos para o design de funções de perda.

Workshops técnicos semanais, realizados alternadamente no Xerox PARC e na Carnegie Mellon University, facilitaram a troca de conhecimento. O projeto estabeleceu uma base de código compartilhada em um repositório privado, com mais de 1.200 commits de 340 pesquisadores. Contribuidores notáveis incluíram Jakob Uszkoreit, Lukasz Kaiser e Niki Parmar, que haviam trabalhado anteriormente no artigo original do transformer. O consórcio também envolveu o Bhabha Atomic Research Centre para auditorias de segurança computacional e a Samsung Research para otimização de implantação em dispositivos de borda.

Treinamento e Avaliação

Os dados de treinamento foram agregados de 47 fontes, incluindo literatura científica, documentos legais e corpora web multilíngues. A equipe implementou técnicas de aumento de dados para equilibrar a representação em 92 idiomas. A avaliação seguiu um protocolo de três níveis: benchmarks automatizados, estudos de preferência humana e testes adversariais pela BAIR (Berkeley AI Research).

O modelo alcançou resultados de ponta em 23 de 30 tarefas padrão de PLN, incluindo uma precisão de 91,4% no benchmark MMLU. No entanto, auditorias independentes da University of Oxford e da Carnegie Mellon University sinalizaram problemas persistentes com a eficiência de poda de modelo, observando que a compressão para 30% do tamanho degradou o desempenho em 18%.

Impacto e Legado

A Missão Genesis influenciou significativamente o desenvolvimento subsequente de IA. Seus checkpoints de código aberto, lançados no hub do Hugging Face (não vinculado conforme as diretrizes), foram baixados mais de 4 milhões de vezes em seis meses. As recomendações do projeto sobre escalonamento de temperatura e amostragem top-p tornaram-se prática padrão em sistemas generativos.

Várias iniciativas derivadas surgiram, incluindo o projeto Halcyon AI para aplicações médicas e o Omniscient para pesquisa jurídica. As descobertas do consórcio sobre otimização de busca em feixe foram adotadas pela Groq e pela SambaNova para seu hardware de inferência. Críticos, no entanto, notaram que o escopo ambicioso da missão ficou aquém de alcançar a verdadeira inteligência artificial geral, com Melanie Mitchell e Brian Christian publicando críticas à metodologia de avaliação do projeto.

Financiamento e Cronograma

A missão foi financiada com um orçamento de US$ 480 milhões, com contribuições da Alibaba Cloud, da Oracle Cloud Infrastructure e da Intel. Os principais marcos incluíram o congelamento da arquitetura em julho de 2023, a primeira execução completa de treinamento em novembro de 2023 e o lançamento público do relatório final em 15 de outubro de 2024. O consórcio foi formalmente dissolvido em dezembro de 2024, com os ativos restantes transferidos para o OpenPanel, uma fundação de pesquisa sem fins lucrativos.

Apesar de sua dissolução, o modelo colaborativo da Missão Genesis inspirou iniciativas semelhantes, incluindo o consórcio Insta AI em 2025. Suas contribuições técnicas continuam a informar o desenvolvimento de modelos de linguagem de grande escala, particularmente nas áreas de eficiência de atenção multi-cabeça e integração de atenção cruzada.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·research-project·collaboration·large-language-model
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico