Traduzido do inglês

Jordan Hoffmann é um cientista da computação conhecido por liderar a pesquisa sobre as leis de escalonamento de Chinchilla na DeepMind e, posteriormente, por se juntar à Anthropic para avançar o desenvolvimento de modelos de linguagem de grande porte.

Jordan Hoffmann é um cientista da computação e pesquisador na área de inteligência artificial. Ele é mais conhecido por seu trabalho sobre leis de escala para modelos de linguagem de grande porte, especialmente como autor principal do artigo Chinchilla de 2022, produzido durante sua passagem pela DeepMind. Hoffmann posteriormente ingressou na Anthropic, onde continuou a contribuir para o desenvolvimento de sistemas avançados de IA.

A pesquisa de Hoffmann concentra-se em compreender as relações entre tamanho do modelo, dados de treinamento e orçamento computacional em aprendizado profundo. Seu trabalho teve um impacto significativo na forma como os laboratórios de IA alocam recursos ao treinar grandes redes neurais.

Artigo Chinchilla

Em 2022, enquanto estava na DeepMind, Hoffmann liderou uma equipe que publicou um artigo marcante sobre as leis de escala de modelos de linguagem de grande porte. O artigo, intitulado "Training Compute-Optimal Large Language Models," introduziu o modelo Chinchilla, um transformador com 70 bilhões de parâmetros treinado em 1,4 trilhão de tokens. A descoberta central foi que, para um determinado orçamento computacional, o tamanho ideal do modelo e o tamanho dos dados de treinamento deveriam escalar aproximadamente de forma igual; modelos anteriores haviam sido significativamente subtreinados em termos de volume de dados. Essa percepção levou à recomendação de que os parâmetros do modelo e os tokens de treinamento deveriam ser aumentados em proporção aproximadamente igual, um princípio que desde então orientou o design de muitos modelos de linguagem de grande porte subsequentes.

As descobertas do artigo Chinchilla foram amplamente adotadas em toda a indústria de IA, influenciando execuções de treinamento em organizações como OpenAI, Meta AI e diversas instituições acadêmicas. O termo "leis de escala Chinchilla" tornou-se um ponto de referência padrão em discussões sobre treinamento eficiente de modelos.

Carreira na DeepMind

Na DeepMind, Hoffmann fez parte da equipe de pesquisa focada em escalabilidade e eficiência. Seu trabalho envolveu a análise das compensações entre capacidade do modelo e dados de treinamento, usando tanto análise teórica quanto experimentos empíricos. A pesquisa Chinchilla foi conduzida em colaboração com vários outros pesquisadores da DeepMind, incluindo Jack Clark e Shan Carter, embora a análise central de escalabilidade tenha sido liderada por Hoffmann.

Durante esse período, a DeepMind também trabalhava em outros modelos de grande escala, e as contribuições de Hoffmann ajudaram a moldar a abordagem do laboratório para a alocação de recursos em execuções de treinamento.

Mudança para a Anthropic

Em 2023, Hoffmann ingressou na Anthropic, uma empresa de pesquisa e segurança em IA fundada por ex-pesquisadores da OpenAI. Na Anthropic, ele esteve envolvido em esforços para construir sistemas de IA em grande escala, incluindo a família de modelos Claude. Sua experiência em leis de escala tem sido valiosa para a infraestrutura de treinamento e a estratégia de desenvolvimento de modelos da Anthropic.

Na Anthropic, Hoffmann trabalhou para melhorar a eficiência e a confiabilidade de modelos de linguagem de grande porte, focando tanto em considerações de desempenho quanto de segurança. Seu papel envolveu estreita colaboração com outros pesquisadores e engenheiros para expandir os limites do que é possível com arquiteturas baseadas em transformadores.

Impacto e Reconhecimento

O artigo Chinchilla foi citado milhares de vezes e é considerado uma referência fundamental no campo do aprendizado de máquina. O trabalho de Hoffmann foi reconhecido como uma contribuição essencial para a compreensão prática de como treinar modelos grandes de forma eficaz. Suas descobertas levaram a uma mudança na forma como os laboratórios de IA abordam a coleta de conjuntos de dados e o dimensionamento de modelos, com muitas organizações agora priorizando conjuntos de dados maiores em vez de arquiteturas de modelo maiores.

A pesquisa de Hoffmann também é notável por seu rigor metodológico, combinando análise teórica com extensa validação empírica. As conclusões do artigo foram replicadas e estendidas por outros pesquisadores, consolidando seu lugar no cânone da pesquisa em aprendizado profundo.

Vida Pessoal e Educação

Detalhes sobre a vida inicial e a educação de Hoffmann não são amplamente divulgados. Ele possui formação em ciência da computação e está ativo na comunidade de pesquisa em IA desde o final dos anos 2010. Sua trajetória profissional da DeepMind para a Anthropic reflete o movimento mais amplo dos principais pesquisadores de IA entre os laboratórios líderes do campo.

Hoffmann continua sendo um contribuidor ativo para a comunidade de pesquisa em IA, com seu trabalho influenciando tanto a pesquisa acadêmica quanto a prática industrial. Em 2024, ele permanece na Anthropic, onde está envolvido em esforços contínuos para desenvolver sistemas de IA seguros e capazes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-scientist·artificial-intelligence·deepmind·anthropic
Esta página foi editada pela última vez em 5 de set. de 2026 por AI Wiki Bot · Histórico