Traduzido do inglês

Phi-2 é um modelo de linguagem de grande porte com 2,7 bilhões de parâmetros desenvolvido pela Microsoft, lançado em dezembro de 2023, conhecido por suas fortes capacidades de raciocínio em relação ao seu tamanho e por seu treinamento em dados de alta qualidade, semelhantes a livros didáticos.

Phi-2 é um modelo de 2,7 bilhões de parâmetros modelo de linguagem de grande porte desenvolvido pela Microsoft, lançado em dezembro de 2023. Ele faz parte da série Phi de modelos de linguagem pequenos, projetados para alcançar desempenho competitivo em tarefas de raciocínio, sendo significativamente menores do que os modelos de fronteira contemporâneos. O Phi-2 demonstrou que a curadoria cuidadosa dos dados de treinamento, focando em conteúdo de alta qualidade semelhante a livros didáticos, pode gerar fortes habilidades de raciocínio sem exigir escala massiva.

O modelo foi treinado em 1,4 trilhão de tokens, um conjunto de dados relativamente modesto para seu tamanho, mas que enfatizava dados de "qualidade de livro didático" - incluindo conjuntos de dados sintéticos gerados por modelos maiores e conteúdo web filtrado. Essa abordagem, enraizada em princípios de aprendizagem curricular, permitiu que o Phi-2 superasse modelos até 25 vezes maiores em benchmarks como GSM-8K (raciocínio matemático) e BIG-Bench. A Microsoft posicionou o Phi-2 como uma ferramenta de pesquisa, lançando-o sob uma licença permissiva para uso acadêmico e comercial, com o objetivo declarado de permitir estudos adicionais sobre a eficiência de modelos pequenos.

Arquitetura e Treinamento

O Phi-2 é um modelo transformador somente decodificador, seguindo a arquitetura padrão usada na maioria dos modelos de linguagem de grande porte modernos. Ele possui 32 camadas, um tamanho oculto de 2560 e 32 cabeças de atenção, com uma janela de contexto de 2048 tokens. O modelo usa técnicas de atenção de múltiplas cabeças e codificação posicional típicas da família GPT. Diferente de alguns modelos maiores, ele não emprega mistura de especialistas ou outras técnicas de esparsidade, contando com computação densa.

O treinamento foi conduzido em um cluster de 96 GPUs NVIDIA A100 por aproximadamente 14 dias. O conjunto de dados compreendia 1,4 trilhão de tokens, com uma parte significativa gerada sinteticamente por modelos maiores como GPT-3.5 e GPT-4, juntamente com páginas web filtradas do corpus "RefinedWeb". Os dados sintéticos foram projetados para ensinar raciocínio passo a passo, enquanto os dados web forneciam conhecimento geral. A Microsoft usou um cronograma de taxa de aprendizado com otimizador Adam e recorte de gradiente, e aplicou normalização de camada para estabilidade. Nenhuma aumentação de dados foi usada além do processo de geração sintética.

Desempenho e Benchmarks

O Phi-2 alcançou resultados notáveis em benchmarks padrão de raciocínio. No GSM-8K, obteve 56,7% de precisão, superando o Llama-2 de 7B parâmetros e o Llama-2 de 13B parâmetros, e se aproximando do desempenho de modelos muito maiores como GPT-3.5. No conjunto BIG-Bench Hard, obteve 57,4%, novamente superando modelos várias vezes seu tamanho. Em tarefas de codificação, mostrou forte desempenho no HumanEval, alcançando 48,4% de pass@1, o que era competitivo com modelos como StarCoder-15B.

Esses resultados foram atribuídos à qualidade dos dados de treinamento, em vez de inovação arquitetural. Os pesquisadores da Microsoft notaram que o desempenho do Phi-2 em tarefas de raciocínio era "surpreendentemente forte" para seu tamanho, sugerindo que a capacidade da rede neural era utilizada de forma eficiente. No entanto, o modelo apresentou limitações em conhecimento factual e geração de texto longo, consistente com sua escala menor e dados de treinamento focados.

Lançamento e Acessibilidade

O Phi-2 foi lançado em 12 de dezembro de 2023, através do hub de modelos Hugging Face sob a licença MIT. Essa licença permissiva permitia uso irrestrito, incluindo aplicações comerciais, o que era incomum para modelos de sua capacidade na época. A Microsoft também integrou o Phi-2 em sua plataforma de nuvem Azure, permitindo implantação através do Azure AI Studio e do Azure Machine Learning. O modelo estava disponível para ajuste fino e inferência, com suporte para execução em CPU e GPU.

O lançamento fazia parte da estratégia mais ampla da Microsoft para democratizar a pesquisa em IA, fornecendo uma alternativa leve a modelos maiores que pudesse rodar em hardware de consumo. O pequeno tamanho do Phi-2 (aproximadamente 5,4 GB em FP16) o tornava acessível a desenvolvedores e pesquisadores individuais, contrastando com os requisitos de recursos de modelos como GPT-4 ou Claude.

Impacto e Legado

O Phi-2 influenciou pesquisas subsequentes em aprendizado de máquina eficiente e design de modelos pequenos. Seu sucesso destacou a importância da qualidade dos dados sobre a quantidade, desafiando a suposição predominante de que a escala era o principal impulsionador da capacidade. A abordagem inspirou outras organizações, incluindo Google DeepMind e Anthropic, a explorar estratégias semelhantes de curadoria de dados para seus modelos menores.

Dentro da Microsoft, o Phi-2 serviu como precursor da família Phi-3, que expandiu os mesmos princípios com contagens de parâmetros maiores (até 14B) e desempenho melhorado. O modelo também contribuiu para discussões sobre o impacto ambiental da IA, pois seu treinamento exigia significativamente menos computação do que modelos de grande escala, alinhando-se com metas de sustentabilidade. Em 2024, o Phi-2 permanece como um ponto de referência para pesquisadores que estudam os trade-offs entre tamanho do modelo, qualidade dos dados e habilidade de raciocínio.

Limitações

Apesar de seus pontos fortes, o Phi-2 tinha limitações conhecidas. Seu corte de conhecimento era no final de 2023, e ele não podia acessar informações em tempo real. O modelo às vezes produzia respostas plausíveis, mas incorretas, particularmente em domínios fora de sua distribuição de treinamento. Sua janela de contexto de 2048 tokens era mais curta do que a de muitos modelos contemporâneos, limitando seu uso para tarefas de documentos longos. Além disso, embora se destacasse em raciocínio, ele tinha dificuldades com escrita criativa e recordação factual nuançada, refletindo o foco estreito de seus dados de treinamento.

A Microsoft aconselhou os usuários a tratar o Phi-2 como um artefato de pesquisa, em vez de um sistema pronto para produção, recomendando ajuste fino para aplicações específicas. O modelo não foi alinhado para segurança e poderia gerar conteúdo tendencioso ou prejudicial se solicitado, um problema comum para modelos de sua época.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·microsoft·transformer·reasoning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico