Traducido del inglés

Phi-2 es un modelo de lenguaje grande de 2.7 mil millones de parámetros desarrollado por Microsoft, lanzado en diciembre de 2023, conocido por sus sólidas capacidades de razonamiento en relación con su tamaño y por su entrenamiento con datos de alta calidad similares a los de un libro de texto.

Phi-2 es un modelo de lenguaje grande de 2.7 mil millones de parámetros desarrollado por Microsoft, lanzado en diciembre de 2023. Forma parte de la serie Phi de modelos de lenguaje pequeños, diseñados para lograr un rendimiento competitivo en tareas de razonamiento mientras son significativamente más pequeños que los modelos frontera contemporáneos. Phi-2 demostró que una curación cuidadosa de los datos de entrenamiento, centrada en contenido de alta calidad similar a libros de texto, puede producir habilidades de razonamiento sólidas sin requerir una escala masiva.

El modelo fue entrenado con 1.4 billones de tokens, un conjunto de datos relativamente modesto para su tamaño, pero uno que enfatizaba datos de "calidad de libro de texto" - incluyendo conjuntos de datos sintéticos generados por modelos más grandes y contenido web filtrado. Este enfoque, basado en principios de aprendizaje curricular, permitió a Phi-2 superar a modelos hasta 25 veces más grandes en puntos de referencia como GSM-8K (razonamiento matemático) y BIG-Bench. Microsoft posicionó a Phi-2 como una herramienta de investigación, lanzándolo bajo una licencia permisiva para uso académico y comercial, con el objetivo declarado de permitir un mayor estudio de la eficiencia de los modelos pequeños.

Arquitectura y Entrenamiento

Phi-2 es un modelo Transformer (architecture) de solo decodificador, siguiendo la arquitectura estándar utilizada en la mayoría de los modelos de lenguaje grandes modernos. Tiene 32 capas, un tamaño oculto de 2560 y 32 cabezas de atención, con una ventana de contexto de 2048 tokens. El modelo utiliza técnicas de atención de múltiples cabezas y codificación posicional típicas de la familia GPT. A diferencia de algunos modelos más grandes, no emplea mezcla de expertos u otras técnicas de dispersión, confiando en cambio en el cálculo denso.

El entrenamiento se realizó en un clúster de 96 GPU NVIDIA A100 durante aproximadamente 14 días. El conjunto de datos comprendía 1.4 billones de tokens, con una parte significativa generada sintéticamente por modelos más grandes como GPT-3.5 y GPT-4, junto con páginas web filtradas del corpus "RefinedWeb". Los datos sintéticos fueron diseñados para enseñar razonamiento paso a paso, mientras que los datos web proporcionaban conocimiento general. Microsoft utilizó un programa de tasa de aprendizaje con optimizador Adam y recorte de gradientes, y aplicó normalización de capas para la estabilidad. No se utilizó aumento de datos más allá del proceso de generación sintética.

Rendimiento y Puntos de Referencia

Phi-2 logró resultados notables en puntos de referencia estándar de razonamiento. En GSM-8K, obtuvo una precisión del 56.7%, superando a Llama-2 de 7B parámetros y a Llama-2 de 13B parámetros, y acercándose al rendimiento de modelos mucho más grandes como GPT-3.5. En el conjunto BIG-Bench Hard, obtuvo un 57.4%, superando nuevamente a modelos varias veces su tamaño. En tareas de codificación, mostró un rendimiento sólido en HumanEval, logrando un 48.4% de pass@1, lo que era competitivo con modelos como StarCoder-15B.

Estos resultados se atribuyeron a la calidad de los datos de entrenamiento más que a la innovación arquitectónica. Los investigadores de Microsoft señalaron que el rendimiento de Phi-2 en tareas de razonamiento era "sorprendentemente fuerte" para su tamaño, sugiriendo que la capacidad de la red neuronal se utilizaba de manera eficiente. Sin embargo, el modelo mostró limitaciones en conocimiento factual y generación de texto largo, consistente con su escala más pequeña y sus datos de entrenamiento enfocados.

Lanzamiento y Accesibilidad

Phi-2 fue lanzado el 12 de diciembre de 2023 a través del centro de modelos de Hugging Face bajo la licencia MIT. Esta licencia permisiva permitía un uso sin restricciones, incluyendo aplicaciones comerciales, lo que era inusual para modelos de su capacidad en ese momento. Microsoft también integró Phi-2 en su plataforma en la nube Azure, permitiendo su despliegue a través de Azure AI Studio y Azure Machine Learning. El modelo estaba disponible para ajuste fino e inferencia, con soporte para ejecución tanto en CPU como en GPU.

El lanzamiento fue parte de la estrategia más amplia de Microsoft para democratizar la investigación en IA, proporcionando una alternativa ligera a modelos más grandes que podía ejecutarse en hardware de consumo. El pequeño tamaño de Phi-2 (aproximadamente 5.4 GB en FP16) lo hacía accesible para desarrolladores e investigadores individuales, contrastando con los requisitos de recursos de modelos como GPT-4 o Claude.

Impacto y Legado

Phi-2 influyó en investigaciones posteriores sobre aprendizaje automático eficiente y diseño de modelos pequeños. Su éxito destacó la importancia de la calidad de los datos sobre la cantidad, desafiando la suposición predominante de que la escala era el principal impulsor de la capacidad. Este enfoque inspiró a otras organizaciones, incluyendo Google DeepMind y Anthropic, a explorar estrategias similares de curación de datos para sus modelos más pequeños.

Dentro de Microsoft, Phi-2 sirvió como precursor de la familia Phi-3, que expandió los mismos principios con recuentos de parámetros más grandes (hasta 14B) y un rendimiento mejorado. El modelo también contribuyó a discusiones sobre el impacto ambiental de la IA, ya que su entrenamiento requirió significativamente menos cómputo que los modelos a gran escala, alineándose con los objetivos de sostenibilidad. A partir de 2024, Phi-2 sigue siendo un punto de referencia para investigadores que estudian los equilibrios entre el tamaño del modelo, la calidad de los datos y la capacidad de razonamiento.

Limitaciones

A pesar de sus fortalezas, Phi-2 tenía limitaciones conocidas. Su corte de conocimiento era a finales de 2023, y no podía acceder a información en tiempo real. El modelo a veces producía respuestas plausibles pero incorrectas, particularmente en dominios fuera de su distribución de entrenamiento. Su ventana de contexto de 2048 tokens era más corta que la de muchos modelos contemporáneos, limitando su uso para tareas de documentos largos. Además, aunque sobresalía en razonamiento, tenía dificultades con la escritura creativa y el recuerdo factual matizado, reflejando el enfoque estrecho de sus datos de entrenamiento.

Microsoft aconsejó a los usuarios tratar a Phi-2 como un artefacto de investigación más que como un sistema listo para producción, recomendando el ajuste fino para aplicaciones específicas. El modelo no estaba alineado para la seguridad, y podía generar contenido sesgado o dañino si se le solicitaba, un problema común para los modelos de su época.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·microsoft·transformer·reasoning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial