Huawei PanGu es una familia de modelos de lenguaje de gran tamaño desarrollada por la empresa tecnológica china Huawei (sin enlace disponible en la lista). La serie se introdujo en abril de 2021 con el lanzamiento de PanGu-α, un modelo con 200 mil millones de parámetros, lo que lo convirtió en uno de los modelos de lenguaje más grandes de la época. Los modelos PanGu se construyen utilizando la arquitectura transformador y se entrenan con grandes corpus de texto en chino e inglés. Se despliegan a través de Huawei Cloud como parte de sus servicios de IA, con aplicaciones en comprensión del lenguaje natural, generación, diálogo y finalización de código.
Arquitectura y entrenamiento
La serie PanGu incluye múltiples variantes de modelos, como PanGu-α, PanGu-Coder y PanGu-Σ. PanGu-α, el modelo original, utiliza una arquitectura de transformador denso y se entrenó con un corpus de 2,6 terabytes. PanGu-Coder, lanzado en 2022, es un modelo especializado en generación de código, entrenado con repositorios de código abierto. PanGu-Σ, introducido en 2023, es un modelo de transformador disperso con cientos de miles de millones de parámetros, construido sobre una arquitectura jerárquica para reducir los costos computacionales. El entrenamiento se realiza en los chips de IA Ascend 910 de Huawei y aprovecha conexiones residuales y normalización de capas para la estabilidad.
Capacidades y aplicaciones
Los modelos PanGu admiten tareas como resumen de texto, traducción automática, respuesta a preguntas y generación de diálogos. En una evaluación de 2021, PanGu-α se comparó con múltiples tareas de comprensión del lenguaje natural en chino y, según se informó, superó a OpenAI's GPT-3 en entornos de cero disparos y pocos disparos en varios conjuntos de datos. Huawei ha integrado los modelos PanGu en sus ofertas de servicios en la nube, incluida la plataforma Pangu PanguStudio, que proporciona herramientas de bajo código y sin código para que las empresas construyan aplicaciones de IA personalizadas. Los modelos se han utilizado en industrias como finanzas, salud y manufactura, con despliegues reportados en empresas asociadas como TomTom, Intuitive Surgical y Commure para tareas específicas de dominio, aunque los detalles no se divulgan ampliamente.
Mejoras de arquitectura
Para mejorar la eficiencia, PanGu-Σ incorpora innovaciones como un método llamado "levantamiento de peso" y un mecanismo de "atención paralela". El proceso de entrenamiento utiliza técnicas de poda y aumento de datos para reducir la hinchazón de parámetros. RLAIF (aprendizaje por refuerzo a partir de retroalimentación de IA) se adopta en versiones posteriores para alinear las salidas con las preferencias del usuario. Los modelos también emplean bloques de atención de múltiples cabezas y atención cruzada en todas las capas.
Historial de lanzamientos y ecosistema
PanGu-α se lanzó por primera vez en 2021. En 2022, Huawei lanzó PanGu-Coder y PanGu-CV para visión. En 2023, se lanzó PanGu-Σ con una supuesta cantidad de 700 mil millones de parámetros. En 2024, Huawei lanzó los servicios de PanGu Studio y PanGu Foundation Model en su nube, junto con la integración en el sistema operativo HarmonyOS. Los modelos son accesibles a través de los equivalentes de la plataforma en la nube de Huawei, aunque también se ofrecen directamente a través de Huawei Cloud. Las asociaciones con Alibaba Cloud y otros proveedores no son públicas.
Recepción y controversia
En 2021, los primeros adversarios plantearon preocupaciones sobre el tamaño del conjunto de datos y una posible fuga de datos de entrenamiento. Huawei publicó resultados de referencia que afirmaban que PanGu-α superaba a GPT-3 en algunos puntos de referencia chinos, pero la verificación independiente fue limitada. El lanzamiento del modelo provocó debates sobre los puntos de referencia de los modelos de lenguaje y la reproducibilidad de los resultados, reflejando debates similares en torno a DeepMind y otros laboratorios. PanGu también forma parte del impulso de China hacia capacidades de IA nacionales y una menor dependencia de autores extranjeros. A partir de 2024, el modelo sigue activo, con Huawei invirtiendo en desarrollo continuo para competir con otros LLM como GPT-4 y Anthropic (sin enlace disponible).