Google PaLM 2 es un modelo de lenguaje grande (LLM) desarrollado por Google AI, anunciado en la conferencia anual Google I/O en mayo de 2023. Es el sucesor del Pathways Language Model (PaLM), un modelo denso de solo decodificador basado en transformadores con 540 mil millones de parámetros, presentado por primera vez en abril de 2022. Se informa que PaLM 2 es un modelo de 340 mil millones de parámetros entrenado con 3,6 billones de tokens, un aumento significativo en comparación con los 780 mil millones de tokens de su predecesor. El modelo impulsa Bard, el servicio de IA conversacional de Google, y otros productos de IA de Google, con capacidades multilingües mejoradas, razonamiento mejorado y mayor competencia en codificación.
PaLM 2 se basa en los fundamentos arquitectónicos de PaLM, que fue diseñado como un transformador denso de solo decodificador. El modelo PaLM original demostró un rendimiento sólido en tareas como razonamiento de sentido común, razonamiento aritmético, explicación de chistes, generación de código y traducción. Cuando se combinó con el prompting de cadena de pensamiento, PaLM logró resultados significativamente mejores en conjuntos de datos que requieren razonamiento de múltiples pasos, incluidos problemas de palabras y preguntas basadas en lógica. PaLM 2 amplía estas capacidades, particularmente en contextos multilingües, lo que le permite comprender y generar texto en una gama más amplia de idiomas con mayor precisión.
Desarrollo y anuncio
El modelo PaLM original se anunció por primera vez en abril de 2022, pero permaneció privado hasta marzo de 2023, cuando Google lanzó una API para PaLM y varias otras tecnologías. La API estuvo inicialmente disponible para un número limitado de desarrolladores que se unieron a una lista de espera antes de que se lanzara al público. PaLM 2 se presentó en Google I/O en mayo de 2023, marcando un hito importante en los esfuerzos de Generative AI de Google. El anuncio destacó la eficiencia y el rendimiento mejorados de PaLM 2 en comparación con su predecesor, con un enfoque en aplicaciones prácticas dentro del ecosistema de productos de Google.
Google y DeepMind también desarrollaron versiones especializadas de PaLM. Med-PaLM, una versión de PaLM 540B ajustada con datos médicos, superó a modelos anteriores en puntos de referencia de respuesta a preguntas médicas. Fue el primer modelo en obtener una puntuación aprobatoria en las preguntas de licencia médica de EE. UU., proporcionando razonamiento y autoevaluación junto con respuestas precisas. Otra variante, PaLM-E, extendió PaLM utilizando un transformador de visión para crear un modelo de visión-lenguaje para manipulación robótica sin reentrenamiento ni ajuste fino. En junio de 2023, Google anunció AudioPaLM para traducción de voz a voz, que utiliza la arquitectura e inicialización de PaLM-2.
Arquitectura y entrenamiento
PaLM 2 es un modelo Transformer (architecture) denso de solo decodificador, similar a su predecesor pero con un corpus de entrenamiento más grande. El PaLM original fue preentrenado en un corpus de alta calidad de 780 mil millones de tokens, que incluía páginas web filtradas, libros, artículos de Wikipedia, artículos de noticias, código fuente de repositorios de código abierto en GitHub y conversaciones de redes sociales. La porción de conversaciones de redes sociales constituía el 50% del corpus, lo que ayudaba a las capacidades conversacionales. Los datos de entrenamiento de PaLM 2 se expandieron a 3,6 billones de tokens, lo que permite una mejor generalización y rendimiento multilingüe.
El PaLM 540B original fue entrenado en dos pods TPU v4, cada uno con 3,072 chips TPU v4 conectados a 768 hosts, utilizando una combinación de paralelismo de modelos y datos. Esta configuración, con un total de 6,144 chips, marcó un récord en la eficiencia de entrenamiento más alta lograda para LLMs a esa escala, con una utilización de FLOPs de hardware del 57,8%. Los detalles de entrenamiento de PaLM 2 están menos documentados públicamente, pero probablemente utilizó una infraestructura similar, lo que refleja la inversión de Google en Google Cloud y hardware especializado.
Capacidades y aplicaciones
PaLM 2 está diseñado para sobresalir en tareas multilingües, razonamiento y codificación. Impulsa Bard, la IA conversacional de Google, y está integrado en otros productos como Google Workspace y los servicios de IA de Google Cloud. Las habilidades multilingües mejoradas del modelo le permiten manejar traducción, resumen y respuesta a preguntas en varios idiomas de manera más efectiva que modelos anteriores. Sus capacidades de razonamiento se mejoran mediante técnicas como el prompting de cadena de pensamiento, lo que permite la resolución de problemas en múltiples pasos.
En codificación, PaLM 2 admite generación de código y depuración en múltiples lenguajes de programación, lo que lo convierte en una herramienta para desarrolladores. La versatilidad del modelo se demuestra en aplicaciones que van desde la investigación en Machine learning hasta soluciones empresariales. Google ha posicionado a PaLM 2 como un modelo fundamental para su ecosistema de IA, compitiendo con ofertas de OpenAI y Anthropic.
Comparación con otros modelos
Los 340 mil millones de parámetros de PaLM 2 lo colocan en el nivel superior de los Large language models, aunque más pequeño que algunos competidores como GPT-4 de OpenAI, que se informa tiene más de un billón de parámetros en una arquitectura de mezcla de expertos. Sin embargo, el entrenamiento de PaLM 2 con 3,6 billones de tokens y su enfoque en la eficiencia le permiten lograr un rendimiento competitivo en puntos de referencia. La arquitectura del modelo, basada en el marco de Transformer (architecture), es similar a la de otros LLMs, pero las técnicas de entrenamiento patentadas de Google y su infraestructura le otorgan ventajas distintivas en escalabilidad.
En comparación con su predecesor PaLM, PaLM 2 ofrece mejoras significativas en comprensión multilingüe y razonamiento, así como menores requisitos computacionales para la inferencia. Esto lo hace más accesible para su implementación en aplicaciones del mundo real. La integración de PaLM 2 por parte de Google en productos como Bard y Vertex AI de Google Cloud ha ampliado su alcance, posicionándolo como un actor clave en el panorama de la Artificial intelligence.
Impacto y recepción
El lanzamiento de PaLM 2 en mayo de 2023 fue recibido con atención por parte de la comunidad de IA y observadores de la industria. Demostró el compromiso de Google con el avance de las tecnologías de Deep learning y Neural network, particularmente en el competitivo campo de la IA generativa. Las capacidades multilingües mejoradas del modelo se consideraron un paso adelante para hacer que la IA sea accesible para hablantes no nativos de inglés, y sus habilidades de codificación atrajeron a los desarrolladores.
Sin embargo, PaLM 2 también planteó preguntas sobre el impacto ambiental de entrenar modelos grandes, aunque Google ha enfatizado mejoras en la eficiencia. La integración del modelo en Bard generó discusiones sobre la ética de la IA, incluidos problemas de sesgo y desinformación, que son preocupaciones comunes para los sistemas de Generative AI. Google ha implementado medidas de seguridad, pero las implicaciones más amplias siguen siendo un tema de debate.
Direcciones futuras
Después de PaLM 2, Google continuó evolucionando sus modelos de IA. A fines de 2023, Google anunció Gemini, un sucesor de PaLM 2 que integra capacidades multimodales y está diseñado para ser más potente y versátil. La arquitectura y los métodos de entrenamiento de PaLM 2 han influido en desarrollos posteriores, incluidas mejoras en técnicas de Multi-Head Attention y Positional Encoding. El legado del modelo es evidente en los esfuerzos continuos de Google para superar los límites de la Artificial intelligence, con aplicaciones en campos que van desde la atención médica hasta la robótica.
A partir de 2025, PaLM 2 sigue siendo un hito significativo en la historia de los LLMs, representando un puente entre modelos anteriores como LaMDA y sistemas más avanzados como Gemini. Sus contribuciones a la IA multilingüe y al entrenamiento eficiente han tenido un impacto duradero en el campo, y sus principios continúan informando la investigación en Google DeepMind y más allá.
Véase también
- LaMDA, predecesor de PaLM
- Gemini, sucesor de PaLM
- Chinchilla, un LLM relacionado
- Transformer (architecture), la arquitectura subyacente
- Google Cloud, infraestructura para el entrenamiento
Referencias
- Blog de Google AI, mayo de 2023, anuncio de PaLM 2
- Wikipedia, PaLM (Pathways Language Model), consultado en 2025
- Google Research, PaLM: Scaling Language Modeling with Pathways, 2022