PaLM 2 (Pathways Language Model 2) es un modelo de lenguaje grande desarrollado por Google AI, anunciado en la conferencia anual Google I/O en mayo de 2023. Es una versión actualizada del modelo PaLM original, con 340 mil millones de parámetros reportados y entrenamiento en 3,6 billones de tokens. PaLM 2 está diseñado para destacar en una amplia gama de tareas, incluido el razonamiento de sentido común, el razonamiento aritmético, la generación de código y la traducción, con un énfasis particular en habilidades multilingües mejoradas.
El modelo PaLM original, presentado en abril de 2022, era un modelo de lenguaje grande basado en transformadores, denso y solo de decodificador, con 540 mil millones de parámetros. Los investigadores también entrenaron versiones más pequeñas con 8 y 62 mil millones de parámetros para estudiar los efectos de la escala del modelo. PaLM 2 se basa en esta base, ofreciendo un rendimiento mejorado y una cobertura lingüística más amplia.
Arquitectura y entrenamiento
PaLM 2 es un modelo de transformador denso y solo de decodificador, similar a su predecesor. Está preentrenado en un corpus de alta calidad de 780 mil millones de tokens, que incluye páginas web filtradas, libros, artículos de Wikipedia, artículos de noticias, código fuente de repositorios de código abierto en GitHub y conversaciones en redes sociales. El conjunto de datos se basa en el utilizado para entrenar el modelo LaMDA de Google, y las conversaciones en redes sociales constituyen el 50% del corpus para mejorar las capacidades conversacionales.
El PaLM 540B original se entrenó en dos pods de TPU v4, cada uno con 3.072 chips TPU v4 conectados a 768 hosts, utilizando una combinación de paralelismo de modelo y datos. Esta configuración, con un total de 6.144 chips, logró una utilización récord de FLOPs de hardware del 57,8%, marcando la mayor eficiencia de entrenamiento para modelos de lenguaje grandes a esa escala.
Capacidades y variantes
PaLM 2 es capaz de realizar una amplia gama de tareas, incluido el razonamiento de sentido común, el razonamiento aritmético, la explicación de chistes, la generación de código y la traducción. Cuando se combina con el prompting de cadena de pensamiento, logra un rendimiento significativamente mejor en conjuntos de datos que requieren razonamiento de múltiples pasos, como problemas de palabras y preguntas basadas en lógica.
Google y DeepMind desarrollaron Med-PaLM, una versión de PaLM 540B ajustada con datos médicos, que supera a los modelos anteriores en puntos de referencia de preguntas y respuestas médicas. Med-PaLM fue el primero en obtener una puntuación aprobatoria en las preguntas de licencia médica de EE. UU., proporcionando razonamiento y autoevaluación además de respuestas precisas.
Google también extendió PaLM utilizando un transformador de visión para crear PaLM-E, un modelo de visión-lenguaje para manipulación robótica sin necesidad de reentrenamiento o ajuste fino. En junio de 2023, Google anunció AudioPaLM para traducción de voz a voz, que utiliza la arquitectura e inicialización de PaLM-2.
Lanzamiento y acceso
El PaLM original permaneció privado hasta marzo de 2023, cuando Google lanzó una API para PaLM y varias otras tecnologías. La API estuvo inicialmente disponible para un número limitado de desarrolladores que se unieron a una lista de espera antes del lanzamiento público. PaLM 2 se anunció en mayo de 2023 y se espera que se integre en varios productos y servicios de Google.
Impacto y legado
PaLM 2 representa un avance significativo en los modelos de lenguaje grandes, particularmente en la comprensión y el razonamiento multilingües. Su desarrollo se alinea con los esfuerzos continuos en el campo de la inteligencia artificial y el aprendizaje automático, contribuyendo al panorama más amplio de la IA generativa. PaLM 2 se considera un sucesor de LaMDA y un predecesor de Gemini, lo que refleja la innovación continua de Google en este dominio.