Traducido del inglés

PaLM 2 es un modelo de lenguaje de gran tamaño desarrollado por Google, anunciado en mayo de 2023 en Google I/O. Se informa que tiene 340 mil millones de parámetros y fue entrenado con 3,6 billones de tokens, sucediendo al modelo original de PaLM.

PaLM 2 es un modelo de lenguaje de gran tamaño (LLM) desarrollado por Google y anunciado en la conferencia anual Google I/O en mayo de 2023. Es el sucesor del Pathways Language Model (PaLM), un LLM denso basado en transformadores solo-decodificador de 540 mil millones de parámetros desarrollado por Google AI. Se informa que PaLM 2 es un modelo de 340 mil millones de parámetros entrenado con 3,6 billones de tokens, lo que representa un avance significativo en escala y capacidad en comparación con su predecesor.

El modelo forma parte de los esfuerzos más amplios de Google en la investigación de IA generativa y modelos de lenguaje de gran tamaño, basándose en la arquitectura de transformadores que sustenta los sistemas modernos de aprendizaje profundo. PaLM 2 se desarrolló junto con Google DeepMind, lo que refleja la integración de las divisiones de investigación de IA de Google.

Arquitectura y capacidades

PaLM 2 sigue el diseño de transformador solo-decodificador establecido por su predecesor, utilizando mecanismos de atención de múltiples cabezas y codificación posicional para procesar datos secuenciales. El modelo es capaz de realizar una amplia gama de tareas, incluido el razonamiento de sentido común, el razonamiento aritmético, la explicación de chistes, la generación de código y la traducción. Cuando se combina con el prompting de cadena de pensamiento, PaLM 2 logra un rendimiento significativamente mejor en conjuntos de datos que requieren razonamiento de múltiples pasos, como problemas de palabras y preguntas basadas en lógica.

El entrenamiento del modelo con 3,6 billones de tokens - un aumento sustancial con respecto a los 780 mil millones de tokens utilizados para el PaLM original - permite un rendimiento mejorado en diversos dominios. Este corpus de entrenamiento incluye páginas web filtradas, libros, artículos de Wikipedia, artículos de noticias, código fuente de repositorios de código abierto y conversaciones en redes sociales, y la porción de redes sociales comprende el 50% del corpus para respaldar las capacidades conversacionales.

Infraestructura de entrenamiento

El PaLM 540B original se entrenó en dos pods de TPU v4 con 3.072 chips TPU v4 en cada pod conectados a 768 hosts, utilizando una combinación de paralelismo de modelo y datos. Esta configuración, que utilizaba 6.144 chips en total, marcó un récord en la mayor eficiencia de entrenamiento lograda para LLM a esa escala, con una utilización de FLOPs de hardware del 57,8%. La infraestructura de entrenamiento de PaLM 2 sigue principios similares, aunque no se han divulgado por completo los detalles específicos de su configuración de hardware.

Modelos relacionados y aplicaciones

Google extendió la arquitectura PaLM para crear varias variantes especializadas. Med-PaLM, una versión ajustada con datos médicos, supera a los modelos anteriores en puntos de referencia de preguntas y respuestas médicas y fue el primero en obtener una puntuación aprobatoria en preguntas de licencias médicas de EE. UU. Proporciona razonamiento y puede evaluar sus propias respuestas, además de responder con precisión preguntas de opción múltiple y de respuesta abierta.

PaLM-E, otra extensión que utiliza un transformador de visión, sirve como modelo de visión-lenguaje para la manipulación robótica sin necesidad de reentrenamiento o ajuste fino. En junio de 2023, Google anunció AudioPaLM para la traducción de voz a voz, que utiliza la arquitectura e inicialización de PaLM-2.

Disponibilidad e impacto

El PaLM original se anunció por primera vez en abril de 2022 y permaneció privado hasta marzo de 2023, cuando Google lanzó una API inicialmente disponible para un número limitado de desarrolladores a través de una lista de espera. El anuncio de PaLM 2 en Google I/O en mayo de 2023 señaló el compromiso de Google de competir en el panorama de la inteligencia artificial en rápida evolución, junto con otros actores importantes como OpenAI y Anthropic. Las capacidades del modelo tienen implicaciones para los servicios de Google Cloud y aplicaciones empresariales más amplias, posicionando a Google como una fuerza significativa en el desarrollo de sistemas avanzados de aprendizaje automático.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·google-ai·artificial-intelligence·deep-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial