Traducido del inglés

Gemma 2 es una familia de modelos de lenguaje grandes de pesos abiertos desarrollada por Google DeepMind, lanzada en 2024. Incluye variantes de 2B, 9B y 27B parámetros, diseñadas para una inferencia eficiente y un rendimiento competitivo en puntos de referencia públicos.

Gemma 2 es una familia de modelos de lenguaje de gran tamaño de peso abierto desarrollados por Google DeepMind. Lanzada en 2024, se basa en la serie anterior Gemma 1, ofreciendo un rendimiento y una eficiencia mejorados en varios tamaños. Los modelos están diseñados tanto para investigación como para uso comercial, con pesos disponibles públicamente bajo una licencia permisiva. Las variantes de Gemma 2 han aparecido en clasificaciones públicas, incluyendo las versiones de 2B, 9B y 27B de parámetros, con los modelos de 9B y 27B a menudo comparados con sistemas propietarios más grandes.

La familia Gemma 2 es notable por sus innovaciones arquitectónicas, incluyendo el uso de atención de múltiples cabezas con atención de ventana deslizante local en los modelos más grandes, y un enfoque en el entrenamiento e inferencia eficientes. Los modelos se entrenan en diversos corpus de texto, enfatizando capacidades multilingües y seguimiento de instrucciones. A finales de 2024, los modelos Gemma 2 están disponibles a través de Google Cloud, Amazon Web Services y otras plataformas en la nube, así como para despliegue local.

Arquitectura y Entrenamiento

Los modelos Gemma 2 se basan en la arquitectura Transformer, con mejoras específicas para la eficiencia. El modelo de 27B utiliza una combinación de atención global y local, reduciendo la huella de memoria mientras mantiene la comprensión de contexto largo. Todas las variantes emplean normalización de capas y conexiones residuales para un entrenamiento estable. El proceso de entrenamiento utiliza una mezcla de fuentes de datos, incluyendo texto web, libros y código, con un enfoque en el filtrado de alta calidad.

Los modelos se entrenan utilizando Adam y variantes de SGD con un programa de tasa de aprendizaje que incluye calentamiento y decaimiento coseno. Se aplica recorte de gradientes para prevenir inestabilidad. El modelo de 27B se entrenó en un gran clúster de chips fabricados por TSMC, aunque los detalles específicos del hardware no se divulgan públicamente. Los datos de entrenamiento incluyen múltiples idiomas, con una porción significativa del inglés y otros idiomas principales.

Lanzamiento y Variantes

Gemma 2 se lanzó en tres tamaños principales: 2B, 9B y 27B de parámetros. Los modelos de 9B y 27B están disponibles en versiones base y ajustadas por instrucciones, mientras que el modelo de 2B es principalmente para aplicaciones ligeras. Las variantes ajustadas por instrucciones se afinan utilizando RLHF y otras técnicas de alineación para mejorar la utilidad y la seguridad. Los modelos se distribuyen bajo la licencia Gemma, que permite uso comercial con restricciones en ciertas aplicaciones de alto riesgo.

El lanzamiento incluyó puntos de control preentrenados y un tokenizador, con soporte para marcos como TensorFlow y PyTorch. El modelo de 27B fue destacado por su rendimiento competitivo en puntos de referencia como MMLU y HumanEval, a menudo superando a modelos de tamaño similar de otras organizaciones. El modelo de 9B, en particular, ha sido resaltado por su eficiencia, logrando un rendimiento comparable a modelos más grandes mientras requiere menos recursos computacionales.

Rendimiento y Puntos de Referencia

Los modelos Gemma 2 han sido evaluados en una variedad de puntos de referencia públicos, incluyendo razonamiento de inteligencia artificial, codificación y tareas multilingües. El modelo de 27B obtiene puntuaciones altas en MMLU (comprensión de lenguaje multitarea masiva) y GSM8K (matemáticas de escuela primaria), mientras que el modelo de 9B muestra resultados sólidos en puntos de referencia de codificación como HumanEval. En clasificaciones públicas, las variantes de Gemma 2 han ocupado puestos entre los mejores modelos de peso abierto, a menudo superando versiones anteriores de OpenAI GPT-3.5 y Anthropic Claude 2 en ciertas tareas.

Los modelos están diseñados para una inferencia eficiente, con soporte para técnicas de cuantización y poda. El modelo de 2B puede ejecutarse en dispositivos de borde, mientras que los modelos de 9B y 27B son adecuados para despliegue en la nube. A partir de 2024, Gemma 2 se ha integrado en varias plataformas de IA generativa, incluyendo Hugging Face (aunque no en la lista proporcionada, es una plataforma común) y el hardware de inferencia rápida de Groq.

Ecosistema y Adopción

Gemma 2 ha sido ampliamente adoptado tanto en el ámbito académico como en la industria. Los investigadores utilizan los modelos para ajuste fino en tareas específicas de dominio, como aprendizaje automático para descubrimiento científico o aprendizaje profundo para aplicaciones médicas. Empresas como Samsung Electronics e Intel han explorado la integración de Gemma 2 en sus productos, aunque los despliegues específicos no se detallan públicamente.

Los modelos están disponibles a través de los principales proveedores de nube, incluyendo Microsoft Azure y Oracle Cloud, así como soluciones locales. La naturaleza de peso abierto permite la personalización, y la comunidad ha producido numerosas variantes ajustadas para casos de uso especializados. El lanzamiento de Gemma 2 ha contribuido a la tendencia más amplia de modelos de peso abierto desafiando a sistemas propietarios, particularmente en la comunidad de investigación de redes neuronales.

Limitaciones y Direcciones Futuras

A pesar de sus fortalezas, Gemma 2 tiene limitaciones, incluyendo posibles sesgos en los datos de entrenamiento y errores fácticos ocasionales. Los modelos no son tan capaces como los sistemas propietarios más grandes, como OpenAI GPT-4, en tareas de razonamiento complejo. Sin embargo, su eficiencia y apertura los hacen atractivos para muchas aplicaciones. A partir de 2024, Google DeepMind continúa iterando en la serie Gemma, con versiones futuras que se espera incorporen técnicas más nuevas como variantes de atención de múltiples cabezas y métodos de alineación mejorados.

El lanzamiento de Gemma 2 también ha provocado discusiones sobre el impacto ambiental del entrenamiento de modelos grandes, aunque las cifras específicas de consumo de energía no se divulgan públicamente. Los modelos están diseñados para ser más eficientes que sus predecesores, con la variante de 2B requiriendo recursos mínimos. En general, Gemma 2 representa un paso significativo en hacer que los modelos de lenguaje de alta calidad sean accesibles a una audiencia más amplia.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:large-language-model·google-deepmind·open-weight·generative-ai
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial