Gaudi es una familia de circuitos integrados de aplicación específica (ASIC) diseñados por Intel para acelerar cargas de trabajo de aprendizaje profundo, particularmente el entrenamiento e inferencia de modelos de lenguaje de gran tamaño. La arquitectura enfatiza un enfoque de cómputo heterogéneo, integrando múltiples núcleos de procesamiento tensorial con una red en chip dedicada y memoria de alto ancho de banda (HBM) para permitir una escalabilidad eficiente a través de múltiples aceleradores. Los procesadores Gaudi se posicionan como competidores de los aceleradores basados en GPU de Nvidia y de otros chips de IA como la serie Instinct de AMD y las TPU de Google Cloud.
El procesador Gaudi de primera generación, anunciado en 2019, fue desarrollado por Habana Labs, una startup israelí de chips de IA adquirida por Intel en 2019 por aproximadamente 2 mil millones de dólares. La segunda generación, Gaudi 2, se lanzó en 2022, y la tercera generación, Gaudi 3, se presentó en 2024. Intel comercializa Gaudi como una alternativa rentable para el entrenamiento e inferencia de IA, con un enfoque en ecosistemas de software abiertos y soporte para marcos populares como PyTorch y TensorFlow.
Historia
Los orígenes de Gaudi se remontan a Habana Labs, fundada en 2016 por David Dahan, Ran Halutz y otros, con sede en Cesarea, Israel. La empresa desarrolló inicialmente el chip de inferencia Goya, lanzado en 2018, antes de centrarse en el entrenamiento con Gaudi. Intel adquirió Habana Labs en diciembre de 2019, integrando el equipo en su Grupo de Plataformas de Datos. La adquisición fue parte de la estrategia más amplia de Intel para competir en el mercado de aceleradores de IA, que había estado dominado por las GPU de Nvidia.
El primer procesador Gaudi, Gaudi 1, se lanzó oficialmente en 2019, con clientes iniciales que incluyeron Amazon Web Services (AWS), que ofreció instancias basadas en Gaudi en 2021. Gaudi 2, anunciado en mayo de 2022, presentó mejoras significativas en capacidad de memoria y rendimiento de cómputo, y fue adoptado por proveedores de nube y empresas. En abril de 2024, Intel introdujo Gaudi 3, que incorporó un proceso de 5nm más avanzado (fabricado por TSMC) y duplicó el rendimiento en comparación con su predecesor para el entrenamiento de modelos de lenguaje de gran tamaño.
Arquitectura
Los procesadores Gaudi se construyen alrededor de una arquitectura heterogénea que combina múltiples núcleos de procesamiento tensorial (TPC) con una red escalable. Cada chip Gaudi incluye un conjunto de TPC totalmente programables que ejecutan multiplicaciones de matrices y otras operaciones tensoriales, similares a los núcleos tensoriales en las GPU de Nvidia. Los TPC se complementan con un subsistema de memoria dedicado que utiliza HBM, que proporciona alto ancho de banda para alimentar datos a las unidades de cómputo.
Una característica distintiva de Gaudi es su capacidad de red integrada. A diferencia de las GPU que típicamente requieren conmutadores externos de InfiniBand o Ethernet para la escalabilidad de múltiples nodos, Gaudi incluye motores RDMA (Acceso Directo a Memoria Remota) sobre Ethernet (RoCE) en el chip. Esto permite que múltiples aceleradores Gaudi se interconecten directamente, reduciendo el costo y la complejidad de construir clústeres de IA a gran escala. La red en chip (NoC) permite una comunicación eficiente entre los TPC dentro de un solo chip, mientras que los motores RoCE manejan la comunicación entre chips.
Gaudi 2 y Gaudi 3 también incorporan un motor de multiplicación de matrices dedicado, separado de los TPC, para acelerar operaciones comunes en transformers y otras arquitecturas modernas de redes neuronales. Los procesadores admiten entrenamiento de precisión mixta, incluidos formatos FP32, BF16 y FP8, para equilibrar precisión y rendimiento.
Generaciones
Gaudi 1
El procesador Gaudi de primera generación, lanzado en 2019, presentaba 32 TPC y 16 GB de memoria HBM2 con un ancho de banda de 1.2 TB/s. Fue diseñado para el entrenamiento e inferencia de modelos de redes neuronales, con un enfoque en eficiencia y escalabilidad. Gaudi 1 logró un rendimiento de 1.6 TFLOPS por chip en precisión BF16 (aunque esta cifra a menudo se cita como 1.6 TFLOPS para operaciones de matrices densas). El chip se fabricó utilizando un proceso de 16nm de TSMC.
Gaudi 2
Gaudi 2, lanzado en 2022, duplicó el número de TPC a 64 y aumentó la capacidad de HBM a 96 GB de HBM2e, con un ancho de banda de 2.4 TB/s. También agregó un motor de multiplicación de matrices dedicado, impulsando el rendimiento a 3.2 TFLOPS en BF16. Gaudi 2 se construyó sobre un proceso de 7nm. Intel afirmó que Gaudi 2 ofrecía una relación precio-rendimiento superior en comparación con la GPU A100 de Nvidia para el entrenamiento de modelos de lenguaje de gran tamaño, citando puntos de referencia en modelos como GPT-3 y BERT.
Gaudi 3
Gaudi 3, anunciado en abril de 2024, representó un salto arquitectónico importante. Integró 128 TPC y un motor de matrices más potente, con 128 GB de memoria HBM2e y un ancho de banda de 3.7 TB/s. El chip se fabricó en un proceso de 5nm en TSMC. Intel declaró que Gaudi 3 podría entrenar un modelo de lenguaje de gran tamaño de 175 mil millones de parámetros (similar a GPT-3) un 50% más rápido que la GPU H100 de Nvidia, consumiendo menos energía. Gaudi 3 también introdujo soporte para precisión FP8, mejorando aún más el rendimiento.
Ecosistema de software
Los procesadores Gaudi son compatibles con la pila de software SynapseAI de Intel, que proporciona un compilador, tiempo de ejecución y bibliotecas optimizadas para el hardware. SynapseAI se integra con marcos populares de aprendizaje profundo, incluidos PyTorch y TensorFlow, lo que permite a los desarrolladores ejecutar modelos con cambios mínimos en el código. Intel también proporciona una integración con Hugging Face, que facilita la implementación de transformers preentrenados.
La pila de software incluye herramientas para la optimización de modelos, como la cuantización y la compilación de grafos, así como soporte para entrenamiento distribuido a través de múltiples nodos Gaudi. Intel ha enfatizado la apertura, con Gaudi compatible con protocolos de red estándar (RoCE) y compatible con Kubernetes para la orquestación en entornos de nube.
Rendimiento y puntos de referencia
Intel ha publicado resultados de puntos de referencia para los procesadores Gaudi, particularmente para el entrenamiento e inferencia de modelos de lenguaje de gran tamaño. En 2023, Intel afirmó que Gaudi 2 logró una relación precio-rendimiento de 1.5x a 2x mejor que la A100 de Nvidia para el entrenamiento de modelos GPT-3 y Llama 2. Para Gaudi 3, Intel informó una mejora de 1.7x en el rendimiento de entrenamiento para GPT-3 en comparación con la H100 de Nvidia, y una mejora de 2x para la inferencia en modelos como Falcon y Llama 3.
Los puntos de referencia independientes han sido limitados, pero algunos proveedores de nube, como AWS e IBM Cloud, han ofrecido instancias basadas en Gaudi e informaron resultados competitivos. En 2024, Intel también anunció una colaboración con Google Cloud para ofrecer Gaudi 3 como servicio, ampliando su disponibilidad.
Posición en el mercado y competencia
Gaudi compite directamente con las GPU de centros de datos de Nvidia, incluidos la A100, H100 y la más nueva H200, así como con la serie Instinct MI300 de AMD y los chips Trainium e Inferentia de AWS. Intel posiciona a Gaudi como una alternativa más rentable, particularmente para empresas y proveedores de nube que buscan reducir los costos de infraestructura de IA. La compañía también ha destacado la eficiencia energética de Gaudi, una preocupación creciente para los centros de datos.
A pesar de sus méritos técnicos, Gaudi ha enfrentado desafíos para lograr una adopción generalizada, en parte debido al ecosistema de software dominante de Nvidia (CUDA) y su presencia establecida en el mercado. Intel ha intentado contrarrestar esto apoyando estándares abiertos y proporcionando herramientas de migración, pero a partir de 2025, la cuota de mercado de Gaudi sigue siendo pequeña en comparación con Nvidia.
Aplicaciones
Los procesadores Gaudi se utilizan tanto para el entrenamiento como para la inferencia de modelos de aprendizaje profundo, con un enfoque en modelos de lenguaje de gran tamaño, visión por computadora y sistemas de recomendación. Se implementan en centros de datos en la nube, sistemas empresariales locales y entornos de borde. Los casos de uso clave incluyen procesamiento de lenguaje natural, reconocimiento de imágenes y aplicaciones de IA generativa como chatbots y generación de contenido.
Además de los servicios en la nube, Intel se ha asociado con integradores de sistemas para ofrecer servidores y estaciones de trabajo basados en Gaudi. Los procesadores también se utilizan en entornos de investigación, con universidades y laboratorios de IA que aprovechan Gaudi para el desarrollo de modelos.
Recepción y críticas
Los analistas de la industria generalmente han visto a Gaudi como una alternativa creíble a Nvidia, pero señalan que la madurez del software y el soporte del ecosistema siguen siendo más débiles. Algunos críticos han señalado que las afirmaciones de puntos de referencia de Intel a menudo se basan en configuraciones específicas que pueden no reflejar el rendimiento del mundo real. Además, el rápido ritmo de lanzamientos de productos de Nvidia (por ejemplo, H100, H200 y la próxima arquitectura Blackwell) ha dificultado que Gaudi mantenga una ventaja de rendimiento.
Intel ha respondido enfatizando el costo total de propiedad (TCO) y la eficiencia energética, argumentando que Gaudi ofrece un mejor valor para implementaciones a gran escala. La compañía también se ha comprometido a un ritmo de lanzamiento regular, con Gaudi 4 esperado en 2025.
Desarrollos futuros
Intel ha anunciado planes para continuar desarrollando la familia Gaudi, con Gaudi 4 esperado para usar un proceso más avanzado y mejorar aún más el rendimiento. La compañía también está trabajando en integrar Gaudi con sus procesadores Xeon y el modelo de programación unificado oneAPI para simplificar el cómputo heterogéneo. A partir de 2025, Intel tiene como objetivo capturar una mayor parte del mercado de aceleradores de IA, dirigido tanto a segmentos de nube como empresariales.
Véase también
Referencias
- Sala de prensa de Intel. "Intel Adquiere Habana Labs para Ampliar su Cartera de IA." 16 de diciembre de 2019.
- Habana Labs. "Procesador de Entrenamiento Gaudi." 2019.
- Intel. "Acelerador de IA Intel Gaudi 2." 2022.
- Intel. "Acelerador de IA Intel Gaudi 3." 2024.
- Documentación de proveedores de nube para instancias Gaudi (AWS, IBM Cloud, Google Cloud).