Dataflow (SambaNova)

Traducido del inglés

Dataflow es la arquitectura de flujo de datos reconfigurable de SambaNova Systems para IA, diseñada para acelerar cargas de trabajo de aprendizaje automático al mapear grafos de cómputo sobre una rejilla de elementos de procesamiento con memoria en chip, reduciendo el movimiento de datos y mejorando la eficiencia.

Dataflow es una arquitectura de computación desarrollada por SambaNova Systems para acelerar cargas de trabajo de inteligencia artificial. A diferencia de los diseños de procesadores convencionales que ejecutan instrucciones secuencialmente, Dataflow organiza la computación como un grafo dirigido donde los datos fluyen continuamente a través de una red de elementos de procesamiento. Este enfoque está adaptado a las operaciones estructuradas y repetitivas que se encuentran en los modelos de aprendizaje profundo, como las redes neuronales y los grandes modelos de lenguaje. La arquitectura se implementa en el hardware personalizado de SambaNova, incluidos los sistemas DataScale y la serie SN10 de unidades de flujo de datos reconfigurables (RDU).

La arquitectura Dataflow surgió de la investigación en la Universidad de Stanford y fue comercializada por SambaNova, que fue fundada en 2017 por Kunle Olukotun, Christopher Ré y Rodrigo Liang. El primer producto de la empresa, el DataScale SN10, se anunció en 2020 y comenzó a enviarse en 2021. La arquitectura está diseñada para abordar el cuello de botella del ancho de banda de memoria que limita los sistemas tradicionales basados en GPU, que a menudo gastan una energía significativa moviendo datos entre la memoria y las unidades de cómputo. Al mantener los datos en el chip y transmitirlos a través de un tejido configurable, Dataflow tiene como objetivo lograr una mayor utilización y una menor latencia para la inferencia y el entrenamiento de IA.

Principios de diseño

El principio central de Dataflow es eliminar el cuello de botella de von Neumann al desacoplar la computación de la búsqueda y decodificación de instrucciones. En una CPU o GPU convencional, cada operación requiere buscar una instrucción, decodificarla y luego ejecutarla sobre los datos obtenidos de la memoria. Dataflow, en cambio, compila el modelo completo en un grafo de flujo de datos estático, donde cada nodo representa una operación matemática (como multiplicación de matrices o activación) y cada borde representa una dependencia de datos. El grafo se mapea luego sobre una cuadrícula de elementos de procesamiento (PE), cada uno con su propia memoria local y unidades aritméticas.

Cada PE en la arquitectura Dataflow puede realizar una variedad de operaciones, incluyendo multiplicación-acumulación, funciones de activación y agrupación. Los PE están interconectados mediante una red de alto ancho de banda y baja latencia que soporta comunicación tanto entre vecinos cercanos como de mayor alcance. La configuración de esta red se determina en tiempo de compilación, lo que permite especializar el hardware para cada modelo específico. Esta reconfigurabilidad es un diferenciador clave frente a aceleradores de función fija como AWS Trainium o el procesador de flujo de tensores de Groq, que también utilizan principios de flujo de datos pero con diferentes compensaciones.

Compilación y pila de software

SambaNova proporciona una pila de software llamada SambaFlow, que compila modelos escritos en marcos como PyTorch y TensorFlow en grafos de flujo de datos. El compilador realiza varias optimizaciones, incluyendo fusión de operadores, optimización del diseño de memoria y canalización. También maneja el mapeo del grafo sobre la cuadrícula física de PE, equilibrando los recursos de cómputo y memoria. SambaFlow soporta tanto entrenamiento como inferencia, e incluye un tiempo de ejecución que gestiona el movimiento de datos y la sincronización.

El proceso de compilación es estático, lo que significa que el grafo está completamente determinado antes de que comience la ejecución. Esto permite al compilador programar las operaciones con precisión y evitar la sobrecarga en tiempo de ejecución. Sin embargo, también significa que el flujo de control dinámico, como bucles con conteos de iteraciones variables, debe desenrollarse o manejarse mediante mecanismos especiales. SambaNova ha extendido su compilador para soportar modelos de transformadores, que son la base de la mayoría de los sistemas modernos de IA generativa, optimizando los mecanismos de atención y las capas de avance.

Implementación de hardware

El RDU SN10, introducido en 2020, contiene 40 mil millones de transistores y se fabrica utilizando un proceso de 7 nanómetros en TSMC. Cuenta con 48 GB de SRAM en el chip, distribuidos a través de la cuadrícula de PE. El chip opera a una velocidad de reloj de alrededor de 1.2 GHz, pero su rendimiento se mide en términos de rendimiento de flujo de datos en lugar de velocidad de reloj bruta. SambaNova afirma que un solo SN10 puede entregar hasta 638 teraflops de cómputo para modelos dispersos y 125 teraflops para modelos densos, aunque estas cifras dependen de la carga de trabajo.

El sistema DataScale integra múltiples chips SN10 en un solo chasis, con hasta 16 RDU por sistema. Estos sistemas se conectan mediante una interconexión de alta velocidad que soporta comunicación de igual a igual. Generaciones posteriores, como el SN30 y el SN40, han aumentado la capacidad de memoria y cómputo, con el SN40 introducido en 2023 con 1.5 TB de memoria en el chip y soporte para modelos con hasta 5 billones de parámetros. El hardware también incluye unidades especializadas para poda y dispersión, que pueden omitir cálculos de valor cero para mejorar la eficiencia.

Características de rendimiento

Los sistemas Dataflow son particularmente efectivos para cargas de trabajo de inferencia, donde el mismo modelo se ejecuta repetidamente con diferentes entradas. La programación estática permite una latencia predecible, y la memoria en el chip reduce la necesidad de acceder a DRAM externa. En puntos de referencia publicados por SambaNova, el DataScale SN10 logra un mayor rendimiento que las GPU NVIDIA A100 para varios modelos populares, incluidos BERT y GPT-3, mientras consume menos energía. Sin embargo, los puntos de referencia independientes han sido limitados, y el rendimiento real puede variar según el modelo y el tamaño del lote.

Para el entrenamiento, Dataflow enfrenta desafíos debido a la necesidad de actualizaciones frecuentes de pesos y la naturaleza dinámica del cálculo de gradientes. SambaNova ha abordado esto soportando paralelismo de datos y paralelismo de modelos, donde múltiples RDU trabajan en diferentes partes del modelo. El compilador puede canalizar los pases hacia adelante y hacia atrás para superponer cómputo y comunicación. A pesar de estos esfuerzos, el rendimiento de entrenamiento ha sido menos competitivo que el de inferencia, y muchos clientes utilizan Dataflow principalmente para despliegue.

Comparación con otras arquitecturas

Dataflow se compara a menudo con la IPU de Graphcore, que también utiliza un diseño de muchos núcleos con memoria en el chip. La diferencia clave es que Graphcore utiliza un modelo de ejecución basado en instrucciones más tradicional, mientras que Dataflow es puramente impulsado por datos. El procesador de flujo de tensores de Groq es otra arquitectura similar al flujo de datos, pero utiliza un diseño más simple y rígido sin memoria en el chip, dependiendo en cambio de transmitir datos a través de una gran matriz de unidades de multiplicación-acumulación. La reconfigurabilidad de SambaNova ofrece más flexibilidad para diferentes formas de modelos, pero también añade complejidad al compilador.

En comparación con las GPU de NVIDIA (no en la lista proporcionada, pero implícito) o AMD, Dataflow ofrece menor latencia para lotes pequeños y mejor eficiencia energética para inferencia. Sin embargo, las GPU se benefician de un ecosistema de software maduro y un soporte más amplio para marcos y bibliotecas. La ventaja de Dataflow es más pronunciada para grandes modelos de transformadores, donde el mecanismo de atención puede mapearse eficientemente sobre la cuadrícula de PE.

Aplicaciones y adopción

SambaNova ha desplegado sistemas Dataflow en varios sectores, incluidos gobierno, salud y servicios financieros. Clientes notables incluyen el Departamento de Energía de los Estados Unidos, que utiliza el sistema para cómputo científico, y Oracle Cloud, que ofrece hardware SambaNova como servicio gestionado. La arquitectura se ha utilizado para tareas como procesamiento de lenguaje natural, visión por computadora y descubrimiento de fármacos. En 2023, SambaNova introdujo Samba-1, un gran modelo de lenguaje con 1 billón de parámetros, entrenado en sus sistemas Dataflow, demostrando la capacidad de la arquitectura para entrenamiento a gran escala.

La empresa también se ha centrado en hacer Dataflow accesible a través de servicios en la nube, permitiendo a los clientes alquilar tiempo en el hardware sin comprarlo directamente. Este modelo ha sido adoptado por empresas que necesitan inferencia de IA de alto rendimiento pero carecen de los recursos para mantener infraestructura dedicada. A partir de 2024, SambaNova ha recaudado más de mil millones de dólares en financiación y continúa iterando en su hardware y software.

Desafíos y limitaciones

Uno de los principales desafíos para Dataflow es la complejidad del compilador. Mapear modelos arbitrarios sobre la cuadrícula de PE requiere algoritmos sofisticados para particionamiento, programación y asignación de memoria. Esta complejidad puede llevar a tiempos de compilación más largos, especialmente para modelos grandes. Además, la naturaleza estática del grafo dificulta el soporte de modelos con formas dinámicas o flujo de control, que son comunes en algunas aplicaciones como el aprendizaje por refuerzo.

Otra limitación es la falta de soporte del ecosistema en comparación con las GPU. Muchos investigadores y desarrolladores de IA están familiarizados con CUDA y PyTorch, y pueden ser reacios a adoptar una nueva arquitectura que requiere un modelo de programación diferente. SambaNova ha mitigado esto proporcionando capas de compatibilidad, pero aún hay brechas. La empresa también ha enfrentado competencia de actores más establecidos como Google Cloud y AWS, que ofrecen sus propios aceleradores personalizados.

Direcciones futuras

SambaNova continúa evolucionando la arquitectura Dataflow, con un enfoque en mejorar la eficiencia de entrenamiento y soportar modelos más grandes. La generación SN40 incluye mejoras para cómputo disperso y aritmética de precisión mixta. La empresa también está explorando el uso de Dataflow para dispositivos de borde, aunque el hardware actual está diseñado principalmente para centros de datos. A medida que los modelos de IA generativa crecen en tamaño, es probable que aumente la demanda de hardware de inferencia eficiente, y el enfoque de Dataflow puede volverse más atractivo.

La investigación en arquitecturas de flujo de datos también continúa en el ámbito académico, con grupos en MIT CSAIL y Berkeley AI Research explorando ideas similares. Los principios de la computación de flujo de datos tienen una larga historia, que se remonta a la década de 1970, pero solo recientemente los avances en fabricación de chips y tecnología de compiladores los han hecho prácticos para cargas de trabajo comerciales de IA. El Dataflow de SambaNova representa una de las implementaciones comerciales más prominentes de este concepto, y su éxito dependerá de su capacidad para adaptarse al panorama de IA en rápida evolución.

Conclusión

Dataflow es un enfoque distintivo para la aceleración de IA que prioriza la eficiencia del movimiento de datos y la reconfigurabilidad. Al mapear modelos sobre una cuadrícula de elementos de procesamiento con memoria en el chip, ofrece una alternativa convincente a las GPU tradicionales para tareas de inferencia. Aunque enfrenta desafíos en complejidad de compilador y adopción del ecosistema, sus ventajas de rendimiento para grandes modelos de lenguaje han atraído una inversión significativa e interés de clientes. A medida que los modelos de IA continúan creciendo, los principios subyacentes a Dataflow pueden volverse cada vez más relevantes para la industria informática en general.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-architecture·artificial-intelligence·hardware-acceleration·dataflow-computing
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial