Neural Magic es una empresa de software que desarrolla tecnologías para acelerar la inferencia de aprendizaje automático en CPU de propósito general. Fundada en 2017 y con sede en Boston, Massachusetts, la empresa se centra en hacer que el despliegue de la inteligencia artificial sea más accesible y rentable al eliminar la necesidad de aceleradores especializados como las GPU. Su enfoque principal combina innovaciones algorítmicas en escasez de modelos y cuantización con optimizaciones específicas para CPU, lo que permite que las redes neuronales profundas se ejecuten de manera eficiente en procesadores x86 estándar. Las soluciones de la empresa se utilizan en diversas industrias para tareas que incluyen visión por computadora, procesamiento de lenguaje natural y cargas de trabajo de IA generativa.
La empresa surgió de la investigación en el MIT CSAIL y Berkeley AI Research, donde sus fundadores exploraron formas de explotar la estructura matemática de las redes neuronales para reducir las demandas computacionales. La tecnología de Neural Magic se basa en la observación de que muchas redes neuronales contienen redundancia significativa y, al podar o cuantizar los pesos, la inferencia se puede realizar con muchas menos operaciones. La pila de software de la empresa, que incluye el tiempo de ejecución DeepSparse y el kit de herramientas SparseML, permite a los desarrolladores comprimir y acelerar modelos sin requerir hardware personalizado. Este enfoque ha posicionado a Neural Magic como un actor notable en el espacio de la infraestructura de IA, particularmente para organizaciones que buscan evitar los altos costos y las limitaciones de suministro de los clústeres de GPU.
Historia
Neural Magic fue fundada en 2017 por Mark Chen, Jakob Uszkoreit y Lukasz Kaiser, tres investigadores con experiencia en aprendizaje automático y sistemas. Uszkoreit y Kaiser fueron contribuyentes tempranos a la arquitectura del transformador en Google, y Chen había trabajado en técnicas de inferencia eficiente. El trío tenía como objetivo comercializar la investigación sobre redes neuronales dispersas, que había demostrado que los modelos podían podarse a una fracción de su tamaño original manteniendo la precisión. La empresa operó inicialmente en modo sigiloso, publicando artículos académicos y desarrollando su tecnología central antes de lanzar públicamente sus primeros productos en 2020.
En 2020, Neural Magic lanzó su motor de inferencia DeepSparse, que demostró aceleraciones significativas para modelos convolucionales y de transformadores en CPU. La empresa también presentó SparseML, una biblioteca de código abierto para aplicar escasez y cuantización a modelos durante el entrenamiento. Estos lanzamientos atrajeron la atención de empresas y proveedores de nube, lo que llevó a asociaciones con compañías como Intel y AMD. Para 2021, Neural Magic había recaudado más de 50 millones de dólares en financiamiento de inversores, incluidos NEA, Andreessen Horowitz y Pillar VC. La empresa continuó expandiendo su línea de productos, agregando soporte para la inferencia de modelos de lenguaje grandes e integrándose con marcos populares como PyTorch y Hugging Face Transformers.
Tecnología y enfoque
La tecnología central de Neural Magic gira en torno a dos técnicas principales: escasez y cuantización. La escasez implica podar los pesos de una red neuronal, estableciendo muchos de ellos en cero, lo que reduce el número de multiplicaciones requeridas durante la inferencia. La cuantización reduce la precisión de los pesos y las activaciones de punto flotante de 32 bits a enteros de 8 bits, lo que reduce aún más el costo computacional y el ancho de banda de memoria. El software de la empresa aplica automáticamente estas técnicas a los modelos, a menudo con una pérdida mínima de precisión, y luego genera código optimizado para la CPU objetivo.
El tiempo de ejecución DeepSparse es el motor que ejecuta estos modelos comprimidos. Utiliza una técnica llamada multiplicación de matrices dispersas, que omite las entradas cero, y aprovecha instrucciones vectoriales de CPU como AVX-512 y VNNI para acelerar las operaciones restantes. El tiempo de ejecución también incluye un compilador justo a tiempo que genera núcleos especializados para cada modelo y configuración de hardware. Este enfoque permite a Neural Magic lograr velocidades de inferencia que rivalizan o superan a las de los sistemas basados en GPU para ciertas cargas de trabajo, particularmente para inferencia por lotes y aplicaciones en tiempo real.
SparseML, la biblioteca de entrenamiento complementaria, proporciona API para poda y cuantización durante el entrenamiento o el ajuste fino de modelos. Admite una técnica llamada poda gradual por magnitud, que elimina progresivamente los pesos según su magnitud, y entrenamiento consciente de la cuantización, que simula la aritmética de baja precisión durante el entrenamiento para preservar la precisión. Estas herramientas están diseñadas para ser fáciles de integrar en los pipelines de aprendizaje automático existentes, lo que hace que la tecnología sea accesible para una amplia gama de desarrolladores.
Productos y servicios
Neural Magic ofrece varios productos bajo las marcas DeepSparse y SparseML. El tiempo de ejecución DeepSparse está disponible como un paquete de Python y un contenedor Docker, y admite tanto despliegues en CPU como en la nube. Incluye un modo de servidor para servir modelos a través de API REST, así como una biblioteca cliente para incrustar la inferencia en aplicaciones. La empresa también proporciona un zoológico de modelos preoptimizados, una colección de modelos populares que han sido podados y cuantizados, listos para su despliegue inmediato.
SparseML es una biblioteca de código abierto que se integra con PyTorch y TensorFlow, ofreciendo interfaces de línea de comandos y API de Python para aplicar escasez y cuantización. También incluye recetas para modelos comunes como redes residuales y variantes de transformadores, que especifican el programa de poda y los hiperparámetros. Además, Neural Magic ofrece un servicio en la nube llamado DeepSparse Cloud, que proporciona endpoints de inferencia gestionados con escalado automático, aunque este servicio fue posteriormente descontinuado en favor de los despliegues locales.
Para la inferencia de modelos de lenguaje grandes, Neural Magic ha desarrollado optimizaciones especializadas para modelos como Llama y Mistral. Estas optimizaciones incluyen cuantización de caché KV y núcleos fusionados que reducen el uso de memoria y mejoran el rendimiento. La empresa también ha colaborado con Intel para optimizar su software para los procesadores Xeon más recientes de Intel, logrando ganancias significativas de rendimiento en benchmarks populares.
Rendimiento y benchmarks
Neural Magic publica resultados de benchmarks que demuestran la efectividad de su tecnología. Por ejemplo, en un servidor con doble socket Intel Xeon Platinum 8380, la empresa informó que una versión podada y cuantizada del modelo BERT-large logró más de 1,000 oraciones por segundo, en comparación con alrededor de 200 para la línea base no optimizada. Para modelos de visión por computadora como YOLOv5, DeepSparse alcanzó velocidades de cuadro superiores a 100 FPS en un solo socket de CPU, lo que es competitivo con la inferencia en GPU para muchas aplicaciones.
La empresa también destaca los beneficios de costos de la inferencia basada en CPU. Al utilizar la infraestructura de servidores existente, las organizaciones pueden evitar el gasto de capital de los clústeres de GPU y reducir el consumo de energía. La tecnología de Neural Magic es particularmente atractiva para despliegues en el borde, donde la energía y el espacio son limitados, y para aplicaciones en tiempo real que requieren baja latencia.
Sin embargo, las ganancias de rendimiento dependen de la arquitectura del modelo y del grado de escasez alcanzable. Los modelos densos con redundancia limitada pueden ver mejoras más pequeñas, y algunas cargas de trabajo aún se benefician de las GPU, especialmente para modelos muy grandes con paralelismo masivo. Neural Magic reconoce estas limitaciones y proporciona orientación sobre qué modelos son más adecuados para la aceleración en CPU.
Posición en el mercado y competencia
Neural Magic opera en el campo competitivo de la optimización de inferencia de IA, que incluye tanto soluciones de hardware como de software. En el lado del hardware, empresas como Nvidia dominan con GPU, mientras que Groq y SambaNova ofrecen aceleradores de IA especializados. En el lado del software, los competidores incluyen Triton de OpenAI, JAX de Google DeepMind y varios marcos de compilación como TVM y ONNX Runtime. Neural Magic se diferencia al centrarse exclusivamente en CPU, que son ubicuas y a menudo subutilizadas en los centros de datos.
La empresa también ha enfrentado competencia de técnicas emergentes como la destilación de modelos y el conocimiento, que pueden producir modelos más pequeños sin hardware especializado. Sin embargo, el enfoque de Neural Magic se puede combinar con estos métodos, y sus herramientas están diseñadas para complementar los flujos de trabajo de optimización existentes.
En 2023, Neural Magic fue adquirida por Red Hat, una subsidiaria de IBM, por una cantidad no revelada. La adquisición tenía como objetivo integrar la tecnología de Neural Magic en la plataforma OpenShift AI de Red Hat, proporcionando a los clientes opciones de inferencia basadas en CPU. Este movimiento señaló un creciente interés de los proveedores de software empresarial en el despliegue eficiente de IA.
Casos de uso y aplicaciones
La tecnología de Neural Magic se utiliza en una variedad de aplicaciones del mundo real. En visión por computadora, acelera modelos de detección de objetos, clasificación de imágenes y segmentación para su uso en comercio minorista, manufactura y seguridad. En procesamiento de lenguaje natural, impulsa sistemas de análisis de sentimientos, reconocimiento de entidades nombradas y respuesta a preguntas. El soporte de la empresa para modelos de lenguaje grandes también ha permitido el despliegue de chatbots y herramientas de generación de código en servidores CPU, reduciendo costos para startups y empresas establecidas.
Un caso de uso notable es en el sector de la salud, donde el software de Neural Magic se ha utilizado para ejecutar modelos de imágenes médicas en servidores hospitalarios, evitando la necesidad de enviar datos sensibles a la nube. En finanzas, acelera modelos de detección de fraude y trading algorítmico que requieren baja latencia. La tecnología también se utiliza en vehículos autónomos y robótica, donde las CPU son a menudo el único recurso computacional disponible.
Investigación y código abierto
Neural Magic mantiene un programa de investigación activo, publicando artículos sobre entrenamiento disperso, cuantización y optimización de inferencia. Sus investigadores han contribuido a conferencias como NeurIPS, ICML y MLSys. La empresa también publica gran parte de su software como código abierto, incluidos SparseML y partes de DeepSparse, fomentando una comunidad de usuarios y contribuyentes.
La estrategia de código abierto ha ayudado a Neural Magic a construir una gran base de usuarios y establecer credibilidad en la comunidad de aprendizaje automático. Los desarrolladores pueden experimentar con las herramientas e integrarlas en sus proyectos, y la empresa se beneficia de los comentarios y contribuciones de la comunidad. Este enfoque es similar al de otras empresas de infraestructura de IA como Hugging Face y Weights & Biases.
Direcciones futuras
De cara al futuro, Neural Magic tiene como objetivo expandir su soporte para arquitecturas de modelos emergentes y hardware. Con el auge de los modelos basados en transformadores y la IA generativa, la empresa está invirtiendo en optimizaciones para la inferencia de modelos de lenguaje grandes, incluidas técnicas como decodificación especulativa y agrupación dinámica. También está explorando soporte para procesadores ARM Holdings y CPU EPYC de AMD, que están ganando popularidad en entornos de nube.
A medida que los modelos de IA se vuelven más grandes y complejos, la necesidad de inferencia eficiente solo crecerá. El enfoque de Neural Magic en CPU podría volverse cada vez más relevante a medida que las organizaciones buscan equilibrar rendimiento, costo y consumo de energía. La integración de la empresa con Red Hat e IBM proporciona una vía para la adopción empresarial, y su ecosistema de código abierto continúa atrayendo desarrolladores.
Conclusión
Neural Magic se ha establecido como pionera en la optimización de inferencia basada en CPU, ofreciendo una alternativa convincente a los enfoques centrados en GPU. Su combinación de escasez, cuantización e ingeniería de tiempo de ejecución ofrece mejoras significativas de rendimiento en hardware de propósito general, haciendo que la IA sea más accesible y asequible. Si bien persisten desafíos, como las limitaciones inherentes de las CPU para ciertas cargas de trabajo, la tecnología de la empresa ha demostrado ser valiosa en múltiples industrias. Con el respaldo de Red Hat e IBM, Neural Magic está bien posicionada para desempeñar un papel clave en el futuro del despliegue de IA.