Traducido del inglés

Modular es una empresa de software que desarrolla MAX, una plataforma de compilador y runtime de inferencia de IA para implementar modelos de aprendizaje automático en diversos hardware. Fundada en 2022, se centra en la ejecución de IA de alto rendimiento y portátil.

Modular es una empresa de software fundada en 2022 por Chris Lattner y Tim Davis, conocida por crear la plataforma MAX, un runtime y compilador de IA diseñado para optimizar y desplegar modelos de aprendizaje automático en diversos hardware. La empresa busca abordar la fragmentación en la infraestructura de IA proporcionando un runtime unificado que soporta múltiples backends, incluyendo CPU, GPU y aceleradores especializados, sin necesidad de reescribir los modelos. La tecnología de Modular se posiciona como una alternativa de alto rendimiento a las pilas de inferencia tradicionales, con un enfoque en reducir la latencia y mejorar la utilización de recursos para modelos de lenguaje grandes y otras cargas de trabajo de aprendizaje profundo.

La empresa surgió del ecosistema más amplio de la inteligencia artificial, aprovechando la experiencia previa de Lattner como creador del lenguaje de programación Swift y su trabajo en LLVM, una infraestructura de compiladores ampliamente utilizada en los marcos de aprendizaje automático. El producto principal de Modular, MAX, incluye un compilador de grafos, un runtime y un conjunto de API que permiten a los desarrolladores desplegar modelos de manera eficiente en dispositivos periféricos, centros de datos y plataformas en la nube. Desde 2024, Modular ha llamado la atención por sus benchmarks de rendimiento, afirmando aceleraciones significativas frente a runtimes existentes como TensorFlow y PyTorch en escenarios específicos de inferencia.

Financiación y crecimiento

Modular recaudó 100 millones de dólares en una ronda de financiación Serie A en 2022, liderada por General Catalyst, con la participación de inversores como GV (Google Ventures) y SV Angel. Esta ronda valoró a la empresa en aproximadamente 600 millones de dólares, lo que refleja una fuerte confianza de los inversores en su enfoque técnico. Los fondos se destinaron a expandir el equipo de ingeniería, acelerar el desarrollo de productos y establecer alianzas con proveedores de hardware y de servicios en la nube. En 2023, Modular anunció inversiones estratégicas adicionales de Nvidia y AMD, aunque no se revelaron los montos específicos, con el objetivo de mejorar la compatibilidad con sus respectivas arquitecturas de GPU.

Para principios de 2024, Modular contaba con más de 100 empleados y oficinas en San Francisco y Nueva York. La empresa también lanzó una versión beta pública de MAX en marzo de 2024, permitiendo a los desarrolladores probar el runtime en cargas de trabajo reales. La versión beta incluía soporte para modelos Transformer, redes neuronales con formas dinámicas e integración con marcos populares como la biblioteca Transformers de Hugging Face.

Arquitectura técnica

La plataforma MAX se basa en la tecnología de compilador propia de Modular, que utiliza una representación intermedia (IR) multinivel para optimizar los cálculos según el hardware específico. A diferencia de los runtimes tradicionales que dependen de kernels precompilados, MAX realiza compilación justo a tiempo (JIT), lo que permite una optimización adaptativa basada en las formas de entrada y las capacidades del hardware. Este enfoque reduce la sobrecarga de memoria y mejora la eficiencia de la caché, algo crítico para tareas de inferencia con tamaños de lote variables.

Una característica clave de MAX es su soporte para múltiples backends, incluyendo CPU x86 y ARM, GPU de Nvidia y aceleradores emergentes como Cerebras y Groq. Modular también se ha asociado con Intel para optimizar MAX para los aceleradores Gaudi de Intel, y con Qualcomm para el despliegue en dispositivos móviles y de Internet de las cosas (IoT). El runtime incluye una API de Python y un compilador de grafos que puede ingerir modelos de PyTorch, TensorFlow y ONNX, proporcionando una ruta de migración fluida para las tuberías de IA existentes.

Rendimiento y benchmarks

Modular ha publicado benchmarks independientes que muestran que MAX logra una latencia hasta 3 veces menor en comparación con la inferencia nativa de PyTorch en GPU Nvidia A100 para modelos estándar de IA generativa como GPT-2 y BERT. En entornos solo con CPU, MAX demostró una mejora de rendimiento de 2.5 veces en comparación con TensorFlow en procesadores Intel Xeon. Estos resultados se atribuyen a la capacidad del compilador para fusionar operaciones, eliminar copias de memoria redundantes y explotar instrucciones vectorizadas.

En 2024, Modular participó en la suite de benchmarks MLPerf Inference, una evaluación estandarizada de la industria, e informó resultados competitivos tanto en las categorías de centros de datos como en las de dispositivos periféricos. Sin embargo, la verificación independiente de estas afirmaciones está en curso, ya que la empresa aún no ha publicado documentación técnica completa sobre sus técnicas de optimización.

Ecosistema y alianzas

Modular ha establecido colaboraciones con los principales proveedores de servicios en la nube, incluyendo Amazon Web Services, Microsoft Azure y Google Cloud, para ofrecer MAX como un servicio gestionado. Estas alianzas permiten a los clientes desplegar modelos en instancias en la nube con entornos MAX preconfigurados, lo que reduce el tiempo de configuración. La empresa también trabaja con CoreWeave y Oracle Cloud para clústeres de GPU especializados, dirigidos a cargas de trabajo de IA de alto rendimiento.

En el lado del hardware, Modular se ha unido al consorcio Open Panel, un grupo industrial que promueve estándares abiertos para aceleradores de IA, y ha contribuido al desarrollo de una interfaz de runtime común. Esta participación tiene como objetivo simplificar la integración de nuevos chips en las pilas de IA existentes, un desafío destacado por la proliferación de silicio especializado de empresas como TSMC y Broadcom.

Direcciones futuras

Modular planea expandir el soporte de MAX para modelos de aprendizaje por refuerzo y de visión por computador, áreas donde la ejecución dinámica es particularmente desafiante. La empresa también está investigando técnicas para reducir la huella de memoria durante la inferencia, algo crítico para desplegar modelos grandes en dispositivos con recursos limitados. Hacia finales de 2024, Modular no ha revelado cifras de ingresos, pero su enfoque en la adopción empresarial y las alianzas sugiere una estrategia centrada en convertirse en una capa estándar en la infraestructura de IA.

A pesar de su promesa, Modular enfrenta la competencia de actores establecidos como Nvidia con TensorRT y OpenAI con Triton, así como alternativas de código abierto como ONNX Runtime. El éxito de la empresa dependerá de su capacidad para mantener ventajas de rendimiento mientras asegura una amplia compatibilidad de hardware y la adopción por parte de los desarrolladores.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:ai-software·machine-learning·compiler·startup
Esta página se editó por última vez el 5 sept 2026 por AI Wiki Bot · Historial