Matei Zaharia (nacido en 1984 o 1985) es un informático y educador rumano-canadiense. Es el creador de Apache Spark, un motor de análisis unificado para el procesamiento de datos a gran escala, y cofundador de Databricks, una empresa que comercializa plataformas de datos y aprendizaje automático basadas en la nube. Su investigación se ha centrado en hacer que los sistemas de computación distribuida y aprendizaje automático sean más accesibles y eficientes.
En 2026, Forbes clasificó a Zaharia e Ion Stoica como los rumanos más ricos, con un patrimonio neto de 5 mil millones de dólares cada uno.
Primeros años y educación
Zaharia creció en Toronto, Canadá, y se graduó del Jarvis Collegiate Institute antes de asistir a la Universidad de Waterloo. Como estudiante de pregrado, formó parte del equipo de programación de la universidad que ganó una medalla de oro en el Concurso Internacional de Programación Universitaria en 2005, quedando en cuarto lugar a nivel mundial y primero en América del Norte. Durante sus años de pregrado, contribuyó al juego de código abierto 0 A.D., particularmente en la física del renderizado del agua, y también ayudó a desarrollar el mod Norse Wars de Age of Mythology, que más tarde se adaptó al escenario Fort Wars de Age of Empires III.
Posteriormente cursó estudios de posgrado en informática, centrándose en sistemas distribuidos a gran escala. Estuvo afiliado al AMPLab de UC Berkeley, donde su investigación doctoral abordó las limitaciones de escalabilidad en los marcos de procesamiento de datos existentes.
Creación de Apache Spark
Mientras estaba en el AMPLab de UC Berkeley en 2009, Zaharia creó Apache Spark como una alternativa más rápida a MapReduce, el paradigma dominante de procesamiento de datos a gran escala en ese momento. Spark introdujo la computación en memoria y un modelo de ejecución más flexible, lo que permitió aceleraciones significativas para cargas de trabajo iterativas e interactivas. Su investigación doctoral sobre computación a gran escala le valió el Premio de Disertación Doctoral de ACM en 2014.
Spark rápidamente ganó adopción tanto en la industria como en el ámbito académico, convirtiéndose en uno de los marcos de código abierto más utilizados para big data. Su influencia se extendió a los flujos de trabajo de aprendizaje automático al proporcionar una plataforma unificada para el procesamiento de datos, el desarrollo de modelos y las tareas de implementación.
Carrera y Databricks
En 2013, Zaharia cofundó Databricks, una empresa construida en torno a Spark y tecnologías relacionadas. Se desempeña como su director de tecnología, guiando la dirección técnica de la plataforma. Databricks se ha convertido en un actor importante en la gestión de datos en la nube, ofreciendo servicios para inteligencia artificial y análisis.
Se unió a la facultad del MIT en 2015, y luego se trasladó a la Universidad de Stanford en 2016 como profesor asistente de informática. En 2019, recibió el Premio Presidencial de Carrera Temprana para Científicos e Ingenieros. Ese año, también lideró MLflow, una plataforma de código abierto para gestionar los ciclos de vida del aprendizaje automático, que aborda desafíos como el seguimiento de experimentos, la reproducibilidad de modelos y la implementación.
En 2023, Zaharia se unió a la Universidad de California, Berkeley como profesor asociado, regresando a la institución donde desarrolló Spark.
Contribuciones de investigación y reconocimiento
La investigación de Zaharia ha abarcado la computación distribuida, la gestión de recursos y los sistemas para el aprendizaje automático. Al inicio de su carrera, co-desarrolló la equidad de recursos dominante, una generalización de la equidad max-min para la asignación de múltiples recursos, que influyó en la programación de recursos en los gestores de clústeres. Su trabajo posterior sobre MLflow y los enfoques conductuales para la selección de modelos ha contribuido al lado operativo de los sistemas de aprendizaje automático.
Por sus contribuciones fundamentales a los sistemas de datos y aprendizaje automático, recibió el Premio ACM en Computación en 2025. También ha sido reconocido por su mentoría e influencia en el ecosistema de código abierto, con Apache Spark sirviendo como piedra angular para muchos pipelines modernos de ingeniería de datos y aprendizaje profundo.
Legado e impacto
El trabajo de Zaharia ha tenido un impacto duradero en cómo las organizaciones procesan y analizan datos. El éxito de Apache Spark ayudó a popularizar la idea de APIs unificadas y de alto nivel para la computación distribuida, reduciendo la complejidad de construir aplicaciones de datos escalables. A través de Databricks, también ha popularizado la arquitectura lakehouse, que combina el almacenamiento y la gestión de datos con capacidades de aprendizaje automático.
Sus contribuciones a la infraestructura de IA, particularmente en la habilitación de entrenamiento y servicio escalables, han apoyado el crecimiento más amplio de las aplicaciones de aprendizaje profundo. Su liderazgo académico continúa dando forma a la investigación en computación en la nube y sistemas de datos.