Jonathan Frankle es un científico de la computación especializado en aprendizaje automático y aprendizaje profundo. Es conocido principalmente por su investigación sobre la escasez en redes neuronales, especialmente la hipótesis del boleto de lotería, que desarrolló junto con Michael Carbin en el MIT CSAIL. A partir de 2024, se desempeña como científico principal en MosaicML, una empresa centrada en el entrenamiento y la implementación eficientes de modelos de lenguaje grandes.
La obra de Frankle conecta conceptos teóricos en redes neuronales con sistemas prácticos para IA generativa. Sus contribuciones han influido en la manera en que investigadores e ingenieros abordan la compresión de modelos y la IA eficiente en recursos, un tema de importancia creciente en toda la industria.
Vida temprana y educación
Frankle completó sus estudios de licenciatura en ciencias de la computación en la Carnegie Mellon University, graduándose en 2013. Luego cursó un doctorado en el mit-csaail, donde fue asesorado por Michael Carbin. Su investigación doctoral se centró en comprender la estructura interna de las redes neuronales entrenadas, lo que llevó a la formulación de la hipótesis del boleto de lotería en 2018. Obtuvo su doctorado en 2021.
Hipótesis del boleto de lotería
La hipótesis del boleto de lotería, presentada en un artículo de 2019 coautorado con Carbin, propone que una red neuronal densa contiene una subred - un 'boleto ganador' - que, cuando se entrena de forma aislada, puede lograr una precisión en pruebas comparable a la de la red original. Esta subred se identifica mediante un proceso de poda iterativa: entrenar la red, podar los pesos de menor magnitud, restablecer los pesos restantes a sus valores iniciales y volver a entrenar. La hipótesis desafió la suposición habitual de que la poda solo mejora la eficiencia durante la inferencia, demostrando que las redes dispersas también pueden entrenarse desde cero de forma eficaz.
Este trabajo recibió gran atención en la comunidad de inteligencia artificial por sus implicaciones tanto para comprender como para optimizar redes neuronales. Sugirió que el exceso de parametrización en el aprendizaje profundo podría relacionarse más con la presencia de muchas subredes viables que con una mayor capacidad. Investigaciones posteriores de Frankle y sus colaboradores ampliaron esta idea a arquitecturas más complejas, como transformers, y exploraron el papel de la tasa de aprendizaje y la inicialización de pesos en la búsqueda de estos boletos.
Carrera en MosaicML
Tras su doctorado, Frankle se unió a MosaicML, una startup fundada en 2021 por ex ingenieros de Intel y NVIDIA, como científico principal. En MosaicML, dirigió investigaciones sobre métodos de entrenamiento eficiente, incluyendo el desarrollo de la biblioteca de datasets en streaming de MosaicML y el framework de entrenamiento Composer. Su equipo se centró en reducir el costo y el tiempo requeridos para entrenar grandes paradigmas, haciéndolos accesibles para organizaciones más pequeñas.
En 2023, MosaicML fue adquirida por Databricks, una empresa de análisis de datos, por aproximadamente 1.300 millones de dólares. Frankle continuó en su papel tras la adquisición, supervisando la investigación sobre optimización de modelos y la publicación de modelos de código abierto como MPT-7B y MPT-30B. Estos modelos destacaron por su rendimiento competitivo en comparación con el GPT-3 de OpenAI, mientras que requerían menos recursos computacionales.
Contribuciones a la investigación
Más allá de la hipótesis del boleto de lotería, Frankle ha contribuido a varias áreas de investigación en aprendizaje automático. Su trabajo sobre 'conectividad de modo lineal' exploró cómo los modelos entrenados de forma independiente pueden ser interpolados en el espacio de los pesos, lo que genera información sobre el paisaje de pérdida de las redes profundas. También investigó el impacto del orden de los datos y la normalización por lotes en la dinámica de entrenamiento.
Frankle ha promovido la reproducibilidad en la investigación de IA, publicando protocolos experimentales detallados y abriendo el código fuente de sus muestras para todos sus estudios. Sus artículos han aparecieron en conferencias importantes como NeurIPS, ICML e ICLR, y ha servido como revisor en estos eventos.
Impacto y reconocimiento
La obra de Frankle ha sido citada ampliamente dentro de la literatura de aprendizaje profundo, con el artículo sobre la hipótesis del boleto de lotería reuniendo miles de citas. Sus ideas han influido en herramientas prácticas para la compresión de modelos, como librerías de poda en frameworks como PyTorch y TensorFlow. Los practicantes industriales de compañías como Google DeepMind y Anthropic han hecho referencia a su investigación en discusiones sobre diseño eficiente de modelos.
En el contexto más amplio de la IA generativa, la atención de Frankle a la eficiencia se alinea con los esfuerzos por democratizar el acceso a modelos grandes. Su trabajo en MosaicML contribuyó a la tendencia de modelos de peso abierto, que prestan un contraste con los enfoques propietarios de los principales laboratorios. A partir de 2024, sigue activo en el campo, con aportaciones en conferencias y participación en una divulgación pública sobre desarrollo sostenible de IA.
Publicaciones seleccionadas
- 'La única hipótesis del boleto de lotería: cómo encontrar redes neuronales de alta calidad entrenables' (con Michael Carbin, 2019)
- 'Conectividad de modo lineal y la hipótesis del boleto de ganador' (with guía final Sahu et al., 2020)
- 'Estabilizando la hipótesis del boleto de lotería' (con Gundappa Sahu et al., 2020)
- 'MosaicML: Entrenamiento eficiente de modelos de lenguaje grandes' (reporte técnico, 2023)
Referencias
Su obra está documentada mediante publicaciones académicas y reportes técnicos disponibles en arxiv y archivo de procedimientos de conferencias. Las entrevistas y perfiles han aparecido en medios tecnológicos donde se discuten sus contribuciones a la IA eficiente.