Siva Reddy é professor na Universidade McGill e membro acadêmico central do Mila - Instituto Quebecense de Inteligência Artificial. Sua pesquisa foca no processamento de linguagem natural (PLN), particularmente modelos multilíngues, generalização composicional e a integração de estrutura linguística em arquiteturas de redes neurais. Ele é conhecido por suas contribuciones à compreensão de como os modelos de linguagem de grande escala representam e processam sintaxe e semântica em diversas línguas.
O trabalho de Reddy conecta linguística computacional e aprendizado de máquina, abordando desafios em línguas de baixo recurso e transferência interlingüe. Ele publicou extensamente em conferências de alto nível como ACL, EMNLP e NeurIPS, e sua pesquisa influenciou tanto a teoria acadêmica como aplicações práticas em sistemas de IA multilíngues.
Educação e Início de Carreira
Reddy completou seus estudos de doutorado na Universidade de Edimburgo, onde trabalhou em parsing semântico e compreensão de linguagem fundamentada. Sua pesquisa de doutorado explorou como conectar linguagem natural a representações formais de significado, estabelecendo bases para trabalhos posteriores em modelos composicionais. Após seu doutorado, ocupou posições pósdoctorales na Universidade Stanford, colaborando com pesquisadores do Stanford AI Lab, e na Universidade de Edimburgo, antes de se unir à Universidade McGill como membro do corpo docente.
Contribuciones de Pesquisa
Um tema central no trabalho de Reddy é a generalização composicional - a capacidade dos modelos de entender combinações novas de palavras e estruturas conhecidas. Ele propôs benchmarks e métodos para avaliar e melhorar essa capacidade em redes neurais, frequentemente contrastando com abordagens puramente estatísticas. Seus artículos sobre generalização sistemática têm sido amplamente citados e informaram trabalhos subsequentes na era do Transformer (architecture).
Reddy também investiga representações multilíngues, examinando como características compartidas e específicas de cada língua emergem em modelos de Neural network. Ele contribuyó a conjuntos de dados e marcos de avaliação para línguas tipologicamente diversas, incluindo aquelas com recursos digitais limitados. Este trabalho se alinha com esforços más amplios em Machine learning para tornar os sistemas de IA más equitativos entre comunidades linguísticas globais.
Integración de Linguística e Aprendizaje Profundo
A diferencia de investigadores de PLN enfocados puramente en ingeniería, Reddy enfatiza el papel de la teoría lingüística en el diseño de modelos. Ha colaborado con sintactistas y semantistas para inyectar sesgos inductivos en arquitecturas de Deep learning, como el uso de codificadores basados en árboles o mecanismos de atención que respetan relaciones jerárquicas. Este enfoque ha demostrado que el conocimiento lingüístico explícito puede mejorar la eficiencia de muestreo y la robustez, particularmente en entornos de bajo recurso.
Su trabajo también critica y analiza las limitaciones de los Large language models, como su tendencia a depender de estadísticas superficiales en lugar de razonamiento más profundo. A través de experimentos controlados, ha demostrado dónde estos modelos fallan en tareas que requieren comprensión verdadera, contribuyendo a debates en curso sobre la naturaleza de la cognición en IA.
Enseñanza y Mentoría
En McGill, Reddy enseña cursos sobre PLN y lingüística computacional, mentorando a estudiantes de posgrado que han pasado a ocupar posiciones en academia e industria. Es conocido por fomentar la colaboración interdisciplinaria, reuniendo a estudiantes de ciencias de la computación, lingüística y ciencias cognitivas. Su laboratorio publica regularmente herramientas y conjuntos de datos de código abierto, apoyando la reproducibilidad en el campo.
Impacto y Reconocimiento
La investigación de Reddy ha sido reconocida con múltiples premios al mejor artículo y nominaciones en conferencias importantes. Ha servido como presidente de área y miembro senior del comité de programa para ACL y EMNLP, ayudando a dar forma a la dirección de la investigación en PLN. Su trabajo sobre modelos multilíngues ha sido adoptado por profesionales que construyen sistemas para lenguas como hindi, tamil y suajili, y sus ideas han influido en el diseño de productos comerciales de IA.
Más allá de la academia, Reddy ha colaborado con socios de la industria, incluyendo colaboraciones con grupos en Google DeepMind y Anthropic, para explorar la seguridad y robustez en modelos de lenguaje. Sigue siendo una voz activa en discusiones sobre el desarrollo responsable de la IA, abogando por estándares de evaluación informados lingüísticamente.
Publicaciones Seleccionadas
Reddy ha sido autor de más de 50 artículos revisados por pares. Obras notables incluyen estudios sobre benchmarks de generalización composicional, transferencia interlingüe en transformadores multilíngues y el papel de la sintaxis en el parsing semántico. Su encuesta coautora sobre PLN multilíngue es frecuentemente citada como referencia para investigadores que ingresan al campo.
Sus proyectos en curso implican extender métodos composicionales a entornos multimodales y desarrollar técnicas de ajuste fino más eficientes para lenguas de bajo recurso, reflejando un compromiso continuo con hacer el PLN más inclusivo y científicamente riguroso.