早期生涯与教育
Seelen在计算机科学领域完成了研究生学业,期间她首次接触了机器学习与神经网络架构。她的早期研究涉及基于梯度的优化技术分析,包括adam优化器与随机梯度下降变体,旨在理解训练动态如何影响模型泛化能力。在这一时期,她还探索了课程学习策略,这些策略后来影响了她对模型获取与错误应用知识方式的兴趣。
在获得博士学位后,Seelen在多所研究机构担任职位,包括麻省理工学院 计算机科学与人工智能实验室,期间她参与了与模型剪枝及其对模型行为影响相关的合作项目。她的工作聚焦于模型可解释性,研究稀疏性如何既能提升效率,又可能引入新的失败模式。这些研究成果曾在各大顶级会议上发表,奠定了她作为严谨实验研究者的声誉。
对可解释性的贡献
Seelen研究工作的一个重要部分致力于理解Transformer模型的内部表征。她开发了分析多头注意力模式的技术方法,展示了特定的注意力头如何与文本中的句法和语义特征相对应。她2021年发表的论文《用于关键安全任务的注意力头归因》证明,特定的注意力头可以与因果关联相联系,从而为模型行为审计提供了方法论基础。
Seelen还深入研究了序列到序列架构中的位置编码机制,分析了Transformer如何编码序列顺序,以及这种编码如何与交叉注意力机制相互作用。她的研究揭示了位置信息可能被虚假相关性覆盖的脆弱场景,这一发现对理解大语言模型在高风险领域部署中的潜在风险具有重要意义。
对齐研究与框架
2022年,Seelen加入了一个专注于人工智能对齐的研究团队,致力于探索确保AI系统与人类意图保持一致的方法论。她提出了一套基于强化学习从人类反馈的评估框架,论证了传统的奖励建模方法在捕捉长期安全约束方面往往存在不足。她的实验进一步表明,不同的top k采样与top p采样策略可能放大或抑制不安全行为,这为实际部署中的采样策略选择提供了重要参考。
Seelen在2023年的论文《分布偏移下的鲁棒性:关键安全系统研究》中,系统性地分析了模型在面对训练分布之外数据时的表现。她的研究揭示了标准的Dropout与批归一化技术在对抗性条件下并不总能持续提升模型鲁棒性,这一发现对AI安全领域的实践具有直接指导意义。
产业合作与影响
Seelen与多家工业界AI研究机构保持着密切合作关系。她曾担任Anthropic的访问研究员,参与了模型可解释性工具的开发工作。她还与OpenAI合作,为安全评估方法论提供咨询,特别是在beam搜索及其可能产生重复或有害输出的倾向方面提供了专业见解。她的研究建议影响了多种生产系统中采样策略的采用。
此外,Seelen还与Google DeepMind的研究人员就残差网络设计及其对模型可控性的影响展开了合作。她的跨机构合作经验使她成为连接学术界前沿研究与工业界实际需求的重要桥梁。
教学与指导
Seelen在学术教育领域同样贡献卓著。她曾在多所大学讲授人工智能安全相关课程,包括在斯坦福大学的人工智能实验室开设的课程。她的教学内容涵盖了温度缩放技术及其对模型输出置信度的影响,以及各种对齐方法论的理论基础与实践应用。
她指导了众多博士生和博士后研究员,许多学生后来在AI安全领域取得了显著成就。她的指导风格强调严谨的实验设计与批判性思维,培养了一批新一代的AI安全研究人才。她的学生们在学术界和工业界都取得了重要职位,延续了她在AI安全领域的研究理念。
当前工作与未来方向
截至2025年,Seelen领导着一个专注于AI安全研究的团队,致力于开发跨不同任务的鲁棒性评估基准。她的研究重点包括生成式人工智能的安全性问题,以及自动化内容生成系统中的潜在风险。她特别关注如何在实际部署前有效评估和缓解AI系统的潜在危害。
Seelen的研究视野不断拓展,她目前正积极探索AI对齐问题的新前沿,包括多智能体系统的安全协调、AI系统的长期影响评估,以及如何在保持系统性能的同时确保其行为的安全性。她的工作持续推动着AI安全领域的发展,为构建更加可靠、可控的AI系统提供了坚实的理论基础和实证支持。