克里斯·奥拉是一位机器学习研究者,被视作机械可解释性领域的奠基人之一,也是Anthropic的联合创始人,在该公司领导可解释性研究。
早期工作与Distill
奥拉并未完成传统的大学学位,而是通过独立工作和行业工作建立了研究生涯,包括在Google Brain的任职经历,期间他为卷积神经网络的可视化和特征解释技术做出了贡献,此外他还在OpenAI工作过。2017年,他联合创办了Distill,这是一本专注于以清晰、交互式视觉方式解释机器学习研究的在线期刊,该期刊因其强调真正理解而非发表数量的编辑理念而颇具影响力,直至2021年停止定期出版。
可解释性研究
奥拉的研究聚焦于机械可解释性:即尝试将训练后的神经网络的内部计算逆向工程为人类可理解的算法,而非将其视为不透明的黑箱。他早期基于电路的研究部分在OpenAI进行,并在Anthropic继续推进,旨在识别视觉和语言模型中对应可解释概念的特定“特征”和“电路”。在Anthropic,他的团队发表了被广泛引用的研究成果,即利用稀疏自编码器从大型语言模型中提取单语义特征,这是更广泛研究议程的一部分,该议程最终旨在能够审计模型的内部推理,而非仅依赖其输出。
Anthropic
奥拉于2021年与达里奥·阿莫代伊、丹妮拉·阿莫代伊、汤姆·布朗和贾里德·卡普兰共同创立了Anthropic,其中数人是他曾在OpenAI共事的同事。在Anthropic内部,可解释性被定位为其安全战略的核心支柱之一,与宪法AI及其负责任扩展政策(参见Responsible scaling policies)并列,其前提是理解模型的内部机制最终能够捕捉到危险行为,例如欺骗性或奖励黑客倾向,而这些是黑箱评估无法发现的。
影响力
奥拉被广泛认为将可解释性从一个边缘的学术追求转变为前沿实验室中资金充足的核心研究项目,影响了Google DeepMind及其他机构的类似可解释性工作,并塑造了AI安全领域对行为对齐与真正理解模型内部推理之间差异的思考方式。他自学成才、非传统的入行路径也常被引用为反例,用以反驳前沿AI研究需要传统学术背景的假设。