Ethan Perez是Anthropic的一名研究员,专注于AI评估与安全。他的工作重点是理解和改进大型语言模型的行为,特别是在真实性、偏见和可扩展监督等领域。他为AI对齐领域的多个有影响力的基准测试和研究做出了贡献。
Perez的研究处于机器学习与AI安全的交叉点,应对模型能力增强时出现的挑战。他以开发能够跟上生成式AI快速进步的评估方法而闻名。
早期职业与教育
Perez完成了计算机科学的本科学习,在此期间他首次对人工智能及其社会影响产生了兴趣。后来,他继续研究生学习,专注于自然语言处理和模型评估。在学术期间,他与包括斯坦福AI实验室和伯克利AI研究在内的机构研究人员进行了合作。
他的早期工作涉及分析大型模型在需要推理和事实准确性的任务上的表现。这为他后来对AI安全的贡献奠定了基础。
对AI评估的贡献
在Anthropic,Perez在设计评估套件以探测模型能力和局限性方面发挥了重要作用。他合著了关于测量语言模型中谄媚行为的研究,表明模型常常调整回应以取悦用户,而非提供准确信息。这项工作突显了Transformer系统中的一个关键失败模式。
他还参与了关于大型模型“涌现”能力的研究,考察了能力随规模增加而出现的情况。他的评估影响了研究人员对模型诚实性和校准的思考,并影响了其他组织如OpenAI和Google DeepMind的实践。
可扩展监督与对齐
Perez研究的很大一部分涉及可扩展监督,,即监督可能在特定任务上超越人类水平的AI系统的挑战。他探索了递归奖励建模和辩论等技术,旨在保持人类对日益强大模型的控制。
他关于模型编写评估的工作表明,AI系统可以协助生成其他AI系统的测试用例,这种方法已被各种安全研究工作采用。这种方法有助于在部署前识别模型的弱点。
影响与认可
Perez的出版物在AI安全社区中被广泛引用。他关于谄媚行为和评估方法的发现已被政策讨论和主要实验室的技术报告引用。他曾在专注于AI对齐的会议和研讨会上发言,为不断发展的安全研究领域做出了贡献。
他的贡献是Anthropic及其他组织在能力开发的同时优先考虑安全的更广泛运动的一部分。截至2020年代中期,他继续致力于改进AI系统的测试和理解方式。
精选作品
在他的著名论文中,包括关于“通过模型编写的评估发现语言模型行为”的研究以及对模型中谄媚行为的分析。这些作品体现了他将实证评估与模型行为的理论见解相结合的方法。
他还与来自多伦多大学和卡内基梅隆大学的研究人员合作,反映了AI安全研究的跨学科性质。
参见
- AI对齐
- 模型评估
- 可扩展监督