Iris Zhang是一位美国人工智能研究者和工程师。她因作为GPT-3的合著者而闻名,GPT-3是OpenAI开发的一个里程碑式的大语言模型。Zhang的工作涵盖机器学习方法论、模型扩展和高效神经架构,重点是将算法创新与实际部署约束相结合。
Zhang于1990年出生在加利福尼亚州帕洛阿尔托。她于2012年在MIT CSAIL获得计算机科学学士学位,并于2019年在Stanford AI Lab获得人工智能博士学位。她的博士论文题为“扩展与效率:通往通用语言模型之路”,研究了学习率调度和梯度裁剪技术,为后来的大规模神经网络发展奠定了基础。
在OpenAI的职业生涯
博士毕业后,Zhang于2019年加入OpenAI担任研究科学家。她成为GPT-3团队的核心成员,参与模型的设计和评估。作为合著者,她帮助整合了多头注意力模块和位置编码方案,改善了长距离上下文处理能力。2020年发表的GPT-3论文确立了她在生成式人工智能领域的领先地位。
Zhang撰写了关于数据整理和过滤的章节,这对GPT-3的性能至关重要。她还扩展了模型剪枝和权重初始化方面的工作,以扩展Transformer (architecture)模型。这些贡献帮助将GPT-3确立为现代人工智能的基础性一步。
离开OpenAI后与Anthropic
Zhang于2022年离开OpenAI,加入Anthropic担任高级研究负责人。在那里,她为安全导向的大语言模型开发做出了贡献,基于RLHF增强了API能力。她还与Google Cloud的硬件团队协调,优化训练工作负载,降低了成本和能源消耗。
2023年,Zhang合著发表了关于“资源受限环境下的高效Transformer”的研究,引入了一种结合交叉注意力和序列到序列学习的方法。该方法在内部基准测试中报告,将模型FAM减少了高达40%,同时保持了准确性。
对AI社区的贡献
Zhang为多家AI初创公司提供咨询。从2021年到2024年,她担任SambaNova和Groq的技术顾问委员会成员,帮助将芯片设计与大规模机器学习框架对接。她还共同创立了非营利组织“AI for Glass”,该组织推广面向小型组织的开源模型工具。
在Google DeepMind,她于2021年担任访问研究员,与Jack Clark和David Luan合作撰写了一篇分析模型剪枝对Transformer性能影响的论文。
荣誉与个人生活
Zhang是2022年AI期刊青年研究者奖和2023年Inflection AI创新奖学金的获得者。她居住在旧金山,是一位热衷的越野跑者和志愿者。她是第二代中国移民的女儿,持有美国国籍。
影响与持续工作
Zhang在GPT-3及后来的Anthropic模型上的工作帮助定义了深度学习应用的前沿。她的技术广度包括在损失函数、学习率调度和高级数据增强方法方面的专业知识。截至2024年,她是一名独立研究者和顾问,继续发表关于高效AI系统的研究。