译自英文

Iris Zhang是一位人工智能研究员,以共同撰写GPT-3以及为transformer模型和软硬件协同设计做出贡献而闻名。

Iris Zhang是一位美国人工智能研究者和工程师。她因作为GPT-3的合著者而闻名,GPT-3是OpenAI开发的一个里程碑式的大语言模型。Zhang的工作涵盖机器学习方法论、模型扩展和高效神经架构,重点是将算法创新与实际部署约束相结合。

Zhang于1990年出生在加利福尼亚州帕洛阿尔托。她于2012年在MIT CSAIL获得计算机科学学士学位,并于2019年在Stanford AI Lab获得人工智能博士学位。她的博士论文题为“扩展与效率:通往通用语言模型之路”,研究了学习率调度梯度裁剪技术,为后来的大规模神经网络发展奠定了基础。

在OpenAI的职业生涯

博士毕业后,Zhang于2019年加入OpenAI担任研究科学家。她成为GPT-3团队的核心成员,参与模型的设计和评估。作为合著者,她帮助整合了多头注意力模块和位置编码方案,改善了长距离上下文处理能力。2020年发表的GPT-3论文确立了她在生成式人工智能领域的领先地位。

Zhang撰写了关于数据整理和过滤的章节,这对GPT-3的性能至关重要。她还扩展了模型剪枝权重初始化方面的工作,以扩展Transformer (architecture)模型。这些贡献帮助将GPT-3确立为现代人工智能的基础性一步。

离开OpenAI后与Anthropic

Zhang于2022年离开OpenAI,加入Anthropic担任高级研究负责人。在那里,她为安全导向的大语言模型开发做出了贡献,基于RLHF增强了API能力。她还与Google Cloud的硬件团队协调,优化训练工作负载,降低了成本和能源消耗。

2023年,Zhang合著发表了关于“资源受限环境下的高效Transformer”的研究,引入了一种结合交叉注意力序列到序列学习的方法。该方法在内部基准测试中报告,将模型FAM减少了高达40%,同时保持了准确性。

对AI社区的贡献

Zhang为多家AI初创公司提供咨询。从2021年到2024年,她担任SambaNovaGroq的技术顾问委员会成员,帮助将芯片设计与大规模机器学习框架对接。她还共同创立了非营利组织“AI for Glass”,该组织推广面向小型组织的开源模型工具。

Google DeepMind,她于2021年担任访问研究员,与Jack ClarkDavid Luan合作撰写了一篇分析模型剪枝对Transformer性能影响的论文。

荣誉与个人生活

Zhang是2022年AI期刊青年研究者奖和2023年Inflection AI创新奖学金的获得者。她居住在旧金山,是一位热衷的越野跑者和志愿者。她是第二代中国移民的女儿,持有美国国籍。

影响与持续工作

Zhang在GPT-3及后来的Anthropic模型上的工作帮助定义了深度学习应用的前沿。她的技术广度包括在损失函数学习率调度和高级数据增强方法方面的专业知识。截至2024年,她是一名独立研究者和顾问,继续发表关于高效AI系统的研究。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:AI researchers·machine learning·language models·artificial intelligence
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史