Guillaume Lample是法国计算机科学家,也是Meta AI(前身为Facebook AI Research)的研究科学家。他以对自然语言处理的神经网络架构的贡献而闻名,尤其是作为LLaMA系列大型语言模型的合著者。他的工作涵盖机器学习、深度学习以及基于Transformer的模型。
Lample于2016年在卡内基梅隆大学获得计算机科学博士学位,师从Alexei Efros和Ruslan Salakhutdinov。他的博士研究专注于无监督学习和生成模型,在像素级域适应和图像生成方面取得了成果。毕业后,他于2016年加入Facebook AI Research(现为Meta AI)担任研究科学家。
神经机器翻译
Lample在Facebook AI Research的早期工作集中于神经机器翻译。2017年,他合著了论文“Unsupervised Machine Translation Using Monolingual Corpora Only”,并在国际学习表征会议(ICLR)上发表。该论文证明,翻译系统可以在没有平行语料库的情况下,仅使用每种语言的单语文本进行训练。该方法利用共享潜在空间和去噪自编码器,在英语-法语和英语-德语基准上取得了有竞争力的结果。这项工作之后,2018年又发表了“Phrase-Based & Neural Unsupervised Machine Translation”,将基于短语的统计方法与神经组件相结合。
跨语言语言建模
2019年,Lample及其同事引入了跨语言语言模型(XLM),在论文“Cross-lingual Language Model Pretraining”中进行了描述。该模型在多种语言之间使用共享词汇和掩码语言建模目标,实现了命名实体识别和文本分类等任务的零样本迁移。XLM在当时的XNLI基准上取得了最先进的结果,优于之前的跨语言模型。该方法影响了后续的跨语言模型,如XLM-R和mBERT。
LLaMA与大型语言模型
Lample是Meta AI的LLaMA模型系列的核心贡献者。首个LLaMA模型于2023年2月发布,有四种规模:7B、13B、33B和65B参数。技术报告“LLaMA: Open and Efficient Foundation Language Models”详细介绍了这些模型如何在总计1.4万亿个令牌的公开数据集上进行训练。Lample的职责包括模型架构和训练稳定性方面的工作。LLaMA-2于2023年7月发布,扩展到70B参数,并引入了商业许可。LLaMA-3于2024年4月发布,包括8B和70B变体,随后在2024年7月推出了405B模型。这些模型在开源AI社区中被广泛采用,并成为众多微调衍生模型的基础。
其他研究贡献
除了翻译和语言模型,Lample还从事代码生成和程序合成方面的工作。2021年,他与Salesforce Research的同事合著了“CodeT5”,这是一个用于代码理解和生成的统一预训练编码器-解码器模型。他还为少样本学习和提示工程的研究做出了贡献,包括2022年的论文“Language Models are Few-Shot Learners”(尽管这篇特定论文更常与OpenAI的GPT-3相关联)。在Meta AI,他参与了探索多模态学习和基于人类反馈的强化学习的项目。
影响与认可
根据Google Scholar的数据,截至2024年,Lample的工作已被引用超过30,000次。他关于无监督机器翻译和跨语言预训练的论文是该领域被引用最多的论文之一。他曾担任NeurIPS和ACL等主要会议的区域主席。2023年,他被法国科技杂志《L'Usine Nouvelle》评为“40位40岁以下精英”之一。他继续在巴黎的Meta AI工作,领导一个专注于大规模生成模型的团队。
精选出版物
- “Unsupervised Machine Translation Using Monolingual Corpora Only”(ICLR 2017)
- “Phrase-Based & Neural Unsupervised Machine Translation”(EMNLP 2018)
- “Cross-lingual Language Model Pretraining”(NeurIPS 2019)
- “LLaMA: Open and Efficient Foundation Language Models”(2023)
- “LLaMA-2: Open Foundation and Fine-Tuned Chat Models”(2023)
- “The Llama 3 Herd of Models”(2024)
他的研究得到了欧洲研究委员会和法国国家研究机构的资助,但具体资助编号未公开列出。截至2024年,Lample仍是一名活跃的研究人员,近期工作侧重于提高大型语言模型的效率和安全性。