梁文锋是中国企业家,深度求索(DeepSeek)的创始人。该公司是一家人工智能研究实验室,在2025年初因发布了一款推理模型而引发国际关注,该模型的性能可与西方顶级系统相媲美,而训练成本据称仅为后者的一小部分。
梁文锋在中国攻读电子与信息工程及信息与通信工程专业,后联合创立了幻方量化(High-Flyer),一家利用机器学习技术进行自动化交易的量化对冲基金。幻方量化早期对GPU基础设施的投资,使梁文锋的团队拥有了非同寻常的自主研发算力资源和工程人才,这为他后来在2023年创立DeepSeek并将研究重心转向通用人工智能提供了基础,而DeepSeek的启动资金也来自幻方量化。
DeepSeek-R1与市场冲击
DeepSeek在2023年至2024年间发布了一系列开源权重的大型语言模型,但该公司在2025年1月因发布DeepSeek-R1而声名鹊起。这是一款推理模型,通过大规模强化学习训练而成,在数学和编程基准测试中与OpenAI的o1模型表现相当。DeepSeek在技术报告中称,其训练成本远低于业界对同类前沿模型的估算,并将模型权重公开发布,使全球开发者均可下载使用。这一消息引发了“DeepSeek冲击”,导致包括英伟达在内的人工智能相关股票大幅下跌,投资者开始质疑前沿AI发展是否真的需要如此庞大的算力基础设施投入。
技术路线
在梁文锋的带领下,DeepSeek的模型广泛采用了混合专家架构和注重效率的训练技术,以降低计算成本。与西方实验室日益减少披露训练细节的做法不同,DeepSeek发布了极为详尽的技术论文。梁文锋很少接受公开采访,但在为数不多的访谈中,他表示DeepSeek的使命是追求通用人工智能的基础研究,而非短期商业产品。
外界反响
与西方AI高管的高调形象形成鲜明对比,梁文锋保持低调,这使他在DeepSeek-R1发布后引发了媒体极大的好奇。中国官方媒体和政府部门也将该公司视为中国在AI领域实力的体现,尽管美国对先进芯片实施了出口管制。西方评论人士则对DeepSeek所宣称的训练成本是否真实反映了全部投入展开辩论,但普遍认同该模型的发布加速了业界对高效训练和推理技术的关注。