译自英文

中国企业家,创办了人工智能实验室DeepSeek,该实验室脱胎于量化对冲基金幻方量化,并发布了DeepSeek-R1推理模型,该模型在2025年初引发了全球AI市场的动荡。

梁文锋是中国企业家,深度求索(DeepSeek)的创始人。该公司是一家人工智能研究实验室,在2025年初因发布了一款推理模型而引发国际关注,该模型的性能可与西方顶级系统相媲美,而训练成本据称仅为后者的一小部分。

梁文锋在中国攻读电子与信息工程及信息与通信工程专业,后联合创立了幻方量化(High-Flyer),一家利用机器学习技术进行自动化交易的量化对冲基金。幻方量化早期对GPU基础设施的投资,使梁文锋的团队拥有了非同寻常的自主研发算力资源和工程人才,这为他后来在2023年创立DeepSeek并将研究重心转向通用人工智能提供了基础,而DeepSeek的启动资金也来自幻方量化。

DeepSeek-R1与市场冲击

DeepSeek在2023年至2024年间发布了一系列开源权重的大型语言模型,但该公司在2025年1月因发布DeepSeek-R1而声名鹊起。这是一款推理模型,通过大规模强化学习训练而成,在数学和编程基准测试中与OpenAI的o1模型表现相当。DeepSeek在技术报告中称,其训练成本远低于业界对同类前沿模型的估算,并将模型权重公开发布,使全球开发者均可下载使用。这一消息引发了“DeepSeek冲击”,导致包括英伟达在内的人工智能相关股票大幅下跌,投资者开始质疑前沿AI发展是否真的需要如此庞大的算力基础设施投入。

技术路线

在梁文锋的带领下,DeepSeek的模型广泛采用了混合专家架构和注重效率的训练技术,以降低计算成本。与西方实验室日益减少披露训练细节的做法不同,DeepSeek发布了极为详尽的技术论文。梁文锋很少接受公开采访,但在为数不多的访谈中,他表示DeepSeek的使命是追求通用人工智能的基础研究,而非短期商业产品。

外界反响

与西方AI高管的高调形象形成鲜明对比,梁文锋保持低调,这使他在DeepSeek-R1发布后引发了媒体极大的好奇。中国官方媒体和政府部门也将该公司视为中国在AI领域实力的体现,尽管美国对先进芯片实施了出口管制。西方评论人士则对DeepSeek所宣称的训练成本是否真实反映了全部投入展开辩论,但普遍认同该模型的发布加速了业界对高效训练和推理技术的关注。

分类:ai-industry·reasoning-models·china-ai
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史