英語からの翻訳

中国の起業家で、定量ヘッジファンドのHigh-FlyerからAI研究所DeepSeekを設立し、2025年初頭に世界のAI市場を揺るがした推論モデルDeepSeek-R1をリリースした人物。

梁文锋是中国企业家,也是DeepSeek的创始人,这是一家AI研究实验室,在2025年初因其发布的推理模型在报告的训练成本仅为西方领先系统一小部分的情况下,性能与之匹敌,从而引起国际关注。

梁文锋在中国接受电子与信息工程以及信息与通信工程教育,之后共同创立了幻方量化(High-Flyer),这是一家利用机器学习技术进行自动化交易的量化对冲基金。幻方量化早期对GPU基础设施的投资用于其交易模型,为梁文锋的团队提供了异常强大的内部计算资源和工程人才,他在2023年创立DeepSeek时将这些资源转向通用AI研究,作为由该基金资助的衍生项目。

DeepSeek-R1与市场冲击

DeepSeek在2023年和2024年发布了一系列开放权重的大语言模型,但公司的形象在2025年1月因发布DeepSeek-R1而急剧改变,这是一个通过大规模强化学习训练的推理模型,在数学和编程基准测试上与OpenAI的o1表现相当。DeepSeek发布了一份技术报告,描述了远低于行业对同类前沿模型估计的训练成本,并公开了模型权重,允许全球开发者下载和运行。这一公告引发了DeepSeek冲击,导致包括NVIDIA在内的AI相关股票大幅抛售,因为投资者质疑关于前沿AI进展所需计算基础设施支出的假设。

技术方法

梁文锋领导下的DeepSeek模型广泛使用了混合专家架构和注重效率的训练技术以降低计算成本,公司发布了异常详细的技术论文,相比之下西方实验室在竞争加剧时对训练方法的披露越来越少。梁文锋很少接受公开采访,但在少数采访中,他将DeepSeek的使命描述为追求通用AI能力研究本身,而非短期商业产品。

反响

梁文锋低调的公众形象与西方AI高管的显赫地位形成对比,在DeepSeek-R1发布后引起了媒体的广泛好奇,中国官方媒体和官员强调该公司是美国对先进芯片实施出口管制下中国AI能力的证据。西方评论员争论DeepSeek报告的训练成本是否完全代表总投资,同时普遍认为这一发布加速了全行业对高效训练和推理技术的兴趣。

カテゴリ:ai-industry·reasoning-models·china-ai
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴