95后研究员年薪亿元出走字节,新模型屡次难产:DeepSeek怎么了?

问AI · DeepSeek核心人才为何集体转向大厂高薪职位?

文|董文

编辑|宋辰


DeepSeek核心AI研究员郭达雅,以年薪亿元的身价正式入职字节跳动Seed团队的消息落地,整个大模型圈的目光再次聚焦到这家曾经风光无限的创业公司身上。

这位95后技术核心的离职与再就业,本是行业人才流动中的寻常一幕,却因为天文数字般的薪水,以及发生在DeepSeek新一代旗舰模型V4迟迟未能面世的关键节点,而被赋予了更多神秘的意味。

郭达雅并非近期DeepSeek离职的首个技术大牛。在他之前,王炳宣、魏浩然、阮翀等核心技术人员也已离开,四人覆盖了DeepSeek 最核心的四条技术主线——多模态推理/代码基座大模型OCR(文本识别)。


 该图片使用了AI生成技术图片


当技术天才接连离去、新一代旗舰模型V4数次跳票、线上平台突发长时间宕机,这家曾被寄予厚望的大模型明星公司,站到了技术理想与商业现实、人才流失与战略转型的十字路口。

从横空出世到陷入困局,仅仅两年时间,DeepSeek经历了从国产AI之光到争议缠身的剧烈转折。DeepSeek的困境,折射出中国大模型行业在狂飙突进后,集体面临的成长阵痛。


大咖科技

 Tech Chic

突如其来的“技术地震”

2023年成立的DeepSeek,依托幻方量化的资金实力与顶尖科学家团队,迅速成为国产大模型赛道上的一匹黑马。

从初代模型惊艳亮相,到R1在推理上比肩国际顶尖水平,DeepSeek一度被视作对抗GPT-4的重要力量,资本与市场关注度一路走高。

但2025年下半年开始,DeepSeek骤然陷入沉寂。

原定密集发布的新一代模型频频跳票。比进度滞后更引人关注的是核心技术团队的大规模流失,多位从V1模型到R1模型全程参与的顶尖人才相继离职,有的被大厂高薪挖走,有的转向其他赛道创业。

最新离开的郭达雅深度参与了从V系列模型到R1等关键版本的研发工作,尤其在推理、代码能力等DeepSeek赖以成名的技术方向上扮演了关键设计者的角色。

对于高度依赖顶层架构设计与核心算法突破的大模型项目而言,郭达雅这样的人才一旦离开,带来的不仅是人员空缺,更是技术路线、工程经验与研发节奏的断层,是公司一次难以快速弥补的技术损失。而这样的人才,DeepSeek半年内就走了四个。

大模型研发并非简单的流水线工程,一个核心人物的思路、判断与经验,往往贯穿训练、微调、对齐、工程优化等全流程。新人接手,不仅需要时间熟悉代码与架构,更要重新理解模型设计的底层逻辑,这直接导致了关键项目的节奏被打乱。


图片


对一家高度依赖核心技术天才的AI初创公司而言,这样的人员动荡几乎等同于“技术地震”。人才出走不仅带走了关键研发经验,也直接打乱了模型迭代节奏,外界对其技术稳定性与内部管理的质疑声随之四起。

屋漏偏逢连夜雨,敏感时期DeepSeek线上服务又出现长时间宕机,大量企业客户受影响,进一步加剧了市场担忧。曾经一路高歌的明星公司,突然走到了舆论的风口浪尖。

DeepSeek的核心人才流失,并非简单的行业挖角,而是理想主义与现实压力碰撞后的必然结果。

这群年轻的技术天才,最初被DeepSeek纯粹的科研氛围吸引。公司一度推行极简管理、弱化KPI,梁文锋希望打造一个不受商业干扰的技术理想国,让科学家专注于冲击AGI与全球顶尖模型性能。这种环境在早期激发出惊人创造力,也让团队对技术本身抱有极高期待。

但变化来得猝不及防。一方面,国内互联网大厂开出数倍薪资与丰厚期权,对核心人才形成难以抗拒的吸引力。同等强度的工作,在大厂能获得更明确的职业路径与更确定的收益,情怀在悬殊的价码面前逐渐失去说服力。

更深层的矛盾来自公司战略的突然转向。

随着外部芯片环境收紧与自主可控要求提升,DeepSeek放弃成熟的英伟达架构,全面转向国产算力适配。

据悉,DeepSeek V4模型将首次实现与华为昇腾等国产芯片的深度适配。这标志着中国AI产业在摆脱对国外技术生态依赖、推进去CUDA化进程中迈出了具有里程碑意义的关键一步。

但这同时也意味着DeepSeek核心团队此前大量研发成果需要推翻重来。对于追求技术巅峰的科学家而言,这不仅仅是工作量的陡增。当理想中的AGI探索变成繁重的适配工程,离开或许也就成了意料之中的选择。

大咖科技

 Tech Chic

公司组织与战略之困

产品延期叠加核心人才变动,外界很自然地将两者关联,进而对DeepSeek的持续研发能力产生怀疑。对比同期崛起的竞品,DeepSeek的这种“落差”显得更为明显。

智谱AI今年1月8日完成公开上市后,在资本市场的加持下持续加大研发投入,模型能力与商业化同步推进;Kimi在长文本理解与专业场景体验上建立了鲜明壁垒,用户粘性与商业变现路径日渐清晰。

这些AI大模型公司有的登陆资本市场获得充足“弹药”,有的在垂直场景赚得盆满钵满,而DeepSeek却仍在模型迭代与人才稳定的泥潭中挣扎。这种对比,让市场上出现了“DeepSeek是否昙花一现”的讨论。

模型迭代速度就是生命线,一旦长期没有重磅产品面世,用户注意力与行业关注度就会迅速被竞品吸引,技术口碑也会随之淡化。早期依靠惊艳表现建立起来的领先优势,如果不能持续通过新版本巩固,很容易在激烈竞争中被稀释甚至反超。

深层剖析V4模型的屡次跳票,表面是技术进度问题,本质是DeepSeek在战略切换与组织管理上的系统性困境。

为了实现代际突破,同时适配全新的国产算力平台,DeepSeek选择对模型架构进行激进升级,从参数规模到上下文窗口再到多模态能力,都提出极高目标。

这相当于在高速推进中彻底重构模型,训练难度、工程复杂度成倍上升,再加上国产芯片生态尚不完善,适配、集群稳定性还需时间,直接导致V4的发布时间一推再推。


图片


比技术挑战更棘手的是组织能力的脱节。DeepSeek长期依赖高度扁平化的管理模式,创始人梁文锋一人主导关键技术决策,项目推进高度依赖核心天才。

小团队阶段,这种模式高效灵活;但随着公司扩张、人才流失、攻坚任务加重,组织立刻暴露出短板。核心人员缺位后,技术方向难以快速统一,决策链条拉长,原本顺畅的研发节奏可能会被打乱。

DeepSeek的困境,也是许多中国AI创业公司的缩影:依靠天才与资本快速起量,却在规模扩张、外部环境剧变时,暴露出短板。

中国大模型在经历两年狂飙后,正从单纯比拼模型参数、追求速度,转向更务实的自主可控、商业落地与组织建设。

天才出走、模型难产,让DeepSeek从巅峰骤然承压。对它来说,V4模型不仅是一次版本升级,更是一场重建市场信心的背水一战。

最新消息是,梁文锋在内部会议确认4月下旬将发布V4模型,希望这一次不再跳票。V4模型的表现究竟会怎样,也将直接决定这家明星公司的下一程。