距离中国AI大模型反超美国还剩6个月

两年前DeepSeek出来的时候,我说中国大语言模型性能很快会反超美国,当时嘲讽的声音震耳欲聋。

前两天Kimi K3发布,冲到AA排名第三的位置,跟第一二名的Claude Fable以及ChatGPT 5.6打得难解难分,某些细分领域已经实现领先。

现在说中国AI大模型还有半年就能超过美国,已经没什么人再有异议了。

而且,这还只是我们拿落后美国三代还被阉割的显卡做出来的成绩。

作为一个理工男创业者,我从来不盲目乐观,之所以有反超美国的判断,是因为我充分了解中国的智力资源优势。

只要实现了01,剩下就是工程优化,而这正是我们的甜区。

黑盒让人看着无从下手,只要拆解成白盒,一个细节一个细节攻克,世上也就无难事了。

之前我们拆解过芯片制造,又拆解了EUV光刻机,今天我们来拆解大语言模型,拆完你会发现,它远不如前面两个棘手。

第一步是数据采集与清洗,这是AI这顿饭的米。

数据主要是文本,包括网上的网页、书籍、论文、代码、社交媒体帖子等等。

简单说,凡是你能在网上看到的东西,都有可能被喂给模型。

数据采集团队会写爬虫程序,从互联网上抓取海量文本。

但问题来了,网上的数据99%都是垃圾,你随便打开一个网页,里面可能有广告、有乱码、有重复内容、有错误信息、有恶意代码。

如果模型吃了这些垃圾,它就会变成垃圾模型。

所以要把垃圾数据过滤掉,只留下高质量数据,这事由数据清洗团队来做。

去重,同一篇文章出现在多个网站,只保留一份。

去噪,去掉广告、导航栏、页脚、乱码。

去低质,去掉语法错误、拼写错误、无意义内容。

去敏感,去掉色情、暴力、仇恨言论、个人隐私。

分类,把数据按领域分类,比如科技、文学、数学、代码。

这其中有3个难点。

一是数据量太大,动辄十几万亿token,处理这么多数据,需要巨大的存储和计算资源。

二是数据质量难以保证,所谓高质量数据本身就是一个主观问题,所以需要复杂的算法和人工标注。

三是版权问题,即便网上的数据很多也是有版权的,OpenAI就被《纽约时报》起诉过侵权。

这个过程中数据采集团队负责写爬虫程序,数据清洗团队负责对抓取的数据进行清洗、去重、分类,数据标注团队负责对数据进行人工标注。

数据采集工程师年薪30-60万。

数据清洗工程师年薪25-50万。

数据标注员年薪10-20万人民币。

这是AI大厂里工资最低的一个团队了。

数据方面中美差距不大。

我们有14亿人,互联网数据量巨大,中文语料丰富。

爬虫技术、数据处理方面,有大量工程师,工程能力强。

但中国在高质量英文语料方面,相对不足,因为很多顶级学术论文、技术博客是英文的,中国公司获取这些数据需要额外成本。

第二步是模型架构设计,让AI长出脑子。

大语言模型的核心架构是TransformerTransformer的核心是自注意力机制。

简单说就是让模型在生成每个字时,能关注到输入文本中所有其他字,并给每个字分配一个权重。

它让模型能理解文本中的关系,这是大语言模型能读懂文本的关键。

架构设计团队通过4步完成设计。

先确定模型大小,参数数量、层数、头数、隐藏层维度。

然后选择架构变体,是使用标准的Transformer,还是使用MoE(混合专家架构)。

再然后设计注意力机制,是用标准的自注意力,还是优化版本。

最后设计位置编码,让模型知道每个字在句子中的位置。

架构设计中存在3个难点。

一是架构创新需要深厚的理论基础,Transformer架构虽然强大,但也有很多局限性,比如自注意力机制的计算量随着输入长度增加,计算量呈平方级增长,如何降低计算量这需要理论创新。

二是平衡性能与成本,更大的模型,性能更好,但训练成本更高,如何用更少的参数实现更好的性能,需要精巧的架构设计。

三是可扩展性,当模型规模扩大时,训练和推理的效率不能下降太多,这需要设计并行化策略,让模型能在数千个GPU上高效训练。

架构研究团队负责研究新的模型架构,发表论文,提出创新,架构工程团队负责将研究团队的架构设计,实现为可运行的代码。

架构研究员年薪80-200万。

AI工程师年薪60-150万。

他们是AI行业里薪酬最高的岗位,因为需要顶尖的学术背景和创新能力。

架构设计是我们主要在追赶美国的领域。

毕竟Transformer架构、自注意力机制等核心技术,都诞生在美国。

他们在基础研究上,有更深厚的历史积累。

但以中国人的智力,这种需要动脑子的领域追赶起来都很快,例如DeepSeekMLAMoE架构,都是中国团队的创新。

第三步是预训练,也就是教育AI的过程。

让模型学习语言基本规律的过程,学会猜下一个字。

预训练数据通常是无标注的,模型通过自监督学习来训练。

这个阶段,模型需要处理海量数据,消耗大量算力。

预训练需要5步。

配置训练集群,数千个GPU连接在一起,形成超级计算机。

编写训练代码,使用深度学习框架编写训练代码。

启动训练任务,将数据分批喂给模型,让模型不断优化参数。

监控训练过程,实时监控损失函数、学习率、梯度等指标,确保训练正常。

保存检查点,定期保存模型参数,防止训练中断导致前功尽弃。

难点有4个。

一是算力需求巨大,即便并行训练也要使用数千个GPU同时进行几个月。

二是训练不稳定,损失函数可能突然飙升,梯度可能爆炸,模型可能崩溃,需要不断调整参数,才能让训练稳定进行。

三是成本高,不过DeepSeek使用MoE架构和高效训练方法,倒是大大降低了成本,说明这里还有很大空间。

四是硬件限制,美国对我们实施了芯片出口管制,限制了中国公司获取高端GPU的能力,这也是我们目前最大瓶颈。

预训练团队负责编写训练代码、配置集群、启动训练、监控过程,基础设施团队负责维护GPU集群、网络、存储等硬件设施。

预训练工程师年薪60-150万。

基础设施工程师年薪50-120万。

薪资仅次于架构团队,尤其基础设施工程师,随着算力快速增长,目前严重供不应求。

这方面美国大幅领先。

毕竟他们可以自由获取NVIDIA最新的GPU,疯狂砸钱,算力储备也多。

但随着华为Atlas 950超节点今年4季度上市,高达8000多卡集成的变态集群,将在很大程度上突破算力瓶颈。

第四步后训练,对AI的专业培训。

预训练之后,模型已经学会了语言的基本规律,但它还不会回答问题。

所以,需要后训练让模型学会遵循指令,生成有用的内容。

这个过程有两个阶段。

一是有监督微调SFT,用人工标注的高质量数据对模型进行调教。

二是强化学习RL,通过奖励机制,让模型学会什么是对的、什么是错的。

SFT需要收集大量问题和答案对QA,让模型学习这些QA,学会如何回答问题。

RL让模型生成多个答案,人类评价哪个答案更好,让模型学会生成更好的答案。

后训练有3个难点。

一是需要大量人工标注,SFT需要人工标注的QA,人类辅助RL需要人类评价模型的答案,都需要大量的人力,成本高昂。

二是如何定义哪个答案好,不同人有不同标准,让模型学会人类偏好需要复杂的奖励模型设计。

三是安全性,防止模型生成有害、偏见、错误的内容,这需要严格的安全训练,包括内容过滤、对抗性测试等。

后训练团队负责设计SFTRL训练流程,数据标注团队负责标注SFT数据和RLHF反馈,安全团队负责测试模型的安全性,防止生成有害内容。

后训练工程师年薪60-150万。

安全工程师年薪50-120万。

后训练中美差距不大。

训练技术相对成熟,掌握了SFTRLHF的核心方法剩下就是执行了。

执行方面我们在数据标注方面,有成本优势。

但在安全性研究方面,美国仍然领先。

第五步评估与测试,这是AI的毕业考试。

模型训练完成需要评估性能,评估分为3种。

一是基准测试,在标准数据集上测试模型的表现。

二是人工评估,让人类评价模型生成的答案。

三是安全测试,测试模型是否会生成有害内容。

评估团队会使用各种基准测试。

例如MMLU(大规模多任务语言理解),测试模型在57个学科上的知识,GSM8K(小学数学推理)测试模型的数学推理能力,HumanEval(代码生成)测试模型的代码生成能力。

这个过程有3个难点。

一是基准测试可能被刷榜,模型通过记忆测试数据,来提高得分,防止作弊需要设计更复杂的测试方法。

二是人工评估主观性强,需要严格的评估流程保证人工评估的一致性。

三是安全测试难以穷尽,一个模型可能在某些场景下安全,在另一些场景下不安全,需要大量的测试用例全面测试模型的安全性。

评估团队负责设计测试流程,运行基准测试,分析结果,安全测试团队负责测试模型的安全性。

评估工程师和安全测试工程师年薪都在50-120万。

评估测试方面中美差距不大。

评估方法相对成熟,我们已经掌握了核心方法,但在安全测试方面,美国仍然领先。

第六步推理部署,AI终于要上岗了。

模型训练完成后,需要部署到服务器上,供用户使用。

推理部署,就是让模型跑起来,为用户提供服务。

这个过程需要4步。

先做模型优化,对模型进行量化、蒸馏、剪枝,降低模型大小和推理成本。

然后将模型部署到GPU服务器上。

再然后配置API,提供API接口,让用户可以通过网络调用模型。

最后配置负载均衡,确保大量用户同时使用时,系统不会崩溃。

这个过程中有3个难点。

一是推理成本高,但也分模型,国产大模型的成本普遍只有美国的1/10

二是推理速度,用户希望模型能快速回答,速度取决于模型大小、硬件配置、优化技术。

三是可靠性,部署后需要保证7x24小时稳定运行,需要强大的运维能力防止模型崩溃。

推理部署团队负责模型优化、部署、运维,基础设施团队负责维护GPU服务器、网络、存储。

推理部署工程师年薪50-120万。

运维工程师年薪40-100万。

这方面是我们领先美国。

在工程能力上,我们是世界顶级。

我们的工程师擅长优化,能用更少的资源,实现更好的效果。

第七步迭代与更新,让AI终身学习。

模型部署后,并不意味着一劳永逸。

用户会反馈问题,模型会暴露缺点,新的数据会不断产生。

所以,需要不断迭代和更新模型。

迭代团队会做4件事。

收集用户反馈,分析用户的使用数据,找出模型的缺点。

从互联网上抓取新的数据,更新训练集。

用新数据重新训练模型,或者对模型进行微调。

最后将新版本的模型部署上线。

这里面有3个难点。

一是如何构建数据飞轮,让用户的使用数据反过来改进模型。

二是防止模型退化,新数据可能包含新的错误,或者模型学会了不好的模式,需要严格的测试和监控防止模型退化。

三是版本管理,这需要完善的版本管理制度和A/B测试流程。

迭代团队负责收集反馈、更新数据、重新训练,产品团队负责分析用户需求,定义迭代方向。

迭代工程师年薪50-120万。

产品经理年薪40-100万。

这方面依然是中国略领先。

毕竟我们的市场竞争激烈,倒逼公司快速迭代。

说到卷,没人能卷得过我们。

总结起来,训练大语言模型就像养娃。

数据是食物,架构是基因,预训练是教育,后训练是专业培训,推理部署是上岗,迭代是终身学习。

每一步,都需要顶尖的人才、海量的资金、强大的算力。

美国在AI领域起步更早,积累了更多的经验、数据、算力、生态。

我们在AI领域起步较晚,但正在快速追赶。

从目前的情况看,中国在工程能力、成本控制、快速迭代上,已经追平甚至超越了美国。

但在基础研究、算力储备、生态建设上,仍然有差距。

最主要的瓶颈其实还是算力,这一项因素对模型性能影响占到超过一半。

好消息是,新的国产大模型都在适配国产算力,尤其这次WAIC上再次亮相的华为Atlas 950超节点,一旦在20264季度如期上市,将一举扭转我们小米加步枪的局面。

当年抗美援朝,我们小米加步枪对美国的飞机加坦克,依然把他们赶回三八线以南,不过自己也落下了火力不足恐惧症的病根,所以有了中国今天的导弹、军舰、六代机大爆发。

如今AI大模型我们用落后几代的显卡,患上了算力不足恐惧症,可依然还是会反超美国,接下来就轮到算力爆发的剧情了。

但不要高兴得太早,大语言模型不是重点,应用层的盈利点才能让整个AI商业模式闭环,现在看起来并不乐观,未来AI会如何发展?请阅读《AI科技牛终局》

虽然未来在中国,但千万别贸然进场一头扎进AI概念,中国真正的护城河不在科技,而在核心资产,如果你非要进,请先仔细阅读《资产配置详细方案》,否则我劝你戒赌。

图片
我的新书《善战》,以兵法突破认知,读了就停不下来……