谷歌与谷歌DeepMind联合出手:让AI在漫长的“进化之旅”中越走越聪明

问AI · 这项研究是否预示AI能自主优化复杂问题求解?

这项由谷歌与谷歌DeepMind、威斯康星大学麦迪逊分校联合开展的研究,以预印本形式发布于2026年5月,论文编号为arXiv:2605.07039,有兴趣深入了解的读者可通过该编号查询完整论文。

**一、当AI开始"摸着石头过河"**

有一类问题,答案不是查出来的,而是一点一点"试"出来的。比如你想设计一个让蛋白质更稳定的分子结构,或者找到一种让服务器分配任务更均衡的算法,再或者搭建一个能更精准猜到你下一步想看什么视频的推荐系统。这些问题没有标准答案,甚至连"好不好"都要跑一遍才知道,往往费时费力。

近年来,研究人员开始让大型语言模型(也就是那种能写文章、写代码的AI)来承担这种"边试边改"的工作。基本流程是:AI看一眼现在最好的方案,提出一个修改意见,改完之后跑一跑测试,看看有没有变好,然后把更好的那个留下来,再重复这个过程。这套流程被称为"进化搜索",就像生物进化一样,一代一代地筛选出更优秀的后代。

这套思路已经在数学发现、算法设计等领域取得了令人印象深刻的成绩。谷歌的AlphaEvolve就用这种方式在矩阵乘法、圆填充等经典难题上刷新了纪录。然而,问题也随之而来:大多数进化搜索系统,AI的"决策风格"从头到尾都是固定的,它并不会从一次次失败和成功的尝试中真正学到什么教训,只是机械地重复同一套提问策略。换句话说,搜索经验可以积累,但这些经验并没有被真正"内化"进AI的判断里。

这就像一个棋手,每局结束后会把对局记录存档,但从不复盘,下一局还是照旧发挥——历史就在眼前,却没有被真正消化成棋感。

这篇论文提出的PACEvolve++,就是为了解决这个问题而生的。

**二、把"导演"和"演员"分开**

为了让AI能在搜索过程中真正学会"什么方向值得试",研究团队提出了一个颇为巧妙的设计:把"决定试什么"和"具体怎么写代码"这两件事,交给两个不同的AI来做。

负责"决定试什么"的叫做顾问模型(Advisor Model),是一个参数量较小、但可以通过强化学习不断调整决策偏好的模型。它的工作是在每一轮搜索开始时,结合当前最优方案、过去的搜索历史和失败记录,先头脑风暴出三个候选方向,然后对它们进行新颖性评估,最后挑选出一个最有潜力的方向,以自然语言的形式描述出来。

负责"具体怎么写代码"的,则是一个更强大的前沿代码模型(如谷歌的Gemini系列)。它接收顾问给出的方向描述,将其翻译成真实可运行的代码。

这种分工设计背后有一个很实际的考量。在复杂的机器学习工程任务中,一个只有四五十亿参数的小模型,往往没有能力可靠地把一个复杂的研究思路完整地实现出来——代码会报错,逻辑会出漏洞,结果就是你根本搞不清楚"这次失败是因为想法本身不好,还是因为代码写错了"。当训练信号被实现质量所污染,AI就很难学会真正有价值的搜索判断。

把这两件事分开,就能让强化学习专注于训练"想法的质量",而不是被代码能力的高低带偏。顾问模型学到的,是"在这类问题里,什么样的方向往往能带来突破"这种隐性的搜索直觉,而不是如何正确地调用某个Python库。

**三、进化搜索的两种"状态",需要两种不同的激励**

把顾问模型和代码模型分开,只是解决了"谁来学习"的问题。更难的问题是:这个顾问模型,应该怎么从搜索过程中获取反馈、进行学习?

强化学习的核心逻辑是:做了某个决定之后,如果结果好,就增强这个决定的概率;如果结果差,就减弱它。但在进化搜索这种场景里,"结果好不好"的含义会随着时间发生根本性的变化。

可以用一场登山比赛来理解这件事。刚出发时,各个队伍走的路线差异很大,有人走山脊,有人沿溪谷,彼此之间高度差异显著。这个阶段,你很容易看出哪条路线更有前途,反馈信号非常清晰。但当大家都接近山顶时,各路队伍挤在同一个区域,彼此之间相差不过几十米,这时候微小的海拔差异,很大程度上是测量误差造成的。如果还用"谁高就奖励谁"的简单逻辑,反而会制造混乱。

进化搜索中的奖励信号,正是这样一个先宽后窄、先清晰后模糊的过程。早期,不同候选方案在机制和质量上差异悬殊,传统的"组内相对打分"方法(GRPO)很管用——把这一轮所有尝试的得分拉出来,去掉均值、除以标准差,就能得到一个清晰的好坏信号。但到了后期,当所有方案都已经是当前最佳方案的微调版本时,奖励分数几乎挤在一起,组内相对打分法就会把微小的数值差异放大成夸张的梯度信号,导致训练不稳定,就像把显微镜下的噪点当成真实特征来学习。

另一方面,一些研究用了"最大化前k个结果"的目标(PKPO),这种方法专注于让最好的那几个候选方案脱颖而出,但它的问题是太早就把资源押注在少数几个方向上,导致探索多样性过快崩溃——相当于登山队还没到半山腰就全挤进同一条路,万一这条路走不通,就没有退路了。

研究团队对这两种问题都有清晰的诊断,他们用实验图像展示了这种失稳的具体表现:在训练过程中,基线方法的策略熵(衡量探索多样性的指标)会急剧下跌或剧烈震荡,梯度的更新幅度也会出现突刺式的飙升,这些都是训练出了问题的典型信号。

**四、相位自适应强化学习:在对的时刻用对的尺子**

针对上述困境,研究团队设计了一套他们称之为"相位自适应强化学习"的训练方法。核心思想是:在搜索的不同阶段,用不同的方式给顾问模型打分。

在搜索早期,也就是各方案差异还比较大的探索阶段,使用"组内原始相对得分"作为信号,也就是把每个候选方案的得分减去这一轮的平均分,保留一个直接反映相对好坏的信号,而不对其进行额外的归一化压缩。同时,研究团队借鉴了另一项工作(DAPO)中的"不对称裁剪"技术,让那些出现概率较低但结果不错的探索方向,仍然能获得足够的正向激励,避免模型过早地排斥小概率但有价值的尝试。

在搜索后期,也就是各方案分数已经非常接近的精炼阶段,使用一种叫做"SLOO前沿贡献信号"的方法。这种方法的逻辑是:与其问"你这次比平均水平高了多少",不如问"如果随机抽取k个候选方案,你在里面有没有贡献了那个最高分"。换句话说,奖励的不是相对的高低,而是"是否改变了当前最优前沿"。这种信号对奖励的绝对大小不敏感,即使所有方案的分数挤在一起,它依然能识别出真正带来突破的那个方案。

这两个阶段对应的两种信号,被设计为在整个训练过程中线性混合:最开始完全使用组内相对信号,然后随着搜索推进,逐渐增大前沿贡献信号的权重,到训练结束时完全依赖后者。这个过渡不是突然切换,而是平滑连续的,就像调光旋钮从一种灯光渐渐过渡到另一种灯光。

为了避免两种信号的数值范围差异造成训练不稳定,研究团队在混合之前,还会对每种信号分别进行标准化处理,把它们拉到同一个尺度上,再按比例相加。当某个信号的方差低于一个极小的阈值——意味着这个信号已经退化成了纯粹的数值噪声——系统会直接跳过这一轮的梯度更新,而不是用噪声来污染模型参数。

研究团队还为这套方法提供了一个数学上的严格论证(Theorem 1),证明了无论奖励因为搜索收敛而被压缩到多小,经过标准化后,两种信号都能维持一个有界的、有意义的信用分配结构,不会因为奖励尺度的变化而失效。

**五、为任务量身打造的奖励换算表**

进化搜索需要同时处理各种不同类型的任务,有的目标是越大越好(比如推荐系统的命中率),有的目标是越小越好(比如负载均衡的最大设备压力),不同任务的数值范围也天差地别。如果直接把这些原始数值塞进强化学习训练,就像用同一把尺子同时量体重和身高,注定乱套。

为此,研究团队设计了一套"进度归一化奖励"机制,把每个任务的当前得分,换算成一个0到1之间的"进步比例"——0代表初始状态,1代表目标状态——然后再线性映射到0到5的奖励区间。如果某次评估运行失败或者产生了无效结果,就直接赋予-1的惩罚分数。这样,不管面对的是什么任务、什么指标,训练信号都在同一个尺度上,模型可以稳定地从中学习。

**六、三个真实世界任务上的实战检验**

研究团队在三个来自真实工业和科研场景的任务上,对PACEvolve++进行了系统测试,并与多个基线方法进行了比较。

第一个任务叫做"专家并行负载均衡"(EPLB),来源于DeepSeek公司的混合专家模型(MoE)服务系统。这类模型在运行时,会把不同的任务分配给不同的"专家"子网络,如何把这些专家分配到不同的计算设备上,让每台设备的工作量尽可能均匀,同时让分配算法本身跑得足够快,是一个纯粹的算法设计问题。AI在这里需要自动发现一套高效的分配策略,评估指标是均衡性和速度的算术平均。

第二个任务是"序列推荐",具体是在KuaiRec数据集(来自快手短视频平台,包含约7176个用户、10728个内容项目和1250万条交互记录)上,进化出一个更好的"下一个视频推荐模型"。AI可以改动的范围包括序列特征的构建方式、编码器的架构设计、评分模块的逻辑等,评估指标是NDCG@10、命中率@10和MRR的均值,每次评估需要完整训练模型16轮,最长允许20分钟。

第三个任务叫做"蛋白质适应度预测"(Multi-Evolve),来自一篇发表在《科学》杂志上的真实研究。蛋白质在多个位点同时发生突变时,如何预测这种组合突变对蛋白质功能的影响,是蛋白质工程中的核心难题。实验设定是:AI只能看到单点突变和双点突变的训练数据,然后预测三个或更多位点同时突变的结果。评估指标是皮尔逊相关系数和Precision@5的加权组合。

在这三个任务上,所有方法都运行在同一套PACEvolve搜索框架内,区别只在于训练顾问模型时使用的强化学习算法不同,测试了ThetaEvolve使用的GRPO、TTT-Discover使用的熵加权目标、纯PKPO(即Max@k)、以及无强化学习的基线,最后与PACEvolve++进行对比。测试使用了两种规模的开源模型:Qwen3.5-4B和DeepSeek-R1-0528-Qwen3-8B,代码实现则统一交给Gemini来完成。

结果显示,PACEvolve++在三个任务上都取得了最高的最终得分,且收敛速度最快。在负载均衡任务上,PACEvolve++和无强化学习的基线最终都达到了接近最优的饱和解,但前者只用了后者一半的迭代次数。在推荐系统和蛋白质预测任务上,PACEvolve++收敛到了比所有基线都更高的性能水平。辅助诊断指标的表现同样清晰:ThetaEvolve在训练后期频繁出现梯度范数的尖峰式飙升,最高峰值超过4,印证了奖励压缩后方差爆炸的问题;Max@k的策略熵从约1.0单调下跌至0.4以下,表明探索多样性过早崩溃;TTT-Discover的训练过程则在多个任务上出现了熵值的急剧崩溃。相比之下,PACEvolve++的梯度范数始终维持在1附近的窄带范围内,策略熵也保持在比Max@k高得多的水平,整个训练过程平稳而有序。

从分项指标来看,各方法找到的最优方案在不同维度上各有侧重。比如在负载均衡任务里,有的方法找到了更均衡但稍慢的方案,有的找到了更快但略不均衡的方案,说明各方法探索的是同一个帕累托前沿上的不同位置。PACEvolve++在综合得分上领先,但并不在每一个单项指标上都占优,这是一个客观存在的权衡结果。

**七、为什么不直接训练一个大模型来做所有事情?**

一个自然的疑问是:既然要做强化学习,为什么不直接训练一个端到端的模型,让它既负责想想法,又负责写代码,岂不是更简单?

研究团队在论文中对此有明确的回答,附录里还专门做了分析。他们发现,对于这三个任务中涉及的代码复杂度,一个只有4B到8B参数的小模型端到端生成完整修改代码的成功率极低——代码经常跑不起来,或者跑起来但逻辑有误。在这种情况下,奖励信号反映的主要是"代码写对了没有",而不是"这个方向好不好"。于是ThetaEvolve风格的端到端训练在这些任务上根本无法有效运作,强化学习的信号被实现错误的噪声淹没了。

这个发现有一定的普遍性:在模型能力有限、任务实现复杂度高的场景中,将策略学习和实现能力耦合在一起,会让两件事都做不好。顾问-实现的分工,是在资源受限条件下一个实际有效的解法,而不仅仅是一个理论上优雅的设计。

**八、这项研究意味着什么?**

归根结底,PACEvolve++做的事情,是让AI在一次次的搜索尝试中,真正学会"什么值得试"。它不满足于让AI的搜索经历只停留在上下文窗口里,而是让这些经历转化为模型参数里稳定的判断偏好。

这件事本身的意义在于:如果搜索过程中的经验只靠上下文来存储,那么每次重新启动搜索,AI都得从头摸索;而如果经验能内化进模型的决策习惯,那么AI对一类问题搜索得越多,就越懂得在这类问题里应该往哪个方向走。这是一种更接近人类研究者成长方式的学习路径。

当然,这项研究也有坦诚声明的局限性。由于强化学习训练本身的成本,加上每次评估候选方案都需要完整训练一个机器学习模型,实验成本相当高昂,研究团队没有能够进行多次重复实验,也没有在更长的搜索周期上验证效果。未来如果能训练出本身代码能力更强的小模型,或许可以进一步探索端到端的可能性。

一个值得思考的延伸问题是:如果进化搜索本身能产生"可以学习的经验",那么随着时间推移,AI在某个专业领域内进行搜索的效率会不会越来越高?这种"越搜越聪明"的能力,与人类专家靠经验积累来提升判断力的过程,有多少实质性的相似?这或许是接下来值得深入追问的方向。感兴趣的读者可以通过arXiv:2605.07039查阅完整的论文内容。

Q&A

Q1:PACEvolve++中的顾问模型和代码模型分别做什么?

A:顾问模型负责"决定试什么",它会结合当前最优方案和历史搜索记录,提出几个候选研究方向,评估其新颖性,并选出最有潜力的一个,以自然语言描述出来。代码模型(如Gemini)则负责"怎么写代码",把顾问给出的方向翻译成真实可运行的代码。这种分工的好处是,强化学习只需要学习"想法的质量",不会被代码写错与否的噪声所干扰。

Q2:相位自适应强化学习为什么要在搜索的不同阶段换不同的激励方式?

A:进化搜索早期各方案差异大,"组内相对打分"能清晰反映好坏;后期方案都接近最优,分数挤在一起,相对打分会把噪声放大成虚假信号。因此后期改用"前沿贡献信号",只看某个方案有没有改变当前最优结果,对奖励绝对大小不敏感,训练更稳定。两种信号在训练过程中平滑过渡混合。

Q3:PACEvolve++在蛋白质适应度预测任务上具体做了什么?

A:蛋白质适应度预测任务要求AI只用单点和双点突变数据,预测三个及以上位点同时突变的效果。PACEvolve++通过顾问模型不断提出改进方向,包括突变特征化方式、成对相互作用建模、正则化策略等,交由代码模型实现后评估,以皮尔逊相关系数和Precision@5的加权组合作为优化目标,最终在该任务上取得了比所有基线方法都更高的综合得分。