这项由腾讯、南洋理工大学、新加坡国立大学及新加坡科技研究局前沿人工智能研究中心联合完成的研究,于2026年7月以预印本形式发布,论文编号为arXiv:2607.26754,研究提出了名为StatePlay的全新游戏世界模型框架,致力于解决AI生成游戏画面时"好看但不能玩"的根本性缺陷。
**游戏AI的"花瓶困境"**
假设你花了很长时间等待一款完全由AI生成的格斗游戏上线,终于在屏幕前坐下来,按下出招键,画面里的角色也跟着动了起来,打斗场景看起来酷炫无比。但没多久你就发现,对手的血量早就归零了,角色却还站在那里继续打你;你的必杀技技能槽明明只剩一半,AI却让你成功放出了只有技能槽满格才能使用的招式。整个游戏"好看",却完全不符合任何游戏规则。
这正是当下AI游戏世界模型面临的核心困境。近年来,一批优秀的AI系统已经能够根据玩家操作实时生成视觉上相当逼真的游戏画面,但这些系统骨子里只是一台"图像预测机器"——它学会了"打拳时拳头会碰到对方身体"这样的视觉规律,却根本不理解游戏背后那套由血量、技能槽、计时器构成的规则体系。结果就是,生成出来的游戏画面像一部精致的武打片,却不像一个真正的游戏。
来自腾讯与多所顶尖学术机构的研究团队正是看到了这个问题,决定从根本上重新设计AI游戏生成系统的工作方式,让它不仅能"看懂"画面,还能"理解"规则。
**一、游戏规则藏在哪里**
要理解这项研究为什么重要,先得搞清楚一件事:游戏规则到底藏在哪里?
在一款格斗游戏中,画面只是表象。你看到角色挥拳,那是画面;但角色挥拳之后对方血量减少了多少,这取决于内部的一个数字——血量值。你看到角色发出了炫酷的超级必杀技,那是画面;但这个必杀技能否被触发,取决于另一个内部数字——技能槽是否已经充满。比赛结束时屏幕上出现"YOU LOSE",那是画面;但触发这个结局的,是血量值归零这个内部状态的变化。
这些隐藏在游戏幕后的数字,研究团队把它们叫做"游戏状态",具体包括计时器、双方的血量值以及双方的技能槽百分比,总共五个核心变量。它们就像游戏世界的骨架,画面只是覆盖在骨架外面的皮肉。过去的AI游戏模型只学习皮肉,却忽视了骨架,所以生成出来的游戏在视觉上看得过去,但一接触规则就露馅了。
研究团队意识到,仅凭画面像素几乎不可能可靠地反推出这些内部状态的变化规律。血量条在画面上只占几十个像素,稍微有一点画面质量波动,AI就可能读错血量。技能槽是否刚好达到100%这个临界点,从像素里判断更是困难重重。因此,要让AI真正理解游戏规则,必须直接告诉它这些内部状态是什么,并让它学会预测这些状态如何随时间演变。
**二、从零搭建一个"懂规则"的训练场**
解决了"为什么",接下来就是"怎么做"。研究团队面临的第一个现实挑战是:市面上几乎找不到现成的、同时包含游戏画面、玩家操作和内部状态数据的公开数据集。
为此,研究团队选择了经典格斗游戏《街头霸王3》作为实验平台。这款游戏有清晰的规则体系,状态变量直观,非常适合研究游戏规则与画面之间的关系。他们通过一个叫做stable-retro的模拟框架,用Python程序控制游戏运行,像"无人驾驶"一样让AI自动打游戏,同时全程记录每一帧画面、每一个玩家操作,以及从模拟器内存中直接读取的五个状态变量。每场对战打到一方被KO为止,然后把整段录像切成每段5秒、每秒20帧的视频片段。
但光有数据还不够,数据的质量和分布同样关键。如果AI训练时接触的99%都是普通对战场景,那它就很少有机会学习"技能槽满了触发必杀技"或"血量归零显示YOU LOSE"这类关键时刻的规律。为了解决这个问题,研究团队设计了一套精心的数据均衡策略,把10000个训练片段分成五类:玩家胜利结局、玩家失败结局、必杀技成功释放、必杀技尝试但未满足条件而失败,以及普通对战。前四类各占10%,普通对战占60%。这样一来,AI就能接受到足够多的关键状态转变场景的训练。
数据集里还加入了一个有趣的设计:用谷歌旗下的Gemini模型对视频中NPC(电脑控制角色)的战斗策略进行自然语言描述,分为主动进攻型、远程控制型和被动防守型三类,并将这些文字描述也加入训练数据,让AI能够通过文字指令来控制NPC的战斗风格。
**三、一个"左右手分工"的全新模型架构**
有了数据,接下来是模型设计。研究团队在一个已有的视频生成模型基础上,做了一个关键改造——给它额外装上了一条专门处理游戏状态的"神经网络支线"。
整个StatePlay模型就像一个双手协作的工匠。右手(视觉分支,50亿参数规模)负责处理画面,学习如何生成视觉上逼真的游戏帧;左手(状态分支,7.6亿参数规模)负责处理数字状态,学习血量、技能槽、计时器如何随时间变化。两只手各有分工,但又在关键环节相互配合。
这个配合机制叫做"联合注意力模块",可以理解为两只手之间的一个信息传递窗口。视觉分支可以通过这个窗口查看状态分支的信息——"哦,现在技能槽满了,那画面里应该出现必杀技的特效";同样,状态分支也可以查看视觉分支的信息——"画面里出现了一记重拳,血量应该减少更多"。这种双向信息交流,让两条支线能够互相校正,共同保证输出内容既好看又合规。
这种"专家各司其职,关键时刻交流"的架构被称为混合专家变换器(MoT),相比另一种"把所有信息塞进同一套网络处理"的方法,在实验中被证明效果明显更好。原因也很直观:画面信息是高维度的复杂数据,而血量值只是一个0到100之间的简单数字,把它们强行塞进同一个处理空间,反而会相互干扰。就像让一个厨师同时兼顾摆盘的美感和食谱的精确配比,不如让两个人分别专注于各自擅长的事情,再在关键步骤沟通协调。
在训练方式上,两条支线也采用了完全不同的方法。视觉分支用的是"流匹配"技术,这是当前主流图像和视频生成模型的标准训练方式,适合处理高维度、充满细节的画面数据。状态分支则选择了更直接的回归损失函数,本质上就是让模型预测出一个数字,然后直接跟真实数字比较差距,差多少就惩罚多少。研究团队解释,这是因为游戏状态变量遵循明确的规则:血量被打了就减少,技能槽使用必杀技后就清零,这些有规律可循的变化用直接的数值预测来学习,比用视频生成那套复杂的扩散框架要高效得多。
**四、实验说话:数字背后的真实差距**
研究团队设计了一套相当全面的评测体系,从四个维度来衡量生成的游戏视频质量。
第一个维度是画面质量,用两个指标衡量:一个叫SSIM,测量生成画面和真实游戏画面在结构上的相似程度;另一个叫LPIPS,从更接近人眼感知的角度衡量画面的视觉相似性,数值越低越好。第二个维度是动作可控性,也就是玩家按了什么键,AI生成的画面里角色就做了什么动作,包括移动准确率和攻击准确率两个子指标。第三个维度是状态预测精度,衡量AI预测出来的血量、技能槽等数值跟真实数值差多少。第四个维度是机制忠实度,用Gemini和GPT-5.5两个大模型当"裁判",看生成视频里的游戏事件是否符合规则,比如必杀技触发对不对、胜负判定准不准。
所有指标都在100个测试片段上评测,这些片段均匀覆盖了各种机制场景。
在零样本测试中,研究团队直接拿了几款当前最先进的游戏世界模型来做横向比较,包括Matrix-Game 3.0、LingBot-World、LingBot-World 2.0、HY-World 1.5和ReactiveGWM。结果显示,这些模型在机制忠实度上几乎全军覆没,最好的ReactiveGWM也只达到48%左右的正确率,很多时候就是在随机猜测游戏结果的水平。这充分说明,当前的游戏AI在视觉上可以做到像模像样,但面对规则约束时基本束手无策。
在针对同一数据集进行微调后,StatePlay的状态预测对齐分数达到了0.947(满分为1),意味着它对血量、技能槽等变量的预测平均误差不超过6%。更重要的是,机制忠实度在Gemini评估下达到82.3%,在GPT-5.5评估下达到78.3%,相比最强基线ReactiveGWM的63.7%,提升了超过18个百分点。与此同时,StatePlay在画面质量和动作可控性上并没有出现明显下滑,SSIM分数0.378和LPIPS分数0.424都处于同级别模型中的最优水平。
消融实验进一步验证了架构设计的每个关键选择。采用MoT双支线结构比共享单一网络的方案在机制忠实度上高出17.6个百分点;用回归损失训练状态支线比用流匹配方法在机制忠实度上高出21.6个百分点,在状态预测精度上高出12.1个百分点。还有一个细节:训练时对状态序列加入噪声(而非简单地把初始状态复制到所有时间步)对模型学习时间演变规律也有帮助,机制忠实度从78.3%提升到82.3%。
**五、眼见为实:三个场景里的胜负分明**
除了数字,研究团队还展示了具体案例,让效果差距一目了然。
在必杀技触发场景里,给定同样的操作序列和初始状态,ReactiveGWM在技能槽已满的情况下依然没能生成出必杀技的视觉效果,而且两个角色在画面里糊在了一起,变成了一团分不清楚的模糊影像。StatePlay则准确地在技能槽满格时触发了必杀技的炫酷特效,并在必杀技使用后正确地把技能槽清零——这正是游戏规则的要求。
在NPC血量归零场景里,ReactiveGWM生成的画面里,对手明明血量早就见底,却依然站着打人,完全无视了游戏应该结束的规则。StatePlay则在正确的时机生成了"YOU WIN"的胜利画面。
在玩家血量归零的场景里,情况更有意思:ReactiveGWM不仅没有生成"YOU LOSE"的失败画面,甚至生成了一个颠倒的场景——玩家在庆祝胜利,NPC躺在地上,完全搞反了胜负。StatePlay则稳定地生成了符合规则的失败结局画面。
这三个案例清晰地说明,没有状态建模的AI会对游戏规则产生严重的理解偏差,有时甚至给出完全相反的输出。
**研究的边界与下一步**
研究团队也坦诚地指出了当前工作的局限性。StatePlay虽然能准确预测内部状态,但生成的画面里,血条和技能槽的视觉表现有时仍然与预测的数值不完全一致——骨架对了,皮肉还在追赶。当多个游戏事件同时发生,比如放出必杀技的同时对方血量归零触发游戏结束,画面质量也会有所下降,处理同时发生的复杂事件仍然是个挑战。
更根本的限制是数据集的范围。目前整个研究只在《街头霸王3》这一款格斗游戏上验证过,其他类型的游戏,比如射击游戏里的弹药数量、赛车游戏里的氮气加速、角色扮演游戏里的魔法值,都有各自不同的状态体系和规则逻辑。把StatePlay推广到更多游戏类型,需要构建更多包含状态标注的游戏数据集,这也是研究团队希望未来社区能共同推进的方向。
说到底,StatePlay这项研究的核心贡献在于指出了一件听起来简单但此前被忽视的事情:一个真正"能玩"的游戏AI,必须同时理解画面和规则,而规则本质上藏在那些看不见的内部数字里。把这些数字显式地纳入模型的学习和生成过程,是让AI游戏从"视觉演示"升级为"真实模拟"的关键一步。对普通玩家来说,这意味着未来由AI生成的游戏世界,不仅会看起来真实,也会玩起来真实。对游戏开发者来说,这套框架提供了一个可以直接扩展到不同游戏类型的技术路线图。
有兴趣深入研究技术细节的读者,可以通过论文编号arXiv:2607.26754查阅完整论文,项目页面也提供了更多可视化演示材料。
Q&A
Q1:StatePlay和普通游戏AI视频生成模型有什么本质区别?
A:普通游戏AI只学习画面之间的视觉变化规律,不知道血量、技能槽这些内部数字的存在。StatePlay在生成画面的同时,额外设置了一条专门预测这些内部状态数字的支线网络,让两条支线互相参考、互相约束,从而确保生成的画面不违反游戏规则。核心区别就是:一个只学"看起来像什么",另一个同时学"规则上应该发生什么"。
Q2:StatePlay的训练数据是怎么来的?
A:研究团队用程序自动控制《街头霸王3》游戏运行,记录每一帧画面、操作指令,同时从模拟器内存里直接读取血量、技能槽、计时器等五个状态数值。共收集了10000个5秒视频片段,并刻意保证其中40%的片段包含必杀技触发、胜负判定等关键规则场景,避免训练数据过于集中在普通对战。
Q3:StatePlay生成的游戏画面质量会不会因为加了状态预测而变差?
A:实验结果显示并没有明显变差。StatePlay的画面质量指标(SSIM为0.378,LPIPS为0.424)在所有同级别参与对比的模型中处于最优水平,动作可控性也基本持平。加入状态预测支线反而通过信息互补略微提升了画面的一致性,并大幅提升了机制忠实度。