智源研究院院长王仲远:世界模型被说滥了,智能体爆发卡在哪?

问AI · 世界模型如何突破物理状态预测的瓶颈?

图片

文丨胡世鑫  饶富英 

编辑丨叶锦言

出品丨深网·腾讯新闻小满工作室

2026年,AI行业对“落地”的讨论明显变得更加具体。过去被反复比较的是模型参数、榜单排名和推理能力,如今,更多问题转向应用现场:AI Coding能否进入真实研发流程,智能体能否从聊天窗口走向执行工具,Token成本能否支撑大规模使用,具身智能和世界模型又能否把AI从数字世界带入物理世界。

智源研究院院长王仲远给出的回答相对克制。在他看来,智能体会先在数字世界落地,但Token还没有便宜到像纸和笔一样;世界模型仍处在早期,视频生成不等于真正的世界模型,真正关键的是预测“下一个物理状态”;具身智能不用推倒重来,但现有路线未来会被新的模型替代;某种形式的AGI可能很快到来,但真正理解真实世界的AGI还没有那么近。

在第八届北京智源大会期间,智源研究院也展示了几条与上述判断相关的技术进展,包括悟界·Emu3.5、悟界·Brainμ1.0、悟界·OpenComplex2.5,以及面向物理世界、仍处研发早期的悟界·Physis-v0.1;智能体方向则涉及心脏辅助诊断、自主科研、听会分身和生物安全风险发现等场景。

围绕“AI从数字世界走向物理世界”这一判断,智源近期也在世界模型方向加码。据悉,22岁北京大学本科生、逆矩阵创始人、ACL最佳论文得主陈博远出任智源行为世界模型创新中心负责人。该中心聚焦下一代通用世界基座模型的前沿研究,目标是构建面向真实物理世界的通用基座模型。

相比具体产品本身,更值得关注的是这些技术背后的共同问题:当AI从数字世界继续向物理世界推进,下一块真正的基座模型会是什么?王仲远围绕世界模型、具身智能、智能体、Token成本等问题进行交流,以下为经整理后的对话内容:

世界模型的核心是“下一个物理状态预测”

Q:智源的研究重点经历了从大语言模型、多模态模型到世界模型的转向。你怎么看大语言模型当前所处的发展阶段?

王仲远:大语言模型依然还是在非常快速成长的过程中,我们早年做的“悟道”系列就是大语言模型。智源一直秉持的定位,是做高校做不了、企业不愿意做的事情。大语言模型技术路线相对成熟以后,就可以交给企业继续沿着成熟路线提升性能。

两年前,我们把重点放在多模态上,现在则把重点放在世界模型。我们认为,大语言模型仍处在持续发展阶段,国产大模型性能也在持续提升。虽然客观来看,跟全球最顶尖的模型还是有一定距离,但我对此充满信心。国产大模型已经向全世界证明,在全球范围内,不管是流量、使用,还是口碑和认可度,都已经达到很高水平。

接下来更长时间里,AI Coding和大语言模型依然会有继续提升的空间和潜力。我们也乐见国内领军企业继续发力,让国产大模型成为全球最顶尖的大模型。

Q:为什么现在智源会把重点进一步放到世界模型上?现阶段世界模型最需要解决的核心问题是?

王仲远:问题已经比较清楚,但尚未收敛。以具身智能为例,机器人之所以还不能像人类一样灵活行走、执行多样任务,根本原因在于缺乏对世界常识和物理规律的理解。它们可以在操作台或流水线上完成特定任务,但仍缺乏泛化性和通用性。

对当前物理世界人工智能而言,感知、理解、交互到决策的完整能力链条仍未真正打通,虽然部分模型已展现出其中一些能力。如今这一方向一方面非常火热,另一方面概念也较为混乱,因此我们希望业界逐步形成共识,避免“世界模型”等概念被滥用。

Q:现在不少视频生成模型也会被称为世界模型。你怎么看视频数据在世界模型训练中的作用?它距离真正推动世界模型发展,还有多远?

王仲远:视频数据仍是少数能够海量获取、同时包含时间、空间、物理因果和意图等关键要素的数据。具体到具身智能,过去两年行业主要采用VLA(Vision-Language-Action)技术,而我判断今年World Action Model会成为热点,它通过视频生成类世界模型与动作协同训练,来解决部分具身智能场景问题。

但无论是VLA还是World Action Model,都还没有触及具身智能最核心的能力,即泛化能力,以及对真实时间、空间、物理状态、物理规律和物理常识的理解、规划与决策能力。

智源研究院也提出了对世界模型的四类划分(以语言为中心、以像素为中心、以三维结构为中心,以视觉表征为中心),并进一步认为,下一代世界模型必须是全模态的,以预测下一物理状态为核心,能够理解真实物理规律和常识,并具备主动交互能力。

Q:也就是说,视频数据虽然重要,但仍然不完整。比如大量视频平台上的数据,并不是对因果关系的全方位展示,也缺乏触觉、力觉等数据。这些缺口要怎么补?

王仲远:这是一个很好的问题。视频和传统视觉数据噪声较多,如何提炼其中最核心的信息,是当前具身智能和未来世界模型训练需要解决的关键问题。

事实上,悟界·Physis仍在依靠大量视频数据学习所需的物理知识。我们也必须看到,当前物理世界的真实数据依然严重不足,而且高度分散、存在数据孤岛,尚未形成像数字世界互联网那样的数据环境。

因此,当前有两条路径:一是等待物理世界数据逐步变得充分、海量并开放共享;二是先从视频和数字世界中学习基础能力,再迁移到物理世界,以增强模型的泛化能力。

Q:你提到,智源可能找到多模态Scaling的新范式。你判断Scaling仍然有效的依据是什么?

王仲远:第一,Emu3.5相比Emu3,训练数据提升约50倍、参数规模提升约4倍,模型能力和性能都有显著增强。

第二,它采用自回归架构,能够复用现有计算基础设施以及大语言模型的训练、强化学习和后训练方法,这意味着它有望沿着大语言模型的Scaling路径持续演进。

第三,Emu3.5目前参数量仍只有约320亿,使用的互联网公开视频数据不到1%,说明后续仍有很大提升空间。与此同时,进入物理世界后,还需要进一步探索包含时间、空间、物理规律和物理常识的新Scaling方式。

智能体、Token与AI Native:数字世界会先被重构

Q:关于AI落地,你认为今年哪些方向会率先看到进展?落地节奏会有什么不同?

王仲远:未来一年,我们会看到越来越多智能体落地,帮助解决实际问题。智源研究院今天也有多款结合科研布局研发的智能体,如心脏辅助诊断智能体、自主科研智能体和大会听会智能体,它们都将显著提升效率。比如在医疗领域,顶尖诊断能力有望下沉到基层医院,推动医疗普惠;自主科研智能体也能提升科研效率、加速科研发现,这将是未来一到三年的重要趋势。

相比之下,物理世界的智能体发展会慢一些,因为我们仍缺乏一个能够充分理解时间、空间、物理规律,并具备多模态理解、推理、规划和决策能力的世界基座模型。

Q:也就是说,智能体会先在数字世界落地。但从今年很多产品的使用体验来看,成本仍然是一个很现实的问题。未来一两年,Token成本会出现明显下降吗?

王仲远:今天王坚博士今年在智源大会开幕式播客中提到,如果未来Token能像纸和笔一样便宜、便利,人工智能的发展可能会迎来新一轮加速。

长期来看,随着工业化、规模化和工程创新推进,Token 和算力成本一定会持续下降,这也符合技术从高成本走向普惠的一般规律。虽然今年未必就能达到最理想状态,但成本的持续降低,必将进一步推动智能体等技术和产品的落地与普及。

Q:当智能体真正进入工作流之后,很多公司也开始讨论AI Native组织,甚至One Person Company。你怎么看这种变化?

王仲远:AI Native目前更像一种理念,意味着人们已经意识到,人工智能和大模型正在开启一个全新时代,甚至可能带来一场新的工业革命。

在我看来,AI Native组织的核心,是把AI作为基础设施,重塑组织形态,以释放更大的产能、效率和新质生产力。但这一概念仍很新,大家还在探索。

与此同时,它也带来一系列现实问题,例如是否会导致组织空心化、走向One Person Company,数字员工一旦失误又该由谁负责。大家都看到了这一趋势,也都在摸索,并期待出现真正可复制、可推广的成功案例。

数字世界的AGI可能很快到来

Q:行业里关于AGI何时到来的判断越来越多。你怎么定义AGI?它什么时候会到来?

王仲远:按照传统图灵测试的定义,如今很多 AI 实际上已经达到这一水平。如果按大众理解的AGI,即具备类似人类的通用问题解决能力,那么数字世界的AGI很可能很快到来。

在我过去的研究和产品实践中,我原本认为AGI至少还要四五十年,但大模型技术的出现,让我意识到这个时间可能已缩短到四五年。对于AGI何时到来,海外不少专家预测,今年或明年就可能出现某种形式的AGI,我认同这一判断。

不过,更广义的AGI,比如真正理解现实世界、具备常识并能完成与物理世界交互的能力,可能仍需较长时间。当然,随着人工智能加速发展,这个时间也可能进一步缩短。

Q:也有学者提出,未来机器智能可能会深度改变人类社会,甚至到2050年之后承担大量原本由人完成的工作。你怎么看这种判断?

王仲远:这是一个学术观点,也算是一家之言。更多体现了人工智能正在加速演进,并可能走向人机共存的未来形态。但 2050 年离现在仍有距离,在人工智能持续加速发展的背景下,预测20年后的情况依然很难。

王坚博士也提到,人类一直善于驾驭新技术。就像当年人类学会用火,虽曾担心其风险,但最终还是让火成为普遍工具。我们也期待,未来 AI 能像水、电、火一样,成为日常可用的基础设施。

Q:如果AGI和智能体能力都在加速,AI安全议题是否也发生变化?今年你觉得最需要警惕的风险是?

王仲远:人工智能的安全风险始终存在,只是近两年的关注点已从超级人工智能等长期担忧,转向智能体发展带来的现实风险。随着智能体能力增强,它们正逐步绕过既有安全机制。

我们在今年智源大会分享的一款风险发现智能体,就曾绕过现有筛查机制,识别并合成有害蛋白相关基因,这一风险已在11款大语言模型和3个智能体上复现。

结合Anthropic提到的最新模型能力和递归自进化现象,可以看到,大模型已经能够发现网络安全漏洞,并可能对生物安全等领域产生直接影响。因此,AI安全不仅是技术问题,更需要技术、产业、政策及各领域专家共同应对。