【摘要】国际顶尖AI 学者苏昊归国加盟复旦大学,作为通用物理智能研究院(GPI)首任院长,领衔建设通用物理智能研究院。
这位深耕物理智能领域十余年的学者,从学术圈走进了国内产业视野的中心,“苏昊会不会成为具身智能时代的汤晓鸥”的讨论,也开始在产业界持续升温。
相比个人学术成就,这一现象背后的产业逻辑变迁更值得关注。具身智能走向产业化前夜,行业竞争正在从机器人本体逐渐延伸至数据、仿真、评测体系和世界模型等底层基础设施。谁能够定义关键问题、建立行业通用标准,谁就有机会掌握下一阶段的发展主动权。
苏昊受到产业内的关注,本质是赛道发展到深水区的必然结果—— 行业开始需要真正的基础设施构建者走到台前。而他能否成为汤晓鸥式的 “学术 + 产业” 双栖领军者,最终仍取决于,他能否真正打通物理智能从实验室到产业落地的鸿沟。
01
从ImageNet到物理智能:苏昊是谁?
今年4月,在第五届中国三维视觉大会(China3DV 2026)上,苏昊宣布加盟复旦大学,并担任通用物理智能研究院首任院长。这个在学术圈和产业界如雷贯耳的名字,在计算机视觉、三维感知与具身智能领域,他早已是绕不开的人物。
图源:复旦大学官网
与许多以单点突破闻名的学者不同,苏昊过去近二十年的研究轨迹,几乎对应着人工智能从“看见世界”到“理解世界”的演进过程。
2008年前后,苏昊参与ImageNet项目建设。ImageNet由超过1400万张标注图像组成,被广泛视为现代计算机视觉发展的重要基础设施之一。2012年,AlexNet在ImageNet竞赛中取得突破性成绩,推动深度学习进入快速发展阶段,也开启了此后十余年的人工智能浪潮。
不过,在二维视觉取得突破后,新的问题开始显现:机器能够识别一把椅子,却并不真正理解椅子的空间结构,更无法理解人与物体之间的交互关系。
此后,苏昊的研究重心逐步转向三维视觉领域。他主导建设的ShapeNet成为全球最具影响力的三维物体数据集之一,为三维感知研究提供了统一的数据基础。
其团队提出的PointNet则开创了直接处理点云数据的深度学习框架,被认为是3D深度学习领域的重要里程碑之一。相关工作至今仍被广泛应用于自动驾驶、机器人感知等场景。
但在苏昊看来,空间理解并非终点。机器知道物体是什么、长什么样,并不意味着理解物体会如何运动、如何交互,更无法据此完成真实世界中的操作任务。
围绕这一问题,苏昊进一步推动SAPIEN仿真平台建设,为机器人训练提供可交互的物理仿真环境;随后推出ManiSkill平台,尝试建立机器人操作技能学习与评测体系。
从ImageNet、ShapeNet到SAPIEN、ManiSkill,苏昊的研究方向经历过多次变化,但其关注的问题始终没有改变:机器究竟该如何理解真实世界。
这些成果之所以受到持续关注,一个重要原因在于它们大多以数据集、仿真平台和评测框架的形式存在。相比具体产品,它们更接近支撑整个研究社区运行的基础设施。
ImageNet定义了视觉时代的数据标准,ShapeNet推动了三维视觉研究社区的发展,SAPIEN与ManiSkill则成为具身智能研究的重要工具链。许多研究者和企业能够在此基础上开展创新,正是因为这些底层平台率先搭建完成。
这也是苏昊受到业内高度关注的重要原因之一。
从某种意义上说,他所构建的不只是一个个技术项目,更是一套贯穿感知智能、空间智能与物理智能的发展脉络。这也为理解其在具身智能产业链中的特殊地位提供了一个重要切口。
这条覆盖 2D 感知、3D 空间理解、物理仿真、操作评测的全链路研究路径,构成了苏昊区别于单一领域学者的核心优势,也让其成为当下具身智能底层基础设施领域的关键领军者。
02
为什么是现在?具身智能开始需要“定义问题的人”
过去两年,具身智能无疑是人工智能领域最受关注的赛道之一。从创业公司密集涌现,到科技巨头加速布局,再到资本持续涌入,机器人正在成为继大模型之后最受期待的新方向。
不过,相比早期围绕机器人本体、运动控制和场景展示展开的竞争,行业关注的焦点正在悄然发生变化。
在具身智能发展的初期阶段,市场更关心的是机器人能不能动起来、能不能完成指定动作。但当越来越多企业能够实现抓取、搬运、整理等基础能力后。
新的问题开始浮现:机器人为什么难以适应陌生环境?为什么同一个动作换一个场景就可能失效?为什么许多演示效果惊艳的Demo,进入真实环境后表现却大打折扣?
这些问题最终都指向同一个核心挑战——机器人仍然缺乏对物理世界的深层理解。
今年5月,在复旦大学校庆科学报告会上,苏昊以《物理智能:从感知到交互》为题,系统阐述了其对于下一代人工智能发展的思考。
在他看来,智能能力可以分为感知智能、空间智能、物理智能和行为智能四个层级。过去十余年,人工智能已经在感知智能层取得突破,空间智能能力也在持续提升,但决定具身智能上限的物理智能层,依然存在大量尚未解决的问题。
这也是当前行业普遍面临的现实。
过去两年,世界模型成为具身智能领域最热门的技术方向之一。无论是机器人企业,还是大模型厂商,都希望通过世界模型提升机器人的泛化能力。
然而从实际进展来看,无论是偏重空间理解的几何世界模型,还是偏重视觉生成的视频世界模型,都尚未真正解决物理规律建模的问题。
机器人可以识别桌上的杯子,也能够模仿抓取和移动动作,但对于“推动杯子后会发生什么”“不同力度会带来怎样的结果”等涉及物理因果关系的问题,依然缺乏稳定可靠的理解能力。
苏昊在演讲中提到,当前行业真正缺少的,是一种能够同时理解空间结构、物理规律以及行动后果的“物理交互世界模型”。这也是为什么越来越多业内人士开始将关注点从机器人本体转向数据、仿真、评测和世界模型等基础设施环节。
图源:苏昊演讲
回顾人工智能的发展历程,这样的变化并不陌生。
ImageNet推动了计算机视觉时代的爆发,CUDA生态支撑了深度学习和大模型时代的发展,而自动驾驶产业的崛起同样离不开数据闭环、仿真平台和评测体系建设。
当行业进入规模化发展阶段后,真正决定产业上限的往往不再是单一产品,而是支撑整个生态运行的底层基础设施。
具身智能正在经历类似的过程。过去两年里,大量企业围绕机器人本体展开竞争,行业不断刷新运动控制能力和任务完成能力的展示纪录。
但当产业开始迈向规模化落地时,数据从哪里来、模型如何训练、能力如何评测、泛化如何验证,正在成为比机器人本身更重要的问题。
芯流认为,随着行业逐步迈向产业化,具身智能竞争的重心正在从本体制造逐步延伸至底层基础设施。掌握评测与数据标准的玩家,有望掌握下一阶段的话语权。
站在这个角度再看苏昊过去十八年的研究路径,会发现其中存在一条十分清晰的主线。
从ImageNet时代参与视觉数据体系建设,到ShapeNet推动三维视觉研究发展;从SAPIEN构建机器人物理仿真环境,到ManiSkill建立机器人技能学习与评测框架,再到如今主导通用物理智能研究院建设,苏昊长期关注的并非某一个具体产品,而是支撑行业发展的底层能力建设。
这往往决定着整个行业能够走多远。
因此,苏昊受到广泛关注,并不是因为具身智能热度提升后被重新发现,而是因为行业发展到深水区后,开始需要这类长期建设底层基础设施的学者走到台前。
从这个角度看,苏昊被拿来与汤晓鸥比较,原因在于他们都出现在各自产业发展的关键节点。
03
苏昊会成为具身智能时代的汤晓鸥吗?
如果说前文讨论的是苏昊为何在当下受到关注,那么另一个更具争议的话题则是:他是否会成为具身智能时代的汤晓鸥?
过去近二十年里,他先后参与ImageNet项目建设,推动ShapeNet、PointNet等三维视觉基础设施发展,又在机器人仿真、技能学习和物理智能方向持续布局。从感知智能、空间智能到物理智能,其研究轨迹几乎覆盖了人工智能向现实世界延伸的关键阶段。
也正因如此,近年来关于“苏昊是否会成为具身智能时代的汤晓鸥”的讨论开始增多。
两人所面对的产业阶段并不相同。
回顾中国人工智能产业的发展历程,汤晓鸥之所以成为行业公认的标杆人物,并不仅仅因为其在计算机视觉领域的学术贡献,更重要的是他带领商汤科技完成了从实验室研究到产业化落地的闭环。
计算机视觉技术兴起的十余年间,安防、智能手机、互联网平台、自动驾驶等多个市场快速成长,为视觉算法提供了广阔的应用空间。
技术成熟、场景明确、需求旺盛,推动计算机视觉从实验室走向大规模商业化,也让商汤成为中国人工智能产业化的重要代表。
相比之下,具身智能仍处于产业发展的早期阶段。过去两年,机器人叠衣服、做饭、整理货架等演示视频频繁刷屏,融资规模屡创新高,不少企业估值快速攀升。
但热闹背后,一个现实问题始终没有完全解决:具身智能究竟会率先在哪个场景实现大规模落地?无论是家庭服务、商业服务还是工业制造,目前行业仍在探索过程中。
机器人可以完成越来越复杂的动作,却未必能够稳定创造商业价值;模型能力不断提升,但距离形成成熟商业闭环仍有相当距离。这也是当前具身智能与计算机视觉产业化初期的重要区别之一。
对于今天的行业而言,最大的挑战已经不只是让机器人学会一个动作,而是如何让机器人在复杂、开放、动态变化的真实世界中持续工作。而这恰恰对应着苏昊长期关注的物理智能问题。
在复旦大学校庆科学报告会上,苏昊曾提出一个观点:许多机器人策略之所以失效,并非因为动作本身出现问题,而是因为机器没有真正理解背后的物理规律。门的阻尼发生细微变化,训练上百万次的机器人就可能无法完成任务;桌面摩擦力稍有不同,原本有效的操作策略就会失去作用。
换句话说,今天很多机器人展示出来的能力仍然带有较强的场景依赖性。从实验室走向现实世界,中间仍横亘着数据获取、仿真训练、物理建模和泛化能力等一系列难题。这些问题很难依靠单一企业或者单一产品解决。
也正因为如此,苏昊回国后的第一步并不是创业,而是组建通用物理智能研究院。相比打造一家公司,这是一条周期更长、回报更慢的路径。在当前普遍追求快速商业化的产业环境下,这样的选择甚至显得有些“逆势”。
但从另一个角度看,这或许也是其受到广泛关注的重要原因。
当行业大多数资源仍集中在机器人本体、应用场景和商业模式探索时,苏昊选择继续向下挖掘物理智能、世界模型和交互数据等更底层的问题。而这些问题,恰恰可能决定未来十年具身智能的发展上限。
04
尾声
回顾人工智能的发展历程,无论是计算机视觉、自动驾驶还是大模型,每一次产业跃迁的背后,都离不开数据集、算法框架、评测体系等基础设施的成熟。真正改变行业格局的,往往不只是推出产品的人,还有那些定义问题、建立标准的人。
芯流认为,一个健康的产业创新生态,既容得下顶尖学者走向产业一线推动技术商业化,也容得下领军研究者回归学术底座,搭建底层技术基础设施、培养行业通用人才。这种对多元路径的包容,恰恰是赛道持续向前、创新根基稳固的核心支撑。
至于苏昊是否会成为 “下一个汤晓鸥”,眼下的讨论或许为时尚早。或许从始至终,苏昊要做的都只是“第一个苏昊”。