通用物理智能终于不是PPT了
大家好,我是刀哥。做过大厂研发、做过出海硬件,现在挖掘AI圈一手更新,深耕 AI 视频、AI 编程。
2026 WAIC开幕。总展览面积首次突破10万平方米,超200家具身智能企业同台竞技,具身智能首次与智算并列为大会两大核心赛道。但是,我想聊一个离物理世界最近的话题:机器人什么时候能真的干活?
过去十年,AI的能力边界一路狂奔——理解语言、生成图片、拍视频、写代码,甚至在围棋和电子竞技里碾压人类。有一个领域,AI始终没真正跨过去:在物理世界里自主行动。
想想看,你家扫地机器人还经常卡在沙发腿中间,酒店里的送餐机器人听到帮我按电梯就原地懵圈。更别提工厂里那些号称智能的机械臂,换个稍微不同的零件就得重新编程调试半天。
这个爆笑视频我相信不少朋友刷到过。著名博主葬爱咸鱼,花了149元请了一个机器人做家务,不停卡死,折腾一小时等于阿姨1分钟的工作,只能提供科普娱乐服务。
这属于整个领域的结构性瓶颈,怪不到某一家具体公司头上。核心难点有三个:
1. 感知问题 —— 真实世界的光照、背景、物体形状千变万化,实验室里测得好好的,换个环境就歇菜。
2. 数据问题 —— 训练大语言模型可以爬全网文本,训练机器人却只能采集真机数据。一台机器人一个场景一条一条录,成本高到令人窒息。
3. 泛化问题 —— 学会抓杯子绝不等于会抓碗,每换一类物体就得重来一遍。
现在的具身机器人行业面临一个极其尴尬的现状:大部分所谓的智能机器人,骨子里依然是单一场景的自动化专用设备。换个场景就得重新定制,跟通用两个字完全不沾边。但最近一年,有些质的变化正在发生。
全球范围看,盯着通用物理智能这个方向的公司其实不算多,因为门槛太高了。
海外阵营:Physical Intelligence (PI) 走 VLA 大模型路线,用真机数据加遥操作训练,跨场景迁移能力有限;
Google DeepMind 的 RT 系列偏向学术前沿,离产品化还有距离;Figure、1X 和 Tesla Bot 主攻运动控制,操作能力还在早期。
国内阵营:苏度科技 (sudo),走纯仿真加世界模型路线,实现了零真机数据下 98% 的抓取成功率。
行业里绝大多数公司的路径是先做一个具体场景的 Demo,再想办法往外泛化。银河通用、原力灵机、灵初智能本质上都还在用真机数据做后训练或微调。在目前公开的技术路线中,苏度是将纯仿真+零真机数据作为核心卖点的少数几家之一。
从通用走向落地:反向路线的威力解释
苏度的思路是:先将通用能力做大、做通,再面向具体场景进行小而稳的落地部署。
这种升维打法更接近 OpenAI 在通用 AI(AGI)领域的范式。OpenAI 通过庞大的通用底层模型让大语言模型涌现出理解万物的能力,从而支撑起各种上层 Agent 应用。
苏度科技则是将这种通用性搬进了物理世界,其技术的核心在于,通过构建通用物理智能,让机器人天然具备空间与物理因果的泛化能力,从而真正支撑物理智能走向具身通用。
苏度这个公司名也很有意思,程序员都知道,sudo是超级管理员权限的意思。具身智能这个赛道,新公司天天有,我平时不太关注还没拿出真东西的。但苏度有几个点确实让我觉得值得聊聊。
1. 98%成功率,而且不挑物体
在发布首篇技术 Blog 时,苏度展示了一段 60 分钟不间断、未经剪辑的抓取测试视频。苏度机器人面对 100 多个从没见过的物体——透明的杯子、反光的金属件、软趴趴的布料——首次抓取成功率约为 98%。
最关键的是,训练这个操作模型完全基于仿真数据构建,未依赖任何真实世界采集数据。这种零样本(Zero-shot)直接部署真机的能力,在行业里为纯仿真路线的可行性提供了有力佐证。。
2. 它认识的是几何,而非物体名字
苏度的自研机器人方案极其纯粹,没有使用任何额外的深度传感器或力传感器,走的是纯视觉方案。
它能抓取没见过的东西,在于它的模型压根不去判断物体的标签,而是深度理解三维几何的空间关系。
通过在仿真训练时将折射、反射等光学现象进行极限渲染,它成功攻克了传统传感器直接失效的透明玻璃与反光金属件。
3. 四个月内从 1 个技能到 10+ 个技能的快速扩展
苏度科技成立于 2025 年 5 月,在短短 14 个月的时间里,工程化速度飞快。
继公布首个泛化抓放技能后,短短 4 个月内,技能库已迅速扩展为 10+ 技能。这次在世界人工智能大会(WAIC)现场, 他们展示的场景能力包括:
4. 为什么这套用 AI 做具身的打法能跑通?
因为他们构建了一套支持可持续 Scaling 的研究范式。
高保真物理仿真系统自带完整的物理交互信息,让世界模型与强化学习深度融为一体,直接逼着模型去习得可泛化的底层的物理规律,而非死记硬背某一个单一动作。
这种底层的虚实融合数据链路,让机器人不仅能够通过可泛化的技能模块自主组合解决开放任务,还能在千行百业实现开箱即用。
5. 背后的世界级人才
董事长&CTO苏昊教授,复旦大学通用物理智能研究院院长,Google Scholar 引用超 15 万次,位居华人具身智能学者首位。
他不仅是 ImageNet 的核心缔造者之一,更参与主导了 ShapeNet、PointNet 等一众改变了 3D 视觉与空间智能走向的底座工作。
CEO韩铮具备深厚的微软亚研技术底色与连续成功创业的商业化落地经验;研发副总裁徐泽祥博士前身为 Adobe Research 研究科学家,是打通 3D 生成、空间智能与多模态基础模型的年轻一代技术中坚。
作为成立一年以来的首次国内参展与系统性媒体露面,苏度科技这次几乎倾巢出动。我跟苏度的朋友聊了下,他们在上海世博展览馆(7月17-19日)铺满了互动展位,很让人期待:
核心主展位:H3-B301。这里是技术的演兵场,没有任何防护隔离带,大家可以把随身携带的私人物品直接丢上去,近距离肉眼测评通用物理智能的 zero-shot 泛化水平。
集中展区(工业场景):位于世博展览馆公区 H2-4楼梯门口。
管理层交流同样排得很满:7月17日下午苏昊教授将在主论坛发表 Talk;7月18日韩铮与徐泽祥将分别围绕“AI启未来产融论坛”与国投先导的“世界模型主题论坛”展开多场高层技术对话。
具身智能这件事,行业喊了几年,但真正在通用路线上跑通底层基本范式的公司凤毛麟角。苏度用纯仿真加世界模型的技术架构,正面回应了数据规模与物理世界建模不足的行业核心瓶颈,目前展现出的涌现速度确实值得关注。
物理智能的技术奇点已经不再是镜花水月,它正在以极具工程感的姿态,一步步走向真实的物理世界。
行业对具身智能GPT时刻分歧明显——有人坚信正迎来AlphaGo时刻,有人判断不会出现。苏度机器人到底好不好用?我们在上海 WAIC 现场见。
© 2026 Tech & AI Evaluation. 保留所有权利。转载请注明出处。