"
数字世界会反过来长进物理世界,虚实之间再没有边界。
—— 凯文·凯利
📌 本文看点
01
现场五个真实演示
02
为什么它是个大脑
03
一个脑子多种身体
大家好啊,我是甲木,这周一直频繁出差,去完上海 AGI Builder,又去杭州,接着返京 Force 原动力和 ISC 大会,现在终于到家能安静的写点东西了……
来聊聊前段时间去『清华』参加发布会的见闻。
— 跟朋友们在现场看具身智能的发布
发布方是一念 Unisonmind(清华团队),发布的产品叫UnisonMind。
一句话解读:
「这是一个端侧部署、实时运行的原生多模态模型。支持流式输入与持续状态更新,是一套可以进入不同本体的认知大脑。」
行业首发。
它可以同时进入三种以上完全不同形态的机器:机器狗、人形机器人、电动轮椅。
一个大脑,几种不同的本体。现场不是每台设备各自跑一套系统,它们共享的是同一个上层认知内核。
这已经不是我第一次去看一念团队做的东西了。
更早之前,一念团队的好朋友英健就跟我聊过这个方向:如果机器人想从「会执行程序」走向「能理解世界」,核心问题可能不在腿、不在轮子、不在机械臂。
而在背后有没有一个足够统一、足够实时、足够靠近物理世界的大脑。
这两年,通过春晚也能发现具身智能确实很热。
机器狗、人形机器人、机械臂、电动轮椅、服务机器人,各种视频每天都能刷到。
但说实话,我看多了之后,而且也在行业里,都知道演示得很热闹,背后其实基本是三类东西:
第一类,是遥控或者遥操。第二类,是提前写好的脚本。第三类,是多个模型拼在一起,视觉管视觉,语音管语音,动作管动作,中间靠规则和接口硬串。
这几种方案不是没价值。工程上能跑起来,已经不容易。
但它们离真正进入真实世界,还有很长一段路。
真实世界不是舞台。
人会突然走动,光线会变,声音会重叠,任务会被打断,硬件也会出故障。
你让机器狗在舞台上整齐跳舞,和让它在一个真实小院里听懂人话、找人、数球、去咖啡店,完全不是一回事。
前者更像表演。后者才开始接近「理解世界」。
具身智能最难的地方,其实在于持续理解正在发生的世界。
这次,一念团队搞出来了。
而且顺便带着聪哥、袋鼠、苍何、小李、塔塔等好朋友去小院拜访了好几次,他们大受震撼 哈哈哈
ON SITE
我建议大家先别急着听技术词。
先看几个现场片段。
1. 机器狗数乒乓球
第一个是数乒乓球。
工作人员在机器狗面前颠球,球连续起落,节奏并不固定。机器狗要一边看,一边数,最后报出次数。
乒乓球
这个任务对人来说不算离谱。但对模型来说,很要命。
因为球不会停下来等它想明白。颠球的间隔、速度、轨迹都不稳定,一次有效触球可能只发生在很短的瞬间。
如果只是抽帧去解决,再交给模型判断,大概率会漏。
所以数乒乓球这个任务,重点是它在连续时间里保持了一个正在更新的状态。
2. 连续数字倒序播报
第二个是连续数字倒序播报。
现场连续给它一串数字,它要听进去,记住顺序,最后再倒着说出来。
滚滚数数
这也不是简单复读,它得在连续输入里保持短期状态。
然后根据新的任务要求,把刚才的信息重新组织成输出。
这其实就是物理世界里很常见的能力。人不会一次只接收一条整齐的输入。现实里,信息总是一边发生,一边进入。
3. 在人群里找白衬衫
第三个是找人。现场让机器狗去找穿白衬衫的人。
它在一群人里找目标,没有提前录入人脸,也不是固定点位识别。
更有意思的是,现场有个人外面披着衣服,但里面也是白衬衫。机器狗注意到了这个细节,还主动补充了出来。
滚滚找人
这个细节比「找到了」更值得说。
因为它说明系统并没有做标签匹配,而是在现场环境里做了语义判断。
4. 机器人导览两幅画
还有一个机器人导览画作的场景。它要在现场,面对作品、观众和自己的位置,完成讲解。
杨戬导览两幅画
很多模型都会说话。但 UnisonMind 证明的是,视觉理解、语言表达、身体位置和现场关系,可以进入同一个任务过程。
5. 轮椅找店
我个人更关注的是轮椅。
一台搭载 UnisonMind 的电动轮椅,接收人的指令,识别标牌,判断空间关系,再带着人往目标位置移动。
轮椅找东西
机器狗和机器人,很多时候大家会下意识觉得是科技玩具。
但轮椅不一样。轮椅这个场景,背后是很具体的人。
一个行动不便的人,能不能少依赖别人一点?能不能用一句自然语言,让设备理解自己的意图?
技术如果最后只停在炫技上,其实没什么意思。但如果它能让一个人的日常生活更有自主性,那就很值得认真看。
尤其是康养类的场景,或许我们以后都会遇到 emmm
比如点咖啡,不在话下。
还有一个非常搞笑的场景,啸天的贱贱人格,看着机器人蹲在那,直接问:「你是来拉屎的吗」 - -
机器人加上拉屎的.mp4
THE BRAIN
讲到这里,就可以回到 UnisonMind 最核心的差异。
💡 流式输入,和持续状态更新。
真实世界没有暂停键。人会移动,球会起落,声音会重叠,新指令会随时插进来。
一个真正进入物理世界的模型,不能只在输入结束后回答。它必须一边看、一边听、一边更新判断。
现在很多 VLM 都是抽帧,会有很大局限。用一个简单类比:
普通聊天机器人,像收到消息才上线。UnisonMind 想做的,是像一个始终在场的人。它知道刚才发生了什么,也知道现在正在发生什么。
当然,只有流式还不够。如果视觉是一个模型,语音是一个模型,动作又交给另一个系统,中间靠规则临时拼接,它依然很难形成稳定的世界理解。
一念给 Physical AGI 提了一个「3+1」框架。
我用人话翻译一下。
01一个脑子实现多模态
视频、图像、语音、文字,以及设备自身状态,都进入同一个世界表征。视觉、语音、动作,不能各做各的。
02理解和生成统一
它不只要看懂,还要根据任务说话、移动、交互。理解和输出,最好属于同一个认知过程。
03流式输入、理解和生成
它不能做完一次问答就下线,而要持续运行。任务可以被打断,可以被修正,也可以被重组。
+1完整端侧运行
核心大脑在设备本体上,端侧模型意味着参数量不大。
UnisonMind 是一个只有11B 参数量的模型,机器人背上的显卡(agx)就是他们的驱动引擎。(可以看出来,朴实无华,就这么焊在背上了……)
能把一个 10B 上下的模型,压进端侧,还要同时跑视觉、语音、认知、生成、保证实时,这件事的难度,懂的人自然懂。
当然,也不是没有代价。
现场是能感觉到「等待」的。部分任务从接令、理解到行动,反应不算快。流式叠加端侧算力的限制,这是真实的短板,我不藏着。
他们有一句官方表达:
One codebook. One evolving world.
一个统一符号空间,一个持续演化的世界。这句话有点技术,但意思其实不复杂。
它的目标,是让设备拥有一个统一的「世界状态」。它知道自己看到了什么,听到了什么,自己处在什么位置,刚刚发生了什么,下一步可能发生什么。然后再决定输出语言,还是输出动作。
话说回具身智能本身。真正困难的地方,恰恰在这里。
它更像系统工程,模型、硬件、控制、传感器、延迟、现场噪声、安全边界,全部搅在一起。
你只懂模型,不够。你只懂机器人,也不够。你必须愿意把手伸进真实世界里,去碰那些麻烦、脏活、边界情况。
这也是我对英健他们团队印象很深的地方。
REAL WORLD
这次现场还有一个点,我觉得应该写出来。
它并不是一个只保留成功镜头的精剪 Demo。
现场有 20 多位来宾,全程录像。人群在走,指令是临时给的,现场有声音干扰,硬件状态也会变化。
其中轮椅演示里,确实出现过一次异常转圈。
这个事情不能被包装成成功。故障就是故障。
但它也提醒我们一件事:Physical AI 面对的不是干净的数据集。它面对的是一个会随时出意外的世界。
真实世界里,本来就有噪声、遮挡、误解、网络问题、硬件问题。
所以判断一套具身智能系统,不能只看它成功完成了几次任务。还要看意外发生后,它能不能感知、回应、调整,并尽量保持安全。
这也是为什么我更愿意看真实现场,而不是看一条剪得很漂亮的视频。漂亮视频当然有传播力,但真实现场更能暴露技术水平。
ONE BRAIN
最后说说我真正关心的想象空间。
UnisonMind 最有意思的地方,不在于机器狗会不会点咖啡。而在于它让「大脑」和「身体」开始解耦。
机器狗是一种身体。人形机器人是一种身体。轮椅也是一种身体。未来扫地机器人、配送机器人、陪伴设备、工业设备,都可能是新的身体。
如果底层执行参数和 API 接口适配好,上层认知就有机会复用。
「这件事一旦成立,商业路径会完全不一样。」
以前是一种硬件做一套系统。机器狗有机器狗的系统,轮椅有轮椅的系统,机器人有机器人的系统。每一种都要重新做一遍。
但如果同一个认知底座可以适配多种设备,具身智能就有机会从「项目制」走向「平台化」。
这才是我觉得它有想象空间的地方。它更像一个物理世界里的 AI Runtime,而非一个单点产品。
当然,这条路还很长。跨本体迁移到底能做到多深,底层控制如何标准化,端侧算力怎么继续提升,安全边界怎么定义,都还需要大量验证。
但方向上,我认为是对的。(当然,评论区如果有高人欢迎随时补充~)
AI 如果要真正进入物理世界,最后一定不能只靠云端大模型远程发号施令。它必须长在设备里,持续在线,和真实世界共享同一条时间线。
ENDING
我不会说一念已经实现了 Physical AGI。这句话太大,也太早。完整的 Physical AGI,需要更多设备、更多环境、更长时间尺度的验证。
但我愿意说,不管是这次在清华小院里还是现场发布会,我第一次比较具体地看见了一条路线:
「AI 不再只是屏幕里的回答者。它开始变成常驻在设备里的大脑。」
它要看见世界,听见世界,记住刚才发生了什么,也理解现在正在发生什么。
以前我们讨论具身智能,经常盯着腿、手、轮子和机械结构。但这次,我更关注的是那个「脑子」。
因为身体可以有很多种。真正决定它能不能走进世界的,是它有没有能力持续理解世界。
具身智能的下半场,拼的是谁能更稳定地和真实世界待在一起。
KK 在《五千天后的世界》里说,再过五千天,数字世界会反过来长进物理世界,虚实之间,再没有边界。
数字世界那个脑子,已经有了。
物理世界这个脑子,刚刚开机。
而这五千天的第一天,可能就是从一个脑子、接上一个身体,开始的。
以上。