机器人闭上眼也能干活了!N₀-TWAM把触觉打造成原生基建

问AI · 机器人如何学会在拧螺丝时先靠“摸”预判未来?
专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注!

机器人学会"摸"着干活了!

你拧螺丝的时候,眼睛看的是螺孔位置,手指感受的是螺纹咬合的阻力。螺丝到底拧没拧到位,靠的不是看,是摸。

NeoteAI团队和复旦TEAI团队,联合提出了一个触觉原生世界动作模型(World Action Model)。它把未来画面、未来触感和动作放进同一个生成模型里联合预测,再用预测出的多模态未来去反推动作。

图片

N₀-TWAM世界模型让机器人在动手之前,先在脑子里"摸"一遍未来。它重构了机器人的认知中枢,首次实现视频、触觉、动作三序列的联合预测。

在UniVTAC、NeoSim和8个真实机器人任务上,N₀-TWAM平均成功率分别达到84.5%、49.4%和46.3%,全面超过现有VLA策略和纯视觉世界模型。

触觉写进未来

现有的视觉语言动作策略(Vision-Language-Action,VLA)从当前观测直接回归动作,不显式建模下一刻会发生什么。已有的世界动作模型通常只预测视频。两者都没有把接触当作未来的一部分来对待。

N₀-TWAM的思路不同。它预测3条耦合的流:未来视频、未来触觉、动作。

图片

一个帧ID因果级联先让视频专家和触觉专家共同生成即将到来的场景和接触状态,再让动作专家基于这对刚预测出的多模态未来去去噪出统一的末端执行器动作。没有任何token能读到未来chunk,整个"先预测、再行动"的分解,在一个共享注意力掩码内完成。

训练数据来自NeoData,覆盖6种机器人本体、450个任务,约750万条训练片段。

每条片段对齐了多视角RGB、逐指触觉视频、语言指令和标准化的20维双臂末端执行器动作。一个冻结的因果视频VAE同时编码相机和触觉流,机器人特定的动作归一化让不同本体兼容。

视频、触觉、动作三者使用等权的流匹配(flow-matching)目标训练。训练先从真实机器人数据开始,再把N₀-TacUMI演示混入约60%的batch。

不对称的7.16B

模型架构是一个不对称的混合Transformer(Mixture-of-Transformers,MoT)。模态容量隔离在私有权重里,注意力不受限制。

图片

视频专家保留完整的3072维宽度,参数量5B;动作专家和触觉专家各1024维,参数分别1.13B和1.03B。三个专家在每个block通过一层全宽共享自注意力保持互相可见。

图片

7.16B可训练参数,大约是3个全宽专家所需15B参数的一半。推理时,预测出的视频和触觉的key和value先缓存,动作去噪阶段只重跑那个轻量动作专家。滚动缓存加异步chunk生成,把大部分预测延迟藏在机器人执行时间后面。这个设计把算力花在了刀刃上。

预测与感知

触觉在N₀-TWAM里扮演两个角色,走两条不同的通路。

预测通路把触觉视频当作未来的一部分。触觉流使用和场景视频相同的冻结视频VAE、相同的潜帧流匹配目标,配合可学习的传感器标识符,支持最多4个触觉视角。

专家预测的是相对初始触觉帧的残差,把容量集中在接触发生、打滑、加载、释放这些关键变化上,而不是去复现一个几乎不动的传感器背景。

感知通路处理的是正在发生的接触。在真实机器人上,一个冻结的估计器把每张InTac S1图像转成稠密的三轴力图,NeoForce编码器再把物理信号变成token。一个零初始化的交叉注意力端口在动作头之前注入这些token。

图片

预测触觉在VAE潜空间里提供预期性接触信息,感知触觉在力空间里提供反应性的、传感器接地的实时读数。一个管"将要发生什么",一个管"现在正在发生什么"。

训练时刻意分离这两个角色。大规模预训练只开启预测触觉,逼模型去学接触动力学,而不是拿当前触觉走捷径。任务特定的后训练才激活感知条件,并用动作目标微调NeoForce。仿真环境里,同一个条件接口处理仿真触觉观测。

消融实验验证了两条通路都不可或缺。

图片

去掉预测触觉,均值掉10.6个百分点。去掉感知触觉,掉17个百分点。感知通路对NeoSim的影响尤为剧烈,从49.4%跌到29.6%。仿真环境里接触信号更干净,模型对它的依赖也更深。

预训练数据量的影响同样显著。

图片

数据缩到20%,成功率掉近20个百分点。

接触即标点

长程操作任务的老问题是一句episode级指令没法告诉策略当前执行到哪一步了。

N₀-TWAM用接触事件做标点。触觉幅度的突变标记接触发生、稳固抓取、释放、就位、失去负载;夹爪开合度在触觉事件微弱时提供兜底。这些事件把演示切成短的子任务片段,语言模型为每段生成简洁指令,人工审核修正剩余标签和边界。

图片

推理时,一个轻量调度器维护子任务队列。模型在当前提示下运行,预测触觉流预期下一个接触事件。预测事件可以提前一步触发过渡,但对应的感知触觉里的接触或释放必须确认后,切换才真正提交。抓取失败时夹爪合上了却没有力上升,同一个信号既标记边界,也验证物理完成。

这个设计把预测通路和感知通路在执行层面也串了起来。

在覆盖8个UniVTAC任务、12个NeoSim任务、8个真实机器人接触密集任务(PiPER和Flexiv平台)的评测上,真实机器人平均成功率46.3%,超过Π0.5的30.0%、LingBot-VA的21.9%、FastWAM的14.4%。

图片

增益最明显的任务,恰恰是抓取安全性、负载、打滑、就位这些视觉上模糊的场景。

NeoSim把4个单臂任务和8个双臂任务分开统计。

图片

单臂任务上,N₀-TWAM的63.8%和Π0.5的68.8%差距不大。双臂任务上42.3%对34.3%。双臂协调对接触建模的要求更高,触觉预测的优势在这里体现得更充分。

泛化测试里,面对未见物体、未见位置、视觉扰动,N₀-TWAM拿到51.7%的平均泛化分,同样是最高。

N₀-TWAM把触觉从辅助输入变成了机器人未来模型的原生组成部分。

团队提到的后续方向:拉长预测时域,提高控制频率,把触觉传感器覆盖到更多本体。

你的手指每天替你做着无数次"看不见的判断"?机器人也开始学这件事了。

参考资料:

https://research.neoteai.com/n0-twam/

https://github.com/neoteai/N0-TWAM

https://arxiv.org/pdf/2607.23783v1