AIGC不卷画质却扎堆给机器人当“大脑”?一场被逼出来的硬仗

问AI · 视频公司转向具身智能是竞争所迫还是技术必然?

 作者声明:该图片由AI生成图片




【摘要】过去,输入本文“机械臂拿起杯子”,随后AI生成一段视频,只要动作流畅、画面连贯,便足以赢得掌声。如今,同样的画面被放进机器人训练系统,问题骤然变得棘手:现实世界里,杯子有没有重量?夹爪的力度是否合理?


视频模型开始作答一套来自物理世界的新考卷。


2026年7月,蚂蚁灵波连续发布多项具身智能模型。其中,LingBot-Video在互联网视频之外引入机器人操作、导航和第一视角素材,并将物理合理性、任务完成度写入训练目标。项目方称,这是首个大规模开源的混合专家架构视频基础模型。


类似的迁移也出现在生数科技和恒星AI身上。生数科技正尝试把Vidu积累的视频生成与预测能力延伸至物理世界建模;恒星AI则以自研影视级视频生成技术为起点,宣布进入具身智能赛道。


为何是视频公司?这是AIGC竞争加剧后的转向,还是视频模型与机器人之间本就存在一条隐秘通道?


以下是正文:




01

下一帧,通向物理世界



2024年,AI视频行业最热闹的话题还是如何追赶Sora。


当年5月,生数科技与清华大学联合发布Vidu论文;随后,可灵、Vidu、即梦等产品相继面向用户开放。几个月内,中国市场快速聚集起一批文生视频工具,竞争围绕清晰度、生成时长、镜头运动和人物一致性展开。


一年后,行业的关键词开始改变。


2025年1月,英伟达发布Cosmos世界基础模型平台,将视频模型用于机器人和自动驾驶系统。其设想是通过生成视频补充真实数据,在虚拟环境中测试策略,再根据具体设备和场景训练专用模型。


到2026年6月,Qwen-RobotWorld进一步展示了视频模型进入具身智能的具体方式:模型根据当前画面和语言动作指令,预测未来的视觉轨迹。


其训练语料包含860万组视频,超过2亿帧,覆盖20多种机器人形态和500多类动作。技术报告给出的应用方向包括生成机器人训练数据、搭建虚拟评测环境,以及为下游控制系统提供规划信号。


这条迁移路径并不难理解。


对比部分依赖视觉的数据采集模型,视频模型为了生成下一帧,需要理解人物与物体的位置关系、遮挡关系和运动趋势,并据此预测接下来可能出现的画面。可以说在一定程度上,视频模型一开始就是“睁开双眼”的状态。


加入机器人的动作信息后,模型还需要建立动作与环境变化之间的联系。例如,生成一段人推开房门的视频时,模型需要保证人物、房门和镜头运动保持连贯。


由此,视频模型具备了发展为“世界模型”的潜力。


机器人可以在真正行动前,先推演几种动作可能带来的结果,再选择更合适的方案;模型也可以生成不同光照、视角和物体摆放条件下的训练数据,降低真实环境采集与反复试错的成本。




02

从数字AI到物理AI



过去几年,视频生成模型的竞争主要围绕内容生产展开。


基础模型提供生成能力,产品工具降低创作门槛,API服务连接企业需求,最终进入广告、影视、营销和内容消费等场景。


进入具身智能领域后,这套商业逻辑开始发生变化。


视频模型面对的对象,从创作者和内容平台转向机器人系统和工业场景。模型需要处理的不只是画面连续性,还包括环境状态、动作结果和物理规律。


因此,视频公司的迁移路径并不相同。有的选择延伸已有模型能力,有的寻找新的产业应用场景,也有的直接围绕机器人任务重新组织模型体系。


生数科技:从视频生成走向世界预测。


生数科技的起点,是他们的Vidu模型。


Vidu采用U-ViT架构,能够单次生成最长16秒、1080P视频。除了文生视频,团队还展示了边缘控制、主体驱动生成和视频预测等实验。


随后,Vidu面向用户开放,进入文生视频、图生视频等内容创作场景。在这一阶段,模型能力通过创作工具触达用户,同时面向企业提供相关服务。


随着视频模型向具身智能延伸,生数科技开始探索另一条价值链。


2025年7月,生数科技与清华大学联合发布具身视频模型Vidar,将视频模型能力引入机器人操作场景。模型根据当前视觉信息生成后续运动轨迹,再从预测结果中推导机器人动作。


同年12月,团队进一步发布Motus,将语言理解、视频生成、环境预测和动作输出纳入统一框架。


这条路线的优势在于复用。


Vidu已经拥有模型底座、训练基础设施、产品入口和企业API,生数科技无需从头搭建一套视频系统。


难点来自数据转换。


影视和互联网视频记录的是“人看到什么”,机器人训练需要知道“机器做了什么”。机械臂的每一次移动,都对应关节状态、动作指令、末端位置和环境反馈。


缺少这些信息,模型只能模仿画面变化,很难准确学习动作与结果之间的因果关系。


图片

图片来源:生数科技


智慧恒星AI:影视级生成寻找工业落点。


2025年7月,恒星AI推出AstroWit,提供文生视频、图生视频、视频生视频、配音和配乐等功能,面向大众创作者和内容消费场景。


直到2026年3月,Starfilm全球版亮相,公司的产品重心还是在影视工业化和海外市场。


但是到了2026年5月28日,恒星AI突然与山东未来集团旗下马尔斯机器人达成战略合作,共同打造全球首个“影视级具身智能”超级终端。


3个月不到的时间,突然转向具身的背后,固然有恒星AI在高质量画面、镜头运动、复杂场景和视觉一致性等方面的技术积累。


但是,机器人训练需要覆盖大量环境和任务变化。同一个抓取动作,可能发生在不同桌面、不同光照、不同视角。依靠真实设备逐一采集,需要持续投入场地、人员和硬件。


此次合作,是恒星AI进入具身智能产业链的第一站。相较于直接制造机器人,这条路径对资本、供应链和硬件能力的要求较低,也能继续利用公司现有的视频模型和创作工具。


不过,影视画面与机器人训练数据采用不同的评价标准。影视作品更关注画面效果、叙事节奏和视觉连贯性。机器人数据还要满足空间结构、运动轨迹和物理规律。


图片

图片来源:智慧恒星AI


蚂蚁灵波:围绕机器人重做视频模型。


2026年7月7日,蚂蚁灵波团队提交LingBot-VLA 2.0技术报告。模型预训练数据约为6万小时,其中包含5万小时机器人轨迹,覆盖20种机器人配置,另外还有1万小时第一视角人类视频。


7月8日,LingBot-Video公开。


这一次,团队将视频模型明确放入具身智能语境。架构采用稀疏混合专家方案,希望在扩大模型容量的同时控制推理开销;训练素材加入机器人操作、导航和第一视角视频。


这些调整指向同一个目标——视频生成的结果要能够描述动作和环境变化,并充分服务后续的机器人学习。


7月9日,LingBot-VA 2.0继续向控制端推进。


模型把视觉状态和动作放进统一的语义空间,并采用因果预训练,让系统根据过去和当前状态预测未来。


从7月7日的VLA模型,到7月8日的视频基础模型,再到7月9日的视频-动作模型,蚂蚁灵波用机器人轨迹训练基础能力、用视频模型学习环境变化,再把预测结果接入动作和控制。


从商业模式来看,蚂蚁灵波面对的是更长周期的产业链。


基础模型需要连接机器人硬件、数据采集、控制系统和应用场景。其商业价值不仅取决于模型效果,还取决于能否形成持续的数据反馈和生态合作。


图片

图片来源:蚂蚁技术研究院


综合来看,三家公司的迁徙路径已经逐渐清晰:生数科技走的是能力外延路线,从成熟的视频生成与预测模型出发,寻找物理世界的新应用;恒星AI走的是场景迁移路线,将影视级生成能力投入机器人数据与仿真;蚂蚁灵波走的是底层重构路线,围绕机器人控制重新组织视频、动作与环境状态。


它们共同说明,AI视频行业的竞争已经开始转向其他AI赛道的转型竞速。


视频模型生成的下一帧,开始承担训练数据、虚拟环境和行动预测等更多任务。但是商业模型的重构、能力的迁移好坏、所承担的责任更现实,这些又是一个个摆在每一家厂商面前最现实的问题。




03

尾声



视频模型奔向具身智能,为陷入激烈竞争的AIGC公司打开了新的商业空间,也为机器人行业提供了低成本数据和虚拟试错工具。


屏幕内的错误可以重新生成,物理世界中的错误往往需要付出真实代价。模型要理解空间、动作与结果,还要经受实时性、稳定性和安全性的长期检验。


生数科技、恒星AI与蚂蚁灵波已经选择了不同入口。


未来的胜负,将取决于谁能把“下一帧会发生什么”,真正转化成机器人“下一步应该怎么做”。

作者声明:个人观点,仅供参考