我是发现了,这一年隔个一两周就会有让人特别兴奋的产品或者模型发布,根本停不下来。
前天不忙,我没给自己安排太多的事,想着下午早点休息。
大概吃完午饭一点多,同事喊我说,阿颖,你看一下这个模型,就是之前咱们曾经设想过的一个应用场景。
我一看,哈哈哈,觉得太有趣了。我给大家放个录屏。一个老师坐在图书馆里,给我讲海明威的故事。他会随着我的提问,实时改变讲解的内容。
因为我们团队一直在做教育工具类产品。像题目讲解这类场景,过去基本就是两种方式:一种是播放录播课,另一种是用文字或语音问 AI。
我当时就想,能不能找到一个模型,让学生可以跟老师实时交互?老师在前面讲课,学生随时打断提问,老师再继续回答。当时已经有大模型了,找了一圈,没有能做到的。
这是两年前的事情。
但昨天看到这个模型的时候,我感觉这个事情终于有机会实现了。模型名字叫 MaineCoon。
当然现在还是刚刚发布,交互的时候最好用英文,对中文的支持还不够好。但我看到了希望,按照过去这一年模型的发展速度,这个方向应该会很热闹。
讲课只是其中一个场景。
#01
有趣的应用场景
但如果虚拟陪伴可以做到这样呢:我们跟她聊天,她能够实时回应,就像豆包的实时语音交互那样,同时加上视频的能力。这个角色的面部表情、神态都跟真人一样。
这样就很有想象空间了。等于我在和我另外一个 AI 实时视频通话,而不只是听声音或者看文字。
同样,我做了一个 Case,大家看看。
设定的场景是深夜里,一个朋友在卧室,陪我聊天。可惜的是,模型目前只能通过文字交互,要是加上实时语音,这个天我感觉能聊一小时。
甚至,我觉得上面这个深夜陪伴的 Case,稍微改一改,就能直接用于英语学习。
开着视频,对面的 AI 外教会根据交流实时变化表情和眼神。表达不准确时,脸上会露出一点疑惑。卡壳的时候,会耐心地看着我们。等表达清楚了,又会笑着点点头。
很多反馈其实不用说出来,一个眼神、一个表情就够了。这也是视频相比语音最大的价值。
我又想到另一个场景。不知道大家有没有用过豆包的博物馆讲解功能。把摄像头对着一个展品,它会用语音介绍背景,还能继续追问。我一直觉得这个体验已经很好了。
但如果再往前走一步呢?比如准备去罗马旅行,在出发前就有一位真人模样的 AI 导游,带着我一边逛景点,一边讲历史。
讲到斗兽场的时候,会伸手指向远处。讲到万神殿的时候,会抬头示意屋顶的穹顶。
一个眼神、一个手势,就能把注意力带到对应的位置。这种体验,比单纯听语音讲解生动得多。
就像下面这样。
这么一想,思路一下子就打开了。
所以 MaineCoon 这个模型真的超级有趣。它刚刚发布,目前相关的信息还不多。我搜了一下,6 月份 Z Potentials 上面有一篇文章介绍了他们整个团队。
做这个模型的公司叫 catnip.ai,全公司就 10 个人,非常年轻的团队。核心成员都来自知名的大厂。
比如创始人杨姝瑞,之前在 TikTok 和 PixVerse 做产品负责人。负责核心算法的谢泽柯是港科大的助理教授,之前在百度研究院。
MaineCoon 是一款 22B 参数的实时音视频基础模型。
和大家熟悉的 Sora、可灵这类生成一段完整视频的模型不同,MaineCoon 更强调实时交互。
用户输入一句话,不到一秒就能开始生成画面和声音,后面的内容会一边播放、一边继续生成,更像是在和一个 AI 角色视频通话。
所以,他们团队对 MaineCoon 模型的定位也很有意思,认为它是一个 Social World Model。
目标希望未来的 AI 不只是会回答问题,还能够通过声音、表情和动作与人实时互动。
#02
和视频生成模型的区别
虽然都是视频,但其实完全不是一个类型的产品。我甚至觉得,如果 AI 时代会诞生下一代的抖音,那大概率是基于这类模型之下的产物。
区别在哪里呢?所有的视频生成模型,不管是 Seedance 还是别的,它都是提前生成好的内容。
我们给它一段提示词,比如一个老师在讲台上讲课,不管它能生成 30 秒还是以后能生成 5 分钟,这些内容都是通过提示词提前生成的。
生成完了,我们只能看。我们和视频之间是单向关系。
而实时音视频模型完全不同。我们说一句话,画面立刻变化,角色立刻回应,剧情立刻调整。
我们消费的已经不是视频本身,而是在和视频里的角色建立互动。
从这个角度看,它更接近下一代交互方式,而不是下一代视频创作工具。
互动非常重要。我之前做教育类工具产品,有一个很深的体会:人最烦的就是被动接受信息。
上课的时候如果老师讲得比较枯燥,没有互动,我们都容易打瞌睡。
ChatGPT 最有意思的地方就是我们问一句它答一句,它不是机械地让我们读一篇文章,也不是像之前的搜索引擎那样丢给我们一堆链接。它会跟我们真正地递进式交互。
因为对话有反馈,有连续性,有参与感。视频也一样。未来最有价值的东西未必是生成一条视频,而是生成一个能够持续互动的角色。
这个方向其实大厂都在做,OpenAI 在做,字节也在做。ChatGPT 和豆包都有实时语音的交互功能。
而现在 MaineCoon 在音频交互的基础上又加上了视频的能力,整个体验就更完整了。
#03
技术层面的突破
第一个是成本。大家都知道现在视频生成有多贵,Seedance 2.0 随便生成十分钟的成品视频,千把块钱就没了。就算再便宜的模型,成本也不低。
MaineCoon 把生成成本压到了一个很夸张的水平,GPU 满载的情况下每秒 0.00025 美元,大概是 Seedance 2.0 的五百分之一,Veo3 的两千分之一。
当成本降到这个量级,产品的商业模式才有可能跑得通。
第二个是速度。传统的视频生成模型有一个结构性的问题,必须整段生成完了才能播放。
我输入一段提示词,可能等好几分钟才能看到结果。这种模式从根本上就不可能做实时互动。
MaineCoon 的做法不一样,它不是先做完再播放,而是边生成边播放。
0.64 秒为一个生成单元,首帧在 1 秒内就能响应,后面像水流一样持续往前走。单卡 H100 跑到了 47.5 FPS,比市面上其他流式音视频模型快了大概 7 倍。
第三个是时长。流式生成有一个很头疼的问题,生成时间一长,画面就会开始变形走样,角色长着长着就不像自己了,音画也对不上。
大多数模型撑不过几分钟,超过 10 分钟基本是无人区。
catnip 的团队为此搞了一套叫 Agentic Streaming Inference 的框架,简单说就是给模型装了记忆系统和规划系统,让它能够管理自己的生成历史,预测接下来的内容走向。
靠这个方案,MaineCoon 实现了 30 分钟以上的连续生成,画面依然稳定。
具体的技术我不展开了,大家可以看我前面贴的技术报告。
这三个问题,成本、速度和时长,过去整个行业一直陷在一个三角困境里面,要速度就得牺牲画质,要画质就得接受延迟,要降低成本就得压缩模型规模。
MaineCoon 从架构层面解决了这个三角难题。它第一天就是奔着实时流式场景设计的,训练框架、模型架构到推理部署,几乎都重新设计了一遍。
#04
写在最后
为什么这么判断?
因为今年 5 月,我偶然用了一次豆包的博物馆讲解功能,就那一次,我后来去博物馆基本都会打开它。
虽然它偶尔还有幻觉,讲解也谈不上完美,但我第一次觉得,AI 可以用一种完全不同的方式和人交流。
MaineCoon 又把这个方向往前推了一步。从语音交互,到实时音视频交互,看起来只是多了一层视频,但体验其实完全不一样。
如果未来这类模型成熟了,无论是博物馆讲解、教育、游戏,还是旅游、陪伴这些场景,都会有很大的变化。
很多产品的核心体验,可能都会围绕实时音视频重新设计一遍。太有趣了。太有趣了。