周五上午,我还在感慨,开源视频模型终于追到了 Seedance 2.0 大概八成的水准。结果到了下午,Seedance 2.5 就发布了。
怎么讲,这半年大家应该都感受到了,Seedance 2.0 已经成为全球范围内 Top 1 的视频模型,这一点已经没什么争议。
这一次,Seedance 2.5 又把第一名和第二名之间的差距拉大了。
过去我们在讨论 LLM 的时候常说,OpenAI 和 Anthropic 的模型大概领先其他模型 3 个月。
目前在视频模型这个领域,看来 Seedance 2.5 对第二名或者第三名的领先幅度至少是 6 个月。
而且这一次让我感受最强烈的一点是豆包专业版已经开始把应用和模型之间形成非常好的配合。
在豆包专业版中,使用视频创作的 Agent,我们只需要用自然语言描述自己的需求。
Agent 就可以帮忙搞定创意拆解、分镜设计,最后再调用模型生成宣传片、广告片等生产力场景的视频内容。
大家看这个截图。也就是说,通过 Seedance 2.5 和豆包应用的配合,提示词的门槛也已经没有了。
视频的生成这一次,核心用户彻底从专业的创作者,过渡到了普通用户。
我感觉,至此,AI 视频的下半场来了。
#01
Seedance 2.5 的提升
之前有一段时间大家会说可灵的画质是比 Seedance 2.0 好的。
但 Seedance 2.5 出来之后再去对比,会发现在画面质量、分镜控制以及对提示词的理解方面,Seedance 2.5 应该都是全面领先了。
而且 Seedance 2.5 单段生成从 15 秒提升到了 30 秒。
下面,这是我一次直出的短片,提示词类似上周五文章中的:
回忆童年的盛夏午后,旧院子总是被暖黄色调包裹。那个无忧无虑的小男孩正在满院子欢跑,试图追逐半空中被风卷起的一只透明塑料袋。木门框旁,满脸慈爱的奶奶正逆着温暖的光站着,温柔地呼唤他吃西红柿拌面。
瞬间的时空跨越,当年那个追逐塑料袋的小男孩,如今已是满身疲惫的成年人。他静静地站在当年同一个位置,但木门前已空无一人,院子也已荒芜。
此时,一阵同样凛冽的风吹过,卷起了他的衣角。最后字幕缓缓出现:“我们在时间里遇见最爱我们的人。后来,也在时间里和他们告别。”
大家再看这次 Seedance 2.5 的效果,很明显更写实了,画质和人物的表达会更真实。
同样,我把之前 Seedance 2.0 的片子也放出来:
又试着做了一个类似电影《呼啸山庄》女主回眸的画面,这次提示词我做了精确控制:
女人骑着一匹缓慢行走的马穿过阴冷荒原,马匹始终不入画,但骑乘感贯穿全片:肩膀、颈部和镜头随着马步轻微起伏,远处荒原向左侧掠过。只保留强风、衣物摩擦、沉闷马蹄声和轻微呼吸。
她穿磨损的暗砖红高领骑装和灰白衬衣,左耳一枚小金色耳环。深棕卷发被风吹散,湿润发丝不断扫过脸庞。真实皮肤纹理,阴天自然光,低饱和灰蓝、泥土褐和暗砖红,寒冷粗粝的电影质感。
0—2秒:她面朝画面右侧前进,观众主要看到后脑、左侧颈部、耳环和少量侧脸。鼻尖朝右,绝不正对镜头。
2—6秒:她察觉身后可能有人,开始缓慢回头。眼睛先向左侧寻找,随后头部、鼻尖、下颌和颈部连续转动。动作必须持续推进,不能突然切换。脸逐渐从侧面转向三分之四角度。
6—8秒:回眸完成,她轻微朝向画面左侧,望向远方荒原,不看镜头。眼神带着寻找和期待,短暂吸气,嘴唇微微分开后合拢。
8—12秒:远处没有任何人。她继续寻找,期待慢慢消退,变成失望、疲惫和不愿接受现实的迟疑。瞳孔下移,下颌轻微降低,呼吸变沉。发丝继续扫过脸庞,身体随着马步轻微起伏。
大家重点看一下它对指令的遵循能力。这次我只生成了 12 秒,但效果非常好。画面几乎完全按照我在提示词里设定的时间和节奏推进。
这也是我前面提到的,Seedance 2.5 在可控性上的提升。它能够按照明确的时间顺序,执行人物动作、镜头运动和情绪变化。
我们可以把每一个时间段的内容写清楚,模型再按照这个安排逐步完成。这个对于想详细控制画面的创作者来说是利好。
同样我感觉这个画面的情绪表达真的已经逼近实拍了。
上面都是模型直出的效果。不过,如果大家对提示词的驾驭能力没有那么强,我还是强烈推荐直接在豆包专业版里调用 Seedance 2.5。
#02
在豆包中快速生成视频
豆包专业版其实已经开始用 Agent 的方式重新组织视频创作流程,而且整个体验非常简单。
下面的截图是豆包网页版本。在技能中选择“创意视频”后,可以看到它主要 Focus 的是商业视频生产场景,包括广告片、口播视频、产品推广视频等。
我们可以把脚本、网页链接、产品资料和参考图片直接交给它,只要大概讲清楚自己想做什么就行。
现在不是有很多专门的视频 Agent 嘛,其实我们可以把豆包专业版这个功能也理解成一个搭建在模型之上的视频 Agent。
它会基于自己对视频创作的理解,先消化我们提供的资料,帮我们梳理创意、拆分任务、设计分镜,最后再调用 Seedance 2.5 生成视频。
如果是 30 秒以上的长视频,它还会自动拆成多个段落分别生成,最后再完成拼接。
所以对于大部分普通用户来说,不需要一上来就掌握特别复杂的视频提示词。
先把自己的需求、素材和想法交给它,再让这个视频 Agent 帮你把后面的工作继续完成。
比如随手又拿起来孩子喜欢的书《青铜葵花》,直接把第一页的文字摘出来,喂给 Seedance 2.5。
接着,豆包专业版会拆解我的需求。
如果和预期不一致的话,可以继续修改。大家可以看到,基于我输入的图片,其实豆包专业版已经把分镜和画面内容准备好了。
最后生成的内容如下:
看到这段视频的时候,我甚至冒出了一个想法:我们或许可以把课本里的诗词和课文,直接交给 Seedance 2.5 做成视频。
因为小学生刚开始接触一首诗、一篇课文时,其实比较难以理解文字想表达的氛围和情绪。他们没有见过大漠孤烟,也不知道古代的长安是什么样子……
过去,这一部分主要依靠老师讲解,再让孩子自己想象。
现在,或许可以把课文交给模型,在几分钟内生成一段视频,这样立马就能直观感受到文字背后想传递的画面。
这可能是 AI 视频在教育里一个非常具体,也很容易落地的场景。
我又把手机相册中唐三彩的照片在豆包专业版中跑了一次,看看效果。我的构想是让图片中的人物醒过来,变得活灵活现,有动作,也有神态。
下面的截图,我的输入其实是通过语音输入法完成的。
这样也许以后博物馆有新的展品或者展览上线,完全可以直接用 AI 做一条宣传片。
这样文物就不再只是静静地摆在展柜里,也能用更生动的方式,把背后的故事讲出来。
继续玩,给我喜欢的咖啡馆做个宣传片。这次的提示词非常简单:
给这个我喜欢的咖啡馆做一个宣传片。要求唯美,能够突出咖啡的属性,能够突出门店的调性。
这是最终的成品,也不错。一次直出这个效果,感觉再简单编辑下,就可以用了。
写文章的间隙,顺手又给老家山西做了一个文旅宣传片。
这里,我还是使用豆包专业版。强烈推荐大家用这个模式,就像下面截图这样,我用语音输入法口喷完自己的需求后,大家看,它会直接去搜索相关的景点图片。
旁白、台词这些都是豆包规划的:
我又补充了下自己的想法:
第一次生成的视频佛光寺不对,我想要的是佛光寺东大殿。于是,手动传了一张图片,让它继续修改。
下面是最终生成的效果:
为了对比,我做了一个模型直出的效果。发现这里面云冈石窟的照片就完全错位了,而且整个镜头的构思没有上面豆包专业版的合理。
这也能侧面说明模型之上 Agent 脚手架的价值。
#03
写在最后
过去一段时间,大家讨论 AI 视频,好像关注点经常集中在电影和短片上。这些方向当然值得关注,但其实离大部分人的实际需求还有一些距离。
我在想,现实里数量更多的需求,可能是今天我测评的这些宣传片、产品介绍、活动预告、课程讲解和广告片。
比如一家电商店铺上架了新产品,需要制作一条产品视频。再或者,有人新开了一家店,需要拍摄一条宣传片。
一个博物馆上线了新展览,希望让用户了解。一个老师讲解课文,希望给学生补充一段影像。
这些视频大多只有几十秒,制作要求也没有电影那么复杂,但过去仍然需要策划、拍摄、演员、场地、剪辑和配乐。一条稍微精致一点的片子,成本很容易达到几万元。
现在,像我们这样规模不大的产品团队,也可以把产品资料、图片和创意交给 Seedance 2.5,快速制作一条产品宣传视频。
按照我们这次测试的实际感受,花费一两百元,已经有机会生成一条相当精美的短片。
它可能还需要挑选版本、修改提示词,或者完成少量后期处理,但成本和过去已经完全不在一个数量级了。
这让我想起十多年前微信公众号刚刚出现的时候。
在那之前,一个普通商家想要持续发布内容、触达用户,需要自己建设网站,或者依靠报纸、电视和其他媒体渠道。特别贵,而且很重。
公众号出现以后,每一个商家都可以迅速申请一个账号,直接发布消息,和自己的用户保持联系。
今天的 AI 视频,有点类似公众号当时的感觉。它彻彻底底成为了一个生产力工具。
以后每一个商家都直接拥有自己的视频生产能力。
发布一个新产品,可以立即生成一条宣传片。策划一场活动,可以迅速制作预告视频。甚至只是更换了菜单、包装或者展品,也可以制作一段内容告诉用户。
我觉得,这才是 Seedance 2.5 真正打开的想象空间。