字节推出全双工音视频大模型并上线豆包

问AI · 全双工技术规模化落地将如何影响行业?

IT时代网8月5日消息,字节跳动Seed今天宣布推出原生音视频全双工大模型SeedRealtime。按官方的说法,这是在往全模态自然交互的方向走。

SeedRealtime用统一架构把音频、视频与文本原生融合到一起,能在连续的多模态信息流上实时交互,带来"边看、边听、边说"的体验。

官方列了三项核心突破。第一项是音视频联合理解,原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。

第二项是主动的交互能力。模型具备持续的环境感知与主动表达能力,察觉画面状态变化时(比如关键目标出现)会主动提醒,还能调用工具融入表达。交互形态由此从被动响应变成了主动协作。

第三项跟对话节奏有关。模型能实时感知用户的对话状态与交流节奏,在合适的时机自然接话、停顿与回应;抗干扰能力也做了加强,能分辨旁人闲聊和背景噪声,不会被这些干扰误触发。

端到端人工评测的结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半。话没说完被抢断、话音落了却回应迟缓、被背景杂音与闲聊误触发——这些让人别扭的卡壳现象明显少了;单次对话能完整顺畅走完的概率也有提升。

目前SeedRealtime已经在豆包App全量上线,把App更新到最新版本,在对话框内选择"打电话"进入视频通话界面就能体验。按字节方面的说法,这是业界率先把音视频全双工技术做到规模化落地。

 该图片疑似使用了AI生成技术,请谨慎甄别图片

注:本文中包含AI辅助创作的内容。