OpenAI为GPT-Live嵌入SynthID水印并开放验证API

图片

7月31日,OpenAI更新其GPT-Live语音模型,将Google DeepMind的SynthID水印技术嵌入所有通过ChatGPT Voice和OpenAI API生成的音频中,并同步开放验证API。此举允许开发者或组织对音频文件进行自动化的来源检查。

该水印不可见且听不见。此次升级的关键在于,第三方现在可以通过API查询信号是否存在,而不仅仅是信号本身的嵌入。

SynthID音频原理:频谱域嵌入

与在像素空间添加扰动的图像水印不同,SynthID音频水印运行于频谱图(音频信号频率内容随时间变化的视觉表示)。其嵌入过程分为三步:首先将音频波形转换为时频表示;其次利用心理声学掩蔽原理在频谱图中编码水印图案;最后从修改后的频谱图重建波形。

心理声学掩蔽是耐久性的关键。人类听觉系统无法感知被相邻频段或更响亮声音掩蔽的信号,SynthID正是利用这些区域放置水印,并采用扩频方法将信号冗余副本分布在多个频段和时间位置。这使得水印即使经过MP3压缩(包括128 kbps激进编码)、速度/音调偏移,甚至通过扬声器播放后重新录制的“模拟漏洞”,依然能够保留。相比之下,传统元数据标签无法经受此类转换。

检测机制采用匹配滤波器,Google的专有解码器经训练可识别编码器引入的统计模式。由于检测器专有,第三方无法独立运行,这正是开放API的核心价值。

开发者API解锁自动化审核

此前,水印仅作为OpenAI可用的事后法医工具。新的验证API改变了这一局面,允许新闻编辑部、社交平台或企业合规团队将来源检查直接整合至工作流中。查询发送至OpenAI匹配器,针对提交波形运行并返回判定结果。

Hugging Face研究员Sasha Luccioni曾指出,SynthID早期的专有检测基础设施限制了其作为通用来源系统的潜力。OpenAI此前的图像验证工具需用户上传至网页,而新API首次解除了这一限制,使开发者能将检查构建到自动化管道中。

需注意,启动时的API范围仅限于OpenAI源音频。ElevenLabs、开源模型或未通过GPT-Live生成的合成语音不会返回信号。无信号并不代表音频真实,仅表示未检测到OpenAI SynthID水印。

GPT-Live:实时语音的水印化

GPT-Live于2026年7月8日发布,取代高级语音模式,成为超过1.5亿周活用户的默认语音体验。其全双工架构可同时处理输入输出,每秒多次决策说话、聆听或暂停,避免了传统轮次系统因沉默或噪音导致的中断。复杂问题时,GPT-Live会在后台委托给GPT-5.5,同时保持对话流畅。

发布时提供两个层级:付费用户的GPT-Live-1和免费用户的GPT-Live-1 mini。实时安全措施可在模型说话时引导至更安全响应或结束对话,并针对自我伤害、情感依赖等类别构建了原生音频安全评估。

局限性与行业足迹

SynthID已嵌入Google Gemini、Imagen等产品,并于2026年5月被OpenAI、NVIDIA等采纳为图像行业标准。7月31日的更新将其扩展至GPT-Live音频,触达最大规模的日常语音受众。C2PA联盟成员现已超过6000个。

然而,该系统并非防绕过。USENIX Security 2025发表的UnMarker论文报告了对SynthID的79%去除率,尽管Google对此提出异议。更根本的限制在于,开源语音模型产生的克隆音频不带SynthID水印,也无法通过API筛查。水印的有效性取决于平台是否主动集成检测层,这仍是生态系统面临的下一个挑战。

【星途科讯 图文丨三一一 首发于ZAKER科技,转载请注明出处】