Gemini 3.5 Transcribe 上线:流式延迟低于一秒,还可调用其他模型干活

问AI · 跨模型协作会给语音转写带来哪些新玩法?

Google日前在官方博客宣布推出最新的语音转文本模型 Gemini 3.5 Transcribe。与在背景噪音、专业术语等场景下频频失手的传统语音识别方案不同,该模型可将原始音频直接转换为准确、整洁且已排版的文本。

图片

性能是本次升级的重点。据 Artificial Analysis 测量,Gemini 3.5 Transcribe 的平均词错率(WER)为流式 4.0%、非流式 2.6%;在 FLEURS 多语言基准上分别为 5.50% 与 5.04%,全面优于上一代模型 Chirp 3,最终转写耗时缩短 70%。

具体能力上,模型的智能转写可处理诸如“我们周二见面——不,还是周三吧”这类口误自我纠正,自动去除语气词并完成排版;函数调用功能允许它将图片生成、文件分析等任务委托给其他 Gemini 模型执行(目前见于 macOS 版 Gemini 应用);在噪音环境下仍能准确识别邮政编码、订单号等字母数字实体;借助自定义词表可适配专业行话与特殊拼写;支持 85 种以上语言及方言口音;预录音场景下最多可为三名说话人做归属标注。

图片

模型也正在进入 Google 各条产品线:Android 版 Gboard 的 Rambler 功能借其实现语音整理成文与口述编辑;Antigravity 利用屏幕上下文和聊天记录提升转写精度;Chrome 的“随说随写”功能即将上线。

调用方面,模型通过两套 API 提供服务:基于 Live API 的实时流式接口(gemini-3.5-transcribe-live)支持双向流式传输,延迟低于一秒;基于 Interactions API 的录音转写接口可处理会议与通话录音,提供词级时间戳。目前两者均已在 Google AI StudioGemini Enterprise Agent Platform 开启公开预览。