#AI
Gemini 3.5 Transcribe 发布
Google DeepMind 发布 **Gemini 3.5 Transcribe**,定位为「最精确的语音转写模型」,面向实时语音交互与智能转写。与上一代 Chirp 3 相比,它不只做识别,还做理解:自动处理自我纠正(「周二——不,周三」)、剔除语气词、格式化文本,并可识别自定义词汇与方言口音。
对开发者,该模型通过两条 API 落地:**Live API**(gemini-3.5-transcribe-live)提供亚秒级双向流式转写,面向语音 agent 与实时字幕;**Interactions API**(gemini-3.5-transcribe)处理会议、通话录音等预录音频,支持最多三人说话人归属与词级时间戳。
💡 为什么值得看噪声环境语音转写 WER 降至 4%,直击企业语音 agent 与会议转写场景。
查证
来源档案
Google DeepMind 官方博客
官方一手产品发布公告,由 Gemini Audio 工程团队署名
官方发布,事实与规格可信;其中 WER 与延迟数据引自第三方 Artificial Analysis,属对外宣称口径,可视为官方引用而非独立验证。
延伸阅读
Live API 与 Interactions API 的参数、延迟与自定义词表如何配置,直接影响语音 agent 落地
WER 与终稿延迟提升 70%,可与 AssemblyAI、Deepgram、Whisper 系列横向比较