#AI
DeepMind 发 Gemini 3.8 TTS,原声库扩到 2000+
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持自然语言逐行指导,覆盖超 100 种语言,音色库扩至 2000+。
Flash 主创意深度,Flash-Lite 主成本与吞吐,面向大规模配音。复刻音色只需 30 秒样本,配同意验证与 SynthID 水印,当天上线 Gemini API 与 AI Studio。
💡 为什么值得看一句 prompt 即可造声、复刻音色,并加 SynthID 水印。
官方给出的评测口径
- **Hume AI 基准**:官方称 Flash TTS 拿下 Hume AI Voice Design Benchmark 总分第一(71.4),口音建模第一(60.8);两款分列 Overall Quality Index 第一、第二。
- **盲测语言**:官方称在 Voice Arena 盲测中,日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语等语言上占头部位置。
- **合作方**:官方列出 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang 等已在接入,开发者平台侧提及 Agora、LiveKit、Pipecat、Vercel。
- **尚未上线**:两家模型面向企业的 Gemini Enterprise API 通道均为「coming soon」;音色混合(voice remixing)功能也在预告阶段。
查证
来源档案
Google DeepMind 官方博客
前沿实验室一手产品发布博客,由 Gemini Audio 团队的产品经理与研究科学总监署名。
发布内容、上线渠道与安全机制属官方口径,可信度高;benchmark 与盲测结论均由 Google 自己援引并解读,缺第三方复核,按待验证看待。
延伸阅读
官方自报的第一名具体分数与评测维度都写在博文里,想判断是否名副其实的可以去核对该 benchmark 的方法与对手名单。
语音复刻门槛降到 30 秒样本后,水印与口头同意录音是这套能力能否被大规模采用的关键约束。