#AI
Meta MSL 发布 Muse 流式语音转写模型
Meta Superintelligence Labs 发布了 **Muse Voice Transcribe**,这是该实验室的首个实时音频感知模型,现已上线 Meta 模型 API。它把流式语音转写(ASR)、说话人分离(diarization)和端点检测(endpointing)集成进一个模型里,实时处理。
官方 Blog 称其在 Artificial Analysis 的流式语音转写基准和公开说话人分离基准上排名第一,并支持 70 多种语言(25 种在发布时完成验证),能处理句中语码切换。Meta 演示了一段八人同场对话,模型实时区分发言人并自动切语言。具体集成到哪些旗舰产品的计划尚未公布。
💡 为什么值得看首个实时音频感知模型实现流式识别及多人分离,自称 SOTA。
查证
来源档案
Meta AI Research 官方博客
Meta Superintelligence Labs 的一手产品发布公告,含模型能力说明与基准排名
官方一手源,能力声明可信;但'SOTA'与'排名第一'是 Meta 自述(引 Artificial Analysis),标杆的窗口口径由第三方基准定义,建议比对实测
延伸阅读
官方博客含八人对话转写演示和 25 种已验证语言清单,可核实单模型同时处理分离、端点、语码切换的实际表现