#AI
DeepMind 推出手语转文本模型,先上 Pixel 11
Google DeepMind 推出 SL2T,一款大规模多语言手语转文本翻译模型,首发搭载于 Pixel 11 的 Gboard 与 Live Transcribe,支持美国手语(ASL)转英文输入。
模型在超 100,000 小时数据上训练,覆盖 50 种以上手语,其中约四分之一为 ASL,在 FLEURS-ASL 基准上取得 70 BLEURT 零样本得分,显着优于此前公开结果。技术关键设计在于不处理原始视频,仅接收设备端 MediaPipe Holistic 提取的姿态关键点坐标,原始视频即时删除,兼顾隐私与实时性,并跳过 gloss 中间层直接输出流畅英文。
💡 为什么值得看首款规模化手语转文本模型落地消费产品,支持 50+ 手语及 10 万小时训练数据,实现聋人手语输入手机。
SL2T 关键数据速览
- **训练规模**:100,000+ 小时,50+ 手语,ASL 约占 1/4
- **基准得分**:FLEURS-ASL 零样本 70 BLEURT(此前最高分未披露至此量级)
- **隐私设计**:仅姿态点坐标上云,原始视频丢弃
- **可用功能**:Gboard 手语听写、Live Transcribe 手语对话
- **首发设备**:Pixel 11,更多设备「即将到来」
查证
来源档案
Google DeepMind 官方博客
一手官方发布,含模型技术细节、基准数据与产品落地范围
高;官方源,数字与能力声明可直接采信,但基准对比表述「remarkably higher」未给出完整对照表
延伸阅读
官方博客含 FLEURS-ASL 翻译样例、错误案例分析与社区治理架构细节,是理解该模型能力边界的一手材料