将手语AI交到用户手中
摘要
Google DeepMind推出大规模多语种手语转文本模型SL2T,并首次将其集成到Pixel 11的Gboard和Live Transcribe中,支持ASL到英语的实时转写。
核心要点
- SL2T训练数据超过100,000小时,覆盖50多种手语,其中约四分之一为美国手语(ASL)。
- 在FLEURS-ASL基准上,SL2T零样本取得70 BLEURT分数,显著高于此前任何报告成绩。
- 该模型仅通过MediaPipe Holistic提取全身姿态关键点并发送至服务器,原始视频即时丢弃,保护用户隐私。
- SL2T直接由姿态关键点序列翻译为文本,绕过了传统方法依赖的“gloss”中间注释,以避免词汇限制。
- 针对实际应用优化了流式延迟、非手语输入防幻觉、左撇子(占10%)及单手手语等场景。
原文佐证
- SL2T is the most capable sign language translation model to date according to key benchmarks like FLEURS-ASL (sd-test), which assesses ASL to English translation quality.
- SL2T achieves a remarkable zero-shot score of 70 BLEURT, which is significantly higher than any previously reported score.
AI 洞察
手语AI从实验室进入消费级产品,是多模态AI惠及少数群体、推动数字包容的关键一步。以姿态关键点而非原始视频作为输入,在能力与隐私之间找到了平衡,可能成为无障碍AI的主流范式。未来随着更多手语和设备的支持,SL2T有望重塑聋人社区的日常沟通,并倒逼行业对手语数据处理建立规范。