谷歌DeepMind推SL2T模型,手语直接转文字
ocean_protocol · reddit · 2026-08-12
Google DeepMind 推出了 SL2T 模型,能够将手语直接转换为文本。该功能首次落地于 Pixel 11 手机,集成在 Gboard 和 Live Transcribe 中,方便听障群体通过手语进行文字输入、搜索或与 Gemini 交互。
该模型完全在设备端运行,通过追踪面部、手部、手臂和躯干的姿态点并将坐标发送至服务器,确保原始视频不会离开手机。它支持单手和左手手语,并加入了防幻觉机制以避免误读。目前仅支持 ASL(美国手语)到英语的转换,未来计划增加更多语言和设备支持。
所属事件:DeepMind发布SL2T手语转文本模型,Pixel 11首发(10 条相关)→
「多模态」频道最新
- Suno 携手 BMG 引入隐形水印,被批沦为审查工具 — TomLikesRobots · 2026-08-13
- Grok 合成结合 Seedance 视频生成:重现《小鹿斑比》复古溜冰场 — Kyrannio · 2026-08-13
- RTX 5090实测:MiniMax H3视频生成5-6分钟搞定 — tekprodfx16 · 2026-08-13
- FLUX 3 惊艳生成机器人跑酷躲避警匪追捕 — Dr_Singularity · 2026-08-13
- Cohere发布24亿参数开源视觉语言模型North Micro — pmttyji · 2026-08-13
- 新玩法:用LTX2.5模型给MiniMax H3视频做放大 — smereces · 2026-08-13