Google DeepMind 发布的 SL2T(sign-language-to-text)试图解决一个长期缺口:让聋人和听障用户像使用语音听写一样,直接对手机打手语,并把结果实时转换为文本。它已经进入 Pixel 11 上的 Gboard 与 Live Transcribe,首发支持美国手语(ASL)到英语,而不是停留在实验室演示。

发布日期:2026 年 8 月 12 日

英文原文摘录

SL2T is state-of-the-art on academic benchmarks, plus it’s optimized for real-world use like one-handed signing while holding a phone.

中文翻译:SL2T 在学术基准上达到当前最佳水平,同时也针对真实使用场景做了优化,例如用户一只手拿手机、另一只手打手语。

原帖还说明,为保护隐私,身体姿态会在设备端完成追踪,服务器接收的是用于翻译的姿态数据,而不是原始视频。

为什么它不是“把手势逐字换成英语”

手语拥有独立的语法和词汇,信息也不只来自双手,还包括手臂、躯干、头部、面部以及空间关系。传统的逐词标注中间层通常称为 gloss,但它难以完整表达面部等非手部标记和空间结构。SL2T 因此不先生成 gloss,而是把连续的身体关键点坐标直接翻译成文本。

Google DeepMind 给出的背景数字是:全球存在 200 多种手语,使用者约有 7000 万人。SL2T 的训练数据超过 10 万小时、覆盖 50 多种手语,其中约四分之一为 ASL。团队称,多语言、方言和不同熟练度的数据联合训练,可以让模型学习跨语言共享的结构,并在实验中优于单语言方案。

推理链路与隐私边界

运行时首先由手机端的 MediaPipe Holistic 跟踪签名者身体关键点。原始摄像画面随后被丢弃,只有几何坐标序列发送到服务器;服务器将序列直接翻译成流式文本,再回传给 Gboard 或 Live Transcribe。

这项设计减少了上传原始视频的需要,但不等于完全离线:官方明确说明翻译仍在服务器端完成。原帖未说明坐标数据的保留期限、网络中断时的行为、端到端延迟数值或是否提供本地模型,因此这些问题不能从现有公告中推断。

指标与真实场景优化

在 FLEURS-ASL 的 sd-test(ASL 到英语)上,官方报告 SL2T 获得 zero-shot BLEURT 70,并称这一结果高于此前公开成绩。这个数字来自 Google DeepMind 自己的发布材料,原帖没有提供独立复现实验或可下载权重。

团队没有只优化离线分数,还针对四类产品问题做了处理:降低流式延迟、避免对非手语动作产生幻觉、照顾约占签名者 10% 的左利手用户,以及支持拿着手机时的单手签名。实际用途包括在搜索框、消息、文档和 Gemini 中直接手语输入,或在 Live Transcribe 对话里用手语回复。

已知局限与验证方法

官方样例仍暴露出多种错误:罕见手势可能识别失败,快速指拼会把 prey 识别成 grey,被动结构、分类词描写和缺乏上下文的时态也可能丢失或被简化。当前产品入口仅从 Pixel 11、ASL 到英语开始;更多设备和语言仍属于后续计划。

如果要验证实际可用性,应在支持的 Pixel 11、Gboard 或 Live Transcribe 环境中,分别测试正常双手签名、单手签名、左利手签名、快速指拼和无手语画面,再把输出与人工转写逐条对照。官方没有给出统一验收阈值,因此不能仅凭 BLEURT 70 判断某个具体用户或场景已经可靠。

完整技术说明:https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/

原作者:Google DeepMind(@GoogleDeepMind)
原帖:Google DeepMind on X: "SL2T is state-of-the-art on academic benchmarks, plus it's optimized for real-world use like one-handed signing while holding a phone. To protect privacy, it tracks body poses on-device, while our servers translate them into text." / X