手机上的AI手语翻译:SL2T真正能做什么
博客
🔬 Innovation Trends7分钟

手机上的AI手语翻译:SL2T真正能做什么

💡 2026年8月12日,谷歌DeepMind发布SL2T,首个将AI手语翻译集成到消费级智能手机应用中的模型。聋人用户现在可以对着Pixel 11的摄像头打手语,实时获得英文文本,日常事务无需口译员。这是真正的首创,也有清晰的局限需要了解。
要点总结
  • SL2T将美国手语(ASL)转换为英文文本,通过Pixel 11上的Gboard和Live Transcribe提供,2026年8月12日发布,手机8月20日开始发货。
  • 系统在设备端追踪130个身体关键点,立即丢弃原始视频,隐私保护从设计源头开始,而非事后补充。
  • 基准测试:FLEURS-ASL达到70 BLEURT分,日常助手短语达到85分,均为谷歌自行报告,尚无独立外部评估发布。
  • 真实局限:仅支持ASL转英文;光线不足、快速指拼、罕见手势时出错;每次最长60秒;不适用于医疗、法律或课堂场景。
  • 模型在50多种手语的10万余小时数据上训练,计划扩展更多语言,但未给出具体时间表。
Close-up of a woman communicating through sign language
Sign language in everyday use. Photo: RDNE Stock project / Pexels
SL2T benchmark accuracy (BLEURT, vendor-reported)
PRESTO-ASL (assistant phrases)85
One-handed signing74
FLEURS-ASL (complex language)70
Fingerspelling exact match64%
Source: Google DeepMind, 2026. BLEURT = semantic similarity (0-100, higher is better). No independent replication published yet.

谷歌发布了什么?

2026年8月12日,谷歌DeepMind将SL2T整合进Gboard和Live Transcribe,AI手语翻译正式走入消费者手中。聋人用户首次可以通过对着手机摄像头打手语来搜索网页、撰写消息或向Gemini提问,就像听力正常的用户使用语音输入一样。Pixel 11将于8月20日开始发货。

这项AI手语翻译技术是如何运作的?

系统不向任何服务器发送视频。设备端模型MediaPipe Holistic从手部、面部和躯干提取130个几何关键点,只将这些坐标发送到云端进行翻译。原始摄像头画面立即被丢弃。这是从设计层面保护隐私,而非事后弥补。

更重要的技术进步是跳过了"手语标注"中间层。以往的手语AI先将每个手势标注为固定词汇,再将词序翻译成自然语言,这种方式会丢失空间语法和面部表情等手语中承载含义的非手部成分。SL2T直接从坐标流翻译为英文文本,这正是其基准分数高于此前任何已报告成绩的原因。

这对聋人和听障人士意味着什么?

对于许多从小使用手语的人,ASL是第一语言,用键盘打英文实际上是使用第二语言。能够通过打手语发送消息或进行搜索,而不是打字,弥补了听力正常用户多年来通过语音输入享有的便利。真正的价值在于交互平等,而不仅仅是转录文字。

在Live Transcribe中,这一功能还让聋人用户可以在手语对话中用手语回应,而不必在对方等待时打字回答。这种对话节奏的微小变化意义深远。对于全球约7000万以手语为主要语言的人来说,这不是便利功能,而是基本访问权的改变。

SL2T的真实局限是什么?

模型目前仅支持ASL转英文,每次只能处理一位打手语者,仅限一款设备系列,每段最长60秒且无对话记忆。在光线不足、强逆光或手部被遮挡时准确率下降。快速指拼、罕见手势和被动语态结构会产生更多错误。系统也存在幻觉问题:当没有人打手语时,例如第二个人进入画面,它可能生成虚假文本。

最关键的限制:谷歌自己的咨询委员会(包括美国全国聋人协会和世界聋人联合会)明确禁止在医疗、法律、警务、课堂、面试和福利场景中使用。该工具"不满足《美国残疾人法》对合理便利措施的法律要求"。这不是脚注,而是当前实践中最重要的边界。

所有基准数字均为谷歌自行报告。撰文时尚无已发布的独立学术评估。这不意味着数字有误,但意味着尚无法完全验证。

为什么这对无障碍技术之外的领域也值得关注?

手语是语言AI中严重被忽视的领域。大多数机器翻译研究针对书面语言对,因为文本数据充足。手语既无标准化书写形式,也无大型文本语料库,使其极难训练。谷歌的方法,即同时从50多种手语中学习再针对数据最多的语言部署,为如何优先解锁低资源语言提供了参考模型。

从翻译角度来看,这也是关于AI与人类边界的早期信号。正如此前一篇关于AI与人工翻译对比的文章所分析的,AI在常规语言任务上越来越有用,而高风险场景的准确性门槛依然很高。SL2T完全符合这一模式:适用于日常消息发送,禁用于法庭和医疗口译。

接下来会发生什么?

谷歌DeepMind表示计划支持更多手语,但未给出时间表。下一个自然步骤,即手语生成(AI用手语与你交流,而不仅仅是读懂你的手语),也被列为未来方向。这将是一个更难的问题:实时从文本生成自然、语法正确的手语动作。

目前最重要的测试不是基准分数,而是使用它的聋人用户是否真正觉得它在日常生活中有用。初步反馈谨慎乐观,但产品刚刚发布。

常见问题

SL2T可以用于法律或医疗场景吗?

不可以。谷歌咨询委员会(包括美国全国聋人协会)明确禁止在医疗、法律、警务、课堂、面试和福利场景中使用。该工具不满足ADA合理便利要求。这些场合仍需专业手语口译员。

SL2T目前支持哪些手语?

目前仅支持美国手语(ASL)转英文,2026年8月20日起上线。模型在50多种手语的数据上训练,谷歌表示将扩展更多语言,但未给出具体日期。

SL2T与以前的手语AI相比准确率如何?

在FLEURS-ASL基准测试中,SL2T获得70 BLEURT分,谷歌称"显著高于此前任何已报告分数"。日常助手短语(PRESTO-ASL)达到85分。这些均为谷歌自行报告数据,尚无已发布的独立复现研究。

SL2T会将用户视频发送到谷歌服务器吗?

不会。设备端模型提取130个身体关键点后立即丢弃原始视频,只将坐标数据发送进行翻译。谷歌将此定位为隐私保护的设计选择。

SL2T只限于Pixel 11用户吗?

目前是的,SL2T仅通过Gboard和Live Transcribe在Google Pixel 11手机上可用。谷歌表示计划扩展到更多设备和手语,但未给出具体日期。

来源:谷歌DeepMind博客 - 将手语AI交到用户手中(2026);Unite.AI - 谷歌DeepMind通过SL2T将手语翻译带入手机(2026)

关于作者

Dao Huy(Lucas)是一位专业翻译,专注于英语、越南语、中文和法语之间的互译,拥有超过七年经验。他关注语言与AI技术前沿,不是作为工程师,而是作为每天与语言打交道并对机器开始弥合曾经看似永久的鸿沟感到着迷的人。SL2T的发布尤其引人深思:这是首次将没有标准化书写形式的语言纳入消费级机器翻译。

如果您需要英语与越南语之间准确、经过认证的翻译服务,包括技术、专利或软件内容,Lucas提供专业服务,欢迎访问daohuy.com获取报价。

Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →

报价WhatsApp