手语AI翻译登陆手机:谷歌SL2T做到了什么
博客
🔬 Innovation Trends7分钟

手语AI翻译登陆手机:谷歌SL2T做到了什么

💡 2026年8月12日,谷歌DeepMind发布SL2T,首个内置于消费级手机的手语AI翻译模型。Pixel 11上的聋哑和听障用户可以直接向Gboard或Live Transcribe比划手语,无需打字。这是真正的首次突破,尽管目前仅支持美国手语,且对于罕见手势仍有错误。

核心要点
  • SL2T于2026年8月12日在谷歌Pixel 11上发布,支持美国手语(ASL)转英文实时翻译。
  • 用户可直接向Gboard(发消息、搜索、查询Gemini)和Live Transcribe比划手语,无需打字。
  • 模型通过MediaPipe在设备端追踪130个身体关键点,原始视频立即丢弃,保护隐私。
  • 在FLEURS-ASL基准测试中获70分BLEURT,据报道为该任务最高分,但这是谷歌自报数据,尚未经独立验证。
  • 诚实的注意事项:目前仅支持ASL,在罕见手势和弱光环境下仍有错误,绝不能替代医疗、法律等正式场合的认证手语翻译员。
一位穿黑色外套的人在室内演示手语动作。
手语走进数字世界。图片:Kevin Malik / Pexels
SL2T基准测试得分(BLEURT,越高越好)
常用短语85
单手签名74
复杂语言70
来源:谷歌DeepMind,2026年8月(自报数据;FLEURS-ASL和PRESTO-ASL基准测试)

谷歌SL2T模型究竟做了什么

数十年来,手语AI翻译主要停留在研究论文和实验室演示中。2026年8月12日,谷歌DeepMind将这项技术整合进两款日常Android应用:Gboard(键盘)和Live Transcribe(无障碍应用)。

该技术名为SL2T,即手语转文字。在Pixel 11手机上,聋哑用户举起手机,用美国手语(ASL)比划,即可看到实时显示的英文文字。用户可以编辑后像普通文本一样发送。

这是该功能首次作为标准手机功能出现,而非研究原型或专用设备。

它如何在保护隐私的同时运行?

SL2T不录制视频并上传服务器。设备端的MediaPipe Holistic将130个关键身体点(位置、角度、运动)逐帧映射为几何坐标,只有这些坐标被发送到谷歌服务器,原始视频立即丢弃。

模型随后将该坐标流直接转换为英文文字,绕过中间的词素层。词素是对每个单独手势的固定标签。早期系统依赖大型词素词典,这意味着它们无法处理词典外的手势,也无法表示ASL的空间语法或面部标记。绕过词素让SL2T直接从数据中学习。

该模型在超过50种手语的100,000小时以上视频上训练,其中约25%为ASL。谷歌表示,多语言训练实际上提高了单一ASL性能。

这对聋哑和听障人士意味着什么?

语音听写作为听力正常用户的默认手机功能已存在超过十年。聋哑和听障用户从未有过等效功能,他们一直只能打字。SL2T弥补了部分差距,至少对于使用Pixel 11的ASL用户来说。

实际使用场景正是听力正常用户视为理所当然的那些:起草消息、网络搜索、询问Gemini、记笔记。在Live Transcribe中,聋哑用户可以通过手语回应而非打字进行对话。谷歌的测试者表示,手语感觉比用英文打字更快、更自然。

全球有超过7000万聋哑和听障人士,使用约200种不同的手语进行交流。这次发布覆盖其中一种手语和一款手机型号,但它证明消费级精度已经可以实现,这对于接下来的发展至关重要。

为什么语言比技术更重要

这次发布也是对如何对待手语的一次声明。早期系统通常将ASL翻译为手势英语,逐词映射,忽略ASL自身的语法。SL2T从一开始就被构建为将ASL视为独立语言,拥有其自身的空间结构、面部标记和非线性语法。

这一区别意义重大。将英语词序强加给ASL的系统不仅性能差,还隐含地将ASL框定为英语的派生或次等形式。手语语言学家数十年来一直记录着这种张力,而将ASL视为主要语言既是治理决策,也是工程决策。

关于语言如何塑造认知的背景,可参阅关于多语言认知与大脑老化的研究,它提醒我们语言不仅是交流媒介,更是一种认知架构。

你应该了解哪些真实局限?

SL2T无法做到的事情与它能做到的事情同样重要。

  • 目前仅支持ASL转英文,BSL、LSF等其他主要手语暂不支持。
  • 在弱光、非正面摄像角度或签名者不是画面中最大人物时性能下降。
  • 对罕见手势、快速手指拼写以及ASL中的被动结构和分类词结构存在错误。
  • 每段限制60秒,段落之间无记忆功能,且未在18岁以下签名者身上训练。
  • 有时在没有人比划时也会生成文字,尽管谷歌表示与发布前版本相比已有所减少。

关键是:谷歌的咨询委员会(包括美国全国聋人协会和世界聋人联合会)明确规定SL2T仅适用于低风险非正式场合:发消息、搜索、日常对话。医疗咨询、法律程序、警察互动、求职面试等正式场合均不得使用,认证翻译员在这些场合依然是法律和道德要求。

所引用的基准分数均为自报数据。截至2026年8月,尚无对已部署模型的独立学术评估发布。

接下来值得关注什么

谷歌路线图包括:添加标点和编辑命令、多人签名支持、更好的面部表情追踪,以及扩展ASL方言数据(包括目前模型表现不足的Black ASL)。最重要的开放问题是SL2T架构是否能迁移到其他手语,而不需要为每种语言再积累100,000小时数据。

若能实现,这将成为同时弥合200种手语语音听写差距的模板。若不能,SL2T仍是重要但范围有限的第一步。

常见问题

SL2T支持所有手语吗,还是仅支持美国手语?

截至发布时(2026年8月),SL2T仅支持Pixel 11上的ASL转英文。该模型在50多种手语的数据上训练,谷歌表示计划扩展,但尚未给出BSL、LSF等语言的具体时间表。

我能在任何Android手机上使用SL2T吗?

不能。发布时SL2T仅在谷歌Pixel 11上可用。谷歌表示将支持更多设备,但未指定具体机型或时间。

SL2T是否足够准确,可以替代手语翻译员?

不能,谷歌自己的咨询委员会也明确禁止这样做。SL2T设计用于非正式场合:发消息、搜索、日常对话。医疗咨询、法律程序、求职面试或任何需要认证翻译员的正式场合均不得使用。

SL2T如何保护我的隐私?

原始摄像视频在设备端立即丢弃。MediaPipe在任何数据离开手机之前,将其转换为130个几何身体关键点。只有这些坐标被谷歌服务器处理,签名者的实际视频永远不会发送给谷歌。

SL2T与早期手语AI系统有何不同?

早期系统依赖词素标签作为中间步骤,这限制了词汇量并丢失了ASL的空间语法。SL2T直接从运动坐标生成英文文字,使翻译质量能够随训练数据提升,而非依赖手工建立的词典。它还将ASL视为独立语言,而非手势英语。

来源:谷歌DeepMind博客:将手语AI带到用户手中(2026年)

关于作者

Dao Huy(卢卡斯)是一位专业翻译员,从事英语、越南语、中文和法语之间的翻译工作,在技术、法律和软件本地化领域拥有七年以上经验。他关注语言与技术交叉领域的发展,因为正如SL2T所展示的,模型对语法、词序和语言权威性的选择不仅是工程决策,更是语言政策。

如果您的企业需要英越翻译、技术文档、专利及知识产权本地化或软件界面本地化服务,欢迎访问daohuy.com获取免费报价。

Written by Dao Huy (Lucas), Vietnamese translator & localization specialist (EN · ZH · FR → Vietnamese). See translation services →

报价WhatsApp