发生了什么
Google DeepMind 表示,它正在通过 SL2T 将手语人工智能转移到消费产品中,SL2T 是一种手语到文本的翻译模型,目前支持 Pixel 11 上的 Gboard 和 Live Transcribe 中的美国手语到英语听写。该公司将此次发布视为第一步:即将推出更多设备,并计划推出更多手语,但该公告并未描述在 Android 硬件上普遍推出的情况。在 Gboard 中,用户可以在通常键入的位置进行签名,包括在搜索网络或起草消息或文档时。在 Live Transcribe 中,预期用途是在对话期间签署响应,而无需切换回键入的英语。
该版本之所以引人注目,是因为它将研究模型与日常输入界面连接起来,而不是仅将手语翻译作为实验室演示来呈现。 Google DeepMind 表示 SL2T 可以在人手语时生成流文本,并且 Android 集成首先可以在 Pixel 11 上使用,无需额外付费。消息来源将 ASL-to-English 描述为第一个支持的方向。它并没有说该功能可以在所有手语之间进行翻译,将文本转换回手语,或者在高风险环境中取代专业口译员。
Google 表示 SL2T 接受了超过 100,000 小时的数据训练,涉及 50 多种手语,其中大约四分之一是 ASL 数据。该团队表示,跨语言、方言和熟练程度的联合训练有助于模型学习共享结构,而不是将每种语言视为孤立的手势列表。这种设计选择很重要,因为手语是独立的自然语言,有自己的语法和词汇。它们还通过同步的手、手臂、躯干、头部和面部动作来表达意思,使任务成为视觉感知和翻译的结合,而不是简单的手势匹配。
该型号的隐私设计也是产品声明的一部分。 Google DeepMind 表示,设备上的 MediaPipe Holistic 模型会跟踪姿势地标,并且翻译服务接收几何坐标而不是原始相机输入。该公司表示,原始视频可以立即丢弃。 SL2T 将地标序列直接转换为文本,而不是首先将签名转换为中间光泽表示。这可能会减少词汇和注释限制的一个来源,但该公告并未提供对保留、遥测、故障处理或每个设备级实施细节的独立审核。
关于报告的性能,Google DeepMind 表示 SL2T 在 FLEURS-ASL sd 测试中达到了 70 BLEURT 的零样本分数,该分数高于之前报告的分数。该公司还表示,它正在研究流媒体延迟、非签名输入幻觉、左手签名以及另一只手拿着手机时的单手签名。其示例显示了罕见符号、快速手指拼写、被动结构、分类词描述以及取决于上下文的时态等方面的剩余错误。因此,该版本结合了强有力的基准声明和明确的警告,即基准质量并不等同于可靠的对话。
来源详情: Google DeepMind's SL2T announcement ↗
为什么这很重要
实际的转变是从询问人工智能是否可以识别手语剪辑到询问手语是否可以成为熟悉的手机工作流程中可用的输入方法。对于聋哑和听力障碍用户来说,工具的价值取决于它是否以对话速度工作、尊重语言结构、处理真正的变化以及让人们控制共享内容。 Gboard 和 Live Transcribe 中出现的模型使普通用户可以看到这些问题,而不仅仅是研究人员。
手语支持与口语听写具有不同的可访问性负担。口语转录主要将按时间顺序排列的声音流映射为文本,而手语系统必须同时解释动作、空间、面部表情和语法结构。主要来源强调手语不是用手表达的英语。这种区别对于产品设计很重要:系统可以显得流畅,但仍然缺少非手动标记、空间参考、分类器或承载句子含义的时态变化。
具有里程碑意义的管道为基于摄像头的辅助功能提供了具体的隐私方向。如果只有身体点坐标离开设备,则服务不需要为每个翻译请求接收原始视频。这可能会降低上游发送的数据的敏感性,特别是当签名发生在家庭、工作场所或公共对话中时。这并不是一个完整的隐私保证。姿势坐标仍然可以描述一个人及其行为,用户需要有关日志、帐户链接、模型改进、保留以及设备无法本地处理输入时会发生什么情况的清晰信息。
产品示例还说明了为什么有用性不仅仅取决于标题的准确性数字。签名搜索、撰写消息或要求 Gemini 完成任务可以消除重复的输入步骤。在 Live Transcribe 内签署回复可以使简短的交流更加流畅。但是,如果名称、否定、数字或指令被错误翻译并且用户在发送之前没有注意到,那么同样的便利也会增加错误的成本。因此,正确的标准是可见的、可编辑的输出以及纠正或重复短语的快速方法,而不是假设流文本会自动正确。
该公告来自构建和发布该模型的公司,因此其基准测试和测试仪比较应被视为来源声明,而不是独立验证。 Google DeepMind 确实提供了有用的限制,并表示它与聋人组织和主题专家一起创建了一个人工智能手语咨询委员会,并为此发布了一份联合影响报告。这种参与过程是一个有意义的信号,但它尚未告诉公众在计划的推出过程中,表现如何因手语者、方言、灯光、摄像机角度、手语速度或对话上下文而变化。
互动机制:它实际上是如何运作的
以交互方式探索这一发展背后的基础技术。
crm_get_transaction(id='4092').Why is sign language translation harder than simply matching gestures to English words?
接下来看什么
下一个证据应该表明 SL2T 在发布帖子中的受控示例之外是否仍然有用。观看实际设备的推出、社区反馈、错误恢复、隐私文档以及跨签名者和手语的独立测试。此次发布是一个重要的产品步骤,但这并不能证明手语翻译已达到与人类翻译或口语听写相同的水平。
首先,查看哪些设备和语言以及何时获得支持。 Google DeepMind 表示 Pixel 11 是起点,后续会有更多设备和语言跟进,但在公告中并未给出公开时间表或完整的兼容性列表。有意义的推出应披露区域可用性、支持的相机条件、语言和方言覆盖范围、设备处理要求以及相同的隐私行为是否适用于各代硬件。这些细节将决定该版本是一项广泛有用的辅助功能,还是连接到一根电话线的狭窄展示。
其次,寻找衡量真实沟通的评估,而不仅仅是一个保留的基准。有用的报告会根据手语者、方言、熟练程度、惯用手、单手使用、速度、灯光、取景和背景运动来分解单词和含义错误。它应该包括延迟、非签名误报、更正、掉线以及从错误中恢复所需的时间。 FLEURS-ASL 分数是一个具体的起点,但来源自己的示例表明了为什么罕见的符号、手指拼写、分类词和上下文相关时态需要单独注意。
第三,当该功能连接到其他 Google 产品时,请注意隐私和安全边界。可以搜索、起草或要求 Gemini 执行任务的符号到文本流在外部操作之前需要明确确认,尤其是在翻译不确定时。用户应该能够查看捕获的内容,在发送之前对其进行编辑,删除相关历史记录,并了解是否保留坐标或派生文本。公开版本解释了这一具有里程碑意义的方法,但它没有解决有关权限、诊断、云处理或帐户级数据控制的产品问题。
最后,随着系统惠及更多人,请寻找联合影响报告、独立复制品以及聋人社区的反馈。 Google DeepMind 表示,其咨询委员会将影响开发优先事项,并计划在主要版本中继续采用这种方法。最有力的后续行动将使这些承诺变得可衡量:公布语言和环境的限制,显示报告的错误如何改变路线图,并让用户区分实验性翻译辅助工具和可靠的口译员替代品。在证据到来之前,SL2T 最好被理解为一种有前途的首次消费者部署,具有有意义的、公开声明的不确定性。