手语人工智能首次进入消费级:谷歌 DeepMind 推出手语转文本模型

浏览10次 点赞0次 收藏0次

8 月 13 日消息,谷歌旗下人工智能实验室当地时间 12 日宣布推出一款大规模多语言手语转文本 (SL2T) 翻译模型。

得益于这一模型,手语人工智能首次进入消费级产品:谷歌 Pixel 11 系列智能手机上的 Gboard 和 Live Transcribe 应用程序支持手语转文本输入功能(初期仅限美国手语,后续将扩展至更多种手语和更多设备)。

全球约 7000 万听力障碍人士使用 200 余种手语,新的功能使他们能享受到类似语音输入的灵活“打字替代”体验。测试显示,使用美国手语比用英语打字更快、更自然、更令人愉悦。

DeepMind 表示,手语是一种独立的自然语言,拥有自身独特的语法和词汇。因此手语翻译需要真正的机器翻译,而非按顺序将手语转换为文字。而能满足 SL2T 任务的模型必须能“看懂”手语使用者的身体多部位同步运动,这需要强大的计算机视觉处理能力。

Google DeepMind 的 SL2T 模型在超过 50 种手语的 10 万小时数据上进行训练。其将手语转化为一系列姿势特征点的位置信息以保护用户隐私安全,无需将原始视频流发送到服务器端。同时其放弃了以往广泛使用的“中间注释”,直接解读空间信息。

相关阅读:

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯