微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格

浏览12次 点赞0次 收藏0次

8 月 4 日消息,科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。

测试方面,消息称微软已邀请部分合作伙伴,在 MAI Playground 平台测试该模型,目前尚不清楚何时上线 Microsoft Foundry,以及扩展到 Copilot 语音功能上。

运行方面,MAI Realtime 采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。

在支持语言方面,MAI Realtime 模型支持中文等在内 16 种语言,援引博文介绍,附上相关支持的语言如下:

  • 英语

  • 德语

  • 西班牙语

  • 法语

  • 意大利语

  • 葡萄牙语

  • 日语

  • 韩语

  • 中文

  • 荷兰语

  • 印地语

  • 印度尼西亚语

  • 阿拉伯语

  • 俄语

  • 土耳其语

  • 越南语

  • 泰语

在语音风格方面,消息称该模型测试提供 Victoria 和 Grant 两种语音,比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言,也可以启用自动检测。

该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。

注:全双工语音(Full-duplex voice)指系统可在同一时间接收用户语音并输出回复,不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束,也需要在用户插话时调整输出。

微软此前发布的 MAI 语音模型均为单向模型,包括用于语音合成的 MAI-Voice-2 及其 Flash 版本,以及用于语音识别的 MAI-Transcribe-1.5。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯