热闻岛
返回全网热点

微软首款自研全双工 AI 语音模型曝光:听说并行,16 种语言自由切换

3天前4 阅读
微软首款自研全双工 AI 语音模型曝光:听说并行,16 种语言自由切换配图
科技媒体 TestingCatalog 报道,微软正在测试其 首款 原生实时语音模型 MAI Realtime。该模型支持 16 种语言、2 种语音风格,可在对话中实现听说并行,并支持自动识别和中途切换语言——这意味着用户无需等待 AI 说完才能开口,对话体验将无限逼近真人交流。 MAI Realtime 采用双向、全双工交互方式,打破了传统语音助手"用户说

科技媒体 TestingCatalog 报道,微软正在测试其 首款 原生实时语音模型 MAI Realtime。该模型支持 16 种语言、2 种语音风格,可在对话中实现听说并行,并支持自动识别和中途切换语言——这意味着用户无需等待 AI 说完才能开口,对话体验将无限逼近真人交流。

MAI Realtime 采用双向、全双工交互方式,打破了传统语音助手"用户说完、模型再答"的轮次交替模式。系统依靠端点检测技术识别说话的开始、停顿和结束,当用户中途插话时,模型能即时调整输出,实现同步聆听与回应。这是微软 MAI 语音模型家族从单向走向双向的关键一步——此前发布的 MAI-Voice-2 和 MAI-Transcribe-1.5 均只能分别完成语音合成或语音识别的单向任务。

两种语音风格更自然,但暂时不会唱歌

在语言覆盖上,MAI Realtime 支持中文、英语、日语、韩语、法语、德语、阿拉伯语等 16 种语言。用户可主动指定对话语言,也可启用自动检测功能,模型能在对话过程中自动识别并切换语言。语音风格方面,测试版本提供 Victoria 和 Grant 两种声音,据称比 Copilot 目前的语音模式更加自然。

不过该模型的定位仍是对话系统,不支持唱歌或生成非语音音效。调试面板可实时显示延迟数据、模型思考内容和处理步骤,样本分享功能有望在测试范围扩大后向更多平台用户开放。目前微软已邀请部分合作伙伴在 MAI Playground 平台进行测试,但何时上线 Microsoft Foundry、何时扩展至 Copilot 语音功能,尚无明确时间表。从单向到全双工,从轮次交替到同步对话,微软正在用 MAI Realtime 向业界宣告——AI 语音交互的"对讲机时代"或将成为过去式。

要点速读

科技媒体 TestingCatalog 报道,微软正在测试其 首款 原生实时语音模型 MAI Realtime。该模型支

  • 科技媒体 TestingCatalog 报道,微软正在测试其 首款 原生实时语音模型 MAI Realtime
  • 该模型支
  • 更多细节仍在持续更新中