微软测试自研全双工 AI 语音模型 MAI Realtime
8 月 2 日消息,科技媒体 TestingCatalog 发布博文称,微软正在测试其首款原生实时语音模型 MAI Realtime。该模型支持 16 种语言、2 种语音风格,可在对话中实现听说并行,还能自动识别并中途切换语言。
在测试渠道方面,消息称微软已邀请部分合作伙伴在 MAI Playground 平台试用该模型。目前尚不清楚该模型何时会上线 Microsoft Foundry,也未明确是否会扩展到 Copilot 的语音功能中。
在运行方式上,MAI Realtime 采用双向、全双工交互模式。与传统的「用户说完、模型再答」的轮次交替不同,该模型可以同步进行聆听和回应。这种机制使得对话体验更接近真人交流,对于打断、抢话这类自然对话行为,理论上都能被更好地处理和响应。
在语言支持方面,该模型覆盖英语、中文、日语、韩语、德语、法语等 16 种语言。在语音风格上,测试版本提供了 Victoria 和 Grant 两种声音选择。据博文描述,这两种声音比 Copilot 目前的语音模式更加自然。
从技术布局来看,微软在自研语音方向已有公开动作。微软官方文档显示,MAI-Voice 是一系列文本转语音模型,已在 Foundry Tools 中通过 Azure 语音服务提供公开预览。其中,MAI-Voice-2-Flash 支持 15 种语言和 18 个区域设置,专为低延迟实时文本转语音优化;MAI-Voice-2 则支持 15 种以上语言,聚焦于高保真长形式内容生成。文档示例语音包括 en-US-Harper(女性)和 en-US-Ethan(男性),还支持通过 SSML 控制情感与风格,例如 excited 等样式。
从产品定位上看,MAI-Voice 系列主要主打文本转语音的输出端,而 MAI Realtime 瞄准的则是完整的实时对话链路,两者更像是同一技术路线上的不同落点。目前该模型仍处于邀请测试阶段,具体能力表现和最终上线节奏还需等待官方的进一步消息。
