微软发布MAI-Transcribe-2语音识别模型,每小时仅0.10美元
5小时前0 阅读

微软9月3日正式发布新一代语音识别模型MAI-Transcribe-2。作为迄今功能 最强 、效率更高的转写产品,该模型在 FLEURS 基准测试(涵盖60种语言)中实现了5.2%的平均词错误率(WER),并在 Artificial Analysis 词错误率排行榜中名列第二。 在保持高精度的同时,其长音频处理速度 最高 可达领先竞争对手的10倍,处理1小时
微软9月3日正式发布新一代语音识别模型MAI-Transcribe-2。作为迄今功能 最强 、效率更高的转写产品,该模型在 FLEURS 基准测试(涵盖60种语言)中实现了5.2%的平均词错误率(WER),并在 Artificial Analysis 词错误率排行榜中名列第二。
在保持高精度的同时,其长音频处理速度 最高 可达领先竞争对手的10倍,处理1小时音频仅需约10秒。目前该模型已在 Microsoft Foundry、MAI Playground 及 Open Router 上线,并推出限时优惠价,每小时音频仅需0.10美元。
MAI-Transcribe-2针对真实复杂场景进行了全面升级,集成说话人分割、词级时间戳、关键词偏好设置以及自动语言识别等功能,支持印式英语(Hinglish)、西英混合语(Spanglish)等语码转换现象,并具备极强的抗噪性能。开发者还可根据需求在“逐字转录”与“精简转录”样式间自由切换,精准适配法律、临床、字幕及高合规分析等多样化生产环境。

随着AI应用从单模态交互向多模态及实时语音智能化演进,高吞吐、低延迟且低成本的语音基础设施正在成为关键竞争壁垒。MAI-Transcribe-2通过重新定义语音转写的准确率与延迟帕累托前沿,不仅显著降低了多语言音频的部署门槛,也为端到端实时语音生态的发展注入了新动能。
要点速读
微软9月3日正式发布新一代语音识别模型MAI-Transcribe-2。作为迄今功能 最强 、效率更高的转写产品,该模型
- 微软9月3日正式发布新一代语音识别模型MAI-Transcribe-2
- 作为迄今功能 最强 、效率更高的转写产品,该模型
- 更多细节仍在持续更新中