微软正式推出三款自研语音AI模型,包括实时流式转写模型MAI-Transcribe-2-Streaming以及语音生成模型MAI-Voice-2.1系列。新模型主打高精度与低延迟,支持多语言及自动语种识别,进一步加速摆脱对外部技术供应的依赖。
微软(Microsoft)于周四发布了三款自研语音与转写人工智能模型。随着对话式语音AI智能体的开发需求激增,微软正加速构建自主AI技术栈,以吸引更多开发者。
微软AI团队通过社交平台宣布推出 MAI-Transcribe-2-Streaming、MAI-Voice-2.1 以及 MAI-Voice-2.1-Flash,三款模型即日起均已上线。微软表示,新模型具备“高精度的流式转写能力”,并能提供“自然的语音表达与更低的交互轮转等待时间”。

根据微软AI官方博文,MAI-Transcribe-2-Streaming 是微软推出的首款流式转写模型。它支持在用户说话的同时实时将语音转为文字,无需等待录音结束。该模型支持60种语言,并能自动检测说话人使用的语言,即使在对话中途切换语种也能实时识别。该模型的首发定价为每小时0.54美元。
在基准测试机构 Artificial Analysis 的 AA-WER Streaming 测试中,该模型在词错率(Word Error Rate)方面位列第一。数据显示,其最终转写准确率与首段部分转写准确率均排在榜首,词错率仅为2.5%。
该模型补充了此前的 MAI-Transcribe-2。开发者此前已可通过 Azure 语音服务调用相关能力。
在语音合成方面,MAI-Voice-2.1 主打高表现力与低延迟,并在长段文本生成中保持稳定。该模型支持23种语言,被定位为微软AI团队目前保真度最高的文本转语音(TTS)模型。MAI-Voice-2.1-Flash 则是专为追求生成速度设计的轻量版本。目前,这两款语音模型及流式转写模型已通过 Vercel 的 AI Gateway 等渠道开放使用。
此次发布标志着微软内部 MAI 系列模型的进一步扩充。市场分析指出,微软每实现一层AI技术栈的自研,就意味着减少对外部供应商的一层依赖,这也显示出微软内部自研AI能力的成熟速度正在超出外界预期。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断