微软(Microsoft)于近日推出三款面向实时语音交互的新 AI 模型,分别为语音转文字模型 MAI-Transcribe-2-Streaming,以及文本转语音模型 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash。这套组合旨在帮助开发者构建可实现即时听取、实时处理并以自然语音应答的对话代理与语音助手。
作为此前 MAI-Transcribe-2 的升级版本,MAI-Transcribe-2-Streaming 打破了仅能处理录音文件的局限,支持持续输入的音频流。该模型可在说话者未结束发音时即时生成阶段性文本,并根据后续语境动态修正,最终输出稳定结果。官方数据显示,模型支持60种语言的连续自动识别,首批识别假设在接收音频后略多于100毫秒内即可呈现,适用于客服、会议字幕及语音输入等场景。在其内部测试中,该模型的文字生成速度达到同类竞争产品的近两倍。在 Artificial Analysis 针对38款模型、涵盖8小时音频的流式转录基准测试中,该模型在最终文本与阶段性文本准确率项目上均位列第一,最终转录词错误率约为2.5%,并在检测到说话结束约0.13秒后给出最终文本。该模型目前促销动向为每小时音频0.54美元,优惠将持续至2026年底。
同步推出的语音合成模型 MAI-Voice-2.1 支持23种语言与26个地区变体,能够在保留说话者声音特征与本地口音的前提下实现跨语言合成,定价为每100万字符22美元,主要面向长文本、旁白及有声读物场景。面向低延迟场景的 MAI-Voice-2.1-Flash 则偏向实时语音代理与客服,定价为每100万字符15美元;官方表示其推理速度提升55%,可在约150毫秒的端到端延迟下生成45秒音频。两款语音模型均支持获授权前提下的跨语言即时语音克隆,参考音频建议为5至60秒,且目前均被微软列为受限访问。
目前,三款模型已通过 Microsoft Foundry、MAI Playground 及 Vercel 开放,语音模型亦接入 OpenRouter 与 Azure Voice Live,LiveKit 的支持预计随后推出。微软 Azure 文档指出,相关模型目前处于公开预览阶段,暂无服务级别协议(SLA),不建议直接部署于生产环境。
参考来源: https://microsoft.ai/news/our-first-streaming-transcription-model/