微软首发流式转写模型:MAI-Transcribe-2-Streaming 双榜第一
微软首发流式转写模型:2.50% 词错误率、语音结束 0.13 秒出全稿,双榜第一,60 语言,每小时 0.54 美元。

微软 AI 10 月 1 日发布 MAI-Transcribe-2-Streaming——公司第一个流式语音转写模型,在 Artificial Analysis 的流式转写榜单上同时拿下最终转写精度与首字延迟两个第一。同批发布的还有 MAI-Voice-2.1 与 Voice-2.1-Flash 两个语音模型。
事实部分
- 榜单成绩:28-38 个流式转写模型中双榜第一;词错误率 2.50%(对比 Grok Voice Transcribe 2.0 Streaming 的 2.73%、ElevenLabs Scribe v2 Realtime 的 3.59%)。
- 延迟:语音结束后 0.13 秒输出完整转写;说话开始约 100 毫秒出首个部分文本、约 320 毫秒出文本。
- 语言:60 种语言,支持连续自动语种检测。
- 可用性:Microsoft Foundry、MAI Playground、OpenRouter;促销价每小时 0.54 美元(约 3.6 元);Azure Speech 流式版未提及。
- 信源说明:微软官方博客与 IT之家数字一致;榜单口径出自 Artificial Analysis 9 月 28 日发布的评测。
实时语音层的选型意义
此前流式转写的精度-延迟权衡没有公认赢家,各家在自家场景自说自话;第三方双榜第一第一次给出可引用的基准。语音智能体(会议纪要、客服、实时翻译)的转写选型可以直接对齐 2.50%/0.13 秒这条线——注意这是「语音结束到全稿」的口径,做实时字幕还要看部分文本延迟。
与 MAI 系列的关系
这是微软自研 MAI 模型线从文本/图像向语音的延伸,与同周重构的 Copilot 产品线配套——「工作入口」需要自有的耳朵和嗓子。自研替代 OpenAI Whisper 系列的路线越走越实。
编辑判断
每小时 0.54 美元的促销价把流式转写拉到接近「不计成本」的区间——按会议纪要场景算,一场一小时会议的转写成本不到 4 块钱。做语音产品的团队值得在本周把这套基准跑进自己的评测集:用真实带噪音频对比 2.50% 这个数字的成色。
榜单口径说明
Artificial Analysis 的流式榜第一次把实时转写的三难摆在同一张表上:部分文本延迟(首字多快)、最终延迟(定稿多快)与精度。过去的领先者只占一条轴;MAI-Transcribe-2-Streaming 双榜第一加促销价,改变的是采购算术。注意两点:榜单音频偏干净,行话多或噪声大的场景仍要自测;Azure Speech 流式版尚未出现——模型目前只在 Microsoft Foundry、MAI Playground 与 OpenRouter。
竞争格局
ElevenLabs(Scribe v2 Realtime)、Grok Voice 与 Deepgram 在公开榜上落后,OpenAI 的 Whisper 系统更缺席流式头部——微软 MAI 线打的正是 OpenAI 无暇顾及的空档。MAI 模型上第三方路由器(OpenRouter)也是新姿态:自研线开始走分发。
对语音智能体开发者的意义
0.13 秒的「语音结束到全稿」适合轮次对话型智能体(助手要知道用户说完了没);实时字幕与同传Overlay更关心部分文本延迟。每小时 0.54 美元的促销价让「全部转写」类产品——常驻会议记录、通话分析——的成本降到低于音频存储本身:转写正在变成免费原语,价值转移到转写之后做什么。
还有一个集成细节:60 种语言的连续自动检测意味着混合语言会议不再需要预先路由——模型可以在语流中切换语种。这一个功能就把通话分析流水线里整类语种检测预处理送进了历史,那些项目往往正是悄悄死在这一步。
对已经在用 MAI 模型的团队,流式版补齐了 Copilot Voice 需要的实时语音闭环:听力、嗓子、智能体大脑出自一家,集成税只交一次。一天发三个模型背后的安静策略正是这套捆绑。