Daily Technical Tracking

每日科技追踪 · 2026-9-4

2026年9月4日(周五) · 产品追踪

每日追踪
← 返回首页

微软发布MAI-Transcribe-2语音模型

微软发布 MAI-Transcribe-2,在 FLEURS 基准 60 个语种上排名第一,平均词错误率 5.2%,定价每小时音频 0.10 美元。

性能表现

  • 在 FLEURS 多语言基准的 60 个语种上排名第一,平均词错误率(WER)仅 5.2%。
  • 在 Artificial Analysis 的准确率—延迟帕累托前沿上定义新的边界,并在其 WER 排行榜上位列第二。
  • 根据 Artificial Analysis 的评测,推理速度比 OpenAI GPT-Transcribe 快 10 倍,比 ElevenLabs Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍,同时准确率更高。
  • 定价为每小时音频 0.10 美元,为市场最低。

新增能力

  • 说话人分离(diarization):区分录音中的不同说话人,并把词语归属到正确的人。
  • 词级时间戳:为每个词提供精确时间,支持更准确的对齐、检索、导航与编辑。
  • 关键词偏置:帮助模型识别领域术语、缩写、人名等仅凭上下文难以区分的表达。
  • 可配置转录风格:“逐字”模式保留填充词与口误,适合合规与分析;“洁净”模式去除填充词,生成更可读的字幕、笔记与成稿。
  • 语码转换:支持在语言之间自然切换的对话,包括印地英语、西班牙英语等常见混合语对。
  • 自动语种识别:无需用户预先指定即可准确检测所说语言。
  • 噪声环境鲁棒性:在受控录音环境之外仍能维持转录质量。

典型场景

从临床病历记录、法律文档,到无障碍服务与隐藏字幕,MAI-Transcribe-2 面向真实世界应用设计,尤其适合长音频场景——其推理延迟相比主要竞品有最多 10 倍的处理速度优势。