性能表现
- 在 FLEURS 多语言基准的 60 个语种上排名第一,平均词错误率(WER)仅 5.2%。
- 在 Artificial Analysis 的准确率—延迟帕累托前沿上定义新的边界,并在其 WER 排行榜上位列第二。
- 根据 Artificial Analysis 的评测,推理速度比 OpenAI GPT-Transcribe 快 10 倍,比 ElevenLabs Scribe v2 快 7 倍,比 Gemini 3.5 Transcribe 快 5 倍,同时准确率更高。
- 定价为每小时音频 0.10 美元,为市场最低。
新增能力
- 说话人分离(diarization):区分录音中的不同说话人,并把词语归属到正确的人。
- 词级时间戳:为每个词提供精确时间,支持更准确的对齐、检索、导航与编辑。
- 关键词偏置:帮助模型识别领域术语、缩写、人名等仅凭上下文难以区分的表达。
- 可配置转录风格:“逐字”模式保留填充词与口误,适合合规与分析;“洁净”模式去除填充词,生成更可读的字幕、笔记与成稿。
- 语码转换:支持在语言之间自然切换的对话,包括印地英语、西班牙英语等常见混合语对。
- 自动语种识别:无需用户预先指定即可准确检测所说语言。
- 噪声环境鲁棒性:在受控录音环境之外仍能维持转录质量。
典型场景
从临床病历记录、法律文档,到无障碍服务与隐藏字幕,MAI-Transcribe-2 面向真实世界应用设计,尤其适合长音频场景——其推理延迟相比主要竞品有最多 10 倍的处理速度优势。