2026年开源语音识别模型竞争激烈,WER、语言覆盖与授权全解析
•1 阅读•5分钟•开源
开源IBMCohereMOSS-Transcribe
•1 阅读•5分钟•开源
赛道概览
2026 年的开源 ASR 市场已不再围绕单一的 Whisper 模型。自 3 月 Cohere 发布 2 B 参数的 Transcribe 并以 5.42% 的平均 WER 登顶后,IBM 的 Granite Speech 4.1(5.33%)以及 ARK‑ASR‑3B、MOSS‑Transcribe‑preview‑2B 紧随其后,排名差距不足 1 个 WER 点。此时,模型的 许可证、语言覆盖、流式支持与每小时音频成本 成为选型的关键因素。
关键指标对比
| 模型 | 参数 | 许可证 | 支持语言 | 平均 WER* | 流式 RT‑Fx (A100) | 主要亮点 |
|---|---|---|---|---|---|---|
| Cohere Transcribe | 2 B | Apache‑2.0 | 14 | 5.42%(8 组英文测试) | 231.3 | Conformer 编码器 + 轻量 Transformer 解码器,已下载 62 万次,支持 transformers、vLLM、mlx‑audio 等多平台 |
| IBM Granite Speech 4.1 | 2 B | Apache‑2.0 | 6 | 5.33%(公开集) | 231.3 | 支持双向语音翻译、关键字偏置、标点真值化,训练时长 174k 小时 |
| ARK‑ASR‑3B | 3 B | Apache‑2.0 | 5 | 5.04%(7 组) | 180 | 非自回归编辑 + 双向 LLM,RT‑Fx≈1820(H100) |
| MOSS‑Transcribe‑preview‑2B | 2 B | Apache‑2.0 (受联系信息协议约束) | 50+ | 5.12%(排除 TED‑LIUM) | 3332.7 | 同时输出说话人标签、时间戳,支持 128k 上下文,RTX 4090 RTF≈0.017 |
| Canary‑Qwen‑2.5B | 2.5 B | CC‑BY‑4.0 | 1 (English) | 5.63% | 418 | FastConformer + Qwen‑3‑1.7B 解码器,支持转录+LLM 摘要模式 |
| Parakeet TDT 0.6B v3 | 0.6 B | CC‑BY‑4.0 | 25 (欧语) | 6.32% | 3332.7 | 自动语言检测,单卡可一次处理 24 分钟音频 |
*注:表中 WER 为公开榜单对应数据,若统一剔除 TED‑LIUM 后,Cohere 实际为 5.84%,Granite 为 5.65%。
许可证与合规要点
- Apache‑2.0:Cohere、Granite、ARK‑ASR、Qwen3‑ASR 系列均可商业使用,无需署名(除非模型仓库另有要求)。
- CC‑BY‑4.0:Canary‑Qwen、Parakeet、Kyutai 需在产品中保留署名,若对品牌统一有严格要求,可能成为阻碍。
- MIT:Whisper large‑v3 仍是最宽松的授权,但仅支持 99 种语言,且生态成熟度最高。
- 特殊约束:Cohere 的代码仓库虽标 Apache‑2.0,却要求填写联系信息后方可下载,实际部署前需评估合规风险。
选型建议流程
- 先审许可证:若项目不能接受署名义务,直接剔除 CC‑BY 系列。
- 语言覆盖:中文业务首选 Qwen3‑ASR(52 种语言+22 种方言)或 MOSS‑Transcribe(50+)。
- 流式需求:对低延迟有严格要求的对话系统,优先考虑 ARK‑ASR‑3B(非自回归)或 Gran ite‑NAR(CTC+LLM 单次前向)。
- 成本核算:在自有 GPU(A100/H100)上测算 RTF×每秒费用,以决定每小时音频成本。
- 实测本地数据:公开榜单间的 0.5% WER 差距在真实噪声、口音环境下往往被放大,务必自行跑一轮评估。
趋势洞察
- 2 B 级开源模型已可媲美闭源 API:Cohere、Granite 的成本远低于商业云服务,且在多数公开基准上领先。
- 许可证分化成为竞争核心:同等精度的模型在授权宽松度上的差异,直接影响企业的采购决策。
- 多语言与本地化:Meta 的 Omnilingual ASR 虽不在 WER 前列,却以 1 600+ 原生语言覆盖打开了稀缺语言市场的可能。
- 架构创新:diffusion‑gemma‑asr‑small 通过并行扩散解码实现了高效推理,但仍属实验性,暂不推荐生产使用。
结论:2026 年的开源 ASR 版图已从“单一 Whisper”转向多模型竞争。企业在选型时应把 许可证合规、语言覆盖与流式吞吐 放在首位,而非仅盯着榜单排名。只要做好本地化评测,2 B 左右的开源模型即可提供与付费闭源相当的准确率与成本优势。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。