ASR evaluator panel v2 · GPU pilot¶
本页只比较 ASR 作为 codec 内容评委的适用性;全部转写在 RunPod RTX 4090 上完成,Mac 没有运行 ASR。 绝对 WER/CER 用来审计评委本身,codec 判断仍使用同一评委的 decoded-minus-reference ΔER。
同一批原音上的准确率与速度¶
| Evaluator | sample | reference en WER | reference zh CER | first-pass seconds | audio seconds | × realtime | 定位 |
|---|---|---|---|---|---|---|---|
Qwen3-ASR |
300 | 0.0258 | 0.0279 | 21.20 | 2038.65 | 96.2× | unified_open_accuracy_primary |
Fun-ASR-Nano |
300 | 0.0194 | 0.0324 | 106.76 | 2038.65 | 19.1× | chinese_open_accuracy_speed_secondary |
Parakeet-TDT |
150 | 0.0491 | — | 5.24 | 971.05 | 185.3× | european_open_speed_secondary |
这里的速度包含首次模型加载和推理,但不含 checkpoint 下载与环境安装。Fun-ASR 当前适配器逐条调用, 所以 19.1× 不是模型的吞吐上限;在不改变准确率合同的前提下可以另做批处理优化。
MOSS full-v1 的内容损伤切片¶
| Evaluator | lang | q6 ΔER | q8 ΔER | q16 ΔER | q32 ΔER |
|---|---|---|---|---|---|
Qwen3-ASR |
en |
-0.0025 | +0.0068 | -0.0002 | +0.0027 |
Qwen3-ASR |
zh |
+0.0142 | +0.0126 | +0.0039 | +0.0039 |
Fun-ASR-Nano |
en |
+0.0000 | -0.0035 | -0.0035 | -0.0005 |
Fun-ASR-Nano |
zh |
+0.0298 | +0.0147 | +0.0013 | +0.0000 |
Parakeet-TDT |
en |
+0.0284 | +0.0037 | -0.0016 | +0.0103 |
裁决¶
- 统一开源主评委:Qwen3-ASR-1.7B。它覆盖目标七语,并在本轮原音上得到 English WER 2.58%、Mandarin CER 2.79%。
- 中文/英日独立副评委:Fun-ASR-Nano-2512。本轮 English WER 1.94% 更低,Mandarin CER 3.24% 略高;它的价值是不同模型家族的交叉检查。
- 欧洲语系速度副评委:Parakeet-TDT-0.6B-v3。本轮 English WER 4.91%,不取代准确率主评委,但 185.3× realtime 适合大规模初筛。
- API shadow:Scribe v2 用于 English/de/fr/es/ja 的少量外部审计;MAI Transcribe 1.5 用于七语统一审计。它们不作为不可复现的唯一正式评委,也不需要在本地部署。
- MOSS-Transcribe-preview-2B 是 English-only;MOSS-Transcribe-Diarize 更适合未来长音频、多说话人 D6,不塞进当前干净单说话人 D5。SenseVoice 仅保留历史桥接,不再新增正式本地运行。
证据边界¶
- 这是固定 30 English + 30 Mandarin、四个 codec 点的内部 pilot,不是通用 ASR 排行榜,也不能证明全球 SOTA;
- Qwen 与 Fun 的部分负 ΔER 是 ASR 随机/归一化边界下 decoded 偶尔比 reference 更容易识别,不能解释为 codec 改善了语义;
- 多评委的意义是揭示代理模型分歧,不是投票制造一个伪精确单分数;自动进化不得直接优化某一个 ASR 的裸分;
- 人类终审仍负责内容、身份、表达和总体听感;个人录音是可选扩展,不阻塞公共 benchmark;
- raw transcript、音频 SHA、模型 revision、环境 freeze、GPU 与首次运行日志 hash 均已绑定。