跳转至

ASR evaluator panel v2 · GPU pilot

本页只比较 ASR 作为 codec 内容评委的适用性;全部转写在 RunPod RTX 4090 上完成,Mac 没有运行 ASR。 绝对 WER/CER 用来审计评委本身,codec 判断仍使用同一评委的 decoded-minus-reference ΔER。

同一批原音上的准确率与速度

Evaluator sample reference en WER reference zh CER first-pass seconds audio seconds × realtime 定位
Qwen3-ASR 300 0.0258 0.0279 21.20 2038.65 96.2× unified_open_accuracy_primary
Fun-ASR-Nano 300 0.0194 0.0324 106.76 2038.65 19.1× chinese_open_accuracy_speed_secondary
Parakeet-TDT 150 0.0491 5.24 971.05 185.3× european_open_speed_secondary

这里的速度包含首次模型加载和推理,但不含 checkpoint 下载与环境安装。Fun-ASR 当前适配器逐条调用, 所以 19.1× 不是模型的吞吐上限;在不改变准确率合同的前提下可以另做批处理优化。

MOSS full-v1 的内容损伤切片

Evaluator lang q6 ΔER q8 ΔER q16 ΔER q32 ΔER
Qwen3-ASR en -0.0025 +0.0068 -0.0002 +0.0027
Qwen3-ASR zh +0.0142 +0.0126 +0.0039 +0.0039
Fun-ASR-Nano en +0.0000 -0.0035 -0.0035 -0.0005
Fun-ASR-Nano zh +0.0298 +0.0147 +0.0013 +0.0000
Parakeet-TDT en +0.0284 +0.0037 -0.0016 +0.0103

裁决

  • 统一开源主评委:Qwen3-ASR-1.7B。它覆盖目标七语,并在本轮原音上得到 English WER 2.58%、Mandarin CER 2.79%。
  • 中文/英日独立副评委:Fun-ASR-Nano-2512。本轮 English WER 1.94% 更低,Mandarin CER 3.24% 略高;它的价值是不同模型家族的交叉检查。
  • 欧洲语系速度副评委:Parakeet-TDT-0.6B-v3。本轮 English WER 4.91%,不取代准确率主评委,但 185.3× realtime 适合大规模初筛。
  • API shadow:Scribe v2 用于 English/de/fr/es/ja 的少量外部审计;MAI Transcribe 1.5 用于七语统一审计。它们不作为不可复现的唯一正式评委,也不需要在本地部署。
  • MOSS-Transcribe-preview-2B 是 English-only;MOSS-Transcribe-Diarize 更适合未来长音频、多说话人 D6,不塞进当前干净单说话人 D5。SenseVoice 仅保留历史桥接,不再新增正式本地运行。

证据边界

  • 这是固定 30 English + 30 Mandarin、四个 codec 点的内部 pilot,不是通用 ASR 排行榜,也不能证明全球 SOTA;
  • Qwen 与 Fun 的部分负 ΔER 是 ASR 随机/归一化边界下 decoded 偶尔比 reference 更容易识别,不能解释为 codec 改善了语义;
  • 多评委的意义是揭示代理模型分歧,不是投票制造一个伪精确单分数;自动进化不得直接优化某一个 ASR 的裸分;
  • 人类终审仍负责内容、身份、表达和总体听感;个人录音是可选扩展,不阻塞公共 benchmark;
  • raw transcript、音频 SHA、模型 revision、环境 freeze、GPU 与首次运行日志 hash 均已绑定。

权威入口