跳转至

EvoSpeech · 分层评委与云端执行规范

  • 状态:active v1
  • 生效日期:2026-07-21
  • 目的:让“可复现比较”“当前 SOTA 能力”和“人类真实听感”各自回答正确的问题,不再让 MacBook 承担批量神经评委。

一、先给结论

今后的默认计算拓扑是:

flowchart LR A["Mac:开发、冻结协议、抽样验收"] --> B["RunPod GPU:codec 与开源大模型评委"] A --> C["SOTA ASR API:闭源能力评委"] B --> D["hash-bound 逐样本证据"] C --> D D --> E["自动 Pareto 与冲突审计"] E --> F["少量前沿候选的人类盲测"]
  • Mac 只运行单元测试、非 ASR 的少量 smoke、结果审计和无法迁移的原生工具;
  • Mac 不运行任何 ASR,包括正式任务和临时 smoke;ASR smoke 也进入临时 GPU 或 API;
  • codec、speaker encoder、开源 ASR 等批量神经推理默认进入可恢复 GPU capsule;
  • 当前最强但不开放权重的 ASR 直接调用 API,不为每家服务自行部署;
  • 所有评委按层独立报告,禁止把多个不同含义的分数压成一个“准确率”。

二、四层评委分别回答什么

L0 · 确定性与信号层

真实 payload 字节、独立解码、采样率、时长、STOI、SI-SNR、ViSQOL、F0、能量和资源计账。 这一层检查 transport 与波形是否诚实,不能证明文字内容或人类偏好。

L1 · 冻结可复现内容层

用固定权重 revision、固定归一化、固定 decode 参数和固定 scorer 的开源 ASR。它的职责不是 代表世界上最强的听写能力,而是为所有历史模型提供一把不会随 SaaS 更新而漂移的尺。

现有 common_benchmark_v1 的历史 lineage 是:

  • Whisper small,faster-whisper,CPU int8,beam 5;
  • SenseVoiceSmall,固定 checkpoint revision 与本地归一化。

这两者从 v2 起降为历史 bridge,不再是新模型的最终内容评委。新共同 benchmark 必须周期性 选择当期强开源模型、固定 revision 后在全部锚点上重跑;“可复现”不等于“永远使用旧模型”。旧分数 保留且不覆盖,新分数用新的 evaluator version 并列。

L2 · 当前 SOTA shadow judges

这一层回答:“以今天可取得的强识别能力看,codec 是否仍丢失内容?”它用于发现 L1 的盲点和 校准前沿候选,不替代 L1 的可复现排名。

截至 2026-07-21,候选与裁决是:

模型/服务 准确率与速度证据 语言/角色 裁决
Qwen3-ASR-1.7B 官方公开表中 FLEURS zh 2.41、en 3.35;52 种语言/方言;1.7B 七语言统一开源准确率主评委 入选 GPU v2;固定 qwen-asr/Transformers、BF16、greedy、由 manifest 强制语言
Fun-ASR-Nano-2512 官方报 AISHELL-1 1.80、AISHELL-2 2.75、FLEURS-zh 2.56;vLLM 340× realtime、CER 8.20%(其速度集) 中文专用第二评委,兼顾 en/ja 入选 GPU v2;公开集准确率接近 Qwen,双家族冲突必须保留;实际速度以本项目适配器为准
Parakeet-TDT-0.6B-v3 Artificial Analysis:AA-WER 4.5%、906.8×、$1.50/1000min;官方 FLEURS de/es/fr 为 5.04/3.45/5.15 英/德/法/西高速开源第二评委 入选 GPU v2;只覆盖 25 个欧洲语言,不得用于中/日/韩
ElevenLabs Scribe v2 Artificial Analysis:AA-WER 2.2%、31.5×、$3.67/1000min 英文/欧洲语系 API 准确率评委,中文仅交叉检查 入选 L2;官方支持 90+ 语言,但 Mandarin 为 5–10% 档、Korean 为 10–20% 档,不能由英文榜单外推
Azure MAI-Transcribe-1.5 Artificial Analysis:AA-WER 2.4%、262.4×、$6/1000min 七语言统一 API 评委 入选 L2;明确支持 en/zh/de/fr/es/ja/ko,但仍在 public preview
MOSS-Transcribe-Diarize 0.9B 官方主表是 AISHELL-4/Alimeeting/Podcast/Movies 的 CER、cpCER 与说话人归因;无可比短句吞吐数字 长音频、多说话人、时间戳 D6 不进入 clean single-speaker D5 主评委;放入会议/播客/diarization stress
MOSS-Transcribe-preview-2B English-only,官方 Open ASR average WER 4.87,2.4B BF16,当前无 inference provider 英文研究候选 不胜过当前 Scribe/Parakeet 组合,暂不入主协议
SenseVoiceSmall FunASR benchmark 速度很高,但它是旧共同尺且不是当前准确率前沿 历史 bridge、情感/事件诊断 新模型不再以它作为最终 SOTA 内容裁判
Smallest Pulse Pro AA-WER 2.4%、约 250–300×、$4/1000min 英文批处理 官方 English-only;已有 Scribe + Parakeet 后边际信息不足,暂不入主轨

最终不是“一种语言选一个永远的赢家”,而是一个最小双评委路由:

语言 开源固定准确率主评委 独立第二视图 当期 API shadow
Chinese Qwen3-ASR-1.7B Fun-ASR-Nano MAI-Transcribe-1.5;Scribe v2 仅交叉
English Qwen3-ASR-1.7B Parakeet v3 Scribe v2;MAI-Transcribe-1.5 交叉
German/French/Spanish Qwen3-ASR-1.7B Parakeet v3 Scribe v2 + MAI-Transcribe-1.5
Japanese/Korean Qwen3-ASR-1.7B Fun-ASR-Nano 只覆盖 Japanese;Korean 暂无同级开源第二家族 MAI-Transcribe-1.5 + Scribe v2

这是按职责冻结的 v2 pilot 路由,不是通用冠军表。第一轮 MOSS bridge 已在同一 30 English + 30 Mandarin 原音和 240 条 codec 失真样本上完成:Qwen 原音 WER/CER 为 2.58%/2.79%、96.2× realtime;Fun 为 1.94%/3.24%、19.1×(当前逐条适配,非模型上限);Parakeet English WER 4.91%、185.3×。完整逐点 ΔER、环境 freeze 和边界见 ASR GPU v2 实测与选型。德/法/西/日/韩仍需在对应公共集完成 bridge, 因此厂商自报与不同硬件吞吐仍不能直接混排。

Artificial Analysis non-streaming Speech-to-Text 只用来发现当前候选,不充当我们的 ground truth。其 AA-WER 是约 8 小时、按时长加权的英语主导 组合(AgentTalk 50%、VoxPopuli-Cleaned-AA 25%、Earnings22-Cleaned-AA 25%);它不能证明中文、 codec 失真、数字实体或我们的六/七语言合同。

L2 的冻结请求至少包含:

  • provider、精确 model ID、API version、调用 UTC 与价格快照;
  • 音频 SHA-256、强制语言、verbatim/normalization 配置;
  • 禁用 keyterm、phrase list、上下文 prompt、diarization 和事后人工纠正;
  • 原始响应、规范化 transcript、重试次数、错误与请求成本;
  • reference 与 decoded 使用完全相同配置,并按 decoded ER − reference ER 报告;
  • API 版本漂移时新增 evaluator version,不覆写旧缓存。

L3 · 人类任务层

只对 Pareto 前沿、原创候选和评委冲突样本执行。内容听写、身份、表达和总体偏好分开;肉耳朵 是最终感知证据,但不是逐模型几百条批量筛选器。

三、为什么仍归档 Whisper + SenseVoice

归档它们不是因为论文都指定这两个模型,也不是因为它们比 SOTA API 更准确。codec 论文的原生 evaluation 各不相同,必须在 D3/D4 按论文自己的数据和指标复现。Whisper + SenseVoice 属于 EvoSpeech D5 的共同尺,价值是:

  1. 权重和 scorer 可归档,几年后仍能重建;
  2. 全部模型接受同一误差模式,允许合法纵向比较;
  3. 双家族冲突会暴露 evaluator dependence,禁止挑好看的一个;
  4. reference 原音自身错误率可以校准,不把 ASR 的错全算给 codec。

从 v2 起不再在本机或云端新增 Whisper/SenseVoice 转写,只保存历史结果作为 bridge。因此三类数字 永远分表:paper-nativefrozen-commoncurrent-SOTA-shadow。论文没用 Whisper/SenseVoice,不妨碍共同横评;共同横评也绝不能冒充论文复现。

四、默认执行位置

工作 默认位置 例外
代码、协议、测试、结果审计 Mac
codec 批量 encode/decode RunPod GPU 纯 CPU codec 或少量 smoke
开源 ASR / speaker 大模型批量推理 RunPod GPU ASR 无本地例外;smoke 也在 GPU;非 ASR 的轻量 speaker 工具可另行冻结
ViSQOL 官方镜像 Docker,可与 GPU job 同 Pod/host 算法不使用 GPU,但不再因它单独占用 Mac 数小时
闭源 SOTA ASR 官方 API 隐私数据默认不上传;public benchmark 可上传
人工盲测 静态 blind bundle 只用于终审和周期校准

任何预计超过 10 分钟或超过 100 个神经模型调用的正式任务,默认不得直接在 Mac 前台启动;先生成 冻结 manifest、成本投影、可恢复 cache 和云端 capsule。RunPod 的 lifecycle、安全与持久卷规则仍以 RunPod runbook为准。

五、当前 MOSS D5 的迁移边界

MOSS D5 在用户提出本规范前已经产生了部分本地 Whisper cache。该本地 ASR 任务已终止;这些 cache 只保留为中断恢复证据,不进入 GPU v2 正式结果。MOSS codec 阶段和 ASR panel 均已在 RTX 4090 完成:Qwen/Fun 各 300 条,Parakeet 150 条,共 750 条 hash-bound 评分记录;GPU、revision、环境 freeze、首次运行时间和 transcript SHA 均已归档。Mac 只对下载后的文字 cache 运行 WER/CER scorer, 没有加载 ASR。

MOSS 首先作为迁移 pilot;随后 Quark/BigCodec 的正式 runner 必须把 codec 与开源 evaluator 都放入 云端 capsule。L2 API 在凭据通过本机 secret 注入后作为独立 shadow 输出;它不参与事后选择模型点。

六、凭据与隐私

  • API key 只存在本机 secret store、未跟踪的权限 0600 配置或运行时 secret;
  • 禁止粘贴到聊天、commit、Dockerfile、镜像 layer、日志、result JSON 或 Cloudflare Pages;
  • runner 只记录 credential_source=runtime_secret,绝不记录 key 值;
  • 公共 benchmark 可以调用外部 API;私人录音、未发布数据和受限 corpus 默认不上传;
  • API 调用前先跑 2 条 smoke、验证 locale/normalization,再按显式成本上限执行。

以 MOSS D5 的 60 reference + 240 decoded 为例,总音频约 33.98 分钟。按 2026-07-21 Artificial Analysis 显示的价格估算,Scribe v2 约 $0.125,MAI-Transcribe-1.5 约 $0.204,双评委约 $0.329。价格只是预算快照,正式调用必须重新读取官方账单口径。

七、升级与验收

新增或替换评委前必须:

  1. 在 reference 原音、Opus、Codec 2、EnCodec 与一个强神经 codec 上做 bridge;
  2. 按语言报告 reference ER、decoded ER、delta ER 和双评委分歧;
  3. 加入数字、否定、实体顺序、前导零的规则核验;
  4. 验证缓存按音频 SHA + evaluator version 命中;
  5. 重放失败、429、timeout 和 API 响应 schema 变化;
  6. 页面明确展示它属于 L1 还是 L2,不允许静默替换。

验收通过只表示该评委适合对应层;任何自动 ASR 都不能单独证明人类自然度、身份、表达或总体偏好。