Batch A · 五家族公共 Benchmark Pareto 审计¶
状态:passed。本页从已经冻结的 13 点 × 60 句 D5 artifact 确定性重建;没有重跑 codec、Whisper、SenseVoice、ViSQOL 或其他指标,也没有生成单一综合分。
先读结论¶
- 不存在一个不带条件的赢家。 在最接近项目北极星的六轴
minimum_sufficient_speech视图中,13 点全部 non-dominated;这不是大家一样好,而是 wire、内容、弱语言 STOI、speaker proxy、共享 decoder prior 与速度之间尚无一点评价上全胜。 - 480 bps headline 不等于最低真实 wire。 WavTokenizer 的 representation 最低(约 480.8 bps),但短句 EVSWAV01 平均约 1805.7 bps;Codec 2 1200 的完整 artifact 约 1733.3 bps,反而略低。会话级 metadata 摊销仍可能改变未来协议,当前不能只看 token rate。
- 强 SOTA 确实形成降维压力。 DAC 在约 6 kbps representation 上给出最高 ViSQOL;Opus 24 kbps 给出最高 STOI、WavLM 与 Resemblyzer;WavTokenizer 把 learned representation 压到最低。原创设计必须解释自己从这些强项学了什么,而非只和传统 low-bit 系统比。
- 内容裁判仍是最薄弱的轴。 英文、中文两个内容视图都没有产生任何 dominance edge;双 ASR 的幅度甚至符号会冲突。后续 CandidateContract 必须继续保留双评委,并增加数字、否定、实体顺序的确定性检查,不能把一个 ASR delta 当真值。
- 当前 state 与速度账仍不完整。 conventional codec 的 0 只表示没有另计 external learned endpoint state,不表示程序、静态 VQ 表、working memory 或算力为零;RTF 也只是当前 macOS 短句实现。原创 baseline 必须补 package/RAM/MAC/latency 账。
13 个冻结模型点¶
repr 是表示位率;wire 是完整可独立解码 artifact;state 是当前已计共享 decoder endpoint state;worst ΔER 是四个 English/Mandarin × Whisper/SenseVoice mean delta 中最差者。fronts 是六个预注册视图中的 non-dominated 次数,不是总分。
| point | repr kbps | wire kbps | overhead | state MiB | ViSQOL | STOI | worst ΔER | WavLM | speaker | enc× | dec× | fronts |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
codec2_1200bps |
1.198 | 1.733 | 44.7% | 0.0 | 3.711 | 0.630 | 0.064 | 0.908 | 0.711 | 17.66 | 21.93 | 5/6 |
codec2_2400bps |
2.398 | 2.935 | 22.4% | 0.0 | 3.734 | 0.632 | 0.032 | 0.913 | 0.718 | 18.35 | 22.29 | 6/6 |
codec2_3200bps |
3.198 | 3.734 | 16.8% | 0.0 | 3.740 | 0.642 | 0.023 | 0.932 | 0.747 | 18.00 | 23.34 | 5/6 |
dac_6kbps |
6.003 | 10.320 | 71.9% | 283.0 | 4.549 | 0.973 | 0.007 | 0.994 | 0.991 | 0.53 | 0.77 | 6/6 |
encodec_12kbps |
12.009 | 12.859 | 7.1% | 88.8 | 4.311 | 0.943 | 0.007 | 0.983 | 0.984 | 1.90 | 2.00 | 4/6 |
encodec_1_5kbps |
1.501 | 2.346 | 56.3% | 88.8 | 4.136 | 0.816 | 0.338 | 0.913 | 0.846 | 2.00 | 1.99 | 6/6 |
encodec_24kbps |
24.019 | 24.869 | 3.5% | 88.8 | 4.331 | 0.956 | 0.006 | 0.987 | 0.989 | 1.85 | 2.00 | 3/6 |
encodec_3kbps |
3.002 | 3.847 | 28.1% | 88.8 | 4.230 | 0.874 | 0.041 | 0.958 | 0.930 | 1.98 | 1.99 | 6/6 |
encodec_6kbps |
6.005 | 6.850 | 14.1% | 88.8 | 4.275 | 0.915 | 0.188 | 0.974 | 0.969 | 1.90 | 1.97 | 5/6 |
opus_12kbps |
12.038 | 13.845 | 15.0% | 0.0 | 4.302 | 0.961 | 0.003 | 0.990 | 0.984 | 11.60 | 29.86 | 4/6 |
opus_24kbps |
24.075 | 25.884 | 7.5% | 0.0 | 4.266 | 0.991 | 0.006 | 0.997 | 0.994 | 11.21 | 28.30 | 6/6 |
opus_6kbps |
6.019 | 7.822 | 30.0% | 0.0 | 3.785 | 0.849 | 0.015 | 0.950 | 0.861 | 13.92 | 28.43 | 4/6 |
wavtokenizer_large_unified_480bps |
0.481 | 1.806 | 275.6% | 324.7 | 4.137 | 0.835 | 0.439 | 0.911 | 0.861 | 0.90 | 0.61 | 6/6 |
六个预注册前沿¶
| view | frontier | dominated | edges |
|---|---|---|---|
representation_quality_all |
6 | 7 | 9 |
wire_quality_all |
9 | 4 | 5 |
wire_content_en |
13 | 0 | 0 |
wire_content_zh |
13 | 0 | 0 |
deployment_all |
12 | 1 | 1 |
minimum_sufficient_speech |
13 | 0 | 0 |
representation_quality_all¶
Separate learned representation efficiency from container overhead.
Frontier:codec2_2400bps, dac_6kbps, encodec_1_5kbps, encodec_3kbps, opus_24kbps, wavtokenizer_large_unified_480bps。
Dominated:codec2_1200bps, codec2_3200bps, encodec_12kbps, encodec_24kbps, encodec_6kbps, opus_12kbps, opus_6kbps。
wire_quality_all¶
Compare complete source-blind artifacts rather than nominal rates.
Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_1_5kbps, encodec_3kbps, encodec_6kbps, opus_24kbps, wavtokenizer_large_unified_480bps。
Dominated:encodec_12kbps, encodec_24kbps, opus_12kbps, opus_6kbps。
wire_content_en¶
English content-sensitive wire frontier under two frozen ASR evaluators.
Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。
Dominated:无;该视图没有 mean-dominance edge。
wire_content_zh¶
Mandarin content-sensitive wire frontier under two frozen ASR evaluators.
Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。
Dominated:无;该视图没有 mean-dominance edge。
deployment_all¶
Expose the joint wire/state/speed/intelligibility burden without calling it total system size.
Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。
Dominated:encodec_24kbps。
minimum_sufficient_speech¶
Project north-star view using worst observed language/evaluator content, weakest-language intelligibility and identity proxy, complete wire bytes, shared decoder prior and slower endpoint speed.
Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。
Dominated:无;该视图没有 mean-dominance edge。
双 ASR 内容证据与 95% CI¶
ΔER = decoded error rate − original-audio error rate。负数保留原值,但不解释为 codec 恢复了真实内容。以下每格都是 mean [95% utterance-bootstrap CI]。
| point | EN Whisper | EN SenseVoice | ZH Whisper | ZH SenseVoice |
|---|---|---|---|---|
codec2_1200bps |
+0.051 [+0.015, +0.091] | +0.030 [+0.010, +0.052] | +0.064 [-0.003, +0.129] | +0.050 [+0.017, +0.090] |
codec2_2400bps |
+0.032 [+0.005, +0.065] | +0.011 [-0.010, +0.040] | +0.025 [-0.033, +0.081] | +0.029 [+0.004, +0.059] |
codec2_3200bps |
+0.023 [+0.002, +0.049] | +0.006 [-0.007, +0.022] | +0.001 [-0.058, +0.056] | +0.010 [-0.009, +0.032] |
dac_6kbps |
+0.007 [+0.001, +0.016] | -0.009 [-0.019, -0.002] | +0.005 [-0.021, +0.026] | +0.004 [-0.012, +0.023] |
encodec_12kbps |
+0.005 [-0.004, +0.015] | -0.000 [-0.017, +0.015] | -0.011 [-0.064, +0.037] | +0.007 [-0.009, +0.022] |
encodec_1_5kbps |
+0.075 [+0.039, +0.116] | +0.045 [+0.016, +0.078] | +0.338 [+0.153, +0.618] | +0.175 [+0.123, +0.230] |
encodec_24kbps |
+0.005 [-0.004, +0.015] | +0.006 [-0.008, +0.021] | +0.004 [-0.048, +0.055] | -0.006 [-0.020, +0.008] |
encodec_3kbps |
+0.015 [-0.005, +0.043] | +0.012 [-0.005, +0.033] | +0.037 [-0.029, +0.096] | +0.041 [+0.019, +0.063] |
encodec_6kbps |
+0.188 [-0.005, +0.562] | -0.003 [-0.020, +0.013] | -0.005 [-0.063, +0.050] | +0.021 [-0.002, +0.049] |
opus_12kbps |
+0.003 [-0.008, +0.015] | -0.009 [-0.024, +0.002] | -0.021 [-0.074, +0.027] | -0.006 [-0.019, +0.007] |
opus_24kbps |
+0.003 [-0.004, +0.012] | -0.001 [-0.010, +0.006] | +0.003 [+0.000, +0.007] | +0.006 [-0.003, +0.019] |
opus_6kbps |
+0.008 [-0.005, +0.021] | +0.015 [-0.001, +0.032] | -0.035 [-0.095, +0.022] | +0.013 [-0.005, +0.032] |
wavtokenizer_large_unified_480bps |
+0.116 [+0.068, +0.167] | +0.124 [+0.083, +0.169] | +0.439 [+0.369, +0.511] | +0.277 [+0.207, +0.355] |
一个尤其重要的反例是 EnCodec 6 kbps:English Whisper ΔER mean 约 +0.188,而 English SenseVoice 约 -0.003。只选其中一个评委,会得到完全不同的内容结论。WavTokenizer 在两个语言、两个评委上都显示正退化,尤其 Mandarin;但这仍不替代关键实体人工/规则核验。
对原创 baseline 的直接影响¶
下一阶段不应复制一个单一冠军,而应保留五种互补角色:
- Codec 2:1.2–3.2 kbps 参数通信下界与微型 decoder 纪律;
- Opus:成熟 packet、强实时和高内容/质量通信锚点;
- EnCodec:同一 checkpoint 合法 RVQ depth sweep,适合检验连续 rate-control;
- DAC:高保真生成式 neural teacher,提醒量化训练和强 decoder 的上限;
- WavTokenizer:极低帧率单码本 teacher,迫使我们分清 token rate、wire bytes、内容和巨大 prior。
这是 role recommendation,不是预注册 winner verdict。Batch B/C 新模型进入后要按同一 D5 字段重算;原创 agent baseline 的第一版 reward 至少拆成 wire、内容、弱语言可懂度、speaker、state、speed 六轴,并让每个代理指标只裁决对应维度。
明确没有证明什么¶
本审计没有证明人类自然度/身份/表达偏好,没有证明 causal streaming、算法延迟、移动端速度、噪声/丢包鲁棒性、关键实体安全或训练成本,也没有把不同论文原生数据混入 D5。
所有前沿均由未取整 mean 计算;页面显示的 rounded 数字只用于阅读。mean dominance 不是统计显著性。完整 CI、derived fields、frontier memberships 与 15 条 dominance edge 分别保存在 points.jsonl、results.json 和 dominance_edges.jsonl。