跳转至

Batch A · 五家族公共 Benchmark Pareto 审计

状态:passed。本页从已经冻结的 13 点 × 60 句 D5 artifact 确定性重建;没有重跑 codec、Whisper、SenseVoice、ViSQOL 或其他指标,也没有生成单一综合分。

先读结论

  1. 不存在一个不带条件的赢家。 在最接近项目北极星的六轴 minimum_sufficient_speech 视图中,13 点全部 non-dominated;这不是大家一样好,而是 wire、内容、弱语言 STOI、speaker proxy、共享 decoder prior 与速度之间尚无一点评价上全胜。
  2. 480 bps headline 不等于最低真实 wire。 WavTokenizer 的 representation 最低(约 480.8 bps),但短句 EVSWAV01 平均约 1805.7 bps;Codec 2 1200 的完整 artifact 约 1733.3 bps,反而略低。会话级 metadata 摊销仍可能改变未来协议,当前不能只看 token rate。
  3. 强 SOTA 确实形成降维压力。 DAC 在约 6 kbps representation 上给出最高 ViSQOL;Opus 24 kbps 给出最高 STOI、WavLM 与 Resemblyzer;WavTokenizer 把 learned representation 压到最低。原创设计必须解释自己从这些强项学了什么,而非只和传统 low-bit 系统比。
  4. 内容裁判仍是最薄弱的轴。 英文、中文两个内容视图都没有产生任何 dominance edge;双 ASR 的幅度甚至符号会冲突。后续 CandidateContract 必须继续保留双评委,并增加数字、否定、实体顺序的确定性检查,不能把一个 ASR delta 当真值。
  5. 当前 state 与速度账仍不完整。 conventional codec 的 0 只表示没有另计 external learned endpoint state,不表示程序、静态 VQ 表、working memory 或算力为零;RTF 也只是当前 macOS 短句实现。原创 baseline 必须补 package/RAM/MAC/latency 账。

13 个冻结模型点

repr 是表示位率;wire 是完整可独立解码 artifact;state 是当前已计共享 decoder endpoint state;worst ΔER 是四个 English/Mandarin × Whisper/SenseVoice mean delta 中最差者。fronts 是六个预注册视图中的 non-dominated 次数,不是总分。

point repr kbps wire kbps overhead state MiB ViSQOL STOI worst ΔER WavLM speaker enc× dec× fronts
codec2_1200bps 1.198 1.733 44.7% 0.0 3.711 0.630 0.064 0.908 0.711 17.66 21.93 5/6
codec2_2400bps 2.398 2.935 22.4% 0.0 3.734 0.632 0.032 0.913 0.718 18.35 22.29 6/6
codec2_3200bps 3.198 3.734 16.8% 0.0 3.740 0.642 0.023 0.932 0.747 18.00 23.34 5/6
dac_6kbps 6.003 10.320 71.9% 283.0 4.549 0.973 0.007 0.994 0.991 0.53 0.77 6/6
encodec_12kbps 12.009 12.859 7.1% 88.8 4.311 0.943 0.007 0.983 0.984 1.90 2.00 4/6
encodec_1_5kbps 1.501 2.346 56.3% 88.8 4.136 0.816 0.338 0.913 0.846 2.00 1.99 6/6
encodec_24kbps 24.019 24.869 3.5% 88.8 4.331 0.956 0.006 0.987 0.989 1.85 2.00 3/6
encodec_3kbps 3.002 3.847 28.1% 88.8 4.230 0.874 0.041 0.958 0.930 1.98 1.99 6/6
encodec_6kbps 6.005 6.850 14.1% 88.8 4.275 0.915 0.188 0.974 0.969 1.90 1.97 5/6
opus_12kbps 12.038 13.845 15.0% 0.0 4.302 0.961 0.003 0.990 0.984 11.60 29.86 4/6
opus_24kbps 24.075 25.884 7.5% 0.0 4.266 0.991 0.006 0.997 0.994 11.21 28.30 6/6
opus_6kbps 6.019 7.822 30.0% 0.0 3.785 0.849 0.015 0.950 0.861 13.92 28.43 4/6
wavtokenizer_large_unified_480bps 0.481 1.806 275.6% 324.7 4.137 0.835 0.439 0.911 0.861 0.90 0.61 6/6

六个预注册前沿

view frontier dominated edges
representation_quality_all 6 7 9
wire_quality_all 9 4 5
wire_content_en 13 0 0
wire_content_zh 13 0 0
deployment_all 12 1 1
minimum_sufficient_speech 13 0 0

representation_quality_all

Separate learned representation efficiency from container overhead.

Frontier:codec2_2400bps, dac_6kbps, encodec_1_5kbps, encodec_3kbps, opus_24kbps, wavtokenizer_large_unified_480bps。 Dominated:codec2_1200bps, codec2_3200bps, encodec_12kbps, encodec_24kbps, encodec_6kbps, opus_12kbps, opus_6kbps

wire_quality_all

Compare complete source-blind artifacts rather than nominal rates.

Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_1_5kbps, encodec_3kbps, encodec_6kbps, opus_24kbps, wavtokenizer_large_unified_480bps。 Dominated:encodec_12kbps, encodec_24kbps, opus_12kbps, opus_6kbps

wire_content_en

English content-sensitive wire frontier under two frozen ASR evaluators.

Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。 Dominated:无;该视图没有 mean-dominance edge。

wire_content_zh

Mandarin content-sensitive wire frontier under two frozen ASR evaluators.

Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。 Dominated:无;该视图没有 mean-dominance edge。

deployment_all

Expose the joint wire/state/speed/intelligibility burden without calling it total system size.

Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。 Dominated:encodec_24kbps

minimum_sufficient_speech

Project north-star view using worst observed language/evaluator content, weakest-language intelligibility and identity proxy, complete wire bytes, shared decoder prior and slower endpoint speed.

Frontier:codec2_1200bps, codec2_2400bps, codec2_3200bps, dac_6kbps, encodec_12kbps, encodec_1_5kbps, encodec_24kbps, encodec_3kbps, encodec_6kbps, opus_12kbps, opus_24kbps, opus_6kbps, wavtokenizer_large_unified_480bps。 Dominated:无;该视图没有 mean-dominance edge。

双 ASR 内容证据与 95% CI

ΔER = decoded error rate − original-audio error rate。负数保留原值,但不解释为 codec 恢复了真实内容。以下每格都是 mean [95% utterance-bootstrap CI]。

point EN Whisper EN SenseVoice ZH Whisper ZH SenseVoice
codec2_1200bps +0.051 [+0.015, +0.091] +0.030 [+0.010, +0.052] +0.064 [-0.003, +0.129] +0.050 [+0.017, +0.090]
codec2_2400bps +0.032 [+0.005, +0.065] +0.011 [-0.010, +0.040] +0.025 [-0.033, +0.081] +0.029 [+0.004, +0.059]
codec2_3200bps +0.023 [+0.002, +0.049] +0.006 [-0.007, +0.022] +0.001 [-0.058, +0.056] +0.010 [-0.009, +0.032]
dac_6kbps +0.007 [+0.001, +0.016] -0.009 [-0.019, -0.002] +0.005 [-0.021, +0.026] +0.004 [-0.012, +0.023]
encodec_12kbps +0.005 [-0.004, +0.015] -0.000 [-0.017, +0.015] -0.011 [-0.064, +0.037] +0.007 [-0.009, +0.022]
encodec_1_5kbps +0.075 [+0.039, +0.116] +0.045 [+0.016, +0.078] +0.338 [+0.153, +0.618] +0.175 [+0.123, +0.230]
encodec_24kbps +0.005 [-0.004, +0.015] +0.006 [-0.008, +0.021] +0.004 [-0.048, +0.055] -0.006 [-0.020, +0.008]
encodec_3kbps +0.015 [-0.005, +0.043] +0.012 [-0.005, +0.033] +0.037 [-0.029, +0.096] +0.041 [+0.019, +0.063]
encodec_6kbps +0.188 [-0.005, +0.562] -0.003 [-0.020, +0.013] -0.005 [-0.063, +0.050] +0.021 [-0.002, +0.049]
opus_12kbps +0.003 [-0.008, +0.015] -0.009 [-0.024, +0.002] -0.021 [-0.074, +0.027] -0.006 [-0.019, +0.007]
opus_24kbps +0.003 [-0.004, +0.012] -0.001 [-0.010, +0.006] +0.003 [+0.000, +0.007] +0.006 [-0.003, +0.019]
opus_6kbps +0.008 [-0.005, +0.021] +0.015 [-0.001, +0.032] -0.035 [-0.095, +0.022] +0.013 [-0.005, +0.032]
wavtokenizer_large_unified_480bps +0.116 [+0.068, +0.167] +0.124 [+0.083, +0.169] +0.439 [+0.369, +0.511] +0.277 [+0.207, +0.355]

一个尤其重要的反例是 EnCodec 6 kbps:English Whisper ΔER mean 约 +0.188,而 English SenseVoice 约 -0.003。只选其中一个评委,会得到完全不同的内容结论。WavTokenizer 在两个语言、两个评委上都显示正退化,尤其 Mandarin;但这仍不替代关键实体人工/规则核验。

对原创 baseline 的直接影响

下一阶段不应复制一个单一冠军,而应保留五种互补角色:

  • Codec 2:1.2–3.2 kbps 参数通信下界与微型 decoder 纪律;
  • Opus:成熟 packet、强实时和高内容/质量通信锚点;
  • EnCodec:同一 checkpoint 合法 RVQ depth sweep,适合检验连续 rate-control;
  • DAC:高保真生成式 neural teacher,提醒量化训练和强 decoder 的上限;
  • WavTokenizer:极低帧率单码本 teacher,迫使我们分清 token rate、wire bytes、内容和巨大 prior。

这是 role recommendation,不是预注册 winner verdict。Batch B/C 新模型进入后要按同一 D5 字段重算;原创 agent baseline 的第一版 reward 至少拆成 wire、内容、弱语言可懂度、speaker、state、speed 六轴,并让每个代理指标只裁决对应维度。

明确没有证明什么

本审计没有证明人类自然度/身份/表达偏好,没有证明 causal streaming、算法延迟、移动端速度、噪声/丢包鲁棒性、关键实体安全或训练成本,也没有把不同论文原生数据混入 D5。

所有前沿均由未取整 mean 计算;页面显示的 rounded 数字只用于阅读。mean dominance 不是统计显著性。完整 CI、derived fields、frontier memberships 与 15 条 dominance edge 分别保存在 points.jsonlresults.jsondominance_edges.jsonl