Agent Baseline Gate · 从 SOTA 地图到 EvoCodec-v0¶
状态:Gate passed,下一步可以开始实现原创 seed。
这里的 “passed” 不是说我们已经发明了新算法,而是说:八个代表家族、22 个 operating points 已经完成同一公共评测;我们现在足以选择一个可证伪、可训练、可被 Agent 修改的起点,不需要再用“多测一个模型”无限推迟原创实验。
一、22 点真正告诉了我们什么¶
没有一个模型在所有维度获胜,frontier 次数也不是总分。现有证据形成八个互补老师:
| 角色 | 代表 | 最重要的证据 | 应该学什么 | 不能照搬什么 |
|---|---|---|---|---|
| 传统极小 wire | Codec 2 1200 | wire 1.733 kbps | 参数通信、真实逐帧计账、微型端点 | STOI 只有 0.630,不能把参数语音指标当通用质量 |
| 成熟实时上界 | Opus 24k | STOI 0.991、WavLM 0.997 | causality、packet、delay、鲁棒工程 | 25.884-kbps wire 不是低码率答案 |
| 极低 representation | WavTokenizer 480 | representation 481 bps | 低帧率、单码本的第一性原理压力 | wire 1.806 kbps,最坏 ΔER 30.7%,不能只看 token rate |
| 约 1 kbps 平衡老师 | BigCodec | wire 2.125 kbps、ViSQOL 4.377 | 强 bottleneck + 足够 decoder capacity | non-streaming、316-MiB decoder 不能成为学生目标 |
| 内容保留老师 | MOSS q16 | worst ΔER 0.39%、WavLM 0.994 | scaling/semantic alignment 的上限 | 3.31-GiB decoder 是 teacher prior,不是通信端点 |
| 语义/声学分解老师 | Quark HCodec 1.0 | 2 kbps、ViSQOL 4.501 | semantic + acoustic code 的互补性 | non-causal、555-MiB decoder 和大 semantic encoder |
| 高保真老师 | DAC 6k | 全表最高 ViSQOL 4.549 | RVQ、量化训练、强 decoder/loss | 不能因为它不是 low-bit 就忽视,也不能把 6 kbps 当最终目标 |
| 可控码率老师 | EnCodec family | 同 checkpoint 的五档 RVQ depth | 可变 rate surface 最适合做受控搜索 | 1.5 kbps 中文 ΔER 10.8–13.0%,低码率不自动等于内容充分 |
这正好验证了我们的 SOTA-first mindset:真正有用的创新来源不应被 “low-bit” 标签圈住。DAC、Opus、MOSS 的强项都能对低码率学生形成降维压力;WavTokenizer 则反向证明,极小 token rate 若没有内容和 wire 约束,也可能只是漂亮 headline。
二、为什么不直接拿某个 SOTA 继续改¶
我们需要的第一个 seed 不是当前最好听的模型,而是一个能清楚知道每次修改改了什么的实验对象。
- Codec 2 很小,但它不是适合梯度训练和神经架构搜索的基质;
- BigCodec、MOSS、Quark 很强,但 non-causal 或 state 太大,训练/修改成本会淹没研究信号;
- 直接 fork EnCodec 容易把项目变成调别人框架的配置,而不是建立我们自己的 bitstream、状态和反作弊边界;
- 从零造一个庞大通用框架同样不对。我们只实现当前 speech codec 所需的薄、可审计 seed。
因此选择:EvoCodec-v0,一个项目自有的小型 causal RVQ codec。 它使用已知机制,所以现在不声称算法创新;未来只有经过对照、复现和反例审计的新改动,才可能成为原创贡献。
三、EvoCodec-v0 的冻结形状¶
16-kHz mono PCM
↓ causal residual conv encoder (20-ms hop / 50 fps)
continuous latent
↓ RVQ: 2 / 4 / 8 × 1024-entry codebooks
1 / 2 / 4 kbps representation
↓ packed EVOC0 real bitstream
small causal residual conv decoder
↓ reconstructed PCM
硬约束:
- 16 kHz、单声道、causal、streaming-safe,不能用未来帧或整句全局统计;
- hop 320 samples,即 20 ms / 50 fps;
- 2/4/8 个 10-bit RVQ codebook,合法表示率恰为 1/2/4 kbps;
- decoder FP32 learned state ≤ 100 MiB,设计目标约 20M parameters;
EVOC0payload 必须是真实 packed bytes;独立 evaluator 自己计字节;- decoder 只见 bitstream + 固定模型 identity,永远不见原音路径、文本、语言或 speaker;
- v0 先用 waveform L1、multi-resolution STFT、log-mel、RVQ commitment/codebook loss;semantic teacher 和 adversarial loss 只能作为后来预注册 ablation,不能偷偷藏进 baseline。
Agent 初期只允许修改 channel width、residual depth、dilation、latent width、codebook 数、loss weight、optimizer/schedule、EMA/dead-code policy。CandidateContract、bitstream parser、数据 split、hidden set、评委、预算和失败分母不可修改。
四、接下来五个可验收 Gate¶
A0 · Contract 与代码骨架¶
实现 model/config/bitstream/runner,不追质量。验收:随机 codes pack→unpack bit-exact;截断/坏 header fail closed;source-blind decoder 进程测试;state/payload 参数账有限;CPU 只做 shape/bitstream smoke,CUDA 做 one-batch smoke。
A1 · 32 句 tiny overfit¶
在一台 RunPod GPU 固定 seed 训练。验收:记录窗口 loss 至少下降 30%;无 NaN/Inf;三档都能 decode;checkpoint resume 的下一步状态在声明容差内一致。这个 Gate 只证明训练管线有信号,不证明好听。
A2 · 第一个公共 baseline¶
首次训练前冻结 public train/validation split、预算和失败规则;在 1/2/4 kbps 跑 60 句 D5。完整报告 wire、ViSQOL/STOI、Qwen/Fun/Parakeet、WavLM/Resemblyzer、state 与同 profile speed。不要求 v0 打败 SOTA;一个清楚失败的 baseline 也比无法归因的强模型更有科研价值。
A3 · 证明 search space 有信号¶
等预算比较 no-search、random、Bayesian/TPE、人工消融;至少三次独立 search seed,报告分布与总 compute,禁止只报 best-of-N。hidden holdout 继续 sealed。
A4 · Agent evolution¶
Agent 提交受限 patch → runner 训练/评估 → 成功与失败全部进 archive → Pareto 晋升候选独立复跑。只有少数预先声明的前沿点进入昂贵 D6 人工四维终审。
五、环境和存储怎么安排¶
- Mac:代码、bitstream/manifest/hash、JSON/text scoring、docs、人工听测;不跑 codec/ASR/speaker 神经推理;
- RunPod 24GB:A0 CUDA smoke、A1 tiny overfit、A2 profile;实测需要时才上 48GB;
- 当前 100GB Network Volume:只放热 runtime、活跃 checkpoint、manifest 与当前结果;
- 300–500GB 训练语料和长期 checkpoint:放版本化对象存储,Pod 启动前按 manifest stage 热子集,不把常年挂载卷盲目扩到 500GB;
- GPU 启动后不
pip install,结果验哈希后删除精确 Pod。
下一步¶
立即实现 A0:EvoCodec-v0 contract + skeleton。用户此时不需要录音,也不需要先租更大的 GPU;只有 A0 的 Mac-safe 测试通过后,才开一台 24GB RunPod 做一次 CUDA one-batch smoke。
机器可读裁决见 research/comparisons/full_baseline_pareto_v1/agent_baseline_gate.json,完整 22 点矩阵见 全基线 Pareto。