跳转至

Agent Baseline Gate · 从 SOTA 地图到 EvoCodec-v0

状态:Gate passed,下一步可以开始实现原创 seed

这里的 “passed” 不是说我们已经发明了新算法,而是说:八个代表家族、22 个 operating points 已经完成同一公共评测;我们现在足以选择一个可证伪、可训练、可被 Agent 修改的起点,不需要再用“多测一个模型”无限推迟原创实验。

一、22 点真正告诉了我们什么

没有一个模型在所有维度获胜,frontier 次数也不是总分。现有证据形成八个互补老师:

角色 代表 最重要的证据 应该学什么 不能照搬什么
传统极小 wire Codec 2 1200 wire 1.733 kbps 参数通信、真实逐帧计账、微型端点 STOI 只有 0.630,不能把参数语音指标当通用质量
成熟实时上界 Opus 24k STOI 0.991、WavLM 0.997 causality、packet、delay、鲁棒工程 25.884-kbps wire 不是低码率答案
极低 representation WavTokenizer 480 representation 481 bps 低帧率、单码本的第一性原理压力 wire 1.806 kbps,最坏 ΔER 30.7%,不能只看 token rate
约 1 kbps 平衡老师 BigCodec wire 2.125 kbps、ViSQOL 4.377 强 bottleneck + 足够 decoder capacity non-streaming、316-MiB decoder 不能成为学生目标
内容保留老师 MOSS q16 worst ΔER 0.39%、WavLM 0.994 scaling/semantic alignment 的上限 3.31-GiB decoder 是 teacher prior,不是通信端点
语义/声学分解老师 Quark HCodec 1.0 2 kbps、ViSQOL 4.501 semantic + acoustic code 的互补性 non-causal、555-MiB decoder 和大 semantic encoder
高保真老师 DAC 6k 全表最高 ViSQOL 4.549 RVQ、量化训练、强 decoder/loss 不能因为它不是 low-bit 就忽视,也不能把 6 kbps 当最终目标
可控码率老师 EnCodec family 同 checkpoint 的五档 RVQ depth 可变 rate surface 最适合做受控搜索 1.5 kbps 中文 ΔER 10.8–13.0%,低码率不自动等于内容充分

这正好验证了我们的 SOTA-first mindset:真正有用的创新来源不应被 “low-bit” 标签圈住。DAC、Opus、MOSS 的强项都能对低码率学生形成降维压力;WavTokenizer 则反向证明,极小 token rate 若没有内容和 wire 约束,也可能只是漂亮 headline。

二、为什么不直接拿某个 SOTA 继续改

我们需要的第一个 seed 不是当前最好听的模型,而是一个能清楚知道每次修改改了什么的实验对象。

  • Codec 2 很小,但它不是适合梯度训练和神经架构搜索的基质;
  • BigCodec、MOSS、Quark 很强,但 non-causal 或 state 太大,训练/修改成本会淹没研究信号;
  • 直接 fork EnCodec 容易把项目变成调别人框架的配置,而不是建立我们自己的 bitstream、状态和反作弊边界;
  • 从零造一个庞大通用框架同样不对。我们只实现当前 speech codec 所需的薄、可审计 seed。

因此选择:EvoCodec-v0,一个项目自有的小型 causal RVQ codec。 它使用已知机制,所以现在不声称算法创新;未来只有经过对照、复现和反例审计的新改动,才可能成为原创贡献。

三、EvoCodec-v0 的冻结形状

16-kHz mono PCM
    ↓ causal residual conv encoder (20-ms hop / 50 fps)
continuous latent
    ↓ RVQ: 2 / 4 / 8 × 1024-entry codebooks
1 / 2 / 4 kbps representation
    ↓ packed EVOC0 real bitstream
small causal residual conv decoder
    ↓ reconstructed PCM

硬约束:

  • 16 kHz、单声道、causal、streaming-safe,不能用未来帧或整句全局统计;
  • hop 320 samples,即 20 ms / 50 fps;
  • 2/4/8 个 10-bit RVQ codebook,合法表示率恰为 1/2/4 kbps;
  • decoder FP32 learned state ≤ 100 MiB,设计目标约 20M parameters;
  • EVOC0 payload 必须是真实 packed bytes;独立 evaluator 自己计字节;
  • decoder 只见 bitstream + 固定模型 identity,永远不见原音路径、文本、语言或 speaker;
  • v0 先用 waveform L1、multi-resolution STFT、log-mel、RVQ commitment/codebook loss;semantic teacher 和 adversarial loss 只能作为后来预注册 ablation,不能偷偷藏进 baseline。

Agent 初期只允许修改 channel width、residual depth、dilation、latent width、codebook 数、loss weight、optimizer/schedule、EMA/dead-code policy。CandidateContract、bitstream parser、数据 split、hidden set、评委、预算和失败分母不可修改。

四、接下来五个可验收 Gate

A0 · Contract 与代码骨架

实现 model/config/bitstream/runner,不追质量。验收:随机 codes pack→unpack bit-exact;截断/坏 header fail closed;source-blind decoder 进程测试;state/payload 参数账有限;CPU 只做 shape/bitstream smoke,CUDA 做 one-batch smoke。

A1 · 32 句 tiny overfit

在一台 RunPod GPU 固定 seed 训练。验收:记录窗口 loss 至少下降 30%;无 NaN/Inf;三档都能 decode;checkpoint resume 的下一步状态在声明容差内一致。这个 Gate 只证明训练管线有信号,不证明好听。

A2 · 第一个公共 baseline

首次训练前冻结 public train/validation split、预算和失败规则;在 1/2/4 kbps 跑 60 句 D5。完整报告 wire、ViSQOL/STOI、Qwen/Fun/Parakeet、WavLM/Resemblyzer、state 与同 profile speed。不要求 v0 打败 SOTA;一个清楚失败的 baseline 也比无法归因的强模型更有科研价值。

A3 · 证明 search space 有信号

等预算比较 no-search、random、Bayesian/TPE、人工消融;至少三次独立 search seed,报告分布与总 compute,禁止只报 best-of-N。hidden holdout 继续 sealed。

A4 · Agent evolution

Agent 提交受限 patch → runner 训练/评估 → 成功与失败全部进 archive → Pareto 晋升候选独立复跑。只有少数预先声明的前沿点进入昂贵 D6 人工四维终审。

五、环境和存储怎么安排

  • Mac:代码、bitstream/manifest/hash、JSON/text scoring、docs、人工听测;不跑 codec/ASR/speaker 神经推理;
  • RunPod 24GB:A0 CUDA smoke、A1 tiny overfit、A2 profile;实测需要时才上 48GB;
  • 当前 100GB Network Volume:只放热 runtime、活跃 checkpoint、manifest 与当前结果;
  • 300–500GB 训练语料和长期 checkpoint:放版本化对象存储,Pod 启动前按 manifest stage 热子集,不把常年挂载卷盲目扩到 500GB;
  • GPU 启动后不 pip install,结果验哈希后删除精确 Pod。

下一步

立即实现 A0:EvoCodec-v0 contract + skeleton。用户此时不需要录音,也不需要先租更大的 GPU;只有 A0 的 Mac-safe 测试通过后,才开一台 24GB RunPod 做一次 CUDA one-batch smoke。

机器可读裁决见 research/comparisons/full_baseline_pareto_v1/agent_baseline_gate.json,完整 22 点矩阵见 全基线 Pareto