跳转至

EvoSpeech · 当前进度与阶段封账

最后更新:2026-07-22
当前状态:EvoCodec-v0 A0 全部通过;下一 Gate 是 A1 32-item tiny-overfit 协议冻结

Baseline 阶段完成的历史结论保持不变;本页从现在起继续记录项目自有 baseline 的逐 Gate 进度。

Baseline 机器快照:research/status/baseline_phase_completion_2026-07-22.json。A0 本地结果: research/evocodec_v0/a0_local_validation.json

一、已经完成什么

冻结的八个代表家族全部达到 D0–D5 benchmark_complete,且文档状态为 audited

角色 家族 已完成证据
成熟实时通信锚点 Opus 标准/源码深读、RFC conformance、三档共同 benchmark
传统微型 wire 下界 Codec 2 算法/代码本体、跨 build 审计、三档共同 benchmark
可控 RVQ 老师 EnCodec 论文原生审计、13 个合法点、公共压力轨
高保真神经老师 DAC 论文/代码/权重分层、论文原生审计、6-kbps 共同点
极低 representation 老师 WavTokenizer 单码本/低帧率深读、300 条 paper surface、共同点
内容保持老师 MOSS Audio Tokenizer 2,620 × 6 D4、四点中英 D5、现代 ASR/speaker 评委
语义—声学分解老师 Quark HCodec 两个 endpoint D4、四点中英 D5、真实 adaptive payload
约 1 kbps 平衡老师 BigCodec 2,620 条 D4、1.04-kbps 中英 D5、独立 artifact 审计

完整整合结果为:

  • 8 个家族、22 个 operating points;
  • 1,320 个共同 benchmark item rows;
  • 6 个预声明 Pareto 视图;
  • 172 条可确定性复算的 dominance edges;
  • 现代内容评委统一为 Qwen/Fun,英文再加 Parakeet;旧 Whisper/SenseVoice 不再新增运行;
  • 全 22 点 ParetoAgent Baseline Gate均已发布。

RunPod 已回到安全空闲终态:0 Pods + 1 个 100-GB Network Volume。最后一次核对时卷为 imdh4l9gud / EU-RO-1,账户仅支付 $0.01/h 存储费;下一次 24-GB dry-run 能在同机房选择 RTX 4090。生产站八个模型页、矩阵、Gate、路线与 RunPod 手册均已逐页验证 HTTP 200。

二、没有被完成或证明的内容

这次封账不能被扩大解释为:

  • 40 个 census 条目全部完成;真正完成的是事前选定、机制互补的 8 个代表 baseline;
  • 每条论文 claim 都复现成功;D4 的意义是审计完整,单条仍可能是 failed/approximate/blocked
  • 所有模型都完成 D6–D7;这两道 Gate 只对前沿/关键教师/原创候选选择性执行;
  • EnCodec D6 已全部通过:公共自动和鲁棒性/资源轨完成,但 32 题人工轮尚未执行,所以仍是 in_progress,且不阻塞 D0–D5 完成;
  • EvoCodec-v0 已经有质量结果或算法原创性。现在只证明我们有足够基线和协议,可以开始实现它。

三、接下来执行什么

A0 · Contract 与 Skeleton

该阶段已经完成。16-kHz causal encoder/RVQ/decoder 骨架、2/4/8 × 1024 codebook、EVOC0 10-bit packed bitstream、独立 encoder/decoder 进程和四账计数已提交为 4a07449。Mac 只运行 parser、hash、JSON、源码与 source-blind contract 测试,没有导入或执行神经图。

结果:passed_local_only。 58/58 tests 通过;随机 codes 往返 bit-exact;坏 magic、截断、非法 q-depth、非整数 code、长度错误 fail closed;decoder 看不到源音频、文本、语言或 speaker;静态 decoder endpoint FP32 state 为 71.91 MiB,低于 100 MiB。详见 EvoCodec-v0

A0 CUDA smoke

A0 静态测试通过并提交后,已冻结 RunPod capsule,并在同一台 24-GB RTX 4090 上完成 one-batch forward/backward/optimizer/resume 与三档 fresh-process bitstream。前三次 pre-result 失败均保留; 第四次 clean capsule 656137b 正式通过。

结果:passed。 loss/gradient finite;实际/静态参数相等;checkpoint tensor 精确恢复;q=2/4/8 真实 EVOC0 与独立 decoder 通过;峰值 CUDA 666.52 MiB。返回 tar 为 328,622,789 B,远端/本地 SHA 一致,37 个 manifest 文件重哈希通过;最终 0 Pods + 1 Volume。账户余额差额约 $0.2353

A1 · 32 句 tiny overfit

冻结与 D5 测试集不重叠的 32 句公共训练 capsule,跑固定 seed、固定步数和三档真实 bitstream。

通过条件:结束窗口 loss 相对初始窗口至少下降 30%;无 NaN/Inf、无 silent omission;三档均 可独立解码;checkpoint resume 在预声明容差内一致。A1 只证明训练管线有信号,不证明音质。

A2 · 第一个公共 Baseline

冻结 speaker-disjoint 的 10–50 小时首轮训练集、对象存储 manifest、预算与 checkpoint 选择规则; 训练后在 1/2/4 kbps 各跑同一 60 句 D5,并与六类角色锚点比较。

通过条件:每个数字可回到 checkpoint、真实 bitstream、数据 manifest 和 evaluator;失败仍留在 分母;不要求 v0 打败 SOTA。先跑 30–60 分钟成本/显存 profile,再决定 24 GB 还是 48 GB。

A3 · 搜索空间信号

在 Agent 出场前,等预算比较 no-search、random、Bayesian/TPE 和人工消融,每类至少三次独立 search seed,报告分布与总 compute,禁止只报 best-of-N。

通过条件:证明受限搜索空间存在跨 seed 可重复信号;若没有,就先收缩或重设计搜索空间。

A4 · Bounded Agent Evolution

Agent 只能修改 schema 允许的模型/训练参数;不能修改 evaluator、hidden set、bitstream parser、 预算或失败分母。每次 proposal 保存 parent、hypothesis、diff、seed、compute、成功和失败;晋升候选 必须独立复跑。

通过条件:至少完成一次 proposal → train → evaluate → archive → independent rerun 的闭环, 并与 random/TPE/human 的分布比较,而不是只比较各自最好的一次。

四、眼前的第一步

下一轮直接冻结 A1 32-item tiny-overfit capsule:先选与 D5 测试零重叠的公共训练样本,再固定 step 数、optimizer、loss、三档输出、resume 容差、成本与失败规则;协议提交前不看训练曲线。协议和 数据 hash 在 Mac 完成后才会重新申请短时 GPU。此时不需要用户录音、扩容热卷或手工 SSH;只有进入 A2 数据训练前,才需要最终决定对象存储供应商和首轮训练预算。