EvoSpeech · 当前进度与阶段封账¶
最后更新:2026-07-22
当前状态:EvoCodec-v0 A0 全部通过;下一 Gate 是 A1 32-item tiny-overfit 协议冻结
Baseline 阶段完成的历史结论保持不变;本页从现在起继续记录项目自有 baseline 的逐 Gate 进度。
Baseline 机器快照:research/status/baseline_phase_completion_2026-07-22.json。A0 本地结果:
research/evocodec_v0/a0_local_validation.json。
一、已经完成什么¶
冻结的八个代表家族全部达到 D0–D5 benchmark_complete,且文档状态为 audited:
| 角色 | 家族 | 已完成证据 |
|---|---|---|
| 成熟实时通信锚点 | Opus | 标准/源码深读、RFC conformance、三档共同 benchmark |
| 传统微型 wire 下界 | Codec 2 | 算法/代码本体、跨 build 审计、三档共同 benchmark |
| 可控 RVQ 老师 | EnCodec | 论文原生审计、13 个合法点、公共压力轨 |
| 高保真神经老师 | DAC | 论文/代码/权重分层、论文原生审计、6-kbps 共同点 |
| 极低 representation 老师 | WavTokenizer | 单码本/低帧率深读、300 条 paper surface、共同点 |
| 内容保持老师 | MOSS Audio Tokenizer | 2,620 × 6 D4、四点中英 D5、现代 ASR/speaker 评委 |
| 语义—声学分解老师 | Quark HCodec | 两个 endpoint D4、四点中英 D5、真实 adaptive payload |
| 约 1 kbps 平衡老师 | BigCodec | 2,620 条 D4、1.04-kbps 中英 D5、独立 artifact 审计 |
完整整合结果为:
- 8 个家族、22 个 operating points;
- 1,320 个共同 benchmark item rows;
- 6 个预声明 Pareto 视图;
- 172 条可确定性复算的 dominance edges;
- 现代内容评委统一为 Qwen/Fun,英文再加 Parakeet;旧 Whisper/SenseVoice 不再新增运行;
- 全 22 点 Pareto和 Agent Baseline Gate均已发布。
RunPod 已回到安全空闲终态:0 Pods + 1 个 100-GB Network Volume。最后一次核对时卷为
imdh4l9gud / EU-RO-1,账户仅支付 $0.01/h 存储费;下一次 24-GB dry-run 能在同机房选择
RTX 4090。生产站八个模型页、矩阵、Gate、路线与 RunPod 手册均已逐页验证 HTTP 200。
二、没有被完成或证明的内容¶
这次封账不能被扩大解释为:
- 40 个 census 条目全部完成;真正完成的是事前选定、机制互补的 8 个代表 baseline;
- 每条论文 claim 都复现成功;D4 的意义是审计完整,单条仍可能是
failed/approximate/blocked; - 所有模型都完成 D6–D7;这两道 Gate 只对前沿/关键教师/原创候选选择性执行;
- EnCodec D6 已全部通过:公共自动和鲁棒性/资源轨完成,但 32 题人工轮尚未执行,所以仍是
in_progress,且不阻塞 D0–D5 完成; EvoCodec-v0已经有质量结果或算法原创性。现在只证明我们有足够基线和协议,可以开始实现它。
三、接下来执行什么¶
A0 · Contract 与 Skeleton¶
该阶段已经完成。16-kHz causal encoder/RVQ/decoder 骨架、2/4/8 × 1024 codebook、EVOC0
10-bit packed bitstream、独立 encoder/decoder 进程和四账计数已提交为 4a07449。Mac 只运行
parser、hash、JSON、源码与 source-blind contract 测试,没有导入或执行神经图。
结果:passed_local_only。 58/58 tests 通过;随机 codes 往返 bit-exact;坏 magic、截断、非法 q-depth、非整数 code、长度错误 fail closed;decoder 看不到源音频、文本、语言或 speaker;静态 decoder endpoint FP32 state 为 71.91 MiB,低于 100 MiB。详见 EvoCodec-v0。
A0 CUDA smoke¶
A0 静态测试通过并提交后,已冻结 RunPod capsule,并在同一台 24-GB RTX 4090 上完成 one-batch
forward/backward/optimizer/resume 与三档 fresh-process bitstream。前三次 pre-result 失败均保留;
第四次 clean capsule 656137b 正式通过。
结果:passed。 loss/gradient finite;实际/静态参数相等;checkpoint tensor 精确恢复;q=2/4/8
真实 EVOC0 与独立 decoder 通过;峰值 CUDA 666.52 MiB。返回 tar 为 328,622,789 B,远端/本地
SHA 一致,37 个 manifest 文件重哈希通过;最终 0 Pods + 1 Volume。账户余额差额约 $0.2353。
A1 · 32 句 tiny overfit¶
冻结与 D5 测试集不重叠的 32 句公共训练 capsule,跑固定 seed、固定步数和三档真实 bitstream。
通过条件:结束窗口 loss 相对初始窗口至少下降 30%;无 NaN/Inf、无 silent omission;三档均 可独立解码;checkpoint resume 在预声明容差内一致。A1 只证明训练管线有信号,不证明音质。
A2 · 第一个公共 Baseline¶
冻结 speaker-disjoint 的 10–50 小时首轮训练集、对象存储 manifest、预算与 checkpoint 选择规则; 训练后在 1/2/4 kbps 各跑同一 60 句 D5,并与六类角色锚点比较。
通过条件:每个数字可回到 checkpoint、真实 bitstream、数据 manifest 和 evaluator;失败仍留在 分母;不要求 v0 打败 SOTA。先跑 30–60 分钟成本/显存 profile,再决定 24 GB 还是 48 GB。
A3 · 搜索空间信号¶
在 Agent 出场前,等预算比较 no-search、random、Bayesian/TPE 和人工消融,每类至少三次独立 search seed,报告分布与总 compute,禁止只报 best-of-N。
通过条件:证明受限搜索空间存在跨 seed 可重复信号;若没有,就先收缩或重设计搜索空间。
A4 · Bounded Agent Evolution¶
Agent 只能修改 schema 允许的模型/训练参数;不能修改 evaluator、hidden set、bitstream parser、 预算或失败分母。每次 proposal 保存 parent、hypothesis、diff、seed、compute、成功和失败;晋升候选 必须独立复跑。
通过条件:至少完成一次 proposal → train → evaluate → archive → independent rerun 的闭环, 并与 random/TPE/human 的分布比较,而不是只比较各自最好的一次。
四、眼前的第一步¶
下一轮直接冻结 A1 32-item tiny-overfit capsule:先选与 D5 测试零重叠的公共训练样本,再固定 step 数、optimizer、loss、三档输出、resume 容差、成本与失败规则;协议提交前不看训练曲线。协议和 数据 hash 在 Mac 完成后才会重新申请短时 GPU。此时不需要用户录音、扩容热卷或手工 SSH;只有进入 A2 数据训练前,才需要最终决定对象存储供应商和首轮训练预算。