EvoSpeech · 当前 30 天路线:完成第一份模型研究档案¶
时间:2026-07-20 → 2026-08-18
本月不以模型数量或 AI 候选数为目标。唯一科学目标是:把 EnCodec 从“本地可运行”推进为第一 个经过论文、代码、官方复现、共同 benchmark、项目 stress 和文档审计的完整研究对象,并在此 基础上开始 WavTokenizer 的第二条深读链。
旧 first-loop 路线保存在
archive/ROADMAP_30D_FIRST_LOOP_2026-07-20.md,
其中 Week 3 seed、Week 4 AI smoke 的日期承诺已经失效。
月度成果定义¶
月底应交付:
- EnCodec 完整 model bundle 与可独立阅读的深度页面;
- 论文 headline claim 的本地复现矩阵和诚实 verdict;
- EnCodec / Opus / Codec 2 / 相关神经对照的冻结共同 benchmark;
- 中英、多语言、关键内容、带宽和资源 stress;
- 至少一张经过验证的机制卡与可迁移假设;
- WavTokenizer D0/D1 的身份和论文研究起点;
- Cloudflare 站点、registry 和实验产物相互可追溯。
- EnCodec 关键点能从 clean Linux CPU container 重放;云端 CUDA 训练合同已冻结但不提前启动 原创大训练。
evaluation_complete 不是月底 KPI 的装饰。如果 D0–D7 任一项真实阻塞,EnCodec 保持阻塞前的
合法状态,月底交付失败分类和解阻计划,不能为完成数字降低门槛。
Week 1 · 7/20–7/26:EnCodec D0–D2¶
D0 · Identity & provenance¶
- [x] 固定论文、代码、checkpoint、许可证和全部版本身份;
- [x] 区分官方模型、包转换和本地 adapter;
- [x] 完成 encoder/quantizer/decoder 参数、RVQ buffer 与未包含辅助模型分账;
- [x] 核实采样率、帧率、码本、带宽和已观测 side information。
D1 · Paper deep read¶
- [x] 写清问题、前序工作、核心贡献、数学目标、训练和推理;
- [x] 逐项整理数据、主表、消融、限制和论文没有证明的内容;
- [x] 每个核心主张定位到 primary source。
D2 · Core code deep read¶
- [x] 建立推理和训练核心调用图;
- [x] 保存中间 tensor/token shape;
- [x] 完成 paper-to-code map;
- [x] 核实本地 payload 与官方表示/文件的差异。
W1 Gate:D0–D2 全部通过;页面已有论文、代码和结构图草稿。若身份或代码对不上,不进入 正式论文评测。
Week 2 · 7/27–8/2:EnCodec D3–D4¶
D3 · Protocol freeze¶
- [x] 固定论文 operating points、数据集、split、预处理和 metrics;
- [x] 预声明差值、CI、等价容差、成本和失败规则;
- [x] 将私有/不可得部分在运行前标
blocked/approximate。
D4 · Paper-native reproduction¶
- [x] 对公开可复现主张执行 frozen-asset 与 one-pair raw/entropy smoke;
- [ ] 构建固定 ViSQOL v3.3.3 metric image并执行正式运行;
- [ ] 保存逐样本结果、作者值、本地值、差值和置信区间;
- [ ] 解释所有超出容差的结果;
- [ ] 生成 EnCodec 页面 v0 和 D4 verdict。
W2 Gate:D0–D3 必须通过;D4 每条主张都有合法 verdict。不能获得公开资产也可以形成
blocked 证据,但不能自动升级为 paper_reproduced。
Week 3 · 8/3–8/9:EnCodec D5–D6¶
D5 · Frozen common benchmark¶
- [ ] 冻结 EnCodec、Opus、Codec 2 和一个最相关神经对照的共同 operating points;
- [ ] 英文和中文使用同一版本数据、预处理、真实 payload 和指标;
- [ ] 分别报告内容、身份、表达、质量、码率、模型先验、计算与延迟;
- [ ] 保存逐语言/说话人或逐样本结果和置信区间;
- [ ] 论文原生结果与共同 benchmark 分表,不混成一个排行榜。
D6 · Project-specific stress¶
- [ ] 中英关键实体、数字、否定、金额、日期和专名;
- [ ] 德/法/西/日/韩逐语言 probe;
- [ ] 合法带宽曲线和内容/身份/表达的崩溃顺序;
- [ ] 边界长度、静音、长音频、削波、确定性、CPU/MPS 和资源检查;
- [ ] 仅对前沿近邻安排对应维度的人工盲测。
W3 Gate:共同表能由一条冻结命令重建;至少识别一个真实失败边界,不能只展示平均分和 成功样本。
Week 4 · 8/10–8/16:EnCodec D7 与 WavTokenizer 起点¶
D7 · Synthesis, audit & reproducibility¶
- [ ] 将论文、代码、官方复现、共同横评和 stress 串成完整论证;
- [ ] 所有表格由结构化结果生成;
- [ ] 提炼哪些机制真正强、依赖什么、什么先坏、什么能迁移到小 decoder;
- [ ] fresh process 重跑关键点并核对 hashes;
- [ ] 从
linux_arm64_cpu_evalclean container 重放至少一个关键点,并审计 native/container 差异; - [ ] registry、tests、links、strict build 和 Cloudflare 公网检查全部通过;
- [ ] 只有 D0–D7 全过才将 EnCodec 标为
evaluation_complete。
WavTokenizer D0/D1(条件启动)¶
只有 EnCodec D7 已形成正式 verdict 后:
- [ ] 分开 small 40、large unified 40、large speech 75 三个模型点;
- [ ] 固定论文、代码、checkpoint、训练覆盖与参数身份;
- [ ] 开始单码本、低帧率、训练目标和 decoder 的论文深读;
- [ ] 写明它与 EnCodec 多级 RVQ 的第一个可证伪机制差异。
Day 29–30 · 8/17–8/18:月度审计¶
- [ ] 从空环境/最小环境抽查关键复现命令;
- [ ] 检查网页数字是否全部来自当前 registry/result;
- [ ] 检查 paper claim、local measurement、inference、hypothesis 标签;
- [ ] 更新 40 项 census,但不让新论文打断当前模型;
- [ ] 写月度 verdict:完成、近似、失败、阻塞分别是什么;
- [ ] 根据证据制定下一 30 天,而不是复用旧日期承诺。
月底 Gate¶
理想通过¶
- EnCodec D0–D7 全部通过并标
evaluation_complete; - 第一份深度模型页面可独立解释算法、代码、官方主张、本地误差和项目启发;
- WavTokenizer D0/D1 已开始但没有干扰 EnCodec 主线。
科学上仍合格的阻塞结论¶
- EnCodec 的公开资产不足以严格复现某些 headline claims;
- 阻塞由 primary source、缺失资产和已执行替代检查证明;
- 其余可复现 Gate 完整,页面清楚区分
blocked与failed; - 下一步能明确说出需要作者资产、人工听测、算力还是代码修复。
不通过¶
- 只增加 smoke/G4 数字,没有论文复现;
- 看到本地结果后修改 split、metric 或容差;
- 用统一 benchmark 冒充论文原生复现;
- 用一个总体质量分掩盖内容或身份失败;
- 页面内容靠手抄,无法回到运行产物。
本月明确不做¶
- 不实现原创 seed;
- 不启动随机、TPE 或 AI evolution;
- 不批量下载剩余模型制造进度;
- 不同时让两个模型处于 D0–D4;
- 不把论文之间不同来源 MOS 画成总榜;
- 不因月底日期把阻塞模型强行标绿。
- 不启动通用云平台或 Kubernetes;CUDA image 与
C0–C3只在首个真实训练任务前实现。
原创 Baseline 与 AI 进化只有在至少 6 个代表家族达到严格 evaluation_complete 后重新排期。