跳转至

EvoSpeech · 当前 14 天路线:EnCodec 论文—代码—评测闭环

  • 时间:2026-07-20 → 2026-08-02
  • 当前模型:EnCodec 24 kHz
  • 当前 Gate:D4 · Paper-native reproduction(D0–D3 已于 2026-07-20 通过)

本路线执行 EVALUATION_DOD.md,不以新增模型数量、下载 GB、smoke 句数 或历史 G4 作为完成度。旧 Census/G1–G4 路线完整保存在 archive/ROADMAP_14D_CENSUS_2026-07-20.md

14 天唯一目标

完成 EnCodec 的 D0–D3,并对 D4 论文原生复现形成一份有证据的正式 verdict:passedapproximatefailedblocked。目标不是保证数字一定通过,而是保证结论可追溯、协议没有 事后迁移,读者能从首版页面真正理解论文与代码。

14 天内不要求 EnCodec 已经 evaluation_complete;D5–D7 在 30 天路线中完成。

必须交付的文件

research/models/encodec/record.json
research/models/encodec/paper.md
research/models/encodec/code.md
research/models/encodec/architecture.mmd
research/models/encodec/insights.md
research/models/encodec/evaluations/paper-native-*.json
docs/models/encodec.md
configs/runtime_profiles_v1.json
docs/ENVIRONMENT_AND_TRAINING.md

模型页面必须区分 paper_claimlocal_measurementinferencehypothesis;所有数值来自 结构化记录或实验产物,不能只手抄进 Markdown。

Day 1 · 7/20:R0 封口与任务切换

  • [x] 冻结 D0–D7 Definition of Done;
  • [x] 建立 research registry、schema、模型页面生成入口和严格构建;
  • [x] 历史 G4 重命名为 Transport Qualified;
  • [x] Cloudflare Pages production 发布并验证;
  • [x] 旧路线归档,当前 P0 切换为 EnCodec D0。

验证:registry 显示 40 census、12 已运行家族、16 模型点、8 Transport Qualified、0 evaluation complete;生产站核心路由 HTTP 200。

Day 2–3 · 7/21–7/22:D0 身份与证据链

  • [x] 从论文原始页、官方代码、官方模型卡和 release 建立 primary-source 清单;
  • [x] 固定论文版本、官方代码 commit、checkpoint revision/hash 和许可证;
  • [x] 区分官方 EnCodec、PyPI 包、Transformers 转换和本地 adapter 的身份;
  • [x] 逐模块核对参数:encoder、quantizer、decoder、判别器/训练专用模块、辅助模型;
  • [x] 固定 24 kHz 模型的采样率、声道、hop、帧率、码本大小、带宽点和因果性;
  • [x] 核查 normalization scale、segment、1 秒帧数和已观测 side information;padding 与有限句尾行为进入 D2 的逐调用路径验证。

通过条件record.json 的每个事实都有 primary URL、revision 和访问日期;本地 checkpoint 身份、参数量和运行时结构一致。身份对不上就停在 D0,不进入大评测。

结果:D0 passed。固定 v0.1.1 的许可纠正为 CC-BY-NC-4.0;checkpoint SHA-256 与 93,171,529 bytes 均复核;关键 installed source 与固定 commit 三文件逐字节一致;参数、state、 五档带宽到 RVQ 深度和官方/项目 payload 边界已写入结构化记录与生成页面。

Day 4–5 · 7/23–7/24:D1 深读论文

  • [x] 解释问题背景、前序 neural codec 和 EnCodec 的核心差异;
  • [x] 逐图解释 encoder–RVQ–decoder 与多尺度判别/重建损失;
  • [x] 解释可变带宽训练、quantizer dropout 和码率计算;
  • [x] 整理训练数据、训练设置、消融、主表和论文边界;
  • [x] 建立 claim-to-source 表,定位章节、公式、图、表和补充材料;
  • [x] 明确论文证明了什么、没有证明什么,以及哪些是我们的推断。

通过条件paper.md 不依赖读者先读原论文即可讲清算法;关键主张全部可回到原文,不用 博客或第三方排行榜代替 primary source。

结果:D1 passed。固定 19 页 PDF 的 bytes/SHA-256 并逐页视觉核验;结构化记录 34 条 paper_claim/paper_method 与 6 条 reader_inference。论文的 SoundStream 继承基础、RVQ 码率、 streaming、MS-STFT、loss balancer、entropy LM、训练数据、主表和附录消融均已定位;同时提前 标出 proprietary music、MUSHRA 原始刺激/投票和未发布 ablation checkpoints 等 D3/D4 阻塞候选。

Day 6–7 · 7/25–7/26:D2 深读核心代码

  • [x] 从公开推理入口追踪到 audio preprocessing、SEANet encoder、RVQ 和 decoder;
  • [x] 保存一个最小样本的输入/latent/code/quantized/output shapes;
  • [x] 标出带宽如何映射为 active codebooks;
  • [x] 把论文公式与固定 commit 中的类、函数和行号对应;
  • [x] 对照训练代码中的 loss、判别器、balancer 和 quantizer dropout;
  • [x] 说明本地 adapter 改了什么、没改什么,以及当前真实 payload 与官方 .ecdc 的关系。

通过条件code.mdarchitecture.mmd 能从 paper 走到 code 再走到真实表示;fresh process 最小样本可重放,隐藏默认值和未计 side information 已列出。

结果:D2 passed。固定并哈希 11 个 upstream source,建立 14 条 paper-to-code map;保存 encoder/decoder 各 16 层 shape、五档真实 .ecdc/.evc bytes、八级 RVQ residual、causal prefix counterfactual 与 24,001-sample 句尾边界。发现 release 不含完整 training runner/loss balancer, MS-STFT class 默认三尺度而论文为五尺度,entropy probability precision 论文 1e-6 而固定代码 默认 1e-8;官方 .ecdc time-major、项目 .evc codebook-major,语义相同但 byte-incompatible。

Day 8 · 7/27:D3 冻结论文复现协议

  • [x] 把论文所有 headline evaluation 分成可复现、近似可复现、不可公开复现;
  • [x] 固定每个 operating point 的模型、码率、数据集、split、样本数和预处理;
  • [x] 固定 metric 实现、版本、方向、聚合、统计单位和随机种子;
  • [x] 作者值、本地值、差值、CI、等价容差和 verdict 字段先建表;
  • [x] 估算计算、下载和人工听测成本;
  • [x] protocol commit 后才运行正式 D4。

通过条件:任何人都能在看不到本地最终数字时判断什么算通过。论文私有数据或未公开听测 必须预先写成阻塞,不用替代数据偷换为“官方复现”。

结果:D3 passed。冻结 9 个 claim family:2 个严格/primary-artifact 检查、3 个近似诊断、 3 个一手资产阻塞项、1 个不同模型身份项;固定作者页 20 个 WAV 与官方 LM checkpoint。 MUSHRA、baseline superiority 和训练消融不会被替代数据伪装成复现。D4 final metric 尚未运行。

7/20 插入但不扩张范围:runtime contract

  • [x] Docker Desktop linux/arm64 engine 与 hello-world 验证;
  • [x] 冻结 macOS native、Linux arm64/amd64 CPU、Linux/amd64 CUDA 与 native exception;
  • [x] 冻结 experiment capsule、mount/image/secret/checkpoint 与云端 C0–C5
  • [ ] 用 EnCodec 的固定 ViSQOL v3.3.3 image 验证这套合同的第一个真实 metric tool。

这不是新增基础设施项目;它直接解除 D4 的旧 Bazel/macOS 阻塞,并为未来 GPU 训练保留同一实验 合同。CUDA train image 不在这 14 天内抢占 EnCodec。

Day 9–12 · 7/28–7/31:D4 论文原生复现

  • [x] 准备并核验公开官方资产、哈希和预处理;未公开 split 保持 blocked;
  • [x] 跑最小 raw/entropy protocol smoke;首个作者 demo 严格重生成按冻结阈值失败;
  • [ ] 固定并构建官方 ViSQOL v3.3.3 metric image,记录 source/dependency/image digest;
  • [ ] 保存逐样本和聚合结果、运行日志、资源、失败及环境;
  • [ ] 对作者每个可复现 headline point 计算 local − paper 和置信区间;
  • [ ] 确定性事实要求精确一致;统计指标按预声明容差做等价判断;
  • [ ] 任何偏差先查身份、数据、预处理和 metric,不靠调容差让结果变绿。

通过条件:得到逐主张 passed/approximate/failed/blocked 表;至少一个公开客观指标点完成 端到端复现,或用一手证据证明为何当前无法复现。

Day 13 · 8/1:误差解释与复现边界

  • [ ] 区分 checkpoint/代码漂移、metric 漂移、数据不可得、统计噪声和真实复现失败;
  • [ ] 对关键偏差做最小反事实或消融,不盲目扩大样本;
  • [ ] 把 MOS、主观 MUSHRA 和客观指标严格分开;
  • [ ] 形成 D4 verdict 与 D5 共同 benchmark 的输入条件。

通过条件:每个未通过项有最可能原因、证据强度和下一条可证伪检查;不存在“看起来差不多” 式结论。

Day 14 · 8/2:首版页面、审计与两周裁决

  • [ ] 生成 EnCodec 首版深度页面;
  • [ ] 页面包含结构图、paper-to-code map、官方 claim 与本地复现表;
  • [ ] registry 状态只升级到实际通过的 Gate;
  • [ ] 所有内部链接、外链格式、页面生成和 MkDocs 严格构建通过;
  • [ ] 发布 Cloudflare,并从公网抽查首页、模型页、DoD 和 sitemap;
  • [ ] 写两周 verdict,确定 D5/D6 的冻结共同 benchmark。

两周 Gate

通过

  • D0、D1、D2、D3 全部 passed
  • D4 对公开可复现主张有正式结果,对不可复现主张有一手阻塞证据;
  • EnCodec 页面足以让新读者解释核心算法、代码路径与复现边界;
  • 未把 Transport Qualified、近似复现或单指标通过写成 evaluation complete。

不通过

若身份未封口、论文与代码对不上、protocol 事后修改或作者值无法定位,则保持对应 Gate 未通过, 继续 EnCodec,不因日期切换到 WavTokenizer。

14 天内明确不做

  • 不继续批量安装 Wave 3 模型;
  • 不把旧 8 句 G4 扩成质量排行榜;
  • 不实现原创 codec seed;
  • 不启动随机/TPE/AI 进化;
  • 不为了“一个月有成果”降低论文复现标准;
  • 不同时深读第二个模型。
  • 不把 Docker 扩张成通用 cloud/Kubernetes 平台;本轮只建 D4 所需 metric/eval path。

用户可能需要做什么

默认无需操作。只有出现 gated 数据许可、必须由人执行的官方听测、Cloudflare/GitHub 权限变化 或需要选择付费计算资源时才请求用户;其余下载、运行、校验和发布由项目自行完成。