跳转至

EvoSpeech · 逐模型研究重启计划

开始日期:2026-07-20

本计划取代“继续下载一个模型、跑 8 句、立刻进入下一个”的执行节奏。旧 G1–G4 工程证据 保留;新的完成单位是一份通过 EVALUATION_DOD.md 的完整模型研究档案。

一、固定工作循环

每增加一个模型,严格执行以下顺序:

flowchart LR A["D0 身份与来源"] --> B["D1 深读论文"] B --> C["D2 深读核心代码"] C --> D["D3 冻结复现协议"] D --> E["D4 复现论文结果"] E --> F["D5 统一横评"] F --> G["D6 项目压力测试"] G --> H["D7 页面与可复现审计"]

任何一步失败都形成明确结论和页面,不删除模型;但不能越级声称后续 Gate 已完成。

二、里程碑列表

R0 · 研究系统地基

  • [x] 冻结不可降低的模型评测 Definition of Done;
  • [x] 把知识、执行、评测拆成三条独立状态;
  • [x] 建立结构化 research registry 与 schema;
  • [x] 建立 Material for MkDocs 文档站骨架;
  • [x] 自动生成 40 项模型总览和当前严格状态;
  • [x] CI 校验 registry、生成页面并严格构建站点;
  • [x] GitHub Pages 路线已裁决为暂不采用:private repository 的当前账号计划被 GitHub API 明确拒绝(HTTP 422);仓库不擅自公开。CI 保留严格构建,未来若条件变化再显式开启。
  • [x] 使用 Cloudflare Pages Direct Upload 发布同一静态站点,仓库继续保持 private;已固定 Wrangler 4.112.0site/ 构建目录和可追溯部署脚本,生产 URL https://evospeech-research.pages.dev/ 的首页、模型总览、DoD、部署说明和 sitemap 均验证为 HTTP 200。

通过条件:本地 registry 校验、页面生成检查和 mkdocs build --strict 全部通过;历史 G4 在页面中只能显示为 Transport Qualified,严格评测完成数为 0。

R0.5 · 可迁移运行环境与云训练地基

  • [x] 冻结五个 runtime profile、experiment capsule、mount/image/secret/checkpoint 合同;
  • [x] 明确 Apple Silicon 可做 CPU/MPS 小训练,但不是 Linux/CUDA/NCCL 等价环境;
  • [x] 冻结云端训练 C0–C5:本地 lint → GPU probe → one-batch → 短单卡/resume → 长跑/多卡 → 独立 evaluation;
  • [ ] 为 EnCodec D4 构建固定 ViSQOL metric image 与最小 Linux/arm64 evaluation path;
  • [ ] 在 EnCodec D7 前完成 clean-container replay 与 native/container 数值审计;
  • [ ] 在第一个原创模型训练前完成 CUDA image 和临时 NVIDIA 主机 C0–C3

通过条件:正式运行能够指出 image digest 或 documented native exception;数据、权重、 protocol、硬件和输出由 capsule 绑定。环境工作不得扩张成通用云平台。详见 ENVIRONMENT_AND_TRAINING.md

R1 · EnCodec:打通第一份完整档案

选择理由:官方论文、代码和 checkpoint 成熟,本地已有运行证据,适合校准整条科研管线,而 不是因为它一定是当前最强模型。

  • [x] D0:固定论文版本、官方代码 commit、24 kHz checkpoint、许可证及参数分账;
  • [x] D1:精读论文、补充材料和关键前序工作,形成逐章节论文解读;
  • [x] D2:追踪 SEANet encoder/decoder、RVQ、带宽控制和训练损失的 paper-to-code map;
  • [x] D3:冻结论文主表/主图的可复现项目、数据、预处理、指标和容差;
  • [ ] D4:已完成 frozen-asset 与 one-pair raw/entropy smoke;构建固定 ViSQOL container 后复现 全部公开点,不能复现的 MOS/私有训练条件明确标阻塞;
  • [ ] D5:在冻结共同 speech benchmark 上重跑 EnCodec、Opus、Codec 2;
  • [ ] D6:补中英关键内容、多语言 probe、真实 payload、资源和合法码率曲线;
  • [ ] D7:生成第一篇完整模型页面,并让所有数字可追溯到结果文件。

通过条件:读者能从页面解释 EnCodec 为什么使用 RVQ、带宽怎样改变、代码如何实现、论文 数字哪些复现成功/失败,以及它对 low-bit 学生真正可迁移的机制。

R2 · WavTokenizer:第一个低 token-rate 深读对象

  • [ ] small、large unified、large speech 作为不同 checkpoint 身份,禁止混成一个点;
  • [ ] 深读单码本、低帧率、判别/语义训练目标与 decoder 设计;
  • [ ] 对照官方 speech/audio/music 评测协议及可公开复现范围;
  • [ ] small 与 large unified 做同 40 token/s 的共同基准,不作虚假的受控因果结论;
  • [ ] 补 75 token/s 合法 operating point、削波检查和失败样本分析;
  • [ ] 与 EnCodec 的多码本 RVQ 形成机制对照页面。

通过条件:完成首个“论文低码率主张—本地复现—同协议横评”的闭环。

R3 · 通信锚点:Opus 与 Codec 2

  • [ ] 用标准/官方技术材料替代普通论文模板中不适用的字段;
  • [ ] 解释 bitstream、算法延迟、模式、码率和 packet/container 开销;
  • [ ] 复现官方/标准可验证的测试点,并记录平台差异;
  • [ ] 固定统一 benchmark 的现实通信下界;
  • [ ] 页面明确传统 codec 教给神经模型的工程纪律。

R4 · BigCodec 与 Mimi

  • [ ] BigCodec:完整解释单码本低码率设计、训练目标、官方 1 kbps 结论和代码限制;
  • [ ] Mimi:完整解释 streaming、semantic/acoustic token、延迟合同和模型先验;
  • [ ] 分别完成论文复现、共同 benchmark 和项目 stress;
  • [ ] 做“低码率单流”与“流式双重表示”的机制对照。

R5 · DAC、SNAC、FocalCodec-Stream、LPCNet

  • [ ] 每个模型单独完成 D0–D7,不沿用一句话机制摘要;
  • [ ] DAC 聚焦高质量 RVQ/量化训练;
  • [ ] SNAC 聚焦多尺度 token;
  • [ ] FocalCodec-Stream 聚焦单 token/语义表征与流式约束;
  • [ ] LPCNet 聚焦参数编码与微型生成 decoder;
  • [ ] 形成第一轮可迁移机制矩阵。

R6 · MOSS 与 Quark HCodec 家族

  • [ ] checkpoint 变体分别建身份卡和结果,家族页面只做汇总;
  • [ ] 大模型共享先验、辅助语义模型和 decoder 成本全部分账;
  • [ ] 官方主张、可公开复现范围和硬件约束逐项核实;
  • [ ] 完成 adaptive/grouped 表示的真实计账及 stress curve;
  • [ ] 判断其机制能否成为受约束学生教师,而不只比较重建听感。

R7 · 剩余 execution matrix

按研究价值和可复现性动态排序 Stable Codec、X-Codec 2.0、TaDiCodec、SoundStream、AudioDec、 FunCodec、HiFiCodec、Lyra、SpeechTokenizer、SemantiCodec、FACodec、TiCodec、Step-Audio 和 FARGAN。每次只允许一个模型处于 D0–D4 主线,避免浅尝 15 个模型却没有一份完整研究档案。

R8 · Census 扩展与 paper-only

  • [ ] 每月扫描新 SOTA,但新名字只进入 census,不自动打断当前深读;
  • [ ] paper-only 模型可以完成 D0/D1,不能伪造 D2–D6;
  • [ ] 代码开放后才进入执行队列;
  • [ ] 挑真正改变机制理解的论文写专题综述,而不是机械收集摘要。

R9 · 机制综合、原创 Baseline 与 AI 进化

只有至少 6 个代表家族达到 evaluation_complete,并形成论文复现可信的共同 benchmark 后:

  • [ ] 汇总能迁移的表示、量化、decoder、训练与流式机制;
  • [ ] 选择最小可证伪的原创 seed;
  • [ ] 用人工、随机、TPE 证明搜索空间有信号;
  • [ ] 再接 CandidateContract 和 AI 自动进化;
  • [ ] 所有原创结果回到同一个站点和 DoD 下接受审计。

三、每一轮交付格式

每完成一个 Gate,交付必须明确回答:

  1. 这轮读了、改了、运行了什么;
  2. 产生了哪些结构化记录、文档和实验产物;
  3. 用什么命令和证据验证;
  4. 哪些结论成立,哪些仍不成立;
  5. 是否需要用户授权、听测或硬件操作;
  6. 下一 Gate 是什么。

只要某项可以本地自行验证,就由项目自动验证后报告结果,不把可自动化检查转交给用户。

四、执行优先级原则

  • 一份完整、可审计的模型档案优先于新增五个浅层 adapter;
  • primary source 优先于二手总结;
  • 官方复现和共同横评必须同时存在,互不替代;
  • 论文读不懂或代码对不上时暂停跑大实验,先解决身份和机制问题;
  • 模型官方结果无法公开复现也是重要结论,但必须给出证据边界;
  • 网站是研究记录的视图,机器可读 registry/result 才是数字的唯一事实源。
  • Docker 是默认 Linux 执行封装,不是科学结论;image digest、capsule、输入/输出 hash 与独立 evaluation 缺一不可。