EvoSpeech Research Observatory¶
这里不是一张只看最好数字的排行榜,而是一套可审计的语音 codec 研究档案。
我们的目标是:深刻理解当前最强语音表示为什么有效,忠实复现它的公开证据,再把真正可迁移 的机制压入低码率、微型、实时通信合同。
从哪里开始¶
- 模型研究与评测 Definition of Done:什么情况下才能叫“评测完成”;
- 逐模型研究重启计划:接下来按什么顺序重头完成;
- 当前 14 天路线:EnCodec D0–D4 的论文、代码与官方复现;
- 当前 30 天路线:完成 EnCodec D5–D7,并启动 WavTokenizer;
- 模型研究总览:40 个条目的知识、执行、评测三维状态;
- Research Mindset:为什么 SOTA 是教师,low-bit 是压力条件;
- SOTA Census 与执行队列:当前候选空间和历史工程证据。
每个模型页面最终要回答什么¶
flowchart TD
P["Paper:问题、算法、公式、训练与官方主张"] --> S["可验证的机制理解"]
C["Code:入口、核心类、tensor shape 与 paper-to-code map"] --> S
O["Official evaluation:数据、协议与作者数值"] --> R["本地论文复现"]
S --> R
R --> B["冻结共同 benchmark"]
B --> X["中英、多语言、关键内容、资源与失败边界"]
X --> I["Insights、可迁移机制与下一条可证伪实验"]
独立页面会提供论文和官方 GitHub 链接、经核实的结构图、核心代码路径、官方结果与本地结果 的差值/置信区间,以及对 EvoSpeech 的真实启发。无法复现的内容也会保留为显式阻塞证据。
当前边界¶
此前已真实运行 12 个模型家族、16 个模型点,其中 8 个模型点达到历史 G4/现在的 Transport Qualified。它们证明工程接入和真实表示合同,不证明论文指标或质量结论。按新的严格 DoD,当前 评测完成数是 0;最新机器生成计数以模型研究总览为准。
当前正在做什么¶
R1 · EnCodec D0:Identity & provenance。 当前先固定论文、官方代码、checkpoint、参数、 许可证、运行变体和 side information,再进入论文深读与 paper-to-code map。此阶段不继续批量 安装模型,也不实现原创 seed 或 AI 进化。
旧的 Census/G1–G4 和 first-loop 日程保存在历史 14 天路线 与历史 30 天路线,仅用于追溯。