跳转至

EvoSpeech Research Observatory

这里不是一张只看最好数字的排行榜,而是一套可审计的语音 codec 研究档案。

我们的目标是:深刻理解当前最强语音表示为什么有效,忠实复现它的公开证据,再把真正可迁移 的机制压入低码率、微型、实时通信合同。

从哪里开始

每个模型页面最终要回答什么

flowchart TD
    P["Paper:问题、算法、公式、训练与官方主张"] --> S["可验证的机制理解"]
    C["Code:入口、核心类、tensor shape 与 paper-to-code map"] --> S
    O["Official evaluation:数据、协议与作者数值"] --> R["本地论文复现"]
    S --> R
    R --> B["冻结共同 benchmark"]
    B --> X["中英、多语言、关键内容、资源与失败边界"]
    X --> I["Insights、可迁移机制与下一条可证伪实验"]

独立页面会提供论文和官方 GitHub 链接、经核实的结构图、核心代码路径、官方结果与本地结果 的差值/置信区间,以及对 EvoSpeech 的真实启发。无法复现的内容也会保留为显式阻塞证据。

当前边界

此前已真实运行 12 个模型家族、16 个模型点,其中 8 个模型点达到历史 G4/现在的 Transport Qualified。它们证明工程接入和真实表示合同,不证明论文指标或质量结论。按新的严格 DoD,当前 评测完成数是 0;最新机器生成计数以模型研究总览为准。

当前正在做什么

R1 · EnCodec D0:Identity & provenance。 当前先固定论文、官方代码、checkpoint、参数、 许可证、运行变体和 side information,再进入论文深读与 paper-to-code map。此阶段不继续批量 安装模型,也不实现原创 seed 或 AI 进化。

旧的 Census/G1–G4 和 first-loop 日程保存在历史 14 天路线历史 30 天路线,仅用于追溯。